7月21日
16:39
16:39官方一手marktechpost@Asif Razzaq
72°
NVIDIA 推出 Cosmos 3 Edge,一个 4B 参数的开放世界模型,专为设备端运行设计。该模型可帮助机器人和视觉 AI 代理理解环境、实时推理并本地生成动作。Cosmos 3 系列此前已于 2026 年 5 月 31 日在 GTC Taipei 发布 Cosmos 3 Nano(16B)和 Cosmos 3 Super(64B)。
事件专题

推荐理由:NVIDIA 把 40 亿参数的开放世界模型塞进设备端,机器人不用联网就能自己理解环境、推理并执行动作,适合边缘部署场景。
11:35
11:35官方账号arXiv cs.AI@Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu
论文提出SOPHIA方法,通过分析推理轨迹中隐状态转换,发现失败轨迹陷入自循环。该方法构建状态对索引的引导向量库,在推理时实时检测自循环并干预。在多个基准测试中,SOPHIA有效提升任务准确率和令牌效率。实验表明,细粒度控制能改善推理质量。
推荐理由:这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。
7月20日
21:40
21:40岚叔@lufzzliz
Qwen-3.8 Max 参数量2.4T,支持多模态和1M上下文。同任务下速度比Kimi-K3快十倍,对探索性任务性价比高。前端能力与SOTA模型不相上下,限时一折、夜间0.2折。正式版将开源并持续进化,擅长Cowork类Agent任务。
事件专题

推荐理由:阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。
16:06
16:06官方一手Pandaily@contact@pandaily.com (Pandaily)
Moonshot AI旗下Kimi K3模型在AlphaEngine的专有IRB投资研究基准测试中,以更高得分击败GPT-5.5和OPUS-4.8。测试涵盖时间判断、证据边界控制和前提修正三个维度。Kimi K3已部署在AlphaEngine平台上。
事件专题

推荐理由:Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
10:23
10:23IT之家博客/媒体
腾讯混元大模型Hy3限时免费活动延长至8月5日,面向WorkBuddy和CodeBuddy用户。Hy3于7月6日开源,采用MoE架构,总参数295B,激活参数21B,支持256K上下文。模型在推理、智能体、长上下文任务上显著进步,性能比肩参数规模2-5倍的更大模型。

推荐理由:腾讯又给了两周免费试用Hy3,到8月5日。这个295B参数的MoE开源模型激活仅21B,但性能能打,适合推理和智能体场景。
10:06
10:06官方一手marktechpost@Michal Sutter
精选
社区开发者用 Claude Fable 5 的推理链数据微调了 OpenBMB 的 MiniCPM5-1B,得到一个仅 657MB 的最小化本地推理模型。该模型支持 128K 上下文,推理过程可见。微调后的能力继承自原始模型,但授权条款在模型卡中未完全明确。
事件专题

推荐理由:有人把 Claude Fable 5 的思维链塞进了 MiniCPM5-1B,搞出个 657MB 的本地推理模型,128K 上下文还能看它怎么想的,部署门槛极低。
09:17
09:17官方账号arXiv cs.AI@Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani, Mitch Weiss
新基准BusinessCaseBench涵盖18个学科数百个商业案例问题,每个问题配有专家编写的评分标准。前沿AI模型在该基准上已获得高分,且同一模型家族在两年内能力大幅提升。结果显示AI在分析性知识工作上的表现已经很高且快速进步。
推荐理由:想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
09:16
09:16官方账号arXiv cs.AI@Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai
Loopie系列包含两个MoE模型:20B参数(2B活跃)和6B参数(0.6B活跃)。它解决了循环Transformer的经典问题:在预训练计算量增加N倍时,循环N次不如增加参数N倍。实验表明,Loopie显著优于相同计算预算的普通Transformer基线。后训练阶段赋予模型强推理能力,在2025年IMO和IPhO中获得金牌(无外部工具)。
推荐理由:研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。
07:18
7月19日
18:59
18:59岚叔@lufzzliz
阿里发布Qwen3.8-Max-Preview模型,参数规模超过2万亿。官方评测称其性能仅次于Fable 5。该模型已在Token Plan、Qoder和QoderWork平台上线。作为新一代大参数模型,它旨在提升推理和多任务能力。
推荐理由:阿里新出的2万亿参数大模型Qwen3.8-Max-Preview,号称只比Fable 5差一点,已经能直接试用了,想看看它有多强可以测测。
14:07
04:12
04:12Aravind Srinivas@AravSrinivas
Together AI 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5 的软件工程任务表现。结果显示,Kimi K3 以 Fable 5 约 35% 的价格实现了相同性能,且在更高 pass@k 指标上领先。该分析来自 Together AI 的 Arav Srinivas,数据基于内部测试。
事件专题

推荐理由:想省钱又要强性能?Kimi K3 在编程任务上和 Claude Fable 5 打个平手,价格只要三分之一,高要求场景还更强。
7月18日
16:45
10:00
10:00官方账号Clement Delangue@ClementDelangue
精选
Kimi k3每token价格是GPT-5.6 Sol的一半,但GPT-5.6 Sol生成所需token数仅一半,总成本相近。GPT-5.6 Sol的TPS是Kimi k3的2倍,实际任务速度快约4倍。用户指出Kimi k3性能优秀但并非超值选择。
事件专题

推荐理由:有人觉得Kimi k3便宜?其实和GPT-5.6 Sol算下来价格差不多,GPT-5.6 Sol速度还快4倍,别被误导了。
05:18
00:07
00:07AI Engineer@aiDotEngineer
2018年,Google X秘密启动用机器学习改进编程的项目,Benoit Schilling担任CTO。如今他领导Google DeepMind的Gemini Thinking、Reasoning和Coding团队,认为AI编程已从机器约束进入设计约束阶段。核心挑战不再是写代码本身,而是确保代码满足复杂需求,开发者角色转向架构、验证和高层推理。
推荐理由:Google DeepMind 的 Benoit Schilling 分享了AI编程的新阶段:难点不在写代码,而在设计对齐。他亲自领导 Gemini 的推理和编程团队,观点很实在。
7月17日
15:00
12:08
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
On-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。
推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。
11:17
11:17IT之家博客/媒体
精选
Ubuntu 内核团队于 7 月 16 日报告,Linux 7.0.0-28.28 内核中的 AMDGPU 驱动问题导致 ROCm 计算负载吞吐量降至 1/42。在 Stable Diffusion XL 通过 ComfyUI 推理时,原先约 9 秒的任务延长至 388 秒。该回归源自 Linux 7.0 稳定版上游内核,CachyOS 和 Fedora 用户也已反馈相同问题。

推荐理由:Ubuntu 说这个内核版本让 AMD 显卡跑 AI 慢 42 倍,SDXL 推理从 9 秒变成 388 秒。如果你在用 Ubuntu,赶紧看看内核版本号。
10:00