NVIDIA与百度同日开源,AI代理循环引反思
2026年6月25日,AI领域迎来多项重磅发布与深度反思,三大主题尤为突出。NVIDIA NeMo AutoModel 基于 Hugging Face Transformers v5,通过 Expert Parallelism 等技术使 MoE 模型训练吞吐量提升 3.4-3.7 倍,简化了分布式微调流程。百度 Unlimited OCR 以 3B 参数 MoE 模型实现长文档高效解析,采用 R-SWA 机制保持恒定 KV 缓存,在 OmniDocBench 上取得 93.23 分,单次前向可处理数十页文档。AI 代理循环反思 指出当前 agent loop 会放大 LLM 代码缺陷,导致输出质量下降,且工程师可能过度依赖机器,丧失独立判断能力,引发业界对智能体设计方向的深层思考。
模型发布/更新
5 篇这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。
通义千问出了个新模型,不是教Agent怎么动,而是先让模型懂环境变化。用模拟环境练出的Agent反而比真实环境练的还强,还开源了35B版,值得看看。
Ornith-1.0 用 RL 教模型搭执行框架,在 SWE-Bench 上表现顶尖,本地党还有 GGUF 版本可玩。
产品发布/更新
5 篇NVIDIA 出了个 NeMo AutoModel,基于 Hugging Face Transformers v5,几行代码就能给 MoE 模型训练加速 3 倍以上,搞大模型训练的值得看看。
行业动态
5 篇Anthropic 跑出来告状了,说阿里用了两万多个假账号狂薅 Claude 的羊毛,次数比之前三家加起来还多一倍,还牵扯到美国商务部自己的限制令,挺拧巴。
Adobe 买下获艾美奖的 AI 视频增强公司 Topaz Labs,以后 Photoshop 和 Premiere 里就能直接用它的降噪、放大功能,处理老旧素材很方便。
Anthropic 为让 Fable 5 重新上线,换了谈判代表 Tom Brown。这次谈判可能影响未来 AI 出口管制。
黄仁勋在股东大会上说AI工厂是未来,物理AI会带来下一波增长,还透露英伟达一年营收涨了65%,现金流超960亿美元。想了解英伟达战略的可以看看。
论文研究
4 篇这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。
这篇论文揭示了自蒸馏方法的一个隐藏缺陷:虽然准确率不错,但多样性会变差,导致复杂推理场景下失效。做RL或推理模型的人值得看看。
技巧与观点
3 篇想自己搭一个能记东西、会用工具、还能多智能体协作的Agent框架?这篇教程从零拆开所有模块,代码直接跑,比看黑盒框架实在多了。
NVIDIA 搞了个 NeMo AutoModel,能自动帮你加速微调 Transformer 模型,省去手动调参的麻烦,速度还快很多,适合想快速出结果的人。