VOL.2026.06.25·203 STORIES·AITOP DAILY

AITOP日报

二〇二六年六月二十五日 星期四DAILY · 每早八时
01

模型发布/更新

Model Releases
5

FORCE: 高效VLA强化学习微调框架,提升79%成功率

X·KOLX:arXiv cs.AI (@Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang)原文 ↗

FORCE是一个三阶段框架,通过价值校准热身和自蒸馏来稳定VLA模型的强化学习微调。它解决了Q函数不稳定导致的初期遗忘和低质量探索数据导致的策略更新低效问题。在模拟和真实任务上,FORCE取得了79%的绝对成功率提升,比此前RL方法高出10%,同时训练速度加快32.5%。该框架无需人工干预即可实现稳健性能。

后训练中被忽视的免费午餐:进度优势用于LLM智能体

X·KOLX:arXiv cs.LG (@Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li)原文 ↗

本文提出进度优势(Progress Advantage),通过计算RL后训练策略与参考策略的对数概率比,隐式获得智能体步骤级评分,无需额外训练奖励模型。该方法在五个基准(包括MATH、HotpotQA等)和四个模型家族(Llama-2、Mistral等)上验证,在测试时扩展、不确定性量化、失败归因三项任务中均优于基于置信度的基线。尽管无需任务特定训练,它仍超越专用奖励模型。论文还分析了进度优势的特征,为实际智能体系统提供使用指导。

Qwen发布Agent环境模拟器Qwen-AgentWorld,可模拟7种环境

X·KOLX:berryxia (@berryxia)原文 ↗

Qwen团队直接训练了一个语言世界模型Qwen-AgentWorld,核心目标是从头建模环境而非仅训练Agent行为。模型需预测终端输出、网页变化及代码执行后状态,而非单纯学习操作。利用该模型作为模拟器进行可控Sim RL,在某些任务上模拟训练的Agent性能甚至超过真实环境训练的Agent。此外,仅做环境预测的预训练能力可直接迁移到多轮Agent任务,在多个benchmark上取得显著提升,包括未见领域。Qwen开源了35B MoE版本及对应基准。

02

产品发布/更新

Product
5

NVIDIA NeMo AutoModel 基于 Hugging Face Transformers v5 实现 MoE 训练加速 3.4-3.7 倍

X·KOLX:NVIDIA AI (@NVIDIAAI)原文 ↗

NVIDIA 发布了 NeMo AutoModel,基于 Hugging Face Transformers v5 为混合专家 (MoE) 模型提供原生支持。通过 Expert Parallelism、DeepEP 和 TransformerEngine 内核,仅需几行代码即可应用优化。实测显示 NeMo AutoModel 将主流 MoE 模型训练吞吐量提升 3.4 到 3.7 倍。该工具是 NeMo 框架的一部分,专为大规模模型构建设计。

03

行业动态

Industry
5

Anthropic 致信美国国会,指控阿里通义千问大规模蒸馏 Claude

X·KOLX:宝玉 (@dotey)原文 ↗

Anthropic 指控阿里巴巴旗下通义千问实验室在4月22日至6月5日期间,通过约25,000个虚假账号对 Claude 进行了超过2880万次交互,目标锁定 Claude 的软件工程和 Agent 推理能力。这一规模是今年2月 Anthropic 点名的 DeepSeek、MiniMax 和 Moonshot AI 三家总交互量(1600万次)的近两倍。所谓蒸馏攻击指利用对手模型输出训练自有模型,绕过独立研发成本。Anthropic 称这是系统性、工业化规模的能力收割。该事件恰逢美国商务部以国家安全为由限制 Anthropic 的 Fable 5 和 Mythos 5 模型访问,Anthropic 处境复杂。

Adobe 宣布收购 Topaz Labs 强化 AI 视频与图像布局,交易预计 2026 年下半年完成

官方IT之家原文 ↗

Adobe 宣布收购 AI 图像和视频增强工具开发商 Topaz Labs,交易预计在 2026 年下半年完成,尚需监管批准。Topaz Labs 拥有超过二十年的技术积累,2025 年因其生产技术获得艾美奖,其产品包括用于视频放大升频的 Astra 模型和图像润饰的 Wonder 模型,以及让大型 AI 模型在消费级 GPU 上本地运行的 Neurostream 技术。Adobe 计划将 Topaz Labs 的 AI 模型整合到 Firefly 应用以及 Photoshop、Lightroom、Premiere 等 Creative Cloud 产品中,同时保留其独立服务。

Anthropic 与特朗普政府谈判 Fable 5 解禁,Tom Brown 取代 Amodei 成主要代表

X·KOLX:宝玉 (@dotey)原文 ↗

6月12日美国商务部以国家安全为由,对 Anthropic 的 Fable 5 和 Mythos 5 模型发布出口管制令,因亚马逊研究团队声称找到绕过安全护栏的方法。Anthropic 被迫关闭这两款模型,影响数亿用户。多轮谈判后,白宫态度转暖,原因之一是联合创始人 Tom Brown 取代了难以沟通的 Amodei。Tom Brown 是 GPT-3 首席工程师,目前负责计算基础设施。国会两党四名众议员要求商务部解释管制依据,回复截止 6 月 26 日。

04

论文研究

Research
4

相同证据不同答案:多模态大模型中排序敏感性的审计

X·KOLX:arXiv cs.LG (@Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli)原文 ↗

论文提出Facet-Probe审计框架,从选项、证据块、文档排序、图像集、混合模态五个维度测试18个前沿和开源MLLM的排序敏感性。采用贝叶斯项目反应模型分离排序噪声与各维度偏差,发现所有模型均非排序不变,各维度平均翻转率在24%至50%之间。Gemini在温度0下的同序控制显示,验证单元中存在远超解码器噪声的排序超额。最优模型仍有13.4%的试次输出翻转,提示词级缓解措施无法泛化到视觉推理。

基于全局和局部重建的点云扩散用于实例级三维异常检测

X·KOLX:arXiv cs.AI (@Linchun Wu, Qin Zou, Jiwen Lu, Qingquan Li)原文 ↗

现有3D点云异常检测面临弱缺陷(如划痕)重建难,偏差仅10^{-3},且背景非缺陷区易产生误报。PCDiff框架在生成阶段嵌入实例级多模态注意力,利用纹理梯度、图像块、文本和掩模条件生成高质量弱缺陷异常样本。检测阶段采用联合局部-全局重建算法,同时恢复局部异常和保持全局几何一致性。实验表明PCDiff在异常生成保真度和重建质量上显著超越现有方法。

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

X·KOLX:arXiv cs.LG (@Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville)原文 ↗

一篇论文研究了基于采样示范的在线自蒸馏方法对输出多样性的影响。该方法通过单一模型同时作为教师和学生,教师以正确示范为条件提供密集的token级反馈,在pass@1准确率上表现优异。但论文发现,这会导致推演多样性降低,pass@k曲线变平,即增加推演次数无法提升准确率。作者将原因追溯到自蒸馏设计中的复合偏差:教师在对学生推演评分时以采样到的正确推演为条件,通过模型自身偏见传导反馈。在可控的图路径发现任务和科学问答基准上,自蒸馏模型在平均性能上与强化学习相当或更优,但功能和语义多样性显著下降,在需要多样化策略的分布外场景中失败。

Furthest Pair在超常数维度下需n^{2-o(1)}时间,扩展SETH下界

X·KOLX:arXiv: OpenAI (@Barna Saha, Yinzhan Xu, Christopher Ye)原文 ↗

该论文证明在SETH假设下,Furthest Pair、Bichromatic Closest Pair等几何问题在d=ω(1)维度时需n^{2-o(1)}时间。此前Chen (2020)只对d=2^{Θ(log^* n)}维度成立。新结果将所有可构造维度纳入下界,意味着现有f(d)·n^{2-Θ(1/d)}算法的维度依赖本质上不可避免。证明技术利用了OpenAI近期对Erdos单位距离猜想的反证方法。

05

技巧与观点

Tips & Takes
3

如何设计一个OpenHarness风格的智能体运行时:工具、内存、权限等

X·KOLX:marktechpost (@Sana Hassan)原文 ↗

本文手把手教你从零搭建一个OpenHarness风格的智能体运行时,包含工具调用、类型化工具模式、权限控制、生命周期钩子、记忆模块、技能系统、上下文压缩、重试逻辑、成本追踪以及多智能体协调共10个核心组件。所有代码均可直接运行,无需API密钥或额外基础设施。通过暴露完整控制流,你将理解框架内部机制而非将其当作黑盒。

用Amazon Nova 2 Sonic构建医疗预约语音助手

X·KOLX:AWS Machine Learning Blog (@Jimin Kim)原文 ↗

这篇教程展示了如何利用Amazon Nova 2 Sonic和Amazon Bedrock AgentCore构建一个语音预约提醒助手。该助手能够通过语音验证患者身份,处理确认、取消或改约操作,并收集就诊前健康信息。当需要时,助手会将问题升级给人工客服。教程包含一个浏览器界面用于测试,若要连接真实电话线路,需集成Amazon Connect等电话服务。

203
今日事件
60
一手报道
46
新模型
59
信源
AITOP · 编辑系统自动生成