FORCE: 高效VLA强化学习微调框架,提升79%成功率
FORCE是一个三阶段框架,通过价值校准热身和自蒸馏来稳定VLA模型的强化学习微调。它解决了Q函数不稳定导致的初期遗忘和低质量探索数据导致的策略更新低效问题。在模拟和真实任务上,FORCE取得了79%的绝对成功率提升,比此前RL方法高出10%,同时训练速度加快32.5%。该框架无需人工干预即可实现稳健性能。
FORCE是一个三阶段框架,通过价值校准热身和自蒸馏来稳定VLA模型的强化学习微调。它解决了Q函数不稳定导致的初期遗忘和低质量探索数据导致的策略更新低效问题。在模拟和真实任务上,FORCE取得了79%的绝对成功率提升,比此前RL方法高出10%,同时训练速度加快32.5%。该框架无需人工干预即可实现稳健性能。
本文提出进度优势(Progress Advantage),通过计算RL后训练策略与参考策略的对数概率比,隐式获得智能体步骤级评分,无需额外训练奖励模型。该方法在五个基准(包括MATH、HotpotQA等)和四个模型家族(Llama-2、Mistral等)上验证,在测试时扩展、不确定性量化、失败归因三项任务中均优于基于置信度的基线。尽管无需任务特定训练,它仍超越专用奖励模型。论文还分析了进度优势的特征,为实际智能体系统提供使用指导。
百度开源Unlimited OCR,一个3B参数的MoE模型,能在单次前向推理中解析数十页文档。其突破性的Reference Sliding Window Attention (R-SWA)机制使KV缓存保持恒定,随着输出增长内存和延迟不变。模型在OmniDocBench v1.5基准上获得93.23分,比DeepSeek OCR基线高出6.22分。该模型采用MIT许可证开源。
Qwen团队直接训练了一个语言世界模型Qwen-AgentWorld,核心目标是从头建模环境而非仅训练Agent行为。模型需预测终端输出、网页变化及代码执行后状态,而非单纯学习操作。利用该模型作为模拟器进行可控Sim RL,在某些任务上模拟训练的Agent性能甚至超过真实环境训练的Agent。此外,仅做环境预测的预训练能力可直接迁移到多轮Agent任务,在多个benchmark上取得显著提升,包括未见领域。Qwen开源了35B MoE版本及对应基准。
Ornith-1.0 模型家族覆盖 9B 到 397B MoE 全尺寸。在 Terminal-Bench、SWE-Bench 等 agent coding 基准上达到当前开源模型顶尖水平。其训练方式使用 RL 同时优化任务脚手架和最终解决方案。模型全系列 MIT 开源,并提供了 GGUF 版本,可在 Ollama、Unsloth 等工具中直接运行。
NVIDIA 发布了 NeMo AutoModel,基于 Hugging Face Transformers v5 为混合专家 (MoE) 模型提供原生支持。通过 Expert Parallelism、DeepEP 和 TransformerEngine 内核,仅需几行代码即可应用优化。实测显示 NeMo AutoModel 将主流 MoE 模型训练吞吐量提升 3.4 到 3.7 倍。该工具是 NeMo 框架的一部分,专为大规模模型构建设计。
OpenAI推出新版GPT-5.5 Instant,对话体验更风趣。模型能更好理解用户问题意图并动态调整回应。它处理复杂约束更可靠,购物和本地推荐也更实用。今天向付费用户开放,明天免费用户可用。
OpenAI推出自研AI芯片Jalapeño,专用于推理(Inference)场景,设计制造仅用9个月,并由AI辅助完成。该芯片由Broadcom负责生产,目标是将推理成本降低约50%(Broadcom CEO原话)。早期性能数据显示,其性能功耗比显著优于NVIDIA Blackwell和Google TPU。首批样片已到手并开始测试。
Pika Labs发布Seedance 2.0版本,支持原生4K分辨率视频生成。新版本通过Pika MCP接口提供,无需额外插件。该功能面向所有用户开放,无需等待名单。
OpenRouter推出MCP(模型上下文协议),使AI智能体能够直接获取实时模型信息。该工具可动态评估模型价格、性能并测试,替代依赖6个月前训练数据的猜测。集成后智能体可为任务精准选型,提升效率。
Anthropic 指控阿里巴巴旗下通义千问实验室在4月22日至6月5日期间,通过约25,000个虚假账号对 Claude 进行了超过2880万次交互,目标锁定 Claude 的软件工程和 Agent 推理能力。这一规模是今年2月 Anthropic 点名的 DeepSeek、MiniMax 和 Moonshot AI 三家总交互量(1600万次)的近两倍。所谓蒸馏攻击指利用对手模型输出训练自有模型,绕过独立研发成本。Anthropic 称这是系统性、工业化规模的能力收割。该事件恰逢美国商务部以国家安全为由限制 Anthropic 的 Fable 5 和 Mythos 5 模型访问,Anthropic 处境复杂。
Mirendil AI 完成 2 亿美元种子轮融资,由 a16z 和 Kleiner Perkins 联合领投,NVIDIA 参与投资。该公司正构建一个专精 AI 研发的自主系统,类似为研究设计的编码智能体,可自行控制 GPU 并循环执行科研与工程任务。创始团队 20 人来自 Anthropic、xAI、Google DeepMind 和 OpenAI。
Adobe 宣布收购 AI 图像和视频增强工具开发商 Topaz Labs,交易预计在 2026 年下半年完成,尚需监管批准。Topaz Labs 拥有超过二十年的技术积累,2025 年因其生产技术获得艾美奖,其产品包括用于视频放大升频的 Astra 模型和图像润饰的 Wonder 模型,以及让大型 AI 模型在消费级 GPU 上本地运行的 Neurostream 技术。Adobe 计划将 Topaz Labs 的 AI 模型整合到 Firefly 应用以及 Photoshop、Lightroom、Premiere 等 Creative Cloud 产品中,同时保留其独立服务。
6月12日美国商务部以国家安全为由,对 Anthropic 的 Fable 5 和 Mythos 5 模型发布出口管制令,因亚马逊研究团队声称找到绕过安全护栏的方法。Anthropic 被迫关闭这两款模型,影响数亿用户。多轮谈判后,白宫态度转暖,原因之一是联合创始人 Tom Brown 取代了难以沟通的 Amodei。Tom Brown 是 GPT-3 首席工程师,目前负责计算基础设施。国会两党四名众议员要求商务部解释管制依据,回复截止 6 月 26 日。
英伟达CEO黄仁勋在6月24日股东大会上表示,AI产业已进入智能体AI阶段,物理AI将驱动下一轮增长。他称数据中心为AI工厂,强调企业需部署机器人、自动驾驶等物理AI系统。过去1年营收增长65%,营业利润增长60%,2026财年自由现金流超960亿美元。黄仁勋计划将50%自由现金流用于股票回购和分红。
论文提出Facet-Probe审计框架,从选项、证据块、文档排序、图像集、混合模态五个维度测试18个前沿和开源MLLM的排序敏感性。采用贝叶斯项目反应模型分离排序噪声与各维度偏差,发现所有模型均非排序不变,各维度平均翻转率在24%至50%之间。Gemini在温度0下的同序控制显示,验证单元中存在远超解码器噪声的排序超额。最优模型仍有13.4%的试次输出翻转,提示词级缓解措施无法泛化到视觉推理。
现有3D点云异常检测面临弱缺陷(如划痕)重建难,偏差仅10^{-3},且背景非缺陷区易产生误报。PCDiff框架在生成阶段嵌入实例级多模态注意力,利用纹理梯度、图像块、文本和掩模条件生成高质量弱缺陷异常样本。检测阶段采用联合局部-全局重建算法,同时恢复局部异常和保持全局几何一致性。实验表明PCDiff在异常生成保真度和重建质量上显著超越现有方法。
一篇论文研究了基于采样示范的在线自蒸馏方法对输出多样性的影响。该方法通过单一模型同时作为教师和学生,教师以正确示范为条件提供密集的token级反馈,在pass@1准确率上表现优异。但论文发现,这会导致推演多样性降低,pass@k曲线变平,即增加推演次数无法提升准确率。作者将原因追溯到自蒸馏设计中的复合偏差:教师在对学生推演评分时以采样到的正确推演为条件,通过模型自身偏见传导反馈。在可控的图路径发现任务和科学问答基准上,自蒸馏模型在平均性能上与强化学习相当或更优,但功能和语义多样性显著下降,在需要多样化策略的分布外场景中失败。
该论文证明在SETH假设下,Furthest Pair、Bichromatic Closest Pair等几何问题在d=ω(1)维度时需n^{2-o(1)}时间。此前Chen (2020)只对d=2^{Θ(log^* n)}维度成立。新结果将所有可构造维度纳入下界,意味着现有f(d)·n^{2-Θ(1/d)}算法的维度依赖本质上不可避免。证明技术利用了OpenAI近期对Erdos单位距离猜想的反证方法。
本文手把手教你从零搭建一个OpenHarness风格的智能体运行时,包含工具调用、类型化工具模式、权限控制、生命周期钩子、记忆模块、技能系统、上下文压缩、重试逻辑、成本追踪以及多智能体协调共10个核心组件。所有代码均可直接运行,无需API密钥或额外基础设施。通过暴露完整控制流,你将理解框架内部机制而非将其当作黑盒。
NVIDIA 发布 NeMo AutoModel,通过自动化模型并行、混合精度训练和梯度检查点,简化 Transformer 模型微调流程。该工具可自动检测硬件配置,支持多 GPU 分布式训练,无需手动调整参数。在微调 BERT-base 模型时,相比标准 PyTorch 实现,NeMo AutoModel 将训练时间缩短约 40%,并保持相同精度。
这篇教程展示了如何利用Amazon Nova 2 Sonic和Amazon Bedrock AgentCore构建一个语音预约提醒助手。该助手能够通过语音验证患者身份,处理确认、取消或改约操作,并收集就诊前健康信息。当需要时,助手会将问题升级给人工客服。教程包含一个浏览器界面用于测试,若要连接真实电话线路,需集成Amazon Connect等电话服务。