想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。
强化学习再进化,AI代理安全告急
2026年6月23日,AI 领域在强化学习、智能体安全与模型效率三大方向取得关键进展。SPIRAL 框架让语言模型学会并行搜索与聚合推理,实现最高11倍扩展效率;Prime Intellect 发布支持万亿参数 MoE 的强化学习框架,推动推理能力边界。与此同时,治理衰退研究揭示上下文压缩会静默移除安全策略,导致违规率骤增至59%,提示注入研究也发现模型更信文本风格而非角色标签。Sakana AI 推出编排模型Fugu,动态路由任务至最优LLM,RLM-Cascade 系统则通过投机解码将API成本降低45.8%。这些进展既点燃了推理能力爆发,也拉响了智能体安全的警报。
模型发布/更新
5 篇这个系统把DeepSeek和Opus组合起来,用投机解码省了近一半API成本,还快了一倍,质量也有提升,而且开源可部署。
Sakana AI 搞了个 Fugu 编排模型,能自动在多个前沿 LLM 之间切换最优选择,在编码和推理基准上表现很突出。
产品发布/更新
5 篇Prime Intellect 新开源的 prime-rl 0.6.0,专为训练万亿参数 MoE 模型的强化学习设计。他们在 SWE 任务上用 GLM-5 跑到 131k 序列长度,速度还很快,想了解大规模 RL 训练优化的可以看看。
Claude Code 新版来了,能直接命令行登录 MCP 服务器,工作流视图加过滤,插件多了技能页,还修了一堆 bug,升级很值。
LangChain搞了个低成本trace judge,用阿里Qwen微调,性能不输顶级模型还便宜100倍,做trace监控的可以看看。
行业动态
5 篇JEDEC 刚批了 SPHBM4 内存标准,引脚数砍到 HBM4 的五分之一,速率飙到 44 Gbps,AI 芯片封装门槛大降。
Anthropic的Claude Code团队负责人分享了他们如何让工程师效率提升8倍、用脏话计数衡量体验,还提到非程序员用Claude Code做MRI分析等趣事,全是实战干货。
论文研究
5 篇技巧与观点
5 篇Hugging Face分享了他们如何用GPT-4和GitHub Actions把库发布从两个月一次提速到每周一次,还保留了人工把关,挺实用的经验。
想给 AI 代理按请求计费?看 Ampersend 怎么用 Bedrock AgentCore 做自动路由,还能控预算。
Simon用Claude Code把0.2B参数的Moebius图像修复模型跑在浏览器里,无需显卡就能涂掉图片里的东西自动补全,挺酷的。
IBM Research开源了CUGA框架,有24个现成示例,教你一步步构建能调用工具、多步推理的智能体。想快速上手Agent开发可以看看。