全部 AI 动态 · AI 热点

6月24日

12:11

12:11

arXiv cs.AI@Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

该论文证明通用智能体在大型场景下不可能具备万能能力，传统最坏情况分析无法区分关键瓶颈与无关失败。作者提出结构化认证框架，将受目标条件的性能映射到智能体内部世界模型的逐项保证。他们设计了基于深度组合目标过滤特定转换的算法，并证明在该目标下的通用智能体具有误差界为O(1/n)+O(δ)的结构化世界模型。该界限在δ较小的条件下是紧的，从而允许通过定位可靠的长时规划转换来认证部署通用智能体。

论文世界模型智能体结构化认证规划

推荐理由：这篇论文从理论上解决了通用智能体部署时的可靠性问题，给出了具体的误差界限和认证方法，对智能体安全研究很有参考价值。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

12:10

12:10

arXiv cs.LG@Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

PACT是一种混合架构，结合快速反应式RL策略与慢速SLM规划器。它异步调用2B参数SLM生成候选动作计划，经仿真验证安全、可行、完整后直接执行，无需重训练RL策略。在三个难度递增的FrozenLake配置上，PACT超越所有基线，表明规划与反应协同比单独使用更强。

论文 PACT Small Language Model Reinforcement Learning FrozenLake 规划

推荐理由：这篇论文提出了PACT，用一个小型语言模型来规划动作，再结合强化学习策略，在FrozenLake上比纯RL效果好，而且不用重训练。

6月15日

11:12

11:12

arXiv cs.AI@Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

SIMMER是一个基于人类策划的厨房领域符号世界模型的新基准，包含77个动作、262个独特物体和约46,800种语义真实的交互。实验在六个LLM上进行，前沿模型错误率最高仅17%，最多56%的计划包含潜在失败，其中多数导致不可逆后果。通过反事实预测模拟，潜在失败可减少72%，不可逆情况减少75%。该基准揭示了现有评估忽略的关键失败类型。

论文 SIMMER LLM 世界模型智能体规划

推荐理由：新基准暴露LLM规划隐藏盲区

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月18日

12:14

12:14

arXiv cs.AI@Augusto B. Corrêa, André G. Pereira, Jendrik Seipp

精选

本文提出一种属性引导的LLM程序合成方法，用于PDDL规划领域。传统方法依赖简单分数（如测试通过数）评估程序，缺乏失败原因反馈，导致大量无效生成和评估。新方法在程序违反形式化属性时立即停止评估，并返回具体反例，引导LLM修复。在10个规划域上的实验表明，该方法平均每个域生成程序数减少7倍，无需搜索即可解决更多任务，评估计算量降低数个数量级。该方法适用于任何存在可验证属性的问题，能显著降低成本并提升程序质量。

论文程序合成 LLM 规划形式化验证 PDDL

推荐理由：做AI规划或程序合成的团队，这篇论文提供了一种减少LLM调用次数、提升生成效率的实用方法——用形式化属性替代分数反馈，直接给反例引导修复，值得点开看看具体实现。