WorldSolver 基准测试:LLM 智能体能写物理求解器吗
有人把 61 篇图形学论文的物理仿真做成了 168 道题考 LLM,GPT-5.6-Sol 也只考了 48.7 分,想看模型写仿真代码的真实水平可以读读。
有人把 61 篇图形学论文的物理仿真做成了 168 道题考 LLM,GPT-5.6-Sol 也只考了 48.7 分,想看模型写仿真代码的真实水平可以读读。
做游戏内或实时状态类对话智能体的朋友看看,三个包装器把接地准确率从 60% 多拉到 96.7%,延迟还压在 1.5 秒。
做 LLM 智能体安全评估的团队终于有了自动化工具——VESTA 能生成上千个真实任务场景,直接测出模型执行中的安全漏洞。建议关注智能体安全的开发者点开看看,结果可能会让你重新审视现有模型的风险。
做 LLM 智能体长期记忆系统的团队会发现,现有方案在依赖推理上几乎失效——MEME 基准暴露了被忽视的盲区,值得点开看看你的系统能否通过级联和缺失任务。