10:34量子位@允中五大高校联合发布了首份机器人三视角世界模型评测。评测聚焦三视角世界模型的稳定性表现,回答"谁更稳"这一核心问题。五大高校表示榜单将持续更新。AI模型世界模型机器人三视角推荐理由:五大高校做了个机器人三视角世界模型评测榜,谁更稳看榜单就清楚了,之后还会持续更新。原文稍后读已读值得跟进有用关注 世界模型
06:30elvis@omarsar0Zachary Horvitz发现,把上传的论文从paper.pdf改名为paper_final_draft_pdf_ready_for_review.pdf,GPT-5.6-Terra给出的平均评审分数就会上涨。这个针对GPT-5.6-Terra的实验显示,LLM评审会受文件名等无关因素干扰。他因此建议,在GPT-5.6-Terra这类模型上不要用数值评分做评审,尽量改用二元标签,比如通过/不通过。技巧gpt-5.6-terraLLM评审论文推荐理由:把论文名改成最终送审版,GPT-5.6-Terra给的分数就涨了。以后让LLM审稿别要分数,直接让它说过/不过。原文稍后读已读值得跟进有用关注 gpt-5.6-terra
02:38Harrison Chase@hwchase17LangChain创始人Harrison Chase在X上分享了内部智能体评估的通用方法。他们以Harbor为统一评估基准,并通过专用skill将traces或原始数据转换为Harbor任务。该评估思路计划沿用到LangChain后续的基准测试中。相关帖子获得了1332次浏览。技巧LangChainHarbor智能体推荐理由:Harrison Chase讲了他们内部怎么测智能体,就是统一用Harbor,还能把日志变成评测任务。做智能体评测的可以参考这套流程。原文稍后读已读值得跟进有用关注 LangChain
14:27Philipp Schmid@_philschmidPhil Schmid 本周在 aiDotEngineer 大会上发表演讲,主题涉及智能体与评估。他将在 Google DeepMind 展台或演讲后与参会者交流。本次分享预计涵盖智能体系统的构建思路和自动化评测方法。行业aiDotEngineerGoogle DeepMindPhil Schmid推荐理由:Phil Schmid 要去 aiDotEngineer 讲智能体和评测,想了解 agent 评估的同学可以去现场找他聊聊。原文稍后读已读值得跟进有用关注 aiDotEngineer
02:13官方一手AWS Machine Learning Blog@Po-Shin Chen精选AWS博客介绍了Strands Evals工具,用于检测AI Agent执行中的失败并定位根因。调用detector函数后,输出包含分类失败类型与置信度分数、从根因到下游症状的因果链,以及修复建议(指定修改系统提示还是工具定义)。该工具可集成到评估流程中,实现每个测试运行的自动诊断。技巧Strands EvalsAWS智能体2 个信源在谈事件专题推荐理由:AWS教你用Strands Evals自动揪出AI Agent的失败根因,还告诉你该改提示词还是工具定义,比盲猜管用多了。原文稍后读已读值得跟进有用关注 Strands Evals
04:35lmarena.ai@lmarena_aiAgent Arena 发布了完整的智能体排行榜,涵盖多个 AI 模型的智能体能力评测。该排行榜通过自动化测试评估各模型在任务执行、工具调用等方面的表现,为开发者选择智能体模型提供参考。榜单数据公开可查,支持社区持续关注和对比。AI产品智能体排行榜评测推荐理由:做智能体开发的团队可以直接参考这份排行榜选型,省去自己评测的时间,建议点开看看各模型的具体表现。原文稍后读已读值得跟进有用关注 智能体
12:51lmarena.ai@lmarena_aiAnthropic 的 Claude Fable 5 模型在 Agent Arena 中首次亮相,由 Peter Gostev 进行评测。该视频展示了模型在智能体任务中的表现,包括推理、工具调用和交互能力。Claude Fable 5 被认为在复杂任务处理上有所提升,为开发者提供了新的选择。AI产品Claude Fable 5智能体评测10 个信源在谈事件专题推荐理由:做智能体开发的团队可以看看 Claude Fable 5 在 Agent Arena 的实际表现,直接对比其他模型,值得点开视频一探究竟。原文稍后读已读值得跟进有用关注 Claude Fable 5
23:30lmarena.ai@lmarena_aiAgent Arena 推出了新的排行榜,用于评估智能体模型的综合表现。该排行榜从 5 个关键信号维度进行评测:确认成功率、好评与投诉比、可操控性、Bash 恢复能力以及工具幻觉。这些维度覆盖了智能体在实际任务中的可靠性、用户满意度、灵活性和鲁棒性。对于开发者和研究者来说,这是一个了解不同智能体模型优缺点的直观工具。AI产品智能体排行榜评测推荐理由:做智能体开发或选型的团队,可以直接用这个排行榜对比模型在成功率、可操控性等关键维度的表现,省去自己搭建评测流程的麻烦。原文稍后读已读值得跟进有用关注 智能体
21:36官方一手Anthropic: Engineering(资讯)Anthropic 发布了一项研究,量化了基础设施噪声对智能体编程评测的影响。他们发现,不同的运行环境、工具链版本和硬件配置会导致评测结果出现显著偏差,最高可达 30%。这项研究提出了标准化评测流程的建议,帮助开发者更准确地评估 AI 编程助手的真实能力。对于依赖评测结果进行模型选型和优化的团队,这直接关系到决策的可靠性。论文智能体编程助手评测6 个信源在谈事件专题推荐理由:做 AI 编程评测的团队终于有了量化噪声的方法论——基础设施差异能让结果偏差 30%,建议所有做 agentic coding 评估的开发者点开,避免被虚假分数误导。原文稍后读已读值得跟进有用关注 智能体