#智能体

共 6563 条 · 7 天 621 条 · 30 天 1780 条 · 话题观测 →
10月6日
论文Agent 与开发者多源确认10:33
测量优先的智能体排行榜审计框架:污染风险与评分器验证

一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。

事件专题
arXiv: DeepSeek@Dishu Yang 等 4 人3 个信源在谈原文