全部动态
AI 相关资讯全量信息流 · 785 条
8月12日
8月11日
SWE-Bench ProMax:大规模多语言代码重构智能体基准
想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。
Meta新论文提出Skaling law:耦合容量与数据的新缩放定律
Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。
8月10日
8月8日
8月7日
8月6日
8月5日
同一模型和提示词,换 Agent Harness 单次成功成本相差 5-30 倍
别急着换模型,先看看 agent harness。同一任务成功成本能差 5 到 30 倍,论文还给了省 token 的提示模板。
LongHorizon-Harness:评测真实世界长时程智能体
有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。
8月4日
论文06:24
微软研究院发布SocialRL、PazaBench V2等研究看微软研究院这周新东西:SocialRL 教小模型谈判,PazaBench V2 补非洲语言语音评测,顺带还有 EvoLib 智能体知识库。
8月3日
8月2日
8月1日
AgentRadio:异步消息层打破多智能体阶段边界
这篇把4个Claude Code用AgentRadio串起来,SWE-Atlas上干到62.1%,比单跑Opus 4.8还高。搞多智能体协作的值得看看。
论文03:16
Qwen-UI-Agent技术报告:迈向下一代真实世界GUI智能体Qwen-UI-Agent出了一份技术报告,做的是能操作真实图形界面的智能体,不是只会聊天。想了解GUI智能体怎么搞的可以看。
7月31日
7月30日