全部动态
Sakana AI 和东大搞了个给机器人“先在模拟器里彩排再上场”的方法 SAIL,成功率能从 25% 拉到 73%,做机器人方向的可以看看。
McKinsey 拿出了实际数据:AI 参与的候选药物,发现时间砍掉 15% 到 80%,做医药或关注 AI 落地的可以看看。
把技能文档变成 2756 个训练环境直接练进模型权重,微调后的 Qwen3.5-35B-A3B 在终端基准上超过了 Claude Sonnet 4.6,思路很新颖。
dair-ai 又更新一周论文榜了,这次有 7 篇,稀疏化和智能体自组织团队那几篇可以翻翻,找找自己方向的灵感。
这篇讲的是怎么让科研智能体把实验预算花在刀刃上,同预算下比 AutoResearch 奖励高 10.3%,尝试次数省一半,做法挺巧。
MIT CSAIL 的 JAZ 框架只用一个 invoke 原语就搞定记忆和自我改进,跑分还便宜一半,写 agent 的朋友可以看看这篇论文。
Nvidia 搞了个 SoL-Pi,不改模型只优化 harness,编程智能体 token 省了 49%,跑 3000 多次实验试出来的。
哥大商学院算了笔账:7700万块 GPU 要赚回 3.725 万亿,摊下来每 GPU 小时 5.5 美元,比现在租价还低,基建账能算平。
搞 Agent 记忆层的可以看看这篇:Jev-Mem 用轻量控制器替代 LLM 做决策,构建快 6.6 倍,LoCoMo 上还涨了 11%。
医疗 AI 输出质量很难逐条人工评审,这篇 npj Digital Medicine 论文讨论用大模型当裁判自动打分,做医疗评估的可以看看思路。
一篇关于智能体训练的论文:让智能体先广泛练相关任务再啃难题,4 个任务上从 56.50% 提到 74.54%,附独立校验设计,做 agent 的可以看看。
Microsoft 这篇论文做了个 Taste-Bench,专门考智能体在任务分叉时选路的品味,最强模型也就答对 59.7%,还发现加大推理预算没用。
Microsoft 新论文 CASD,让编码智能体读完整日志自动改提示词,比 GEPA 多提 5.7 分,一次只要 1.6 美元,做 agent 的都该看看。
宫颈癌筛查里双染片人工判读很费病理医生,这篇验证了 AI 自动判读靠不靠谱,做医疗 AI 的可以看看外部验证怎么做。
做了 50 多个临床 AI 算法、铺到 2000 家医院的团队,把落地比研发更难的坑都写出来了,做医疗 AI 的朋友别错过。
把人类技能攻略变成训练环境喂给模型,微调后 35B 小模型在 SkillsBench 上跑赢了 Claude Sonnet 4.6,方法思路挺有意思。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档