Salesforce 这篇论文很有意思:训练多轮工具调用时只练关键那一步,在 BFCL v4 上能多拿 14 个点,做法讲得很清楚。
论文
微软研究院的 Agensh 论文,不用中央调度器,让 1000 多个编码智能体靠共享状态自己协作,pandoc 任务通过率从 33.89% 干到 55.06%,玩法挺新鲜。
Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。
这篇不聊概念,讲一个真实上线的阿拉伯语语音产品怎么搭:6 个 MCP 服务器做检索、自训的 6B 路由模型和 TTS 都开源了,做语音 Agent 的能抄不少作业。
一篇推理系统论文,解决多模态模型 Encode 阶段拖垮 GPU 利用率的问题,goodput 比 vLLM 高 1.7 倍、比 NVIDIA Dynamo 高 4.3 倍,做 MLLM 服务的可以看看。
智能体调工具乱授权是老大难,这篇用元属性加固定策略,比 CaMeL、IPIGuard 更稳还更一致,做 Agent 安全的可以看看。
Sakana AI 和东大搞了个给机器人“先在模拟器里彩排再上场”的方法 SAIL,成功率能从 25% 拉到 73%,做机器人方向的可以看看。
把技能文档变成 2756 个训练环境直接练进模型权重,微调后的 Qwen3.5-35B-A3B 在终端基准上超过了 Claude Sonnet 4.6,思路很新颖。
这篇讲的是怎么让科研智能体把实验预算花在刀刃上,同预算下比 AutoResearch 奖励高 10.3%,尝试次数省一半,做法挺巧。
MIT CSAIL 的 JAZ 框架只用一个 invoke 原语就搞定记忆和自我改进,跑分还便宜一半,写 agent 的朋友可以看看这篇论文。
Nvidia 搞了个 SoL-Pi,不改模型只优化 harness,编程智能体 token 省了 49%,跑 3000 多次实验试出来的。
搞 Agent 记忆层的可以看看这篇:Jev-Mem 用轻量控制器替代 LLM 做决策,构建快 6.6 倍,LoCoMo 上还涨了 11%。
医疗 AI 输出质量很难逐条人工评审,这篇 npj Digital Medicine 论文讨论用大模型当裁判自动打分,做医疗评估的可以看看思路。
一篇关于智能体训练的论文:让智能体先广泛练相关任务再啃难题,4 个任务上从 56.50% 提到 74.54%,附独立校验设计,做 agent 的可以看看。
Microsoft 这篇论文做了个 Taste-Bench,专门考智能体在任务分叉时选路的品味,最强模型也就答对 59.7%,还发现加大推理预算没用。
Microsoft 新论文 CASD,让编码智能体读完整日志自动改提示词,比 GEPA 多提 5.7 分,一次只要 1.6 美元,做 agent 的都该看看。
宫颈癌筛查里双染片人工判读很费病理医生,这篇验证了 AI 自动判读靠不靠谱,做医疗 AI 的可以看看外部验证怎么做。
做了 50 多个临床 AI 算法、铺到 2000 家医院的团队,把落地比研发更难的坑都写出来了,做医疗 AI 的朋友别错过。
智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Mid…
AI制药新玩家:Anthropic的"不盈利疾病"战略能否颠覆传统药物开发? Anthropic,这家以AI安全著称的公司,突然宣布进军药物发现领域。不是辅助工具,而是直接下场开发药物,而且专门瞄准那些传统制药巨头认为无利可图的疾病。这究…
1107 vs 303:谷歌这个开源模型,把大模型的“打字机”拆了 同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。DiffusionGemma 跑出了 1107 token/s,是标准版…
DiffusionGemma:当扩散模型开始“写”字,自回归的统治还能撑多久? 过去一周,我的信息流里“DiffusionGemma”这个词反复出现。在AI圈,当一个技术名词开始密集出现在各个群聊和推文中,通常意味着两件事:要么是又一轮泡…
每秒 1107 个 token,但问题从来不只是速度 昨天,Google 开源了 DiffusionGemma。 一个 26B 参数的模型,在 H100 上跑到 1107 tokens/s。对比之下,传统自回归的 Gemma 4,哪怕开启…