全部动态
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
一个做 3D 点云生成的新扩散架构 EMERGE,用图神经网络替代常规网格化管线,一次训练就能在任意分辨率零样本出结果,做 3D 生成的话可以看看这篇。
一篇体系结构论文,做了个跨主机的总线互连,64 卡系统上把 RoCE 的延迟砍一半,跑 DeepSeek R1 快 30%-80%,做 AI 集群的你看看。
拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。
拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
这篇论文挺反常识的:不用任何权重、靠 Mandelbrot 分形坐标做语言决策,延迟只有 7ms 还能跑在单片机上,可以看看它怎么绕开 LLM 的。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
Perplexity 公开了他们训练 Computer 智能体的后训练细节,用 RFT 加自蒸馏纠正错误工具调用,实测失败率降了 21%,做 agent 的话值得看看他们怎么用真实用户会话。
同一模型放进 Claude Code 和 Codex 跑同样的任务,结果居然会一个升一个降,这篇论文用 PowerPoint 重建实验讲清楚了 harness 的影响。
一篇教你怎么标注 on-policy 对齐数据的论文,思路是在 token 层面做修正,LLM 和 Agent 都适用,做对齐训练的可以看看。
一篇发表在 npj Digital Medicine 上的方法论文,用 MoE 加层级一致性来做脑连接组合成,还能一次预测多种大脑特质,做医学影像方向可以看看。
移植患者用药剂量很难拿捏,这篇 npj Digital Medicine 论文用可解释 AI 帮医生定他克莫司剂量,还告诉你为什么这么算。
想知道现在那些健康类 AI 到底能不能帮患者走完就医流程?这篇 npj Digital Medicine 的论文用了患者旅程这套评估框架,做医疗方向的人可以看看。
npj Digital Medicine 的新论文,讲医院上了编排平台之后怎么靠结构化变更管理让 AI 真正用起来,做医疗信息化的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档