这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。
全部动态
想测翻译模型有没有背答案?Cultivar 用本地化对照来抓数据污染,32 个开源模型跑下来,发现 MT 专用模型反而更脆,美国内容翻译得最好。
这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。
想用最少实验搞清楚因果机制?MDA 把 LLM 和贝叶斯结合,自动设计实验、发现模型,物理化学生物三领域都刷新了纪录。
这篇论文给去中心化下了个清晰定义,还搞了两个新指标,能自动算系统去中心化程度。搞联邦学习或区块链的可以看看,比之前那些模糊说法靠谱。
想用影像预测基因突变?这篇论文告诉你多标签学习不是万能药,KRAS和TP53联合预测能提AUC,但EGFR组合就没用,得看突变配对。
卫星联邦学习老被轨道数据不均衡坑,FedOrbit 用分层聚合和自适应分解,在遥感基准上最高提了 16 个点,做边缘 AI 的可以看看。
想找能处理噪声数据、还能告诉你不确定性有多大的回归方法?ERRLESS用强化学习从后验里采样表达式,Feynman基准上表现不错,表达式还短。
这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。
这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。
做LLM集群硬件设计的朋友可以看看,这个框架能自动探索芯片间互连方案,在DeepSeek-R1上吞吐提升44%,内存省98%,还开源了。
SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
做长期记忆的智能体开发者可以看看,SodaMem用图结构加证据链,在LongMemEval-S上准确率92.8%,成本还低,比普通RAG日记靠谱。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档