一项发表在 npj Digital Medicine 的多中心研究,测了医生审查生成式 AI 临床建议时能抓出多少错误,做医疗 AI 的人可以看看。
全部动态
DeepSeek 发论文讲了训练智能体的沙箱系统 DSec,一天能跑 300 万个沙箱,并发 38 万,做 RL 训练的可以看看。
Boltzbit 和剑桥搞了个新架构,把聊天里的新知识直接编译成 LoRA 权重写进模型,长对话和多轮场景下比 RAG 省算力还更准。
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
斯坦福团队做了个 StudentBench,拿 2383 人测 AI 教 GRE,效果跟人类导师打平,价格便宜 918 倍,数学部分回得越快学生学得越好。
研究者用对比学习训练了一个 ModernBERT Bi-Encoder,判断两段文字是不是同一人写的,在 PAN21 上准确率 98.4%,还列出了调参要点。
把 transformer 注意力当成动力系统来分析的物理论文,找出了混沌、凝聚这些相变结构,做理论或注意力机制研究的可以看看。
一篇理论论文,搞清楚了两层 ReLU 分类器什么时候解唯一、什么时候全局最优,还证明加个 skip connection 就能消除次优局部解,做理论的朋友可以看看。
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
arXiv 上的新论文,Clifford-VAE 把图像数据编码成超维符号向量,做 VSA 基准测试比 Gaussian 和 Hyperspherical VAE 都强,搞神经符号方向的可以看看。
一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
给机器人策略做"删除指定动作"的遗忘方法,在 Unitree G1 和 H2 上验证过,涉及 GDPR 和安全问题的话很值得看看思路。
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
有人把 EU AI Act 那套系统性风险分类做成了开源评估面板,18 个模型最坏情况评分比平均分低 14–37 分,证据可逐条追溯。
一篇把拍卖机制套到 LLM 采购上的论文,Llama 和 Qwen 实测显示固定定价比竞价贵 10% 到 71%,做 API 成本优化的可以看看思路。
给做机器人策略的人:MemBodied 用固定大小记忆替代越堆越长的上下文,RMBench 上成功率达到无状态策略的 7.81 倍,参数开销还小 10 倍。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
arXiv 上这篇论文讲怎么让智能体改的代码和硬件设计在合并、部署前拿到可核验的授权,对做工程流程和合规的人挺有参考价值。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
小米 LLM-Core 团队搞了个 HySparse2 稀疏注意力,1M token 预填充计算量降约 5 倍,做长上下文的可以看看。
数据同化方向的论文,用流匹配把经典集合滤波升级成非线性更新,实验上超过了四种经典滤波器,做预报或同化的朋友可以看看。
搞材料计算的朋友可以看看,1540 万个固液界面 DFT 结构直接可用,配 MACE 模型就能训练自己的机器学习势。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档