全部动态
一篇把 14B 视频世界模型压到 1.3B、四步就能跑的蒸馏论文,专治 DMD 蒸馏后机器人动作变僵的问题,做具身智能的可以看看。
Agent 批准了改数据库,结果顺带发了条没人要的通知,现有护栏根本拦不住。这篇论文的 EffectMatch 在提交前比对实际持久化结果,206 个任务上全拦住了错误提交。
多智能体协作一直难在联合动作的相互影响上,这篇提出了首个给多智能体流策略做测试时规划的世界模型,30 个设置平均提升 22% 还只慢 12 毫秒,做 MARL 的可以看看。
arXiv 上新出的 Purin 机制,给 AlexNet、VGG11 这些老 CNN 加了突触效能调制,三个模型准确率都涨了,搞 CV 的可以看看。
一篇把 LLM 做日志异常检测的选型问题拆开讲的论文:哪类适配策略有效、量化掉不掉点、噪声下稳不稳,做运维或 AIOps 的可以看看。
一篇时间序列方向的新论文,给 transformer 加了可写记忆层,能同时捕捉局部波动和全局趋势,低标注场景下分类效果不错,做时序的朋友可以看看。
机器人形态和控制策略可以像基因一样绑在一起联合优化,arXiv 上这篇 GeCode 在 2D 和 3D 任务上跑赢了现有方法,做具身智能的可以看看。
Bloomberg 开源了 LUCID,专治时间序列里隐变量混杂导致的假因果边,F1 比最强基线高出 46%,做因果推断的可以试试。
智能体调工具乱授权是老大难,这篇用元属性加固定策略,比 CaMeL、IPIGuard 更稳还更一致,做 Agent 安全的可以看看。
SAP 把 TabPFN 这类表格模型的注意力掰开测了一遍,FlashAttention、cuDNN、SageAttention 谁快谁慢、在哪张卡上快都列清楚了,做表格模型推理的可以直接抄作业。
研究者拿 12 万多个中文事实问题测了 DeepSeek、Qwen 和 Doubao,发现让模型别顺着你说话,答案反而会变得含糊。做中文产品的话值得看看。
给智能体安全感兴趣的人:这篇提出 AGATE,用数据溯源和确定性检查防组合攻击,还接了 DeepSeek Harness、OpenCode、OpenClaw 三个真实 harness 验证,连误拦的代价都量化了。
量化小模型的人可以看看:一个一行搜索就能让输出头 W4 量化的 KL 误差降七成的方法,还附 10.8% 延迟实测。
一个 arXiv 预印本,用 DTR 官方模拟器实测发现显存预算只差 0.10%,训练开销能差 7.3 倍,还复现了奇怪的可逆 OOM 区间,做省显存训练的可以看看细节。
DeepMind 系之外的团队拿 QAOA 修 AlphaFold2 的侧链短板,在 5PTI 上能量真的降了,做量子计算或蛋白质折叠的可以看看。
用 22 万条极光光谱做掩码预训练,不用标签就超过专家手工特征和监督基线,还对比了 SpectraFM 和 SpecFormer 的可迁移性,做科学数据自监督的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档