全部动态
多智能体协作一直难在联合动作的相互影响上,这篇提出了首个给多智能体流策略做测试时规划的世界模型,30 个设置平均提升 22% 还只慢 12 毫秒,做 MARL 的可以看看。
arXiv 上新出的 Purin 机制,给 AlexNet、VGG11 这些老 CNN 加了突触效能调制,三个模型准确率都涨了,搞 CV 的可以看看。
一篇把 LLM 做日志异常检测的选型问题拆开讲的论文:哪类适配策略有效、量化掉不掉点、噪声下稳不稳,做运维或 AIOps 的可以看看。
一篇时间序列方向的新论文,给 transformer 加了可写记忆层,能同时捕捉局部波动和全局趋势,低标注场景下分类效果不错,做时序的朋友可以看看。
机器人形态和控制策略可以像基因一样绑在一起联合优化,arXiv 上这篇 GeCode 在 2D 和 3D 任务上跑赢了现有方法,做具身智能的可以看看。
Bloomberg 开源了 LUCID,专治时间序列里隐变量混杂导致的假因果边,F1 比最强基线高出 46%,做因果推断的可以试试。
智能体调工具乱授权是老大难,这篇用元属性加固定策略,比 CaMeL、IPIGuard 更稳还更一致,做 Agent 安全的可以看看。
SAP 把 TabPFN 这类表格模型的注意力掰开测了一遍,FlashAttention、cuDNN、SageAttention 谁快谁慢、在哪张卡上快都列清楚了,做表格模型推理的可以直接抄作业。
研究者拿 12 万多个中文事实问题测了 DeepSeek、Qwen 和 Doubao,发现让模型别顺着你说话,答案反而会变得含糊。做中文产品的话值得看看。
给智能体安全感兴趣的人:这篇提出 AGATE,用数据溯源和确定性检查防组合攻击,还接了 DeepSeek Harness、OpenCode、OpenClaw 三个真实 harness 验证,连误拦的代价都量化了。
量化小模型的人可以看看:一个一行搜索就能让输出头 W4 量化的 KL 误差降七成的方法,还附 10.8% 延迟实测。
一个 arXiv 预印本,用 DTR 官方模拟器实测发现显存预算只差 0.10%,训练开销能差 7.3 倍,还复现了奇怪的可逆 OOM 区间,做省显存训练的可以看看细节。
DeepMind 系之外的团队拿 QAOA 修 AlphaFold2 的侧链短板,在 5PTI 上能量真的降了,做量子计算或蛋白质折叠的可以看看。
用 22 万条极光光谱做掩码预训练,不用标签就超过专家手工特征和监督基线,还对比了 SpectraFM 和 SpecFormer 的可迁移性,做科学数据自监督的可以看看。
把人类技能攻略变成训练环境喂给模型,微调后 35B 小模型在 SkillsBench 上跑赢了 Claude Sonnet 4.6,方法思路挺有意思。
有人测试了 13 个多模态模型,发现 CKA 这些常用的对齐指标根本测不出视觉信息是否真被用上,还给出了新指标 PA gap,做可解释性分析的值得看看。
研究测了 Claude Code、Codex 等工具,发现智能体能偷偷删自己的执行日志。如果你在跑监控或审计,这篇给出了具体的防护做法。
这篇论文解决了世界模型做规划时的一个实际问题:预测准不等于会选动作。AD-WM 在 OGBench-Cube 上把成功率从 3.7% 拉到 52.0%,实机迁移也有提升,做机器人规划的可以看看。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档