研究者用对比学习训练了一个 ModernBERT Bi-Encoder,判断两段文字是不是同一人写的,在 PAN21 上准确率 98.4%,还列出了调参要点。
全部动态
把 transformer 注意力当成动力系统来分析的物理论文,找出了混沌、凝聚这些相变结构,做理论或注意力机制研究的可以看看。
一篇理论论文,搞清楚了两层 ReLU 分类器什么时候解唯一、什么时候全局最优,还证明加个 skip connection 就能消除次优局部解,做理论的朋友可以看看。
斯坦福新开的 Agent 工程课,讲 SWE-agent 那位参与授课,课件免费公开,RAG 到评估到安全都覆盖了,自学党直接看。
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
微软开源了一个脚本,一条命令就能把全新 Win11 配成开发机,30 分钟装好 15 个常用工具,重装系统的可以试试。
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
arXiv 上的新论文,Clifford-VAE 把图像数据编码成超维符号向量,做 VSA 基准测试比 Gaussian 和 Hyperspherical VAE 都强,搞神经符号方向的可以看看。
一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
给机器人策略做"删除指定动作"的遗忘方法,在 Unitree G1 和 H2 上验证过,涉及 GDPR 和安全问题的话很值得看看思路。
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
有人把 EU AI Act 那套系统性风险分类做成了开源评估面板,18 个模型最坏情况评分比平均分低 14–37 分,证据可逐条追溯。
一篇把拍卖机制套到 LLM 采购上的论文,Llama 和 Qwen 实测显示固定定价比竞价贵 10% 到 71%,做 API 成本优化的可以看看思路。
给做机器人策略的人:MemBodied 用固定大小记忆替代越堆越长的上下文,RMBench 上成功率达到无状态策略的 7.81 倍,参数开销还小 10 倍。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
arXiv 上这篇论文讲怎么让智能体改的代码和硬件设计在合并、部署前拿到可核验的授权,对做工程流程和合规的人挺有参考价值。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
李佳琦这种顶流主播都开始被24小时不下班的AI数字人主播抢生意了,文章讲清了直播电商成本和玩法的变化。
Ornn 拉了三个月数据:OpenAI 降价 62%,DeepSeek 降 51%,但 B200 租金反涨 50%。想搞清楚钱最后流向谁的,看这篇。
Morgan Stanley 算了一笔账:7 家巨头给 AI 数据中心担保了 3000 亿美元,表外承诺超 3.1 万亿,想看懂这轮基建热就靠这些数字。
商汤的 SenseNova U1 Pro 图像模型上线了,走交错式思维链生成,最高能出 8K 分辨率图,Raccoon 应用和 API 都能用。
阿里云做了台叫 Qwen Book 的 AI 智能体 PC,键盘上有专门的 AI 技能键,还配了块 AI Island 状态屏,系统用 Omarchy,12 月就能申请试用。
阿里把手机智能体拆成了 Planner、Mobile-Use、Creative 三块再加 OS Harness,荣耀 Magic9 第一家接入,想了解手机 Agent 落地的可以看看。
有人拿 Claude Opus 5.5 加 Three.js 做了个演示,随手画的草图直接生成四阶段演进的 3D 房屋,做前端的可以看看思路。
一位开发者把三条 Agent 测试规则贴在 AGENTS.md 顶部,核心思路是用 E2E 加可复现产物替代事后补的单测,写 Agent 工作流的可以抄走。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档