OpenAI 做了个心理健康对话评测集,专门测模型遇到自伤、焦虑这类敏感问题时答得稳不稳,各家模型能拿它来横向对比。
全部动态
Microsoft Research 研究说机器人不用把推理都塞进本体,放到外部算反而任务成功率更高、效率更好,做具身智能的可以看看。
Stanford 和 Together AI 让 o3-mini、Claude Sonnet 4、DeepSeek-V3 自己商量怎么合作,只练 15 道题就在 AIME 上比理想路由器高 13.4 分,方法写得挺细。
Anthropic 出了份报告,讲有人拿代理偷偷转发用户 prompt 到 Claude API 蒸馏模型,还点出隐私风险,做 AI 产品的人都该看看。
DeepSeek 把训 Agent 最难的环境基建摊开讲了:每秒造 5000 个沙盒怎么做到,容器、虚拟机、镜像加载的全套工程细节都在论文里。
做仓库级代码生成的可以看看这篇:FeatLens 用功能索引建图再检索,比全仓库图方法省六成节点、四成多 token,检索还不用调 LLM。
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
这篇对照实验实测了 Figma Make 到底省不省时间:50 个设计师加 50 个产品经理做同样任务,用的人快 20%,产品经理提升最明显。
这篇讲了怎么把智能体跑长任务的 token 开销砍一半,方法只有一条:压缩只删不改,还开源了能在 Claude Code 里直接用的实现。
一篇很实在的论文:作者发现长文档检索差的真正元凶是近处无关文字抢注意力,给出 LYRA 方法外加 ProxBench 基准,做了 RAG 的话值得看他们的实验数据。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
研究 grokking 为什么突然泛化的论文,理论算出 grokking 时间由学习率乘 weight decay 决定,还用上千个网络验证了,做可解释性的可以看看。
数据集成领域的新论文,LOKI 能自动从文本里发现不同表之间的行级关联,精度 0.982,比直接调 LLM 便宜 40 倍,做数据湖的可以看看。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
机器人移动操作总因底盘跑偏而失败?这篇论文让策略直接预测地图坐标系下的底盘目标位姿再用定位反馈去跟踪,6 个真实任务成功率全赢速度控制,做具身智能的可以看看。
华为团队把 44 万个 GitHub 仓库和 55 万篇 arXiv 论文连起来,发现星标等信号能提前判断哪篇论文会火,精度提升 12%,数据集免费下载。
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档