斯坦福团队做了个 StudentBench,拿 2383 人测 AI 教 GRE,效果跟人类导师打平,价格便宜 918 倍,数学部分回得越快学生学得越好。
论文
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
有人把 EU AI Act 那套系统性风险分类做成了开源评估面板,18 个模型最坏情况评分比平均分低 14–37 分,证据可逐条追溯。
一篇把拍卖机制套到 LLM 采购上的论文,Llama 和 Qwen 实测显示固定定价比竞价贵 10% 到 71%,做 API 成本优化的可以看看思路。
给做机器人策略的人:MemBodied 用固定大小记忆替代越堆越长的上下文,RMBench 上成功率达到无状态策略的 7.81 倍,参数开销还小 10 倍。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
arXiv 上这篇论文讲怎么让智能体改的代码和硬件设计在合并、部署前拿到可核验的授权,对做工程流程和合规的人挺有参考价值。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
论文提出了 CASPER 框架来摘要审讯对话,还配套 6000 条标注的 MINDSum 数据集,做法是让警官、督察等多角色打分迭代,ROUGE 和 BERTScore 都超了基线。
论文提出 ARIA 框架,专门解决多个各自合规的 AI 智能体放一起可能产生集体性歧视的问题,还对照了 EU AI Act 的监管要求,做金融合规的值得看看。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
机器人换个机位就翻车的问题有解了:InfiNoVA 用 3D Gaussian 造新视角训练数据,陌生视角成功率提升 5.4 倍,不用改模型架构。
一篇交通预测论文,提出了 LoReST 网络,用局部加区域两级建模替代昂贵的全对交互,在 LargeST 四个数据集上误差明显下降。
医院里 AI 写放射报告容易漏病灶或编造发现,这篇论文用 Jev 做低成本裁判,成本不到 3 美分评 100 对报告,做医疗 AI 评估的可以看看。
做游戏内或实时状态类对话智能体的朋友看看,三个包装器把接地准确率从 60% 多拉到 96.7%,延迟还压在 1.5 秒。
这篇论文发现 ICL 微调会让模型更容易被假上下文带偏,实测最多降 14.95 个点,J-ICL 方法能两边兼顾,做 RAG 或智能体的朋友可以看看。
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
这篇对照实验实测了 Figma Make 到底省不省时间:50 个设计师加 50 个产品经理做同样任务,用的人快 20%,产品经理提升最明显。