#LLM
斯坦福团队做了个 StudentBench,拿 2383 人测 AI 教 GRE,效果跟人类导师打平,价格便宜 918 倍,数学部分回得越快学生学得越好。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。
Simon Willison 写了个 LLM 插件接入 TypeSafe AI 的 Jev 模型,专做分类、判断、打分这类结构化输出,配的示例直接能抄来用。
OpenRouter 介绍了 Jev 的 Classifiers 功能,能自动给你的 LLM 请求打标签,再到 Explore 页面看各场景的用量分布,运维排查很方便。
Multiverse Computing 把“LLM 该删哪些层”写成 Ising 模型用物理方法解,比逐层打分剪枝的思路新鲜。
这篇论文挺有意思的,专门研究大模型如何理解中文网络热词,比如“yyds”这种,还做了个专门的基准测试,对做跨语言AI或者安全相关的研究应该挺有参考价值。
Gary Marcus 发推澄清,他之前的研究并未证明大语言模型(LLM)能感受痛苦。该研究主要关注模型内部动态和行为模式,而非情感体验。许多“AI 影响者”过度解读了研究结果。
Datawhale 和 RadixArk 联合发起的开源课程,教你从零手搓 mini-sglang,最后能对照真实 SGLang 源码提 PR,适合想深入了解 LLM 推理引擎的人。
TypeSafe AI 新出的 Jev 模型,推理速度比同类 LLM 快 200 倍,成本也低很多,对做代理循环的应该有用。