#语言模型
研究人员发现,在共享语言模型中,限制模块间的证据可见性,能让模型在组合任务上表现更好,比全局可见的模型平均高出20个百分点,而且学到的接口更可复用。
DeepMind 的 Tom Zahavy 说了个大实话:LLM 搞不了真正的新发现,得靠世界模型。不是泛泛空谈,有论文为证。
这篇论文发现大多数大模型判断概率时普遍乐观,只有Anthropic的模型偏悲观,还揭示对齐训练会改变偏差方向,值得AI开发者和伦理研究者关注。
如果你想看语言模型在世界杯预测上的硬核评测,这个基准用104场真实比赛对比了13个系统,结果比博彩市场强得有限,但细节预测有亮点。
Anthropic发现Claude大脑里也有个“工作台”,大部分信息是潜意识,只有一小部分能主动调用。想看看大模型内部怎么“想”的?这篇论文很有料。
这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。
这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。
这篇论文为AI语言哲学提供了新视角,做AI伦理、语言模型研究的学者或开发者值得一读,能帮你跳出“AI是否有意识”的争论,重新理解输出文本的本质。
Hassabis 点出了当前大语言模型的核心天花板——文本无法替代真实体验,做 AI 研究或关注 AGI 路径的人值得细读,看完会对世界模型的价值有更深理解。
这篇论文揭示了AI医疗建议中隐藏的价值偏见问题,做医疗AI开发或临床决策支持的团队值得关注——它提醒我们,模型不只是输出答案,还在无声地传递伦理立场。
这项研究为理解语言模型内部功能组织提供了全新视角,做AI可解释性或认知科学交叉研究的团队值得关注——它把临床神经心理学方法搬到了模型分析中,看完会重新思考“模型损伤”的意义。
循环Transformer训练难、部署贵的问题被Attractor Models用不动点求解优雅解决,做语言模型预训练或推理增强的团队值得关注——它用更少参数和成本实现了对更大模型的超越。
该工作揭示了不同语言模型在规划能力上的根本差异:仅部分模型(如Gemma-3-27B)真正依赖内部的前瞻性计划,而其他模型则依赖逐词条件。这对理解模型内部机制和未来设计更可控的生成系统有参考价值。