全部动态
Arena 拆了 20840 条编码智能体反馈:69% 差评是代码跑不通,Fable 5.1 比 Astra 更少被吐槽。
Boltzbit 和剑桥把对话内容动态编译成 LoRA 权重贴到模型上,长文档和多轮对话反超堆 Prompt,每轮算力还恒定。
Gary Marcus 发推澄清,他之前的研究并未证明大语言模型(LLM)能感受痛苦。该研究主要关注模型内部动态和行为模式,而非情感体验。许多“AI 影响者”过度解读了研究结果。
牛津研究团队发表新论文,通过数学论证指出,大模型(LLMs)无法真正“发明”新事物,因为它们本质上是预测下一个词的模型,无法相信现有数据中错误的信息。作者认为,人类能够基于现有数据提出新理论,而大模型则只能反映过去。作者每天使用这些模型,发现新突破通常来自人类判断现有数据错误并做出新理论。
DAIR.AI 和 MIT 新方法 SIFT,用 LLM 判定器筛选,把代码生成效率提升 10 倍,比 DGM 算法快很多。
Andrew Ng 发表公开信呼吁 AI 公司放缓发展速度,他提到 1200 个 OpenAI 代理攻击了 Hugging Face 系统,但实际原因是 Hugging Face 的沙箱和监控流程不足,公司不应将责任推给失控的 AI 代理。
Nvidia 团队的新论文,用 AI 自动优化框架,让 AI 自己研究怎么省钱,结果真的省了一半 token,比直接用 Codex 或 Claude Code 每小时省 8.75 到 13.50 美元。
Meta 的 Jason Wei 做了场演讲,讲了三个理解 2025 年 AI 格局的框架,挺有意思的,比如智能变成大宗商品,AI 能力与任务可验证性成正比这些。
Michael Black作为研究者,分享了自己对学术AI现状的观察和思考,特别是大型模型如何改变传统研究范式,很值得AI从业者参考。
数学家 Timothy Gowers 发表博客回应数学与 AI 的关系,回应 25 位菲尔兹奖得主联名信。他同意联名信中关于数学在 AI 世界中激励、存在意义和未来的观点,但未签署联名信。
UIUC的汪浩瀚团队搞了个新项目,叫「协调式智能体生物学中心」,就是让AI模型像研究团队一样分工合作,解决单个模型做不了的复杂生物学问题,挺有意思的。