01:55Gary Marcus@GaryMarcusOpenAI 发布了 GPT - 5 模型,该模型在 MMLU 基准测试中取得了 2098 分的成绩,超过了上一代模型的记录,成为当前行业领先水平,专家表示其多领域任务处理能力显著提升。generalGPT - 5OpenAIMMLU3 个信源在谈事件专题推荐理由:OpenAI 发了 GPT - 5 模型,能处理各种复杂任务,和之前模型比分数更高,适合需要高质量输出的场景。原文稍后读已读值得跟进有用关注 GPT - 5
08:20elvis@omarsar0精选IBM发布BenchDrift研究,生成基准问题的语义等价变体来测试模型鲁棒性。结果显示,弱模型从改写中获益多于损失,而强模型损失远大于获益。在GSM8K、MMLU和MATH-Hard上测试的8个模型中,措辞敏感性随模型增强不降反增。该研究表明,顶尖模型的基准分数高度依赖题目措辞,而非纯粹能力。论文已发布于arxiv.org/abs/2608.11694。论文BenchDriftIBMGSM8K推荐理由:IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。原文稍后读已读值得跟进有用关注 BenchDrift
09:31官方一手arXiv: Anthropic@Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt精选研究在120B参数规模上测试了宪法中期训练(constitutional midtraining),使用394M token的宪法语料库(基于Anthropic's Constitution)进行2x2因子设计(curriculum ordering × deliberative reasoning)。与仅回放的对照组相比,宪法中期训练的模型在对齐泛化和持久性上表现更好,尤其在blackmail测试中降低了17.5pp,且优势在良性微调后依然存在。该优势不适用于需要主动抵抗上下文压力的场景,且在SFT后减弱。宪法中期训练对MMLU、ARC-Easy、piqa、GSM8K等能力指标无平均损失。论文Constitutional MidtrainingAnthropic模型对齐8 个信源在谈事件专题推荐理由:Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。原文稍后读已读值得跟进有用关注 Constitutional Midtraining
10:15官方账号arXiv cs.LG@Anna Kuzina, Paul N. Whatmough, Babak Ehteshami Bejnordi72°论文揭示了因果自注意力二次复杂度对长上下文推理的瓶颈,在冻结骨干网络下隔离了状态更新设计的效果。研究表明Softmax依赖key相关的秩1正交投影,解释了为何delta式网络优于纯门控累积。作者通过引入sink token、短卷积和固定预算缓存路由等结构干预,减少了近似误差。在LLaMA和Qwen模型上扩展至32B参数,MMLU基准超越了先前后验线性化方法,长上下文检索匹配复杂自适应缓存框架。论文LLaMAQwenTransformer1 个信源在谈事件专题推荐理由:这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。原文稍后读已读值得跟进有用关注 LLaMA
20:13量子位@闻乐72°该模型参数量达1万亿,在MMLU基准上取得86.2%的准确率,超越同规模Llama-3.1-405B。它完全基于国产芯片训练,训练成本仅为同类模型的30%。模型已开源,采用Apache 2.0许可证,在GitHub上获得超过2万星标。AI模型万亿模型开源模型国产芯片4 个信源在谈事件专题推荐理由:有个模型不用英伟达显卡就做到了万亿参数,性能还比Llama强,成本更低,开源可商用,搞大模型的可以试试。原文稍后读已读值得跟进有用关注 万亿模型
12:33官方一手Claude: Blog(资讯)精选Claude Opus 是Anthropic最新旗舰模型,在MMLU基准测试中达到90.2%,在HumanEval代码生成测试中达到90.1%,均超越GPT-4。它支持200K token上下文窗口,在复杂推理、多语言对话和编程等任务上表现领先。该模型采用Constitutional AI训练方法,提升了安全性和可控性。AI模型Claude OpusAnthropicMMLU10 个信源在谈事件专题推荐理由:推理编程都碾压,性价比高原文稍后读已读值得跟进有用关注 Claude Opus