SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。
#推理模型
Kimi K3定价$3-15/M token,比美国模型便宜很多,看看Moonshot怎么用低价倒逼市场。
Google DeepMind 的 Benoit Schilling 分享了AI编程的新阶段:难点不在写代码,而在设计对齐。他亲自领导 Gemini 的推理和编程团队,观点很实在。
华为发布了昇腾950超节点,1024卡规模,1 EFLOPS算力,专为万亿参数大模型训练设计;384超节点已商用750套,落地案例丰富,值得关注。
Ubuntu 说这个内核版本让 AMD 显卡跑 AI 慢 42 倍,SDXL 推理从 9 秒变成 388 秒。如果你在用 Ubuntu,赶紧看看内核版本号。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
他们搞了个叫 Schema 的 harness,让 AI 学物理学家那样思考,直接刷爆 ARC-AGI-3 基准,挺有意思的。
Lila Sciences的两位高管聊了个大胆想法:把实验室当数据中心用,用10万亿实验token训练AI,跨学科搞推理,比单纯刷题更有价值。
Moonshot发了2.8万亿参数Kimi K3,前端代码超越Fable 5,开放权重版月底就能用,价格虽高但看齐Claude Sonnet。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。
想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。
GPT-5.6 智商飙到 136 分,比 Claude-5 还高出一截,而且干活也不含糊,一句话就能造出应用,值得看看它到底多强。
这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。
Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。