一个 7B 模型在 CUDA 上干过 Claude-4.5-Sonnet,靠的是两个小模型互相出题互相训练,生成 GPU kernel 的可以看看这套思路。
早读VOL 2026.09.30671 篇
大模型数学推理存组合鸿沟
新加坡·二〇二六年九月三十日 星期三·DAILY · 每早八时
2026年9月30日,AI领域研究揭示大模型在数学推理中面临组合鸿沟挑战,即使独立解决中间步骤,在组合完整问题时仍失败率达33-48%。同时,清华大学提出One-Shot OPD技术,将训练集缩减至单个查询,在数学基准上达到完整数据87%的性能。此外,Anthropic发布Claude Code更新,引入1M上下文窗口和MCP重连功能,AI工具链效应研究显示复杂工具链对模型能力提升的边际收益递减。
01
模型发布/更新
5 篇KernelZero:Proposer 与 Coder 协同进化生成高性能 GPU Kernel
NanoGPT 训练纪录刷新至 39.9 秒,Deven Pzak 引入 flop 级稀疏优化
Deven Pzak 把 NanoGPT 训练干到 39.9 秒,思路不是堆算力而是按 flop 精打细算,嵌入参数撒到 65B 还只用 124M 活跃参数,搞训练的都该看看。
Meta RAM 团队提出 RL-XAR:用专家对齐评分标准做写作 RL
Meta 把 RL 那套可验证奖励搬进了写作:先让 Kimi-K2.6 自动生成能区分专家和 AI 的评分标准,再用它训练 Qwen3.5-27B,盲评 95% 胜率打赢人类专家文本。
02
产品发布/更新
5 篇03
行业动态
5 篇04
论文研究
5 篇05
技巧与观点
3 篇671今日事件
132一手报道
142新模型
168信源
AITOP · 编辑系统自动生成