17:43AI Will@FinanceYF5Moonshot AI 创始人兼CEO杨植麟在GTC 2026介绍其学术生涯。他曾在清华、卡内基梅隆大学求学,并在Meta AI、Google Brain工作,与Yoshua Bengio和Yann LeCun合作。其早期论文XLNet被引用超过10,000次。第三代模型Kimi K3加入原生视觉能力,支持1M-token上下文,仅使用16个活跃专家。AI模型Kimi K3Moonshot AI杨植麟10 个信源在谈事件专题推荐理由:杨植麟从Transformer-XL、XLNet到Kimi K3,只用16个专家就做到1M上下文,值得看看他的思路。原文稍后读已读值得跟进有用关注 Kimi K3
16:39官方一手marktechpost@Asif Razzaq72°NVIDIA 推出 Cosmos 3 Edge,一个 4B 参数的开放世界模型,专为设备端运行设计。该模型可帮助机器人和视觉 AI 代理理解环境、实时推理并本地生成动作。Cosmos 3 系列此前已于 2026 年 5 月 31 日在 GTC Taipei 发布 Cosmos 3 Nano(16B)和 Cosmos 3 Super(64B)。AI模型NVIDIACosmos 3 Edge机器人6 个信源在谈事件专题推荐理由:NVIDIA 把 40 亿参数的开放世界模型塞进设备端,机器人不用联网就能自己理解环境、推理并执行动作,适合边缘部署场景。原文稍后读已读值得跟进有用关注 NVIDIA
16:01官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯BAC团队提出ProLaViT框架,用于渐进式潜在视觉思维,使多模态LLM(如Qwen2.5-VL)无需外部视觉工具即可在潜在空间中逐步推理。该框架被ECCV 2026接收,在多个视觉推理基准(如MMMU、MathVista、CLEVR)上相比直接推理方法提升5-15%准确率。ProLaViT通过引入潜在思维令牌,让模型在内部推理步骤中分解复杂视觉问题。AI模型ProLaViT腾讯多模态推荐理由:腾讯发了ProLaViT,让多模态模型像人一样一步步想问题,不用外部工具就能解决视觉推理错误,ECCV 2026保底。原文稍后读已读值得跟进有用关注 ProLaViT
12:12官方一手arXiv: DeepSeek@Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma精选MADA-RL是一个针对参数≤4B紧凑模型的后训练框架,通过LoRA微调少量参数,将模型分为生成器和评论家角色。其核心是反事实评论家优势:动态基线使评论家优化方向为改进生成器共识而非简单复现正确答案。在五个数学推理基准上,DeepSeek-R1-Distill-Qwen-1.5B模型准确率从39.9%提升至41.9%(+2.0点,p<0.001),可训练参数仅为全微调基线的1/16。该方法接近但未超越使用更大数据集的DeepScaleR和STILL-3,分析表明训练后的评论家更擅长纠正生成器错误。论文MADA-RLDeepSeek-R1-Distill-Qwen-1.5BLoRA推荐理由:小模型也能提升推理?MADA-RL用LoRA微调1/16参数,让1.5B模型准确率涨2个点,评论家专挑生成器错误来纠正。原文稍后读已读值得跟进有用关注 MADA-RL
12:03官方账号arXiv cs.LG@Hang Zhang, Warren J. GrossPPL-Factory提出了基于困惑度(perplexity)的任务感知和预算感知数据选择框架,用于大语言模型微调。在GSM8K上仅用1%训练数据即超越现有最佳方法;用10%数据在GSM8K上超过全量微调0.9个点,在MATH上超出4.8个点。该方法通过区分语言建模与推理任务的不同学习目标,实现高效且可解释的数据筛选。论文PPL-Factory数据选择微调推荐理由:想省训练成本又想模型推理更强?PPL-Factory用10%数据在MATH上比全量微调高4.8,门槛低、效果还更炸。原文稍后读已读值得跟进有用关注 PPL-Factory
12:02官方一手歸藏(guizang.ai)@op7418Anthropic一位数学家使用Fable 5模型证明了雅可比猜想的一个反例,该猜想87年来未被解决,曾列入21世纪18大数学难题。随后OpenAI内部Codex版本(不联网)也独立证明了类似反例。该问题曾是张益唐博士的博士论文核心,因其导师给出的错误引理而长期未果。相关推文在Twitter获得超过2000万次浏览,引发对AI数学能力与学术环境的讨论。AI模型Fable 5OpenAI CodexAnthropic10 个信源在谈事件专题推荐理由:Anthropic的数学家随手用Fable 5怼翻了87年的雅可比猜想,OpenAI的Codex也跟上了,连张益唐当年都没搞定,AI这波真有点猛。原文稍后读已读值得跟进有用关注 Fable 5
11:35官方账号arXiv cs.AI@Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu论文提出SOPHIA方法,通过分析推理轨迹中隐状态转换,发现失败轨迹陷入自循环。该方法构建状态对索引的引导向量库,在推理时实时检测自循环并干预。在多个基准测试中,SOPHIA有效提升任务准确率和令牌效率。实验表明,细粒度控制能改善推理质量。论文SOPHIA激活引导推理模型推荐理由:这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。原文稍后读已读值得跟进有用关注 SOPHIA
10:53官方账号arXiv cs.AI@Peiji Yu, Xin Chen, Tianxing Wu本文提出 Debate-on-Graph (DoG) 框架,使大语言模型能与不确定知识图谱 (UKG) 自适应协作。DoG 首先设计针对 UKG 的启发式搜索算法,提取可靠且与问题相关的子图,减少噪声。然后引入多智能体辩论机制,通过对抗性辩论获得可靠答案。在四个基准 QA 数据集上的实验显示,DoG 超越现有 LLM 推理方法和基于 KG 的基线方法。论文Debate-on-GraphUncertain Knowledge GraphLLM推荐理由:这篇论文用多智能体辩论来让大模型在不确定知识图谱上推理更靠谱,四个基准都刷了新成绩,值得一看。原文稍后读已读值得跟进有用关注 Debate-on-Graph
09:29官方账号arXiv cs.AI@Utopia Meng, Unicornt Zhao, Derek Li, Goalen Gao, Frank DuTalaria是一个会话感知的无服务器多模型推理系统,针对工具使用代理的会话连续性优化。在单台TP=8服务器上,用30个SWE-Bench会话(960次调用)测试三个超百亿参数模型。相比轮询调度器(无会话预填充、主机KV恢复和D2D分段),p50会话完成时间从1000秒降至189秒(加速5.3倍),p95从2296秒降至867秒(加速2.6倍)。论文TalariaSWE-BenchLLM推荐理由:这篇论文的Talaria系统把工具代理场景下百亿参数模型的p50延迟从1000秒降到189秒,挺实用的加速方案。原文稍后读已读值得跟进有用关注 Talaria
04:20Ate-a-Pi@svpino精选Runpod推出针对AI模型的serverless服务,解决大模型加载慢和空闲GPU成本高的问题。他们采用FlashBoot技术,将空闲模型转移到廉价存储,流量恢复时快速调回GPU,冷启动时间低于200ms。部署时弃用Docker,改用Python函数,指定GPU后几秒即可完成。该方案声称比主流云厂商降低成本90%。AI产品RunpodFlashBootServerless推荐理由:Runpod让部署大模型像serverless函数一样快,冷启动200ms,成本降90%,不用再纠结闲置GPU还是等待加载了。原文稍后读已读值得跟进有用关注 Runpod
22:16elvis@omarsar0网友 @omarsar0 在推文中称,其 LLM 模型 Fable 找到了 Jacobian 猜想的一个反例:映射 ((1+xy)^3 z + y^2 (1+xy)(4+3xy), y + 3x(1+xy)^2 z + 3xy^2(4+3xy), 2x - 3x^2 y - x^3 z) 的 Jacobian 行列式为 -2,且将 (0,0,-1/4)、(1,-3/2,13/2)、(-1,3/2,13/2) 均映射到 (-1/4,0,0)。作者认为标准基准测试不足以衡量 LLM 的真实能力,LLM 在解决极端难题上被低估了。AI模型FableJacobian猜想数学推理推荐理由:Fable 这个 LLM 自己找到了一个复杂数学猜想的反例,比很多基准测试中的题目难得多,值得关注。原文稍后读已读值得跟进有用关注 Fable
21:40岚叔@lufzzlizQwen-3.8 Max 参数量2.4T,支持多模态和1M上下文。同任务下速度比Kimi-K3快十倍,对探索性任务性价比高。前端能力与SOTA模型不相上下,限时一折、夜间0.2折。正式版将开源并持续进化,擅长Cowork类Agent任务。AI模型Qwen-3.8-Max阿里推理模型10 个信源在谈事件专题推荐理由:阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。原文稍后读已读值得跟进有用关注 Qwen-3.8-Max
16:06官方一手Pandaily@contact@pandaily.com (Pandaily)Moonshot AI旗下Kimi K3模型在AlphaEngine的专有IRB投资研究基准测试中,以更高得分击败GPT-5.5和OPUS-4.8。测试涵盖时间判断、证据边界控制和前提修正三个维度。Kimi K3已部署在AlphaEngine平台上。AI模型Kimi K3Moonshot AIAlphaEngine10 个信源在谈事件专题推荐理由:Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。原文稍后读已读值得跟进有用关注 Kimi K3
10:23IT之家(博客/媒体)腾讯混元大模型Hy3限时免费活动延长至8月5日,面向WorkBuddy和CodeBuddy用户。Hy3于7月6日开源,采用MoE架构,总参数295B,激活参数21B,支持256K上下文。模型在推理、智能体、长上下文任务上显著进步,性能比肩参数规模2-5倍的更大模型。AI模型腾讯混元Hy3MoE推荐理由:腾讯又给了两周免费试用Hy3,到8月5日。这个295B参数的MoE开源模型激活仅21B,但性能能打,适合推理和智能体场景。原文稍后读已读值得跟进有用关注 腾讯混元
10:06官方一手marktechpost@Michal Sutter精选社区开发者用 Claude Fable 5 的推理链数据微调了 OpenBMB 的 MiniCPM5-1B,得到一个仅 657MB 的最小化本地推理模型。该模型支持 128K 上下文,推理过程可见。微调后的能力继承自原始模型,但授权条款在模型卡中未完全明确。AI模型MiniCPM5-1BOpenBMBClaude Fable 510 个信源在谈事件专题推荐理由:有人把 Claude Fable 5 的思维链塞进了 MiniCPM5-1B,搞出个 657MB 的本地推理模型,128K 上下文还能看它怎么想的,部署门槛极低。原文稍后读已读值得跟进有用关注 MiniCPM5-1B
09:33官方账号arXiv cs.AI@Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger多模态大模型(MLLM)在主动观察任务上能力缺失。新基准ActiveVision包含17个任务(3个类别),要求模型反复视觉感知而非单次描述。GPT-5.5在最高推理档次上仅解决10.6%的项,11个任务得零分;Claude Fable 5仅3.5%,而三名人类被试平均96.1%。即使让模型编写并运行自己的视觉代码,大部分差距依然存在,因为代码在真实图像上不可靠,且捕捉自身失败需要模型缺乏的主动感知。结果表明当前MLLM缺乏稳健的主动视觉观察能力。AI模型ActiveVisionGPT-5.5Claude Fable 510 个信源在谈事件专题推荐理由:想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。原文稍后读已读值得跟进有用关注 ActiveVision
09:27官方账号arXiv cs.AI@Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov该论文以国际象棋为受控测试平台,对5M至1B参数的语言模型进行预训练、监督微调和基于可验证奖赏的强化学习后训练。实验发现,后强化学习阶段的性能可由预训练损失准确预测,且奖励曲线斜率随预训练token数近似线性提升。强化学习并未简单锐化监督微调策略:在简单问题上增强已有正确动作,在难题上则浮现出监督微调下几乎不存在的正确动作。该规律在1B参数的数学领域语言模型上得到验证。论文推理模型强化学习预训练推荐理由:这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。原文稍后读已读值得跟进有用关注 推理模型
09:17官方账号arXiv cs.AI@Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani, Mitch Weiss新基准BusinessCaseBench涵盖18个学科数百个商业案例问题,每个问题配有专家编写的评分标准。前沿AI模型在该基准上已获得高分,且同一模型家族在两年内能力大幅提升。结果显示AI在分析性知识工作上的表现已经很高且快速进步。AI模型BusinessCaseBenchLLM基准推荐理由:想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。原文稍后读已读值得跟进有用关注 BusinessCaseBench
09:16官方账号arXiv cs.AI@Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan DaiLoopie系列包含两个MoE模型:20B参数(2B活跃)和6B参数(0.6B活跃)。它解决了循环Transformer的经典问题:在预训练计算量增加N倍时,循环N次不如增加参数N倍。实验表明,Loopie显著优于相同计算预算的普通Transformer基线。后训练阶段赋予模型强推理能力,在2025年IMO和IPhO中获得金牌(无外部工具)。AI模型LoopieIMOIPhO推荐理由:研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。原文稍后读已读值得跟进有用关注 Loopie
07:18官方账号Greg Brockman@gdbOpenAI 的 GPT 5.6 Sol 被认为是最有趣的数学模型。Thomas Bloom 检查了 erdosproblems.com 上几个新证明,均正确。这些证明包含有趣的想法。推文认为数学与科学进步已接近。AI模型GPT 5.6SolOpenAI8 个信源在谈事件专题推荐理由:OpenAI 的 GPT 5.6 Sol 在数学证明上表现靠谱,检查了几项新证明全对,还带来了新思路。原文稍后读已读值得跟进有用关注 GPT 5.6
21:28shao__meng@shao__meng精选Cline 团队在相同 CLI 环境下测试 Kimi K3 和 Claude Fable 5 修复同一仓库 bug。Fable 5 耗时 3.5 分钟、18 次工具调用,Kimi K3 耗时 12 分钟、34 次工具调用,慢 3.4 倍。Token 消耗上 Kimi 用 120 万,Fable 用 73 万,Kimi 多 1.7 倍。但费用 Kimi 仅 $0.92,Fable 需 $2.13,Kimi 便宜 2.3 倍,源于其每 token 定价 $3/$15 对比 Fable 的 $10/$50。这是首次开源模型在修复任务中与顶尖闭源模型正面竞争。AI模型Kimi K3Claude Fable 5Cline10 个信源在谈事件专题推荐理由:想省钱就用 Kimi K3,想快就用 Fable 5,两个都能修好 bug,实测数据给你参考。原文稍后读已读值得跟进有用关注 Kimi K3
18:59岚叔@lufzzliz阿里发布Qwen3.8-Max-Preview模型,参数规模超过2万亿。官方评测称其性能仅次于Fable 5。该模型已在Token Plan、Qoder和QoderWork平台上线。作为新一代大参数模型,它旨在提升推理和多任务能力。AI模型Qwen3.8-Max-Preview阿里巴巴Qoder推荐理由:阿里新出的2万亿参数大模型Qwen3.8-Max-Preview,号称只比Fable 5差一点,已经能直接试用了,想看看它有多强可以测测。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-Preview
16:45量子位@Jay上海AI Lab提出一种方法,让Harness模型通过搜索、验证和迭代实现自我进化,无需更换模型即可在多个任务上取得104%的效果提升。该方法利用自演进机制优化模型性能,验证了无需额外训练即可显著提升推理能力。AI模型Harness上海AI Lab自进化推荐理由:上海AI Lab搞了个新招,不换模型就能把Harness性能翻倍,实用又省钱。原文稍后读已读值得跟进有用关注 Harness
14:07Ethan Mollick@emollick用户向Kimi K3提问,要求推荐两首适用于当前GenAI模型状态的诗。Kimi K3的思维链(CoT)长度达到32页。推理过程中出现大量循环和死路,展现了K3复杂的推理模式。AI模型Kimi K3CoT思维链10 个信源在谈事件专题推荐理由:Kimi K3的思维链居然有32页长,还不停绕圈,看看它怎么解诗题原文稍后读已读值得跟进有用关注 Kimi K3
09:54AI Will@FinanceYF576°Elon Musk 表示,将速度和成本纳入考量后,Grok 4.5 是目前第一名。在 Artificial Analysis 上,Grok 4.5 每项 Intelligence Index 任务仅花 $0.31,而 Claude Fable 5 为 $2.75、Claude Opus 4.8 为 $1.80、GPT-5.6 Sol 为 $1.04、Kimi K3 为 $0.95,Grok 4.5 成本比 Claude Fable 5 低近 9 倍。在 FrontierSWE 基准上,Grok 4.5 每任务 token 用量比 Fable 5 少近 6 倍,仍排名靠前。SpaceXAI 通过 token 效率实现顶级智能与低成本结合。AI模型Grok 4.5效率成本推荐理由:SpaceXAI 的 Grok 4.5 用 $0.31 就干到一流水平,比 Claude 便宜 9 倍,token 还省 6 倍,省钱党可以关注。原文稍后读已读值得跟进有用关注 Grok 4.5
07:58Ethan Mollick@emollick用户以中文请求 Kimi K3 挑选两首不陈腐且适用于 LLM 的诗,但模型在思维链中 95.5% 的字符(88% 的单词)使用英文,即便它明确考虑的是面向中文读者的中文诗歌。这一比例揭示模型在处理中文任务时可能依赖英文推理空间。测试基于单次交互,未涉及更大规模统计。AI模型Kimi K3思维链多语言10 个信源在谈事件专题推荐理由:Kimi K3 回应中文请求时,思维链几乎全英文,挺有意思的观察,适合好奇模型内部机制的朋友。原文稍后读已读值得跟进有用关注 Kimi K3
04:12Aravind Srinivas@AravSrinivasTogether AI 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5 的软件工程任务表现。结果显示,Kimi K3 以 Fable 5 约 35% 的价格实现了相同性能,且在更高 pass@k 指标上领先。该分析来自 Together AI 的 Arav Srinivas,数据基于内部测试。AI模型Kimi K3Claude Fable 5Together AI10 个信源在谈事件专题推荐理由:想省钱又要强性能?Kimi K3 在编程任务上和 Claude Fable 5 打个平手,价格只要三分之一,高要求场景还更强。原文稍后读已读值得跟进有用关注 Kimi K3
22:57IT之家(博客/媒体)72°埃隆·马斯克透露 xAI 的下一代 Grok 4.6 模型参数规模为 2 万亿,预计下周完成初始训练。该模型在各方面优于当前 1.5 万亿参数的 Grok 4.5,且推理速度和 Token 效率接近。马斯克猜测 Grok 4.6 可能超过月之暗面的 Kimi 3。xAI 使用 Colossus 集群(约 20 万块 GPU)进行训练。AI模型GrokxAI2万亿参数推荐理由:xAI 的 Grok 4.6 参数飙升到 2 万亿,下周就练完了,据说能超 Kimi 3,看看它和 GPT 比到底咋样。原文稍后读已读值得跟进有用关注 Grok
16:45官方一手pandaily@contact@pandaily.com (Pandaily)73°Moonshot AI推出Kimi K3,这是继DeepSeek和Manus后第三次中国AI冲击波。Kimi K3定价为每百万token 3至15美元,相比美国主流模型显著降低。该模型迫使全球市场重新评估美国AI的溢价定价和高估值是否可持续。Kimi K3标志着中国AI从廉价路线转向高端能力。AI模型Kimi K3Moonshot AI定价10 个信源在谈事件专题推荐理由:Kimi K3定价$3-15/M token,比美国模型便宜很多,看看Moonshot怎么用低价倒逼市场。原文稍后读已读值得跟进有用关注 Kimi K3
10:00官方账号Clement Delangue@ClementDelangue精选Kimi k3每token价格是GPT-5.6 Sol的一半,但GPT-5.6 Sol生成所需token数仅一半,总成本相近。GPT-5.6 Sol的TPS是Kimi k3的2倍,实际任务速度快约4倍。用户指出Kimi k3性能优秀但并非超值选择。AI模型Kimi k3GPT-5.6 Sol推理模型10 个信源在谈事件专题推荐理由:有人觉得Kimi k3便宜?其实和GPT-5.6 Sol算下来价格差不多,GPT-5.6 Sol速度还快4倍,别被误导了。原文稍后读已读值得跟进有用关注 Kimi k3
05:18官方账号OpenAI@OpenAIOpenAI在推特上宣布GPT-5.6 Sol模型,声称用户有10000个理由喜爱它。该模型通过switch-to-codex.openai.chatgpt.site可访问。目前尚未公开基准测试结果或具体改进细节。AI模型GPT-5.6 SolOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI刚发了GPT-5.6 Sol,号称一万人说好,去那个链接看看它到底强在哪。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:36Gary Marcus@GaryMarcus精选73°Kimi K3是一款2.8万亿参数的模型,支持100万token上下文窗口,在SWE-Bench Pro、SWE-bench Multilingual、BrowseComp和Toolathlon上达到SOTA。它自主运行20小时内核优化实验,实现1.6倍加速。推理价格仅$0.25/百万token,而Fable 5收费$1.30。背后公司Moonshot估值$30B,计划于7月27日开源权重。AI模型KimiK3Moonshot推荐理由:Kimi K3性能打平甚至超越Claude和Fable,价格却只有它们的五分之一,还开源,性价比炸裂。原文稍后读已读值得跟进有用关注 Kimi
00:07AI Engineer@aiDotEngineer2018年,Google X秘密启动用机器学习改进编程的项目,Benoit Schilling担任CTO。如今他领导Google DeepMind的Gemini Thinking、Reasoning和Coding团队,认为AI编程已从机器约束进入设计约束阶段。核心挑战不再是写代码本身,而是确保代码满足复杂需求,开发者角色转向架构、验证和高层推理。行业Google DeepMindGeminiGoogle X推荐理由:Google DeepMind 的 Benoit Schilling 分享了AI编程的新阶段:难点不在写代码,而在设计对齐。他亲自领导 Gemini 的推理和编程团队,观点很实在。原文稍后读已读值得跟进有用关注 Google DeepMind
19:46Yangyi@YangyixxxxxAI发布的Grok-4.5模型被用户评价为速度快、自由度高,能在NewMax中执行逆向Codex等复杂任务。该模型定位为编码、智能体和知识工作的全能旗舰,支持500k上下文窗口,可配置推理强度。API定价为$2/$6每百万token,低于同类旗舰模型。在独立评测中,其每智能指数任务成本显著低于对手,输出token效率领先。AI模型Grok-4.5xAI编程助手推荐理由:Grok 4.5被用户吹爆,说它又快又便宜还能干复杂活,甚至能逆向Codex。如果你想要个干活利索、不磨叽的模型,可以试试它。原文稍后读已读值得跟进有用关注 Grok-4.5
15:00orange.ai@oran_geKimi K3 模型现已上架到 Cola 平台。据发布者称,该模型的智能水平仅次于 Fable 和 GPT 5.6。由于访问量较大,当前推理速度可能较慢。该模型定位为高性能推理模型,适合对比测试。AI模型Kimi K3Cola推理模型10 个信源在谈事件专题推荐理由:Kimi 新模型 K3 上架 Cola,号称只比 Fable 和 GPT 5.6 差一点,想试顶尖水平可以去跑跑。原文稍后读已读值得跟进有用关注 Kimi K3
13:33IT之家(博客/媒体)华为昇腾950超节点(Atlas 950 SuperPoD)真机在2026世界人工智能大会首次公开亮相,基于灵衢互联协议,支持1024卡规模,提供1 EFLOPS FP8和2 EFLOPS FP4算力。该超节点拥有256TB全局统一内存编址空间,时延低至3μs。同时,昇腾384超节点已商用落地750多套,覆盖互联网、运营商、金融等行业,是国内唯一训练出SOTA模型的超节点。AI产品华为昇腾950超节点推荐理由:华为发布了昇腾950超节点,1024卡规模,1 EFLOPS算力,专为万亿参数大模型训练设计;384超节点已商用750套,落地案例丰富,值得关注。原文稍后读已读值得跟进有用关注 华为
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon HanOn-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。论文OPD²蒸馏推理模型推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。原文稍后读已读值得跟进有用关注 OPD²
11:17IT之家(博客/媒体)精选Ubuntu 内核团队于 7 月 16 日报告,Linux 7.0.0-28.28 内核中的 AMDGPU 驱动问题导致 ROCm 计算负载吞吐量降至 1/42。在 Stable Diffusion XL 通过 ComfyUI 推理时,原先约 9 秒的任务延长至 388 秒。该回归源自 Linux 7.0 稳定版上游内核,CachyOS 和 Fedora 用户也已反馈相同问题。行业UbuntuAMDGPUROCm推荐理由:Ubuntu 说这个内核版本让 AMD 显卡跑 AI 慢 42 倍,SDXL 推理从 9 秒变成 388 秒。如果你在用 Ubuntu,赶紧看看内核版本号。原文稍后读已读值得跟进有用关注 Ubuntu
10:59官方账号arXiv cs.AI@Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao ZhengMM-IssueLoc 是评估多模态仓库级问题定位的新基准,包含 652 个 issue-PR 实例、23 种编程语言,标注了 7 种图像类别和 4 个相关性等级。它提供文件级与函数级真值标签,支持纯文本与带图像两种评估模式。在测试中,最强 agent 仅达到 38.96 文件 Acc@5 和 22.45 函数 Acc@10,最强检索器达到 33.86 函数 Acc@10,表明现有系统在多模态定位上仍不可靠。该基准将视觉证据作为显式评估变量,避免与下游补丁生成效果混在一起。论文MM-IssueLoc多模态仓库级问题定位推荐理由:新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。原文稍后读已读值得跟进有用关注 MM-IssueLoc
10:00官方账号arXiv cs.AI@Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev AroraT2MLR是一种基于Transformer的潜在推理架构,将前一token的中间层表示缓存并注入当前token的早期层,使抽象中间计算能跨解码步骤持续。在自然语言预训练和多跳推理微调中,T2MLR始终优于同等数据和参数的Transformer基线。仅对20%的网络应用中层循环就能超过全层循环。改装1.7B预训练Transformer并微调后,数学推理性能显著提升。AI模型T2MLRTransformer推理模型推荐理由:一种新的Transformer改进:只改中间20%的层加个循环机制,就能让模型推理更持久,而且可以直接改装现有模型不用从头训。原文稍后读已读值得跟进有用关注 T2MLR