11:13shao__meng@shao__meng75°马斯克在X上宣布,Grok 4.6将在两周内发布,Grok 4.7则在四周内发布。SpaceXAI的训练和发布速度极快,Grok 4.6的生命周期可能仅有14天。有猜测认为,Grok 4.6和Grok 4.7可能是针对不同能力或价位设计的互补模型。AI模型GrokSpaceXAI马斯克推荐理由:马斯克一口气官宣两个版本,Grok更新快得离谱,看看4.6和4.7到底怎么分工。原文稍后读已读值得跟进有用关注 Grok
11:07@hebbia@hebbia71°Hebbia 宣布在其平台中提供 Claude Opus 5。该模型在 Hebbia 的金融服务基准测试中,推理和引用准确性相比先前模型有显著提升。对于投资银行、私募股权公司和信贷基金,这意味着在收益分析、可比公司、尽职调查等工作流中输出更可靠。AI模型Claude Opus 5Hebbia金融推荐理由:Hebbia 上线了 Claude Opus 5,金融场景下推理和引用更准了,做收益分析和尽调更靠谱。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:00向阳乔木@vista8One2X公司王冠发文,借黄仁勋X平台首帖观点,将中美大模型竞争比喻为爬珠穆朗玛峰:美国从南坡靠训练驱动,中国从北坡靠推理驱动。文章指出两国持有不同资源牌面(美国阶跃式英雄史观,中国渐进式人民史观),导致AGI发展路径完全相反。行业One2X黄仁勋中美AI竞争推荐理由:王冠用登山比喻讲清中美AI路线差异,训练vs推理、英雄史观vs人民史观,看完对两国策略更有数。原文稍后读已读值得跟进有用关注 One2X
08:58SuperTechFans(博客/媒体)85°Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,智能水平接近 Claude Fable 5 但价格减半。该模型支持可调努力程度,在 Frontier-Bench、CursorBench 等多项基准测试中超越前代,尤其在软件工程、知识推理和自动化任务上表现突出。Opus 5 无数据保留要求,相比 Fable 的 30 天政策更受组织欢迎。实际使用中成本低于 Sonnet,早期客户反馈在调试、根因分析和自动化工作流中达到 100% 通过率。AI模型Claude Opus 5AnthropicClaude Fable 510 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5 智能接近 Fable 5 但价格减半,数据保留更灵活,适合团队用更少的钱获得顶尖推理能力。原文稍后读已读值得跟进有用关注 Claude Opus 5
08:13orange.ai@oran_ge评价称Opus 5的智能水平略微超过降智后的Fable 5,且价格保持为Fable 5的一半。OpenAI的开源模型已超过旧版Opus 4.8。Opus 4系列在引领上半年后逐渐退场。评论认为在开源巨浪下,这些模型都将成为浪花。AI模型Opus 5Fable 5Opus 4.810 个信源在谈事件专题推荐理由:Opus 5干过了降智版的Fable 5,价格还便宜一半,开源模型也追上来了,值得关注这波模型更迭。原文稍后读已读值得跟进有用关注 Opus 5
07:57官方账号Simon Willison’s Weblog(博客/媒体)78°Anthropic 推出 Claude Opus 5,定价与 Opus 4.8 相同,并保留双倍价格的快速模式。该模型在 Artificial Analysis 排行榜上超越 Claude Fable 5。性能接近 Fable 5 但价格仅为其一半。在 Frontier-Bench 任务中,Opus 5 自主编写计算机视觉流水线,从像素图重建 3D FreeCAD 模型。在发现漏洞方面接近 Mythos 5,但未训练漏洞利用能力。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 性能接近 Fable 5 还便宜一半,能自己写代码做 3D 重建,很强。原文稍后读已读值得跟进有用关注 Claude Opus 5
06:45官方账号Perplexity@perplexity_ai72°Claude Opus 5 现已在 Perplexity 和 Perplexity Computer 上可用。Perplexity 将其与另外六个模型在 WANDR 基准上进行了评估。Claude Opus 5 表现优于除 Fable 5 外的所有模型,同时成本比这些模型平均低 57%。AI模型Claude Opus 5PerplexityWANDR10 个信源在谈事件专题推荐理由:Perplexity 上了 Claude Opus 5,WANDR 跑分只输 Fable 5,价格还便宜一半多,可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
06:36Claude@claudeai71°在ARC-AGI-3基准上,Opus 5的得分是次优模型的3倍。该基准测试AI模型解决全新问题的能力,共包含400道题。Opus 5在多项类人推理指标上表现突出。AI模型Opus 5ARC-AGI-3推理模型10 个信源在谈事件专题推荐理由:Opus 5在ARC-AGI-3上得分碾压其他模型,证明它的泛化和推理能力很强。原文稍后读已读值得跟进有用关注 Opus 5
05:17Jerry Liu@jerryjliu0据观察,Claude Opus 5 的系统卡显示,在大约20-30%的已报告基准测试中,采用最大思考模式相比xhigh模式导致性能下降。通常增加思考时间和测试时计算会提升性能,但这些结果推翻了这一假设。这可能是小模型的自然涌现属性或后训练环节的问题。AI模型Claude Opus 5推理模型基准测试推荐理由:有人发现 Opus 5 开最大思考反而在某些基准上变差了,和直觉相反,值得研究。原文稍后读已读值得跟进有用关注 Claude Opus 5
05:06ollama@ollamaOllama 发布消息称,由于 GLM-5.2 等前沿开放模型在其云平台上需求激增,公司正在增加计算容量以应对流量。为了维持基础设施的响应速度,Ollama 决定暂时停止接受 Max 计划的新订阅。现有 Max 用户不受影响,而 Pro 计划仍开放新订阅。Ollama 还透露将在下周上线一些非常大的模型。AI产品OllamaGLM-5.2模型部署推荐理由:Ollama 说 GLM-5.2 太火了,怕服务慢,先暂停 Max 新订阅。Pro 还能买,下周还有大模型上线,想用的话赶紧。原文稍后读已读值得跟进有用关注 Ollama
03:36Patrick Loeber@patloeber79°Anthropic 推出 Claude Opus 5,官方称其智力水平接近 Fable 5,但定价仅为后者的一半。该模型还降低了提示缓存最低门槛,有助于优化开发者成本。发布同时基础设施建设同步推进,提升了响应效率。AI模型Claude Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5 性价比超高,接近 Fable 5 能力但价格砍半,缓存优化也实打实省钱。原文稍后读已读值得跟进有用关注 Claude Opus 5
03:00宝玉@dotey79°Anthropic 发布 Claude Opus 5,API 价格每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,仅为 Fable 5 的一半。Frontier-Bench v0.1 上得分是 Opus 4.8 的两倍多,单任务成本更低。CursorBench 3.2 最高 Effort 档下与 Fable 5 差距不到 0.5%,任务成本仅一半。ARC-AGI 3 得分是第二名模型的三倍,Zapier AutomationBench 在相同成本下任务通过率约为第二名的 1.5 倍。安全方面自动行为审计失准得分 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5。AI模型Claude Opus 5Fable 5Anthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 性能直逼旗舰 Fable 5,价格只要一半,多个基准全面碾压 Opus 4.8,开发者可以立刻用上。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:58AI SDK@aisdk72°Anthropic 发布 Claude Opus 5,这是一款思考型主动型模型,现已通过 AI SDK 可用。其智能水平接近 Fable 5,但价格仅为 Fable 5 的一半。该模型在推理和主动规划等任务上表现突出。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 性能接近 Fable 5,价格却只要一半,想省钱又不想降性能的可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:55官方账号Decoder@Matthias Bastian74°Anthropic推出了旗舰模型Claude Opus 5,在编码和知识工作基准上取得高分。该模型在ARC-AGI-3(评估新颖问题解决能力的基准)上达到30.2%,几乎是GPT-5.6 Sol的四倍。其token价格仅为Fable 5的一半。AI模型Claude Opus 5Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:Anthropic的新模型Opus 5在推理和编程上很强,价格只有Fable 5一半,性价比高。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:53cat@_catwu76°Anthropic 推出 Claude Opus 5,定位为“ thoughtful and proactive”模型。官方宣称其前沿智能水平接近 Fable 5,但价格仅为后者一半。该模型擅长长时间自主工作,适合复杂任务场景。AI模型Claude Opus 5ClaudeFable 510 个信源在谈事件专题推荐理由:Claude Opus 5 价格只有 Fable 5 的一半,性能差距不大,适合预算有限又想要前沿能力的团队尝试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:48Guillermo Rauch@rauchgVercel 宣布 Claude Opus 5 已在其 AI Gateway 平台上可用,并新增快速模式支持。相比前代 Opus 模型,Claude Opus 5 在智能体编程任务和低推理努力级别下的输出质量均有提升。该模型通过 Anthropic 的 API 提供服务,Vercel 用户可直接在 Gateway 中调用。AI模型Claude Opus 5VercelAI Gateway10 个信源在谈事件专题推荐理由:Vercel 把 Claude Opus 5 集成进了 AI Gateway,还加了快速模式,编程和低推理成本场景下比上一代 Opus 更强。想用最新 Claude 写代码的可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:38Alex Albert@alexalbert__81°Anthropic发布Claude Opus 5模型,定位为深思熟虑且主动的助手。官方称其智能水平接近Fable 5,但推理成本仅为后者的一半。该模型在x平台由Alex Albert推文首次公开。目前尚未披露具体基准跑分及开放渠道。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic新出的Claude Opus 5,据说能力逼近Fable 5,价格只要一半,性价比很能打。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:35Gary Marcus@GaryMarcus71°Anthropic 推出 Claude Opus 5,称其智能接近 Fable 5 的水平但定价仅为后者的一半。该模型定位为思考更主动的前沿模型,在多项基准测试中表现接近行业顶尖。这一降价策略延续了 Gary Marcus 2023 年预测的价格战趋势。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic 用半价拿出了接近 Fable 5 的模型,性价比拉满,想省钱又想要顶配可以看看。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:31The Rundown AI@therundownai81°Anthropic推出了Claude Opus 5,相比前代Claude 4.8有大幅提升。在多个基准测试中,Opus 5击败了竞争对手Fable。其定价仅为Fable的一半,性价比显著。该模型现已通过API提供。AI模型Claude Opus 5AnthropicFable10 个信源在谈事件专题推荐理由:Anthropic刚发Claude Opus 5,性能比4.8强不少,还在测试中赢了Fable,价格却只要一半,值得关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:13Claude@claudeai82°Claude Opus 5是Anthropic最新发布的推理模型,定位为深思熟虑且主动的模型。其智能水平接近Fable 5,但价格仅为Fable 5的一半。该模型在复杂推理和主动辅助任务上表现突出,旨在以更低成本提供前沿AI能力。AI模型Claude Opus 5Fable 5推理模型10 个信源在谈事件专题推荐理由:Claude Opus 5用一半价格接近Fable 5的水平,性价比很高,适合希望体验前沿AI但预算有限的用户。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:11Claude@claudeai76°Opus 5 今日在所有付费计划和 Claude API 上线,定价与 Opus 4.8 相同。它是 Claude Max 的默认模型,也是 Claude Pro 上最强的模型。此外提供 Fast 模式,运行速度约为默认的2.5倍。AI模型Opus 5AnthropicClaude Max10 个信源在谈事件专题推荐理由:Anthropic 发了 Opus 5,性能更强但没涨价,还有快2.5倍的加速模式,适合既要速度又要质量的人。原文稍后读已读值得跟进有用关注 Opus 5
02:00宝玉@dotey79°Claude Opus 5 API价格为每百万输入Token 5美元、输出Token 25美元,与Opus 4.8相同。在Frontier-Bench v0.1上成绩是Opus 4.8的两倍多,ARC-AGI 3得分达第二名模型三倍。使用最高Effort档时,CursorBench 3.2上它与最强模型Fable 5差距不到0.5%,任务成本仅一半。在OSWorld 2.0上,它用Fable 5三分之一成本即超越后者最佳成绩。Anthropic称其对齐程度最高,综合失准得分2.3,低于Opus 4.8、Sonnet 5和Fable 5。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Opus 5来了,价格没变但能力飙升,在多个基准上吊打旧款,编程和推理尤其强,还带自动降级和缓存优化。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:57Alex Albert@alexalbert__78°Anthropic 发布 Opus 5 模型,在多个领域提升 token 效率的同时,进一步拉高了智能水平。团队投入大量工作优化该模型,使其在编码任务上表现优于 Fable 5。用户反馈使用体验流畅。AI模型Opus 5Fable 5推理模型10 个信源在谈事件专题推荐理由:Anthropic 新模型 Opus 5,token 更省、智商更高,写代码比 Fable 5 顺手,值得试试。原文稍后读已读值得跟进有用关注 Opus 5
01:54Cognition@cognition_labs精选FrontierCode 1.1 是 Cognition 发布的评估真实工程任务的基准,考核代码合并性和质量。Opus 5 在该基准上取得 63.6% 的分数,扩展测试通过率 69.6%,性能接近 Fable 5 而成本仅为后者的一半。在 Devin 环境中,Opus 5 在困难调试和根因分析任务上表现突出。AI模型Opus 5FrontierCode 1.1Devin10 个信源在谈事件专题推荐理由:Opus 5 在代码工程基准上接近顶级模型,但价格只要一半,做调试分析特别强。原文稍后读已读值得跟进有用关注 Opus 5
01:53官方一手歸藏(guizang.ai)@op7418Claude Opus 5 已发布,定价与 Opus 4.8 相同。在多项基准测试中,Opus 5 成绩大幅优于 Opus 4.8,并且多数测评成绩高于 Fable 5。官方称其智能接近 Fable 5,但价格为 Fable 5 的一半。用户反馈该模型可用性明显提升。AI模型Claude Opus 5Opus 4.8Fable 510 个信源在谈事件专题推荐理由:Opus 5 性能强于 4.8,价格不变,还接近 Fable 5 但便宜一半,值得升级。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:24elvis@omarsar076°Anthropic推出Claude Opus 5,定价为Fable 5的一半。该模型在token效率上显著改进,接近Fable 5的边界智能水平。它被设计为更主动和善于思考的模型,兼顾前沿能力与成本可负担性。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Claude Opus 5价格只有Fable 5的一半,token效率更高,适合想要前沿智能又不想花大钱的用户。原文稍后读已读值得跟进有用关注 Claude Opus 5
00:35官方账号Sam Altman@samaEthan Mollick 指出 GPT-5.6 Pro(仅聊天机器人可用)是目前最智能的模型。GPT-5.6 Ultra(Codex 中的最佳模型)在困难任务上表现较弱。对于真正难题,排名为:GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。模型命名令用户困惑。AI模型GPT-5.6CodexFable 510 个信源在谈事件专题推荐理由:OpenAI 的模型命名越来越绕了,看看 E 教授的实测对比,帮你搞清 GPT-5.6 各版本谁最强。原文稍后读已读值得跟进有用关注 GPT-5.6
22:00IT之家(博客/媒体)蚂蚁集团百灵大模型发布Ling-3.0-flash混合推理模型,总参数量124B,激活参数仅5.1B。采用原生混合线性注意力架构(5:1交替堆叠KDA与MLA)及1/64稀疏MoE,能力对标上一代1T旗舰Ring-2.6-1T。在长上下文、Agent等场景下实现性能越级,长输入TTFT降低60%至80%+。目前已开放限时免费API调用至8月3日,之后将开源模型权重。AI模型百灵Ling-3.0-flash蚂蚁集团推荐理由:蚂蚁新出的Ling-3.0-flash用124B参数(仅激活5.1B)就打平了1T的旗舰模型,还能支撑复杂Agent任务,现在免费试用,8月3日后开源,别错过。原文稍后读已读值得跟进有用关注 百灵
14:08@koltregaskes@koltregaskes一篇X帖子要求OpenAI在Codex中提供GPT-5.6 Pro。发帖者指出Ultra并非推理层级,而是使用High推理或混合模式,并运行子智能体而非单一智能体。Claude的Ultracode类似但采用动态工作流。Max是最高推理层级,默认隐藏。行业GPT-5.6 ProCodexOpenAI10 个信源在谈事件专题推荐理由:OpenAI的Codex缺了GPT-5.6 Pro,而且Ultra和Max的概念容易混淆。看看这位用户怎么说。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
13:09Ethan Mollick@emollickEmollick 指出,GPT-5.6 Pro(仅通过聊天机器人可用)是当前最智能的模型。GPT-5.6 Ultra(Codex 中的最佳模型)在困难任务上表现不如 Pro。对于极难问题,性能排序为 GPT-5.6 Sol Pro > Fable 5 Ultracode > GPT-5.6 Sol Ultra。这一命名体系让用户难以区分。AI模型GPT-5.6 ProGPT-5.6 UltraFable 5 Ultracode1 个信源在谈事件专题推荐理由:Emollick 实测对比了 GPT-5.6 系列和 Fable 5,告诉你哪个版本才是真正的推理之王,别再被名字骗了。原文稍后读已读值得跟进有用关注 GPT-5.6 Pro
11:29官方账号arXiv cs.AI@Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma论文发现视觉语言模型在几何推理中,对文本、图像和图文组合三种视图的推理结果不一致。为此构建了ODA-Data多视图几何数据集,并提出了MIRROR强化学习方法。MIRROR通过评估模型在各视图下的表现,选择最佳视图作为教师,用反向KL散度训练其他视图。在多个几何推理基准上,MIRROR比标准RL提高了准确性和模态间一致性。论文MIRRORVLM多模态推理推荐理由:这篇论文提出了MIRROR方法,让视觉语言模型通过不同视角互相学习,在几何推理中表现更稳定、更准确。原文稍后读已读值得跟进有用关注 MIRROR
11:24量子位@一水78°新晋菲尔兹奖得主于获奖当天宣布加入OpenAI。他的学生团队利用OpenAI的数学推理模型Fable 5,成功推翻了一个持续87年的数学难题。这是首次有菲尔兹奖得主直接加入AI企业,标志着AI在纯数学研究中的应用取得里程碑式进展。行业OpenAIFable 5菲尔兹奖10 个信源在谈事件专题推荐理由:菲尔兹奖得主当天入职OpenAI,学生用Fable 5秒杀87年未决难题,数学和AI两界都得看原文稍后读已读值得跟进有用关注 OpenAI
10:19官方账号arXiv cs.AI@Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu72°AREX是一种递归自我改进(RSI)的深度研究代理,设计用于解决需要满足多重约束的复杂检索任务。AREX通过内循环收集证据构建临时答案,外循环逐约束审计答案并启动针对性的后续研究。其核心创新是学习一个自主上下文更新工具,将交互历史压缩为紧凑的改进状态,无需外部模型。AREX在4B密集模型和122B-A10B混合专家模型上实例化,在BrowseComp、WideSearch、DeepSearchQA、HLE等基准上显著优于可比规模基线,与使用更多激活参数的模型竞争。论文AREXRecursively Self-Improving深度研究代理推荐理由:AREX这篇论文让AI自己递归改进答案,在多个搜索和推理基准上超越了同体量模型,想了解自我优化怎么做可以看看。原文稍后读已读值得跟进有用关注 AREX
09:24官方一手arXiv: DeepSeek@Renuka Oladri, Niveda Jawahar, Abdirisak MohamedDeepSeek-R1-Distill-Qwen-7B等思维链模型在推理时呈现双峰收敛模式:在令牌预算内结束(收敛)或耗尽预算无结论(非收敛)。实验显示,收敛的推理在AIME 1983-2024上准确率达90.3%,非收敛仅6.6%,总体收敛率62.0%。通过训练线性探针在隐藏状态激活(token 50-300)上,层20在token 150处达到AUC 0.608(±0.080,五折交叉验证)。激活探针优于基于令牌熵和重复统计的行为基线。扫描级置换检验p=0.063(100,000次置换),表明样本量不足以在常规阈值下确认信号,但收敛命运在生成结束前部分编码于中间表征。论文DeepSeek-R1-Distill-Qwen-7B推理模型早期检测推荐理由:这篇论文发现DeepSeek-R1推理非收敛在早期就能从内部表征检测到,未来可做自适应计算分配,研究推理效率的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
09:21官方一手arXiv: DeepSeek@Qunhui Zhang论文提出VirtualSet,一种接收者类型化的本体世界接口,替代SQL作为LLM的生成目标。在BIRD基准测试的1072题子集上,VirtualSet配合deepseek-reasoner达到67.5%准确率,比带修复和投票的SQL高4.0个百分点(p=0.00117)。系统通过通用约束投影(GCP)在表达式执行前检查,并利用集合链保留具体接收者类型将无效字段转为类型错误。在30个受控决策用例中,写入链拦截了20/20的幻觉动作体且无假阳性。论文VirtualSetBIRDdeepseek-reasoner推荐理由:用VirtualSet替代SQL,让LLM查询出错时提前报类型错误而不是给假结果,BIRD上还比SQL高4个点,很适合做安全决策。原文稍后读已读值得跟进有用关注 VirtualSet
06:09OpenRouter@OpenRouterAILing-3.0-flash是一款124B参数的MoE模型,每token仅激活约5.1B参数,由Novita Labs提供。该模型已在OpenRouter平台上线,主打token高效的agentic推理。即日起至8月3日可免费使用。AI模型Ling-3.0-flashNovita LabsOpenRouter推荐理由:想省token跑agentic任务?试试Ling-3.0-flash,124B参数只激活5B,OpenRouter上免费到8月3日。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
05:38官方账号Together AI@togethercomputeKimi K3 模型将于7月27日通过 Together AI 平台上线,用户可在发布当天立即使用其推理服务。该服务支持编程、智能体以及生产负载等场景。Together AI 提供高性能推理基础设施,使开发者能第一时间体验 Kimi K3。AI模型Kimi K3Together AI推理模型10 个信源在谈事件专题推荐理由:Kimi K3 马上就能在 Together AI 上用了,7月27日当天就能跑编程和智能体任务,想抢先体验的快去试试。原文稍后读已读值得跟进有用关注 Kimi K3
02:33IT之家(博客/媒体)82°AMD 在 Advancing AI 2026 上公布了下一代 AI 加速器 Instinct MI455X,采用台积电 2nm GAA 工艺,集成 3200 亿个晶体管。该芯片配备 432GB HBM4 内存,带宽达 23.3 TB/s,远超英伟达 Rubin 的 288GB HBM4 与 22 TB/s。MI455X 的 OCP MXFP4 理论峰值性能达 40.26 PFLOPS,是前代 MI355X 的 4 倍。Helios 机架架构将 72 个 MI455X 的显存整合为统一相干域,总容量 31.1TB,比英伟达 NVL72 的 20.7TB 高出 50%。AI模型AMDMI455XHBM4推荐理由:AMD 亮出真家伙:MI455X 堆了 432GB HBM4 和 3200 亿晶体管,FP4 算力比上代快 4 倍,72 卡显存比英伟达 Rubin 多一半,直接对标 NVL72。原文稍后读已读值得跟进有用关注 AMD
01:13官方账号NVIDIA AI@NVIDIAAI72°NVIDIA AI展示使用PrimeIntellect托管RL训练,将Nemotron 3 Nano在数学任务上的准确率从22%提升至91%,总成本低于5美元。工作流程包括基线检查、奖励训练和重新测试,最终输出可下载的LoRA适配器。该方案可通过修改一行代码扩展至Nemotron 3 Super和Ultra。AI模型Nemotron 3 NanoPrimeIntellectRL6 个信源在谈事件专题推荐理由:花5美元用托管RL把Nemotron 3 Nano的数学准确率从22%拉到91%,还能一键扩展到更大模型,太实用了!原文稍后读已读值得跟进有用关注 Nemotron 3 Nano
22:37官方账号LMSYS Org (SGLang)@lmsysorg81°Poolside发布Laguna S 2.1模型,总参数量118B,采用稀疏MoE架构,每token仅激活8B参数。模型支持1M上下文窗口,提供思考与非思考两种模式。在Terminal-Bench 2.1上获得70.2%准确率,在SWE-bench Multilingual上达78.5%。官方NVFP4量化版本可运行于单个NVIDIA DGX Spark。模型已在SGLang框架上提供Day-0支持。AI模型Laguna S 2.1PoolsideSGLang10 个信源在谈事件专题推荐理由:Poolside的Laguna S 2.1是个118B参数的稀疏MoE模型,只激活8B参数,SWE-bench多语言拿下78.5%,还能跑在单个DGX Spark上,适合长时编程任务。原文稍后读已读值得跟进有用关注 Laguna S 2.1