21:56官方账号Decoder@Gregor Kobsik72°字节跳动发布AI视频模型Seedance 2.5,可同时生成视频与音频。单段片段最长30秒,是谷歌Gemini Omni Flash输出时长的三倍。用户可输入数十张图片、视频和音频文件作为参考。对广告团队而言,这省去了逐段拼接短片的流程。AI模型Seedance 2.5ByteDance视频生成1 个信源在谈事件专题推荐理由:字节Seedance2.5生成30秒带声视频,是Gemini Omni Flash的三倍,广告剪辑省事。原文稍后读已读值得跟进有用关注 Seedance 2.5
21:08IT之家(博客/媒体)埃隆·马斯克今早关注了 DeepSeek 的 X 账号,Big Tech Alert 账号发布了这一动态。DeepSeek 昨日通过 API 文档宣布 DeepSeek-V4-Flash 正式版上线公测,主打超高性价比,相关 X 消息已获超 2.5 万点赞和超 5000 条转发。马斯克在 7 月 23 日《经济学人》专访中称中国在机器人和 AI 领域实力雄厚,可能成为领导者,并特别提到对月之暗面 Kimi K3 模型印象深刻。他认为中国在 AI 竞赛中有决定性优势,电力供应能力是关键因素。AI模型DeepSeek-V4-FlashDeepSeekKimi K310 个信源在谈事件专题推荐理由:马斯克刚关注了 DeepSeek,同一天 V4-Flash 正式版 API 公测,性价比拉满,X 上已经 2.5 万赞,值得围观。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
17:57官方一手marktechpost@Michal SutterSupabase开源了Apache-2.0许可的基准框架supabase/evals。该框架让Claude Code、Codex和OpenCode在容器化环境中执行真实Supabase任务,例如构建schema、调试Edge Functions、修复RLS策略。评分结合确定性检查与LLM-as-a-judge。AI模型SupabaseEvalsClaude Code1 个信源在谈事件专题推荐理由:Supabase开源Evals,用真实任务评估Claude Code等编码智能体,比普通基准更实战原文稍后读已读值得跟进有用关注 Supabase
16:35官方账号Decoder@Matthias Bastian82°OpenAI正在开发代号Astra的模型家族,其设计目标是让多个智能体协同处理复杂问题,运行时长可达数小时甚至数天。CEO Sam Altman已在华盛顿向政策制定者演示了Astra。OpenAI尚未决定将其作为GPT-6还是新GPT-5变体发布。AI模型OpenAIAstra智能体10 个信源在谈事件专题推荐理由:OpenAI在做Astra模型家族,多个智能体能协作数小时甚至数天,可能叫GPT-6或GPT-5。原文稍后读已读值得跟进有用关注 OpenAI
16:33官方一手marktechpost@Asif RazzaqMiniMax发布新一代多模态生成模型MiniMax H3。该模型将文本、图像、视频、音频作为统一上下文处理,直接输出视频及原生立体声。H3支持2K分辨率,时长可在4至15秒之间选择,且仅支持整数时长。MiniMax称其不是简单的文生视频外加组件,而是通用多模态生成模型。AI模型MiniMax H3MiniMax视频生成7 个信源在谈事件专题推荐理由:MiniMax H3能一次读文本、图、视频、音频,直接出带立体声的2K视频,最长15秒,试试看。原文稍后读已读值得跟进有用关注 MiniMax H3
16:26IT之家(博客/媒体)82°OpenAI公布十项数学与理论计算机科学进展,均由下一代核心模型Astra的内部版本计算得出,解决了多个十余年未解的难题。按Sol API费率计算,生成这些解答的总词元成本约为2000美元,约合13530元人民币。人类研究员在Lean语言中对证明进行了形式化验证并负责正确性,但数学论证本身由AI系统生成。成果包括将球体堆积密度上界收紧至Cohn-Elkies阈值、证明非柔性群存在、证伪Connes刚性猜想等。AI模型OpenAIAstra数学推理10 个信源在谈事件专题推荐理由:OpenAI用Astra模型解决了十个多年没人做出来的数学难题,整个研究烧了约2000美元的token,还在Lean里验证过,值得看看。原文稍后读已读值得跟进有用关注 OpenAI
08:47IT之家(博客/媒体)82°据 The Information 8 月 1 日报道,OpenAI CEO 奥尔特曼在 7 月 29 日的国会山闭门会见中展示了新模型 Astra。Astra 主打长周期任务处理能力,能把任务拆分给多个智能体协同完成。奥尔特曼当天会见了参议员 Raphael Warnock 和 Bernie Moreno,并计划与 Mark Warner 会面。AI模型OpenAIAstra智能体10 个信源在谈事件专题推荐理由:OpenAI 新模型 Astra 能让多个智能体拆任务协同,专攻长周期复杂任务,不是单个模型硬扛。原文稍后读已读值得跟进有用关注 OpenAI
08:32IT之家(博客/媒体)75°DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测。Artificial Analysis 智能指数(AII)测得 DeepSeek V4 Flash 0731 得 50 分,比 4 月版本高 10 分,比 V4 Pro 高 6 分,比 GPT-5.6 Luna 最高分低 1 分。DeepSeek 自有 API 提供约 98% 缓存命中折扣,使单任务成本比 GPT-5.6 Luna 低约 60%。Frontend Code Arena 中 DeepSeek-V4-Flash-High 得 1586 分,总排名第 7,开放类别第 3。每 MToken 价格 0.14/0.28 美元,是同类产品中性价比最高的。AI模型DeepSeekDeepSeek-V4-FlashGPT-5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
08:29官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek-V4-Flash-0731正式发布,参数量304B,在Hugging Face上体积167GB。Artificial Analysis评估其综合智能排名超过428B参数的MiniMax M3。输入价格每百万token 0.14美元,输出0.27美元,是目前性价比最高的模型之一。在默认推理等级下生成质量一般,但将reasoning_effort调至high后效果显著提升。AI模型DeepSeek-V4-Flash-0731DeepSeek智能体推荐理由:DeepSeek新模型便宜又能打,304B参数干翻428B的MiniMax M3,记得把推理等级调高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
06:08官方一手marktechpost@Asif RazzaqDeepSeek于2026年7月31日发布DeepSeek-V4-Flash-0731,并同步将V4-Flash API转为公开测试版。该版本基于V4-Flash重新后训练,架构与规模未变。官方模型卡明确这是取代预览版的正式版本。新版在智能体任务与代码生成方面的表现有明显提升。AI模型DeepSeekDeepSeek-V4-Flash-0731智能体推荐理由:DeepSeek把V4-Flash正式版放出来了,智能体和写代码都变强,API也开放公测,可以直接上手试试。原文稍后读已读值得跟进有用关注 DeepSeek
02:05官方账号Decoder@Matthias Bastian72°Thinking Machines 发布了开放权重的推理模型 Inkling Small,这是其第二款模型。它的体积不到前作 Inkling 的三分之一,但在多项编程和推理基准上表现优于 Inkling。该实验室由前 OpenAI CTO Mira Murati 创立,这次选择用更小的参数规模换取更高效率。AI模型Inkling SmallThinking MachinesMira Murati10 个信源在谈事件专题推荐理由:Mira Murati 的实验室发了新模型,比前作小三分之二,编程推理分数反而更高,开源可下载。原文稍后读已读值得跟进有用关注 Inkling Small
01:08官方账号Decoder@Thomas JoosDeepSeek V4 Flash 的 0731 更新版本在 Artificial Analysis Intelligence Index 上得分 50,较前版提升 10 分。该分数仅比 OpenAI GPT-5.6 Luna 低 1 分,但每任务成本约低 60%。这一成绩让 DeepSeek 的平价模型在性能逼近旗舰的同时,展现出明显的成本优势。AI模型DeepSeekV4 FlashGPT-5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。原文稍后读已读值得跟进有用关注 DeepSeek
21:17IT之家(博客/媒体)稀宇科技宣布 MiniMax H3 通用多模态视频模型将于北京时间 8 月 3 日 0 点在魔搭社区开源。该模型支持文本、图像、视频、声音组成的多模态上下文统一理解,可输出带原生双声道的音视频,最高支持 15 秒 2K 分辨率。官方称其默认提供 2K 分辨率,每秒价格不到主流模型的 1/3,768P 分辨率下价格为主流模型 720P 的 1/2。AI模型MiniMaxH3视频生成推荐理由:MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。原文稍后读已读值得跟进有用关注 MiniMax
16:21官方一手pandaily@contact@pandaily.com (Pandaily)Kimi K3技术报告披露了MoonEP、KDA和AttnRes三套基础设施方案。报告强调MFU对训练效率的关键作用。Moonshot AI认为专家并行与共享专家的工程实现是真正壁垒。这些经验让开源模型的经济优势难以被复制。AI模型Kimi K3Moonshot AIMoonEP9 个信源在谈事件专题推荐理由:Moonshot AI公开了Kimi K3的MoonEP等设计,但真正难抄的是工程调优经验,这决定了开源模型能不能打。原文稍后读已读值得跟进有用关注 Kimi K3
15:47IT之家(博客/媒体)79°OpenAI通过两项框架改进,让GPT-5.6 Sol在ARC-AGI-3基准得分从7.8%升至38.3%。改进前的官方框架会丢弃私有推理,且滚动截断窗口导致早期动作丢失。OpenAI提出推理保留和上下文压缩两个方案,分别解决上述问题。启用改进后,GPT-5.6 Sol输出token降至六分之一,成绩增长188.42%。AI模型GPT-5.6 SolOpenAIARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
15:38IT之家(博客/媒体)Thinking Machines Lab发布Inkling-Small,总参数276B、激活参数12B,规模约为Inkling的四分之一。该模型采用MoE架构,支持音频和图像原生推理、最高1M token上下文。在Humanity's Last Exam基准中,Inkling-Small得分31.6%,高于Inkling的29.7%。模型完整权重已开放,并接入Tinker微调服务。AI模型Inkling-SmallThinking Machines Lab开源模型3 个信源在谈事件专题推荐理由:Inkling-Small四分之一参数就能接近甚至超过原版,权重开源,还能微调,快去玩。原文稍后读已读值得跟进有用关注 Inkling-Small
15:29IT之家(博客/媒体)81°腾讯混元科研智能体 Hyra 为加法组合学中一个悬而未决 50 多年的问题给出完整答案:证明和集与差集扩张指数的最优上确界是 2。此前最佳构造纪录从 1969 年的 1.0290 提升到 2013 年的 1.1259,近一年 AI 辅助搜索达到 1.1449,内部实验中 Codex(GPT-5.5)达到 1.2851。Hyra 用约 24 小时提出基于十二进制数字结构、循环群对称加法基与中国剩余定理的显式构造,使指数可以任意逼近 2。论文预印本和 Lean 4 形式化证明均已公开。AI模型Hyra腾讯混元智能体推荐理由:腾讯混元的 Hyra 跑了24小时就证出加法组合学50年难题,还公开了 Lean 证明,比此前 AI 辅助搜索明显更进一步。原文稍后读已读值得跟进有用关注 Hyra
15:11IT之家(博客/媒体)7 月 31 日,多位用户反馈 Gemini 3.5 Pro 短暂出现在 Arena 平台,约 30 分钟后被移除。用户 Harshith 的截图显示,他只完成了一次 SVG 测试。谷歌于 5 月 19 日发布 Gemini 3.5 系列,首发 3.5 Flash,并计划次月推出 3.5 Pro,但此后多次延迟。这次短暂上线引发外界猜测,官方尚未回应具体原因。AI模型Gemini 3.5 Pro谷歌Arena推荐理由:谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
15:09IT之家(博客/媒体)字节跳动 7 月 31 日发布新一代视频生成模型 Seedance 2.5,火山引擎近期将上线 API 服务。徐工集团、小鹏汽车、智元机器人、灵初智能等多家企业已达成合作意向,率先接入该模型。Seedance 2.5 新增白模参考能力,可将白模素材渲染为写实汽车拼装片段。小鹏汽车将其集成至内部 AI 设计平台,穹彻智能用它扩充具身智能大模型训练数据。多家智驾企业正探索用 Seedance 生成暴雨、大雾、降雪等极限工况训练数据。AI模型Seedance火山引擎字节跳动2 个信源在谈事件专题推荐理由:字节的 Seedance 2.5 来了,徐工、小鹏、智元都要用。能生成工业培训和智驾极限场景视频,还支持白模转写实。原文稍后读已读值得跟进有用关注 Seedance
14:14官方账号Latent Space (swyx)(博客/媒体)OpenAI将GPT 5.6价格下调20%-80%。由于GPT 5.6的递归自我优化,GPT 5.4的智能成本在4个月内下降了13倍。蒸馏技术在其中起到关键作用。AI模型GPT 5.6GPT 5.4模型蒸馏10 个信源在谈事件专题推荐理由:GPT 5.6大幅降价,最高降八成,四个月前GPT 5.4的算力成本现在只要十三分之一,做AI应用的成本压力能小不少。原文稍后读已读值得跟进有用关注 GPT 5.6
14:06IT之家(博客/媒体)DeepSeek 7 月 31 日下午通过 API 文档宣布 DeepSeek-V4-Flash 正式版 API 上线公测。版本号 DeepSeek-V4-Flash-0731 与 preview 版结构尺寸一致,仅重新进行了后训练。Agent 基准中 Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon verified 为 70.3。Agent Last Exam 为 25.2,Automation Bench (Public) 为 25.1,DSBench-FullStack 为 68.7,DSBench-Hard 为 59.6,全面超过 V4-Pro-Preview。新版本原生支持 Responses API 格式并适配 Codex,V4-Pro API 和 APP/WEB 端本次未改动。AI模型DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 转正了,智能体跑分全面压过 V4-Pro 预览版,做开发可直接试。原文稍后读已读值得跟进有用关注 DeepSeek
13:16官方一手marktechpost@Michal SutterPolyAI推出Dialog-RSN-1,该模型直接感知来电者音频,而非读取ASR转录文本。它在一个音频原生模型中融合了轮转、语音识别、函数调用和响应生成,同时将TTS独立出来以保持输出声音可控。模型以基于请求的LLM方式运行,而非始终在线的流式架构。PolyAI报告在实时部署中响应时间低于300毫秒。AI模型Dialog-RSN-1PolyAI语音识别推荐理由:PolyAI出了个新对话模型Dialog-RSN-1,直接听人说话不用转文字,还能自动接话和调函数,延迟不到300毫秒。原文稍后读已读值得跟进有用关注 Dialog-RSN-1
13:04IT之家(博客/媒体)阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,针对上下文一致性、行业词识别和热词定制化做了优化。模型内置覆盖医疗、IT 编程、股票等领域的高质量词库,在内部评测中医疗场景专业词听中率达 95.36%。该模型曾在 Artificial Analysis 上以 1.7% 的错字率拿下全球第一。目前已在阿里云百炼平台开放,提供 Flash、Filetrans、Streaming 三个版本。AI模型Qwen-Audio-3.0-ASR-Flash阿里云百炼语音识别1 个信源在谈事件专题推荐理由:阿里把语音识别模型更新到 3.0,医疗等专业词识别更准了,错字率低到 1.7%,还开放了三个版本随便用。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-ASR-Flash
12:49IT之家(博客/媒体)字节跳动7月31日发布Seedance 2.5视频生成模型,单次生成时长从15秒提升到30秒,并支持多轮延长。模型延续Seedance 2.0统一的多模态音视频联合生成架构,可一次输入最多30张图片、10段视频、10段音频作为参考。官方示例展示了30秒音乐会片段,能同时还原多个人物形象与声音。Seedance 2.5将陆续上线即梦AI与豆包专业版,API服务近期接入火山方舟。模型面向影视、广告、教育、具身智能和自动驾驶等场景。AI模型Seedance字节跳动即梦AI推荐理由:字节新模型一次能生成30秒连贯视频,还能多轮延长,做短片不用一段段拼了,影视剪辑党可以试试。原文稍后读已读值得跟进有用关注 Seedance
11:48IT之家(博客/媒体)LG AI研究院发布了K-EXAONE 2.0,采用混合注意力MoE架构,总参数750B,激活参数37B,规模是初代K-EXAONE的3倍以上,成为韩国迄今最大AI基础模型。该模型以Apache 2.0许可证开源,在24项基准测试中平均得分70.1,比初代63.3分提高超10%。在三大编码和智能体编码基准上性能提升约30%,长上下文理解优于GLM-5.1,智能体工具使用能力优于智谱GLM-5.1和Qwen3.5,指令执行表现与GLM-5.1、DeepSeek V4 Pro Max等相当。AI模型K-EXAONELG AI研究院开源模型推荐理由:LG开源了韩国最大的K-EXAONE 2.0,750B参数,跑分比初代高10%,长上下文和工具调用还压过了GLM-5.1。原文稍后读已读值得跟进有用关注 K-EXAONE
11:00IT之家(博客/媒体)精选Openchip于7月30日公布了基于亚2纳米GAA制程的BER10处理器,开发用时2.5年,定位工业级芯片。该处理器集成4个64位乱序核心,配备宽矢量处理单元,支持多通道内存,兼容Linux系统。Openchip后续还将开发面向数据中心超算和AI的RISC-V计算加速器。AI模型OpenchipBER10RISC-V推荐理由:欧洲芯片公司Openchip出了个RISC-V服务器芯片BER10,用亚2纳米工艺,能跑实际工作负载,还兼容Linux,想做AI/HPC的老本行。原文稍后读已读值得跟进有用关注 Openchip
10:30IT之家(博客/媒体)77°华为今日开源 openPangu-2.0-Pro 模型权重、基础推理代码及技术报告。该模型为昇腾 NPU 训练的 MoE 架构,总参数约 505B,每 token 激活约 18B,支持 512k 上下文,训练数据约 34T tokens。模型采用 MLA 加 DSA/SWA 分层混合、3 头 MTP 自投机等架构升级,后训练结合 SFT、多专项 RL 与 OPD 蒸馏。此前 openPangu-2.0-Flash(92B 参数)已于 6 月 30 日开源,本次 Pro 是 openPangu 2.0 七组件开源计划的一部分。AI模型openPangu-2.0-Pro华为盘古1 个信源在谈事件专题推荐理由:华为盘古 505B 的 MoE 模型 openPangu-2.0-Pro 开源了,带权重和推理代码,支持 512k 上下文,想跑昇腾生态可以看。原文稍后读已读值得跟进有用关注 openPangu-2.0-Pro
10:06IT之家(博客/媒体)MiniMax 推出 H3 全模态生成模型,支持文本、图像、视频、声音的统一理解,并可输出原生双声道音视频。该模型最高支持 15 秒 2K 分辨率输出,在指令遵循、文字呈现和 V2V Motion Transfer 等任务上表现突出。MiniMax H3 新增 Caption 能力,大部分素材消耗约 100K Token 推理,最终平均输出约 4K Token。其 2K 视频不依赖常规超分模块,而是由 H3 基础模型对低分辨率结果进行 in-context 重新生成。模型权重将在未来几天内开放。AI模型MiniMax H3MiniMax视频生成5 个信源在谈事件专题推荐理由:MiniMax 发了新模型 H3,可生成带双声道音效的 2K 视频,超分用模型自己重画而非传统模块,过几天开源权重。原文稍后读已读值得跟进有用关注 MiniMax H3
10:01官方一手pandaily@contact@pandaily.com (Pandaily)Kimi K3 是 Moonshot AI 开源的 2.8T 参数模型,也是目前最大的开放权重模型。发布两天内因访问量过大导致服务短暂过载。该模型上线后占全球开源下载量的 41%,海外付费用户增长 4 倍,API 收入增长 400%。AI模型Kimi K3Moonshot AI开源模型9 个信源在谈事件专题推荐理由:Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。原文稍后读已读值得跟进有用关注 Kimi K3
09:40IT之家(博客/媒体)Sarvam AI 在首届 Sarvam Epoch 会议上宣布将开发万亿参数级模型,预计未来六个月内完成。该公司现有 105B 模型表现不错,语音模型据称性价比优于全球竞争者。Sarvam AI 还发布 Bulbul V4 文本转语音模型和 Saaras V4 多说话人语音识别模型,并计划在美国设办事处吸引印度裔 AI 人才。新模型将面向编程、网络安全、科学研究等领域与领先模型竞争。AI模型Sarvam AIBulbul V4Saaras V4推荐理由:Sarvam AI 要搞万亿参数模型,还发布了两个语音新模型,目标对标编程和科研领域。原文稍后读已读值得跟进有用关注 Sarvam AI
08:30官方账号Simon Willison’s Weblog(博客/媒体)81°OpenAI宣布GPT-5.6 Terra降价20%,GPT-5.6 Luna降价80%。Luna输入价格降至$0.20/百万token,输出$1.20/百万token,低于Google Gemini 3.1 Flash-Lite的$0.025/$1.50。Anthropic Claude Haiku 4.5输入/输出为$1/$5,Luna输入成本仅为Haiku的1/5。OpenAI使用GPT-5.6 Sol优化负载均衡和推理内核,将端到端服务成本降低20%。AI模型GPT-5.6OpenAIGemini10 个信源在谈事件专题推荐理由:OpenAI把Luna价格打到比Gemini Flash-Lite还低,想省钱换模型?Luna现在比Claude Haiku便宜5倍,跑demo或生产都能省一大笔。原文稍后读已读值得跟进有用关注 GPT-5.6
07:15IT之家(博客/媒体)76°Google DeepMind 发布了 Gemini Robotics ER 2,这是其最新具身推理模型,作为机器人的“高级大脑”协调复杂任务。相比 ER 1.6,ER 2 能分析连续视频流,机器人可追踪自身进度、调整错误步骤,并在任务进度分类测试中达 57.4% 准确率。在 moment-finding 测试中,ER 2 准确率为 91.3%,平均时间误差 0.96 秒,且执行速度比更大模型快 4 倍。该模型支持多机器人协作,如 Apptronik Apollo 2 与 Franka FR3 Duo 的协同工作。开发者可通过 Gemini API、Google AI Studio 及 Gemini Enterprise Agent Platform 使用该模型。AI模型Gemini Robotics ER 2Google DeepMind具身推理推荐理由:谷歌DeepMind出了个新模型Gemini Robotics ER 2,能让机器人看懂连续视频、自己纠错,还能和别的机器人一起干活,速度比大模型快4倍,开发者现在就能用上。原文稍后读已读值得跟进有用关注 Gemini Robotics ER 2
06:44官方账号OpenAI@OpenAI (@OpenAI)ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。AI模型ARC-AGI-3GPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。原文稍后读已读值得跟进有用关注 ARC-AGI-3
01:40官方账号OpenAI@OpenAI (@OpenAI)81°OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。AI模型GPT-5.6 SolLunaTerra10 个信源在谈事件专题推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
01:26官方一手marktechpost@Asif Razzaq80°Google DeepMind推出Gemini Robotics 2,包含三个模型:一个视觉-语言-动作模型用于全身人形控制,Gemini Robotics ER 2用于具身推理与任务编排,以及一个设备端VLA可在数小时内适应新机器人躯体。单一检查点驱动Apptronik Apollo 2和Franka Duo两款机器人。仅ER 2模型公开发布。AI模型Gemini Robotics 2具身智能多机器人协作3 个信源在谈事件专题推荐理由:DeepMind发了三个机器人模型:一个控全身,一个做推理,一个快速适应新身体。只公开了ER 2,感兴趣可以直接试。原文稍后读已读值得跟进有用关注 Gemini Robotics 2
18:14官方一手marktechpost@Michal Sutter腾讯开源了AngelSpec,一个基于PyTorch的训练框架,支持6种推测解码架构,包括MTP和块并行方法。该框架引入了DFly块扩散草稿器,采用混合目标条件与隐藏校正自回归头提升生成质量。AngelSpec还集成D-cut机制,实现运行时自适应验证预算分配。在HY3-295B-A21B模型上,TP=8配置下,DFly-8在并发4至64范围内实现1.98至2.40倍的解码速度提升。AI模型AngelSpecDFly腾讯推荐理由:腾讯刚开源了AngelSpec,一个统一训练推测解码草稿模型的框架。它带的DFly块扩散器能让HY3模型推理快最多2.4倍,还支持六种架构,实用性强。原文稍后读已读值得跟进有用关注 AngelSpec
17:42量子位@henryWorld Labs(李飞飞创立)近期将“世界模型”应用在机器人训练中,让机器人获得空间智能。该模型使机器人能够理解三维场景并规划动作路径。早期测试显示机器人可在未见过环境中自主导航和操作物体。World Labs的目标是构建能够像人类一样感知和行动的通用机器人基础模型。AI模型World Labs李飞飞世界模型推荐理由:李飞飞的公司World Labs把世界模型用到机器人上了,机器人能看懂空间、自己规划动作,跟传统方法很不一样。原文稍后读已读值得跟进有用关注 World Labs
17:32IT之家(博客/媒体)RTX Spark是英伟达基于Arm架构N1X CPU与RTX Blackwell GPU的集成芯片。网友Fouquin在TechPowerUp论坛分享了一个月使用体验,使用RTX Spark 616.00预览版驱动。Cinebench 2024多线程得1386分,落后M4 Pro MacBook。3DMark Port Royal光线追踪测试31 FPS,Steel Nomad约22 FPS,更接近桌面RTX 3060 Ti。屏幕存在G-SYNC无法使用、局部调光异常等问题。AI模型RTX Spark英伟达Surface Laptop Ultra推荐理由:RTX Spark提前曝光了!微软Surface Laptop Ultra性能接近RTX 4070但实际游戏卡顿,CPU跑分不如M4 Pro。想买先看这个实测。原文稍后读已读值得跟进有用关注 RTX Spark
16:42IT之家(博客/媒体)83°马斯克宣布Grok 4.6将于8月7日发布,参数规模1.5万亿,在监督微调(SFT)和强化学习(RL)上有显著提升。几周后将推出Grok 4.7,参数规模增至2.1万亿。此前Grok 4.5于7月8日开放,被马斯克称为"Opus级别"模型,运行速度更快、Token利用效率更高、推理成本更低。AI模型GrokGrok 4.6Grok 4.7推荐理由:马斯克预告了Grok 4.6和4.7,参数飙到1.5万亿和2.1万亿,比之前4.5的'Opus级别'更猛,8月7日见。原文稍后读已读值得跟进有用关注 Grok
15:47官方账号Decoder@Matthias Bastian82°OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中通过自定义测试环境获得38.3%的分数,高于Anthropic Opus 5的30.2%。但在官方标准环境下,GPT-5.6 Sol仅得7.8%,远低于Opus 5的30.2%。OpenAI的定制测试保留了推理链和上下文压缩作为辅助手段,而Opus 5在无辅助下完成。这一差异引发了关于基准测试公平性的讨论。AI模型GPT-5.6 SolOpus 5ARC-AGI-310 个信源在谈事件专题推荐理由:OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol