22:08量子位@一水DeepSeek-Coder-V2在SWE-bench Verified上以67.3%的成绩超越GPT-4o和Claude 3.5 Sonnet,成为首个免费开源的编码模型达到该水平。该模型在HumanEval上得分92.1%,在MBPP上得分90.5%。开发者可通过Hugging Face免费下载使用。AI模型DeepSeek-Coder-V2DeepSeek开源模型推荐理由:DeepSeek-Coder-V2免费开源,性能还超过了GPT-4o和Claude,写代码直接省钱了。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-V2
17:45IT之家(博客/媒体)71°腾讯混元将295B参数的Hy3模型权重量化至1bit和4bit,1bit版本体积从598GB压缩至85.5GiB,单张96GB显卡即可运行;4bit版本体积169.9GiB需两张显卡。量化后性能接近原始BF16模型,长文理解几乎持平,Agent和代码能力仅小幅回落。配合llama.cpp和MTP投机解码,开启后解码速度提升约50%-60%。AI模型Hy3腾讯混元1bit量化推荐理由:想用295B的旗舰模型又没多卡?腾讯混元把Hy3压到1bit,一张显卡就能跑,效果还挺稳。原文稍后读已读值得跟进有用关注 Hy3
16:05官方一手Pandaily@contact@pandaily.com (Pandaily)72°北京大学与中国科学院联合团队在《科学》发表40nm相变忆阻器神经动力学芯片,实现2.12ms计算延迟。该芯片在脑皮层重建任务上性能超越NVIDIA A100 GPU达50至478倍。研究展示了忆阻器在类脑计算中的巨大潜力。AI模型Peking UniversityCAS神经形态芯片7 个信源在谈事件专题推荐理由:北大和中科院发了款新芯片,算脑皮层比A100快最多478倍,还上了《科学》封面。原文稍后读已读值得跟进有用关注 Peking University
15:31官方一手marktechpost@Asif Razzaq精选Mistral AI发布了Robostral Navigate,一个8B参数具身导航模型。该模型仅用单RGB摄像头即可根据自然语言指令引导机器人,无需LiDAR或深度传感器。在R2R-CE验证集未见过场景上,借助pointing方法、prefix-caching训练和CISPO在线强化学习,成功率达到了76.6%。AI模型Mistral AIRobostral Navigate8B推荐理由:Mistral AI这个8B模型Robostral Navigate挺有意思,只用普通摄像头就能让机器人听懂指令找路,R2R-CE上76.6%成功率,省了激光雷达的钱。原文稍后读已读值得跟进有用关注 Mistral AI
14:45量子位@量子位的朋友们GPT-5.6-sol模型成功进入DRACO基准榜单,展示其综合性能。OpenSquilla团队推出的集成方案在Brave组的评测中,以较低成本实现高质量输出,两项指标均优于同类方案。Brave组评估聚焦实际部署场景,成本与质量权重各占50%。OpenSquilla的模型集成策略在参数效率与推理速度上取得平衡。AI模型GPT-5.6-solDRACOOpenSquilla推荐理由:GPT-5.6-sol刚冲进DRACO排行榜,OpenSquilla那个集成方案在Brave组又便宜又能打,搞模型部署的值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6-sol
14:39IT之家(博客/媒体)精选西湖大学和达摩院联合开发了干细胞命运预测AI模型“归元”。该模型采用双模态编码策略,整合了25种谱系调控因子(17种小分子药物和8种蛋白生长因子),模拟了近400万种组合。模型推荐的最优方案经实验验证,成功获得高质量下胚层样干细胞,其分子特征与天然细胞高度相似,可体外传代50代。这一成果为人类早期胚胎发育研究和细胞治疗提供新材料。AI模型归元西湖大学达摩院推荐理由:西湖大学和达摩院做了个能预测干细胞命运的AI“归元”,从几百万种药物组合里挑出最优方案,造出了质量更好的下胚层干细胞。原文稍后读已读值得跟进有用关注 归元
12:42量子位@量子位的朋友们高德推出通用世界模型工坊ABot-World Studio,可基于单张5090显卡生成小时级实时交互式视频与3D场景。该工坊支持用户通过输入文本或图像直接创建可交互的3D世界,并实现实时渲染。其生成效率较传统方案提升显著,降低了大规模3D内容创作的门槛。模型已在高德地图内部多个场景进行测试,展示出良好的实用性。AI模型高德ABot-World Studio世界模型推荐理由:高德发了ABot-World Studio,用一张5090就能生成小时级的实时3D场景和交互视频,做游戏或数字孪生都可以试试,门槛低了很多。原文稍后读已读值得跟进有用关注 高德
10:05官方一手Pandaily@contact@pandaily.com (Pandaily)精选中国发布首款结合软件定义与3D近存计算的AI芯片,在14nm工艺下实现520 TFLOPS算力。该芯片通过架构创新而非工艺微缩,内存带宽达到6.4TB/s。相比传统芯片,它在同等工艺下性能提升显著。这标志着中国在AI芯片架构领域取得关键进展。AI模型中国自研AI芯片520TFLOPS14nm推荐理由:中国团队用14nm工艺做出了520 TFLOPS的AI芯片,全靠架构创新,带宽6.4TB/s,很硬核。原文稍后读已读值得跟进有用关注 中国自研AI芯片
09:48IT之家(博客/媒体)Arena平台发布最新周榜(2026年7月6-12日),代码榜榜首由claude-opus-4-7-thinking以ELO 1553分登顶,原榜首claude-fable-5降至第五。综合榜claude-fable-5继续蝉联第一,ELO 1505分,前五名均为Anthropic模型。国产模型最高为qwen3.7-max-preview,综合榜第17名(1475分),代码榜第12名(1526分)。glm-5.1、ernie-5.1等国产模型排名相对稳定。AI模型claude-opus-4-7-thinkingclaude-fable-5Arena10 个信源在谈事件专题推荐理由:想快速了解本周最强AI模型?Arena周榜给出硬核排名:代码能力claude-opus-4-7-thinking超了claude-fable-5,国产qwen3.7也稳在Top20。原文稍后读已读值得跟进有用关注 claude-opus-4-7-thinking
07:21IT之家(博客/媒体)苹果在 2024 年搁置了持续 10 年、投入超 100 亿美元的 Apple Car 项目。相关技术和研究成果未被废弃,而是转入其他产品线。部分员工调入 AI 团队,基于汽车芯片研发积累加速开发 M7 和 M8 系列芯片,优先服务 AI 技术场景。M6 系列仅有标准版,而 M7/M8 将是研发重心。AI模型苹果M7M8推荐理由:苹果把砸了100亿的造车技术用到Mac芯片上,M7/M8的AI性能可能会有大提升,值得关注。原文稍后读已读值得跟进有用关注 苹果
06:45官方一手marktechpost@Michal Sutter精选MORPHEUS 是 Skyfall AI 推出的持久化企业模拟平台,专为持续强化学习设计。它运行永不重置的世界,采用参数化制度转变和六指标评估协议。PPO、HER、EWC、LCM 等算法在该基准上均远低于理论上界。该基准旨在解决结构化非平稳性下的学习挑战。AI模型MORPHEUSSkyfall AI持续强化学习推荐理由:Skyfall AI 新出的 MORPHEUS 基准专门测持续强化学习,PPO 等主流算法都远没到上限,搞 RL 的值得看看。原文稍后读已读值得跟进有用关注 MORPHEUS
05:15官方一手AWS Machine Learning Blog@Tanvi Girinath73°OpenAI 正式发布 GPT-5.6 系列三个模型 Sol、Terra 和 Luna,并已在 Amazon Bedrock 上全面可用。该系列是 OpenAI 迄今最智能的模型家族,针对高性能、安全性和可靠性优化。Amazon Bedrock 提供下一代推理引擎来运行这些模型。用户无需单独部署即可通过 Bedrock 调用 GPT-5.6 系列。AI模型GPT-5.6OpenAIAmazon Bedrock10 个信源在谈事件专题推荐理由:OpenAI 最强模型 GPT-5.6 系列直接上架 AWS,现在在 Bedrock 就能用,省去自己部署的麻烦,三个版本各有特色,性能很强。原文稍后读已读值得跟进有用关注 GPT-5.6
19:46官方账号Decoder@Jonathan Kemper精选德国研究联盟发布开源语言模型Soofi S 30B-A3B,基于德国电信慕尼黑云基础设施训练。该模型采用高效混合架构,每次调用仅激活316亿参数中的部分,长文本下保持稳定吞吐量。训练数据刻意偏向德语,在德语和英语基准测试中均超越所有完全开源竞品。AI模型Soofi S开源模型德语推荐理由:德国团队搞了个30B开源模型,英德双语都很强,还只用了德国电信的本地云算力,跑长文本也不掉速。原文稍后读已读值得跟进有用关注 Soofi S
17:23官方账号Decoder@Tomislav Bezmalinović73°Google Research推出了SensorFM,这是一个在超过1万亿分钟穿戴设备数据上训练的基础模型,数据来自500万Fitbit和Pixel Watch用户。该模型在35项健康和行为任务中击败了34项现有基准。SensorFM可能为Google的AI健康教练提供动力,但公司尚未宣布任何整合计划。AI模型SensorFMFitbitPixel Watch推荐理由:Google用500万用户上万亿分钟数据训练SensorFM,在34/35项健康任务上超越现有模型,可能成为未来健康教练的核心。原文稍后读已读值得跟进有用关注 SensorFM
16:53官方一手marktechpost@Asif Razzaq精选73°斯坦福研究者提出TRACE系统,从智能体轨迹中诊断能力缺口,为每个能力合成一个可验证的训练环境。系统为每个能力训练一个LoRA适配器,并在专家间路由token。在τ²-Bench上性能提升+15.3点,在SWE-bench Verified上达到73.2% Pass@1。AI模型TRACEStanfordLoRA适配器推荐理由:智能体老犯同样错误?斯坦福的TRACE能自动找出短板,给每个能力单独训练,直接提升15个点。原文稍后读已读值得跟进有用关注 TRACE
16:05官方一手pandaily@contact@pandaily.com (Pandaily)精选72°腾讯发布混元Hy3模型,采用295B MoE架构,参数量达295B。该模型在OpenRouter上排名第8,超越了多个竞品。其Agent性能表现强劲,尤其在任务执行和工具调用方面有显著提升。训练流程经过重新设计,重点优化了数据质量和强化学习环节。AI模型Hunyuan Hy3TencentOpenRouter推荐理由:腾讯新出的混元Hy3模型,295B参数,Agent能力很强,OpenRouter上排前8,感兴趣可以看看。原文稍后读已读值得跟进有用关注 Hunyuan Hy3
14:58IT之家(博客/媒体)AMD 正在为 Radeon RX 系列显卡测试 FSR 多帧生成技术。RadeonTuner 工具曝光驱动中已加入多帧生成初步支持,出现 1 倍至 8 倍帧生成倍率选项。目前 Radeon RX 9060 XT 用户安装最新版 Radeon 驱动后无法启用该功能。原因是驱动中仅有占位代码,多帧生成所需模型尚未就绪。AI模型AMDRadeonFSR推荐理由:AMD驱动里悄悄加了FSR多帧生成选项,最高8倍,但RX 9060 XT现在还不能用,得等后续更新。原文稍后读已读值得跟进有用关注 AMD
13:05IT之家(博客/媒体)三星电子已完成特斯拉下一代AI5芯片的流片(Tape-out),计划采用三星2纳米工艺在美国泰勒晶圆厂量产。三星工程师透露,该2纳米工艺良率已突破60%。大规模量产预计于2027年启动。AI5最初将用于擎天柱人形机器人及AI超算,不会先搭载在特斯拉汽车上。AI模型三星特斯拉AI5推荐理由:三星给特斯拉搞定了AI5芯片,用2nm工艺,良率超60%,2027年量产,先给机器人和超算用。原文稍后读已读值得跟进有用关注 三星
12:43IT之家(博客/媒体)精选商汤科技发布并开源SenseNova-Vision理解生成统一视觉大模型,在目标检测、图像分割、深度预测、3D重建等任务上实现原生统一。该模型在多项权威评测中全面领先,比肩甚至超越各领域专用专家模型。相比仅能处理两类问题的Vision Banana,SenseNova-Vision能同时覆盖结构化理解、稠密几何、全景分割和多视角3D四类核心视觉任务。商汤还同步开源了包含5000万条样本的视觉指令语料库SenseNova-Vision Corpus-50M。AI模型SenseNova-Vision商汤Vision Banana推荐理由:商汤刚开源了SenseNova-Vision,统一四大视觉任务还比Vision Banana强,附带5000万条数据,快试试吧原文稍后读已读值得跟进有用关注 SenseNova-Vision
08:40官方一手marktechpost@Asif Razzaq精选密歇根大学提出NeuroVFM,在524万临床MRI和CT体积上训练。其Vol-JEPA算法将I-JEPA和V-JEPA扩展到三维医学影像。该模型无需放射学报告标签即可学习脑部解剖和病理。AI模型NeuroVFMVol-JEPA神经影像推荐理由:密歇根大学NeuroVFM,用Vol-JEPA在524万MRI/CT上无监督训练,学脑解剖和病理,无需放射报告。原文稍后读已读值得跟进有用关注 NeuroVFM
08:25IT之家(博客/媒体)精选中国电信联合北京邮电大学、鹏城实验室,基于亚洲九号卫星完成跨模态语义通信试验。试验融合语义知识库和JSCC技术,将关键帧占比降低至约0.5%。星地传输效率较H.265方案提升3.5倍,视频质量(FID)较H.265提升70%。该方案破解了多模态传输难题,多模态传输质量提升70%以上。AI模型中国电信H.265语义通信推荐理由:中国电信用AI搞卫星视频传输,比H.265快3.5倍,画质还提升70%,远距离通信新思路。原文稍后读已读值得跟进有用关注 中国电信
23:16IT之家(博客/媒体)73°Meta 于 7 月 9 日发布 Muse Spark 1.1,重点提升智能体任务中的规划、协同与执行能力。该模型支持最高 100 万 token 上下文,由主智能体拆分子任务并行执行。在代码开发方面可诊断复杂错误、执行大规模迁移,内部已用于软件开发与评测。安全性通过 Advanced AI Scaling Framework 评估,在前沿风险领域处于安全范围,但部分表现仍落后于 GPT-5.5 和 Claude Opus 4.8。目前模型已上线 Meta AI App 和 meta.ai 的 Thinking 模式,并开放 Meta Model API 预览版。AI模型Muse Spark 1.1Meta多模态推理模型推荐理由:Meta 的 Muse Spark 1.1 强化了多智能体协作与代码开发,支持百万 token 长上下文,但部分场景弱于 GPT-5.5 和 Claude Opus 4.8。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
18:31量子位@一水一位1998年出生的哈工大教授创办公司,目标是构建人形灵巧操作世界模型。技术路线包括触觉数据采集、跨模态对齐以及触觉在实际操控中的应用。该模型旨在让机器人通过触觉实现精细化物体操作,区别于纯视觉方案。AI模型触觉人形机器人世界模型推荐理由:哈工大年轻教授从触觉切入人形机器人,想做世界模型,和主流视觉路线不同,思路挺有意思。原文稍后读已读值得跟进有用关注 触觉
16:34官方一手pandaily@contact@pandaily.com (Pandaily)PHANES AI 由 28 岁的哈工大教授杨朔创立,近日发布了触觉基础模型 TouchWorld。该模型通过预测和反应式触觉信号,使机器人能够完成精确的物理任务,如抓取易碎物体或装配精密零件。TouchWorld 在多个灵巧操作基准上取得了显著提升,相比传统视觉方法错误率降低 60% 以上。AI模型PHANES AITouchWorld机器人触觉推荐理由:PHANES AI 的 TouchWorld 让机器人真正有了触觉,能在你不知道怎么用力的时候自己调整,完成精细活儿。原文稍后读已读值得跟进有用关注 PHANES AI
16:30官方一手pandaily@contact@pandaily.com (Pandaily)2026年6月,具身AI领域迎来爆发,平均每48小时就有一个新模型诞生,共13个具身AI模型和世界模型发布。BAAI发布了其世界模型,阿里巴巴推出了Qwen-Robot。这些模型标志着竞争焦点从机器人硬件基准转向软件智能,如Sim-to-Real、操作泛化等能力。这13个模型涵盖从抓取到导航的多种任务,基准如LIBERO、RLBench表现均有提升。AI模型BAAI World ModelQwen-RobotAlibaba推荐理由:具身AI每两天就冒出一个新模型,这次BAAI和阿里都出手了,想看看软件智能怎么拼过硬件?这篇总结到位。原文稍后读已读值得跟进有用关注 BAAI World Model
16:16官方账号Decoder@Jonathan KemperAgenticSTS项目用五层结构化记忆替代不断增长的聊天日志,将AI提示长度从超过50万tokens压缩至约5000tokens。在卡牌游戏Slay the Spire 2中,该代理赢得6/10局对局,而使用常规聊天日志的竞争代理零胜。结果表明结构化记忆可有效控制token成本并提升游戏策略表现。AI模型AgenticSTSSlay the Spire 2结构化记忆推荐理由:他们把AI的记忆从聊天日志改成5层结构,token瞬间降了100倍,在Slay the Spire 2里赢了6/10场,别的方法全输。原文稍后读已读值得跟进有用关注 AgenticSTS
11:46IT之家(博客/媒体)阶跃星辰发布 Step Edge 端侧模型全家桶,包含 Step Edge 基础模型、Step Edge Audio、Step Edge GUI 和 Step Edge Gen 四款产品。该系列支持低至 0.1 秒的端侧本地 toolcall 执行,实现超低延迟。模型可在本地处理文本、视觉、语音等多模态信息,保护隐私。同时支持端云协同:简单任务本地响应,复杂推理交给云端。配套 Step Inference NPU 引擎可针对终端硬件优化推理效率。AI模型阶跃星辰Step Edge端侧模型1 个信源在谈事件专题推荐理由:阶跃星辰把模型塞进手机和汽车里,本地调用只要0.1秒,隐私数据不出终端,还带音频、界面和生成版本,适合做终端智能体。原文稍后读已读值得跟进有用关注 阶跃星辰
08:49IT之家(博客/媒体)91°OpenAI 于 7 月 10 日宣布,GPT-5.6 Sol Ultra 模型在不到 1 小时内生成了循环双覆盖猜想的完整证明。该猜想是图论领域悬而未决 50 多年的重要难题。证明步骤包括将原猜想归约为三次图问题、利用 8-流定理和 GF(3) 上的线性代数构造。整个证明由 AI 独立完成,但尚未经过正式同行评审,也未使用 Lean 等形式化验证工具。AI模型GPT-5.6 Sol UltraOpenAI循环双覆盖猜想10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 Sol Ultra 只用一小时就搞定了一个困扰数学家 50 年的图论难题,用的是 64 个子智能体协作,比人类更有耐心反复试错。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Ultra
01:46官方账号Decoder@Matthias Bastian82°OpenAI的GPT-5.6 Sol Ultra使用64个子智能体并行工作,在一小时内证明了图论中的Cycle Double Cover猜想。该猜想已悬而未决50年,被认为是图论领域的重要未解问题。数学家Thomas Bloom称该证明方法出人意料地初等,但批评其未引用已知的前期工作。这引发了关于AI是重组现有知识还是创造新知识的讨论。AI模型GPT-5.6 Sol UltraOpenAICycle Double Cover猜想10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6 Sol Ultra一小时破解了困扰数学界50年的Cycle Double Cover猜想,虽被指引用不足,但效率惊人。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Ultra
22:25IT之家(博客/媒体)月之暗面将K2.7 Code高速版结束Beta,成为Kimi Code常驻可选模式。订阅Allegretto及以上会员的用户可直接调用,在Coding Plan中用量消耗为普通版的3倍。该高速版输出速度约为普通版的5-6倍,常规编程场景下约180 Token/s,短上下文可达260 Token/s。价格是K2.7 Code普通版的两倍:输入13元/1M tokens,输出54元/1M tokens,缓存输入2.6元。相比K2.6模型,K2.7 Code在长上下文编程指令遵循能力、长程任务性能上显著提升,平均token消耗减少30%。AI模型K2.7Kimi Code月之暗面推荐理由:月之暗面出了编程加速版,速度翻5倍但收费也翻倍,适合赶进度的开发者试试。原文稍后读已读值得跟进有用关注 K2.7
19:30IT之家(博客/媒体)AMD在2026年度I3D研讨会上公布PEPS(位置编码投影采样)神经纹理压缩技术,在保持画质基本不变的前提下将模型参数量削减25%。在Radeon RX 9070 XT上测试生成1024×1024三通道纹理,Grid-PEPS方案耗时5.47毫秒,高于BI-grid基准的4.32毫秒,优化后的Grid-PinkPEPS版本降至4.86毫秒。在Pitted Stonefish SDF测试中,Grid-PEPS仅用非PEPS方法八分之一的编码器参数,即达到几乎相同的交并比。AI模型AMDPEPS神经纹理压缩推荐理由:AMD用计算换显存,参数少25%画质不变,还能压缩SDF,适合关注游戏优化和显存效率的玩家。原文稍后读已读值得跟进有用关注 AMD
17:35官方账号Decoder@Jonathan Kemper北京人工智能研究院发布Orca世界模型,它预测抽象世界状态而非token或像素。该模型在125,000小时视频上训练,未使用任何动作标签。在五个机器人任务上,Orca的表现与专用π0.5模型相当。这项研究可能有助于缓解机器人领域长期面临的数据短缺问题。AI模型Orcaπ0.5世界模型推荐理由:中国团队搞了个Orca世界模型,不用学动作标签就能看懂视频里的世界,在五个机器人任务上跟专业π0.5打平,厉害。原文稍后读已读值得跟进有用关注 Orca
17:11官方一手pandaily@contact@pandaily.com (Pandaily)精选71°字节跳动Seedream 5.0 Pro在逼真度、复杂可视化与设计三个方向的10个场景测试中表现突出。模型在信息图(infographic)生成和UI线框图(mockups)方面实现显著提升。评测覆盖了现实主义渲染、复杂图表呈现等任务。相比前代,Seedream 5.0 Pro在结构化输出上进步明显。AI模型Seedream 5.0 Pro字节跳动ByteDance推荐理由:字节跳动新出的Seedream 5.0 Pro,实测10个场景,信息图和UI线框图生成进步很大,值得一试。原文稍后读已读值得跟进有用关注 Seedream 5.0 Pro
16:07官方一手marktechpost@Asif Razzaq蚂蚁集团旗下Robant发布LingBot-VA 2.0技术报告,这是为具身智能原生构建的视频动作基础模型,而非从视频生成器微调。模型通过Foresight Reasoning预测未来状态,并基于每个真实观测重新接底,实现225Hz异步控制。架构采用因果DiT、稀疏MoE视频流和语义视觉动作分词器。AI模型LingBot-VA 2.0Robant具身智能推荐理由:蚂蚁Robant出了个面向具身AI的模型LingBot-VA 2.0,能预测未来状态并以225Hz实时控制,跟那些从视频生成器改的模型思路完全不一样。原文稍后读已读值得跟进有用关注 LingBot-VA 2.0
15:37IT之家(博客/媒体)86°开发者 Jarred Sumner 利用 Anthropic 的 Claude Fable 5 模型,在 11 天内将 JavaScript 运行时 Bun 从 Zig 语言重写为 Rust,生成了超过 100 万行代码。重构目的是提升可靠性,Zig 频繁出现内存错误,而 Rust 能在编译时捕获此类问题。过程中 64 个 Claude 实例并行运行,API 费用约 16.5 万美元(约 111.9 万元人民币)。Bun 团队已于 2025 年 12 月被 Anthropic 收购。重构后的 Bun v1.4.0 Canary 版本修复了 128 个错误,运行速度提高 2% 到 5%。AI模型Claude Fable 5BunRust10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Fable 5 太能干了,11 天帮 Bun 重写超百万行 Rust 代码,修了 128 个 bug 还提速 5%,顶一支团队干一年。原文稍后读已读值得跟进有用关注 Claude Fable 5
15:19IT之家(博客/媒体)73°GPT-5.6 Sol 能充当“自动化研究员”,为较小模型 Luna 定制完整后训练方案。在内部评估套件“聚合 RSI”上,GPT-5.6 Sol 比 GPT-5.5 高出 16.2 个百分点。活跃研究员人均日 token 产出较 GPT-5.5 翻倍以上,单个研究员 pull request 和实验数量均上升。AI模型GPT-5.6 SolLunaOpenAI10 个信源在谈事件专题推荐理由:OpenAI 新出的 GPT-5.6 Sol 能自己训练小模型Luna,研究效率比上一代高16%,研究员一天干的活翻倍了。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
14:29量子位@henryGPT-5.6 通过 700 词 Prompt 调度 64 个子 Agent,在一小时内解开了悬而未决 50 年的数学猜想。该成果展示了大型语言模型在复杂推理和协作任务上的突破,子 Agent 架构可并行处理不同子问题。研究人员称,该方法不仅适用于数学,还可推广到科学发现和工程优化。AI模型GPT-5.6推理模型智能体推荐理由:GPT-5.6 用 700 词 Prompt 指挥 64 个小模型,一小时破解了数学家 50 年没解开的难题,推理能力强到离谱。原文稍后读已读值得跟进有用关注 GPT-5.6
13:53IT之家(博客/媒体)精选73°谷歌研究团队推出可穿戴健康基础模型 SensorFM,基于全球500万名参与者的20亿小时(超1万亿分钟)可穿戴数据预训练。模型输入包含34个1分钟聚合特征,融合PPG、加速度计、EDA、皮肤温度和高程计5种传感器数据。在35项健康任务中,SensorFM-B在34项优于特征工程监督基线。最大模型SensorFM-B相较最小版本重建损失下降31%,分类平均AUC提升9%,回归Pearson相关系数提升21%。AI模型SensorFM谷歌可穿戴设备推荐理由:谷歌用500万人的海量数据训练出SensorFM,能搞定心血管、睡眠等34项健康任务,比传统方法更准。原文稍后读已读值得跟进有用关注 SensorFM
13:29IT之家(博客/媒体)扎克伯格接受采访称Meta目前仍落后于Anthropic和OpenAI的AI能力。Meta发布了首款收费模型Muse Spark 1.1,定价为每百万输入token 1.25美元、输出4.25美元,仅为其他顶级模型的25%。该模型在智能体和编程等任务上优于谷歌Gemini。扎克伯格透露正在开发代号“西瓜”的新模型,旨在追赶并超越竞争对手。AI模型Muse Spark 1.1MetaOpenAI10 个信源在谈事件专题推荐理由:Meta刚推出超低价模型Muse Spark 1.1,扎克伯格就承认落后并预告“西瓜”新模型,看看他们怎么追。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
09:22SuperTechFans(博客/媒体)92°GPT-5.6 Sol 在 Agents' Last Exam 上得分 53.6,领先 Claude Fable 5 达 13.1 分。中等推理模式下仅用约四分之一成本即领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上 Sol 取得 80 分,领先 Fable 5 2.8 分,token 和成本大幅降低。新推出 ultra 模式默认协调四个智能体并行工作,提升浏览和证券基准表现。安全方面经过广泛红队测试和自动化评估。AI模型GPT-5.6OpenAIClaude Fable 510 个信源在谈事件专题推荐理由:OpenAI 刚发了 GPT-5.6,三个型号性能都爆表,尤其 Sol 在编码和推理测试里吊打 Claude Fable 5,成本还低很多,编程和复杂任务都更强了。原文稍后读已读值得跟进有用关注 GPT-5.6