VOL.2026.08.04·151 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月四日 星期二DAILY · 每早八时
01

模型发布/更新

Model Releases
5

前沿模型解非线性PDE常出错,神经符号模型更可靠

X·KOLX:Gary Marcus (@GaryMarcus)原文 ↗

Jonathan Gorard在X平台发文指出,包括GPT-5.6 Sol、Fable 5和Kimi K3在内的前沿AI模型,在实现基本非线性PDE求解器时普遍失败,常引入数值稳定性、精度阶数或物理一致性方面的显著错误,即使给出详细提示并要求用Lean形式化实现也是如此。即使成功的案例中,较可靠的模型如Fable 5也常消耗超过Lanyon这类轻量神经符号模型100倍的token。其团队认为,只有像Lanyon这样的真正神经符号模型才能为复杂科学问题生成具有端到端正确性保证的超可靠数值求解器,且目前差距明显。

自变量机器人发布HOST框架并开源,看视频学新技能

官方IT之家原文 ↗

自变量机器人发布并开源HOST框架,让机器人仅观察29秒人类视频即可学习新技能,成功率达62%,超过零样本基线45%。相比Pi-0.5加微调方案,HOST所需数据量减少50倍,学习速度提升500倍。HOST采用双专家MoT架构,将视觉预测与动作生成分离,并通过动态时间规整按任务进度对齐人类视频与机器人操作。研究论文和代码已全部开源。

Qwen3.8-Max 正式发布:2.4T 参数,下周首次开源

X·KOLX:小互 (@imxiaohu)原文 ↗

Qwen3.8-Max 总参数量 2.4T、激活参数 95B,官方宣布下周开源,是 Qwen Max 系列首次开源。它在 oh-my-cli 项目中自主运行 16 天完成无人编程,并在电商多模态意图识别竞赛中提交 45 次,准确率从 0.60 提升到 0.853,击败 458 支队伍。在 365 天模拟电商经营中,模型实现 4.16 倍资金回报,净赚超 10 万元。它还花 125 小时写 7,600 行代码复现论文,并在 AIME24 上反超原论文 2.71 分。视觉与多模态方面,模型支持分析 100+ 小时长视频,并能通过 Hybrid Agent 编程与 GUI 操作复刻应用。

Gary Marcus:2017年后最大突破是模型加入工具和代码解释器

X·KOLX:Gary Marcus (@GaryMarcus)原文 ↗

Gary Marcus在推文中称,2017年以来除规模扩展外,最大突破是将基础模型扩展为整合工具和代码解释器的系统,例如Claude Code。João Mendonça则反驳,LLM领域已有9年没有突破,自2017年6月《Attention Is All You Need》和2017年1月应用稀疏MoE之后,架构没有质变。这场辩论的双方都承认,Claude Code是工具化系统路线的代表产品。

英特尔为 MiniMax H3 提供 Day 0 支持,实现多卡 GPU 部署方案

官方IT之家原文 ↗

英特尔今日宣布为开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持,锐炫 Pro B70 已率先完成适配。团队实现多卡 GPU 部署方案,Encoder 采用 8 卡张量并行,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading,VAE 部署于 B70 GPU。相比纯 8 卡 USP,新方案还开发了 2TP×4USP 混合并行,将 USP 并行度降至 4 并引入 2 路张量并行,以减少通信开销。该方案还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等算子进行持续优化。

02

产品发布/更新

Product
5

Milvus 3.0 引入低成本快照,化解动态数据与离线计算矛盾

X·KOLX:Milvus (@milvusio)原文 ↗

Milvus 3.0 的快照机制引用已有数据、索引和元数据文件而非复制全量数据。用户可在模型替换、重新嵌入、模式迁移前创建轻量检查点。不可变快照视图支持 A/B 评估、去重、回填验证和离线测试。通过对象存储服务端复制复用文件,避免重新导入和索引重建。注意快照不替代备份,备份用于长期保留和灾难恢复。

联发科第二款AI ASIC加速器有望2028年量产,英特尔代工EMIB进展良好

官方IT之家原文 ↗

联发科在2026Q2财报电话会议上透露,首款AI ASIC加速器预计于2026Q2量产,第二款产品开发顺利,计划2028年启动初产并在同年量产。联发科已将英特尔代工EMIB-T与台积电CoWoS并列,作为关键的2.5D异构集成先进封装技术。其448G SerDes高速I/O IP开发顺利,同时基于台积电COUPE平台推进CPO光互联解决方案。联发科董事会已批准50亿美元自由裁量资金,用于保障供应链并支持从AI ASIC芯片向全规模系统平台扩展。

03

行业动态

Industry
5

SK海力士与闪迪将在FMS 2026发布HBF首个标准规范

官方IT之家原文 ↗

SK海力士与闪迪将在FMS 2026发布高带宽闪存(HBF)首个标准规范,该规范由OCP正式发布。HBF介于HBM和固态硬盘之间,基于NAND闪存实现高带宽与大容量。规范定义8层和16层堆叠,最高支持512GB容量,带宽分三个等级覆盖0.4TB/s至3.0TB/s。HBF采用UCIe互联,可灵活连接GPU、CPU等处理器。HBF联盟已汇聚谷歌与Tenstorrent,SK海力士还计划展示V10 375层4D NAND闪存。

20VC 对话 ML Angelopoulos:Kimi K3 与开源模型安全

X·KOLX:lmarena.ai (@lmarena_ai)原文 ↗

AI 评测平台 LMSYS CEO Angelopoulos 在 20VC 播客中表示,中国开源模型 Kimi K3 已超越西方顶级闭源模型,打破了“外国实验室只是蒸馏美国技术”的说法。他警告,开源模型权重可能被植入后门,某个触发词可导致企业数据大规模外泄。他还判断,70% 的 neo-labs 只是研究项目,无法成为可持续业务。他强调,未来企业的护城河将来自专有数据和网络效应,而非可即时生成的软件。

04

论文研究

Research
5

SignMuon:Muon更新的单比特符号压缩与误差反馈极限

官方账号X·KOLX:arXiv cs.LG (@Maria Smirnova, Alexey Kravatskiy)原文 ↗

论文提出 SignMuon,将 Muon 优化器的更新逐参数取符号压缩为 1 bit。在 CIFAR-10 与 nanoGPT speedrun 实验中,SignMuon 优于 SignSGD,但作者构造线性函数实例证明它可能上升。把符号操作放在线性最小化 Oracle 之前或两侧同样无法保证下降。误差反馈用在 Muon 输出上对所有平滑常数、步长和动量都可能失效;用在梯度上则有效,EF21-MuonSign 在光滑非凸问题上达到 O(T^{-1/2}) 平方梯度范数收敛率。实验里最强的压缩方法是符号放在 Oracle 之后,尽管该配置理论上发散。

GQ-FSL:绿色量化联邦分割学习框架

官方账号X·KOLX:arXiv cs.LG (@Idan Roth, Lutz Lampe)原文 ↗

GQ-FSL在联邦分割学习(FSL)中引入随机量化,对客户端和服务器的子模型使用非对称精度,从而解耦设备能耗与全局收敛损失。该方法建立了参数化能耗模型,并推导了数据异构下的理论收敛界。通过联合优化DNN分割点和精度级别,GQ-FSL在满足准确率约束的前提下最小化总系统能耗。实验显示,相比量化联邦学习和全精度FSL,GQ-FSL显著提升能效,支持在资源受限设备上部署大型DNN。

TokTier有状态分词提升智能体服务,TTFT最高降34%

X·KOLX:elvis (@omarsar0)原文 ↗

TokTier提出有状态分词方法,解决智能体场景下代码转录重复提交导致的分词不可复用问题。在153,951次真实智能体调用中,提示缓存命中率94.1%时,分词仍占用首token时延的64%。该方法只对追加位置附近的小窗口重新分词,并通过稳定边界检查拼接,在17个分词器家族的1.5e10次分割检查中零偏差。增量修复100K到3M字符耗时0.5至1.1毫秒,比HuggingFace快最多437倍;在vLLM下中位首token时延下降16%至34%。

差分隐私非参数模态学习及其在回归与聚类中的应用

官方账号X·KOLX:arXiv cs.LG (@Arkajyoti Bhattacharjee, Arnab Auddy)原文 ↗

论文提出DP-GRAMS,一种基于均值漂移的差分隐私模态估计方法,用于多变量密度。该方法在Hölder平滑参数β>2时采用高阶核降低偏差,并用梯度裁剪和校准高斯噪声保护隐私。理论证明所有总体模态能以高概率恢复,渐近误差率为O((log n/n)^{2(β-1)/(d+2β)}) + O((polylog(n,δ)/(n^2ε^2))^{(β-1)/(d+β)})。作者还给出私有模态估计的极小极大下界,表明该估计器在均方误差上近乎最优,仅差对数因子。扩展版本DP-PMS和DP-GRAMS-C分别用于回归和聚类,实验显示隐私-效用权衡优于常见基线。

ExtractBench:面向企业文档模式引导提取的新基准

官方账号X·KOLX:arXiv cs.AI (@Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo)原文 ↗

ExtractBench是一个面向模式引导文档提取的新基准,评估集涵盖370份企业文档、4869页、8个业务领域和67种文档类型。该基准同时评测值准确性、记录完整性、来源可追溯性和成本,其中值F1对顺序不敏感。测试发现,商业VLM在短文档上表现良好,但在长文档上常截断记录列表;编码智能体准确率更高但成本明显更高。LlamaExtract Agentic Plus在三个指标上均排第一,成本仅为编码智能体的很小一部分。

05

技巧与观点

Tips & Takes
5

长上下文模型的推理速度在训练前就已定下上限

官方账号X·KOLX:NVIDIA AI (@NVIDIAAI)原文 ↗

NVIDIA在AI Model Co-Design系列中发文指出,长上下文模型的推理速度在训练前就已被架构选择决定。随着上下文窗口扩大,注意力机制在推理成本中的占比快速上升,逐渐成为主要负担。文章梳理了4个决定性能上限的架构参数:group size、head dimension、KV-cache size和并行策略。这些选择同时影响系统吞吐量和单个用户的响应速度。

Moonshot PerceptionBench评估多模态模型教程

官方一手X·KOLX:marktechpost (@Sana Hassan)原文 ↗

本教程介绍如何用Moonshot PerceptionBench搭建多模态视觉模型评估工作流,覆盖OCR、计数、定位、上下文推理、比较、深度理解与幻觉检测等任务。教程使用Colab环境安装依赖,并加载数据集的平衡子集。通过健壮数据加载与自动判定流程,实现端到端评测。教程同时说明如何配置自动评判模块以减少人工干预。

151
今日事件
49
一手报道
46
新模型
62
信源
AITOP · 编辑系统自动生成