VOL.2026.07.25·207 STORIES·AITOP DAILY

AITOP日报

二〇二六年七月二十五日 星期六DAILY · 每早八时
01

模型发布/更新

Model Releases
5

TTEL:利用错误定位实现推理时扩展

官方账号X·KOLX:arXiv cs.LG (@Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan Raghuveer)原文 ↗

TTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。

OpenForgeRL:端到端训练 Harness 原生智能体的开源框架

官方账号X·KOLX:arXiv cs.AI (@Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao)原文 ↗

OpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。

Anthropic 发布 Claude Opus 5,性能接近 Fable 5,价格降一半

X·KOLX:宝玉 (@dotey)原文 ↗

Anthropic 发布 Claude Opus 5,API 价格每百万输入 Token 5 美元、输出 25 美元,与 Opus 4.8 相同,仅为 Fable 5 的一半。Frontier-Bench v0.1 上得分是 Opus 4.8 的两倍多,单任务成本更低。CursorBench 3.2 最高 Effort 档下与 Fable 5 差距不到 0.5%,任务成本仅一半。ARC-AGI 3 得分是第二名模型的三倍,Zapier AutomationBench 在相同成本下任务通过率约为第二名的 1.5 倍。安全方面自动行为审计失准得分 2.3,低于 Opus 4.8、Sonnet 5 和 Fable 5。

02

产品发布/更新

Product
5
03

行业动态

Industry
5

黄仁勋发文支持开源模型,强调开放权重的重要性

X·KOLX:小互 (@imxiaohu)原文 ↗

黄仁勋在 X 平台发表首条帖子,代表 NVIDIA 签署支持开源模型的公开信。他指出开放权重模型允许任何人下载、修改和运行,降低初创企业和学术机构的部署成本。他强调过度集中封闭模型会产生单点故障风险,开放权重能促进芯片、云和应用层多维度竞争。黄仁勋呼吁政策制定者扩大算力资源、投资共享数据及评估工具,避免过早限制以维持创新活力。

AMD与Cerebras联合开发低时延AI推理方案 每瓦每秒Token吞吐提升5倍

官方IT之家原文 ↗

AMD与Cerebras在Advancing AI 2026活动中宣布联合开发AI推理解决方案,针对超低延迟场景。方案整合AMD Helios机架和Cerebras Wafer-Scale Engine,分别处理提示词/大上下文和Token生成/解码环节。结合使用2个计算引擎,预计将每瓦每秒token吞吐提升5倍。Cerebras晶圆级引擎在单块硅片上集成数十万个核心和数十GB SRAM,以减少外部网络瓶颈。

04

论文研究

Research
5

Lean-QuantumAlg-Bench 和 Lean-QIT-Bench 评估 AI 定理证明

官方一手X·KOLX:arXiv: DeepSeek (@Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang)原文 ↗

研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。

KroQuant: Kronecker结构块变换实现扩散变换器高效后训练量化

官方账号X·KOLX:arXiv cs.LG (@Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu Salzmann)原文 ↗

KroQuant提出一种Kronecker结构可逆变换,对每个32元素激活块进行在线量化,参数少于per-channel缩放的一半。在MI350 GPU上,KroQuant量化核比SmoothQuant核快14%。在PixArt-Σ、SANA和FLUX.1-schnell上以W4A4(MXFP4e2)量化,KroQuant在MJHQ-30K和SDCI上输出比SVDQuant和LoRaQ更接近FP参考,同时保持或提升图像质量。该方法通过离线LoRaQ权重校准吸收残差权重量化误差。

用Claude和LPTP解决P-99 Prolog问题的案例研究

官方一手X·KOLX:arXiv: Anthropic (@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof)原文 ↗

本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。

VLM-IE3D:隐式与显式几何融合的3D感知视觉语言模型

官方账号X·KOLX:arXiv cs.LG (@Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang)原文 ↗

现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。

超越谄媚:LLM道德推理中的结构化抵抗与顺从

官方账号X·KOLX:arXiv cs.AI (@Baihui Wang, Bernard Koch)原文 ↗

该论文研究了大型语言模型(LLM)在道德推理中如何区分合理修正与谄媚顺从。通过三项研究,作者发现模型的判断更新沿着三个维度结构化:观点与模型初始立场的距离、该观点的来源归属(如来自模型自身先前判断的影响更大)、以及支持该观点的联盟结构。模型更易接受邻近立场,对看似自身先前判断的观点更敏感,对群体压力的反应存在差异。这些发现将谄媚重新定义为更广泛的判断更新过程的一部分,为区分建设性信念修正与谄媚顺从提供了基础。

05

技巧与观点

Tips & Takes
3

使用百度Unlimited-OCR构建高分辨率图像与多页PDF的端到端OCR流水线

官方一手X·KOLX:marktechpost (@Sana Hassan)原文 ↗

教程演示基于百度Unlimited-OCR模型的完整OCR工作流程,涵盖GPU环境配置、高分辨率图像tiled推理与Base模式对比。支持处理密集布局、表格及跨页内容,实现可复现的端到端流水线。实验表明tiled模式能有效提升高分辨率(如4K以上)图像的识别准确率,而Base模式在速度上更优。

用Amazon SageMaker AI和PyTorch构建可解释的银行推荐系统

官方一手X·KOLX:AWS Machine Learning Blog (@Ayush Singh Chauhan)原文 ↗

AWS博客介绍了如何利用Amazon SageMaker AI和PyTorch构建一个可解释的银行下个最佳产品推荐系统。该系统采用多塔神经网络与注意力机制,实现高准确率的个性化推荐。关键设计包括可解释性模块,满足银行监管对推荐原因透明化的要求。文章提供了完整的架构设计和决策说明。

2026年Embedding模型选择指南:从榜单到数据形态

X·KOLX:Milvus (@milvusio)原文 ↗

Milvus团队指出,2026年embedding模型选择更依赖数据形态而非排行榜。对于文本知识库,Qwen3 Embedding、Jina v5 text、BGE-M3、OpenAI text-embedding-3、Voyage、Cohere等密集embedding值得测试。对于PDF、图片、截图、音频、视频,推荐Gemini Embedding 2、Jina v5 omni、Cohere Embed 4、Qwen3-VL-Embedding、Voyage Multimodal等模型。长文档可用Voyage context-4进行上下文化片段嵌入。复杂布局可考虑ColPali风格的多向量检索。基准如MTEB、MMEB、ViDoRe可辅助筛选,但最终验证需用自己的文档和查询。Milvus 2.6新增Text Embedding Function,将嵌入管道移入数据库层。

207
今日事件
57
一手报道
64
新模型
80
信源
AITOP · 编辑系统自动生成