VOL.2026.08.11·15 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月十一日 星期二DAILY · 每早八时
01

模型发布/更新

Model Releases
4

Anthropic 研究版 Claude 把黎曼零点下界从 41.6% 提到 67.2%

X·KOLX:宝玉 (@dotey)原文 ↗

Anthropic 今日公开了一个未发布研究版 Claude 的数学结果:它把黎曼 ζ 函数非平凡零点在临界线上的已知比例下界从 41.6% 提高到 67.2%。此前人类数学界从 1974 年 Levinson 的 33% 到 2020 年 Pratt 等人的 41.7%,花了近 50 年。Claude 结合了多位数学家近年论文与 Bombieri 2000 年的工作,Anthropic 数学家 Alpöge 和 Furman 已审查验证。Claude 还用 Lean 写出了可机器验证的证明。这次探索由 60 个子智能体协作,运行了 2400 条命令。

南洋理工、北大、智源发布 Omega-0 世界动作模型,真实家务成功率 81.8%

官方一手X·KOLX:Pandaily (@contact@pandaily.com (Pandaily))原文 ↗

南洋理工大学、北京大学、港科大(广州)与智源研究院联合发布 Omega-0,一种潜在预测世界动作模型,能让机器人同时行走、观察和操作。在 11 项真实家务任务中,单模型成功率达 81.8%,超过 pi-0.5、EgoVLA、GR00T-N1.7 和 psi-0。该模型采用潜在预测机制,提升了对环境变化的响应能力。研究团队强调,Omega-0 在真实家庭场景中的表现优于多个现有基线模型。

02

产品发布/更新

Product
2
04

论文研究

Research
5

ConVAWG:面向暴力侵害女性场景的检索增强合成对话生成框架

官方账号X·KOLX:arXiv cs.AI (@Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele Pergola)原文 ↗

ConVAWG 是一个用于生成暴力侵害女性(VAWG)场景多轮对话的检索增强框架。它利用英国国家统计局的人口统计数据、官方犯罪定义和家庭凶杀案审查案例构建场景,并生成超过 6,000 个多轮对话事件,覆盖 200 个场景。框架采用分层事件时间线生成多场景角色扮演对话,并通过激活导向的毒性控制调整不当表述。人工评估和 LLM-as-Judge 评估显示其对话质量和领域保真度较高。该研究旨在解决敏感领域真实对话数据难以获取的问题。

R4DSG:面向长视频问答的相对4D场景图记忆

官方账号X·KOLX:arXiv cs.AI (@Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang)原文 ↗

R4DSG提出一种相对4D场景图记忆方法,用于长时程第一人称视频中的对象中心问答。该方法将视频转换为按时间、地点、持久对象和锚点相对变化索引的紧凑可查询记忆,而非存储原始图序列。它利用可提示视频分割和相对3D提升等RGB-only技术,在EgoLifeQA的255个对象相关问题子集上,相比EgoRAG-Text在仅问题检索下整体提升6.7分,在“何时”类问题上提升12.5分。

CHORUS:互补专家框架提升硬件验证测试激励生成覆盖率

官方一手X·KOLX:arXiv: DeepSeek (@Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao)原文 ↗

CHORUS是一个面向硬件验证测试激励生成的后训练框架,利用分阶段监督微调产生行为多样的检查点,再通过密集奖励强化学习将其转化为任务级优势互补的专家模型。该框架通过无训练模型合并或进一步后训练整合专家优势,最终将多个专家合并为单个4B模型。CHORUS在CVDP-ECov基准上达到88.0%的Pass@1,比DeepSeek-R1(671B)高出13.5个百分点。

多类政治观点情感分析:XGBoost与BERT基准对比

官方账号X·KOLX:arXiv cs.AI (@Girma Yohannis Bade, Olga Kolesnikova, Jose Luis Oropeza, Grigori Sidorov)原文 ↗

该研究针对社交媒体政治话语,设计并评估了基于XGBoost和BERT的两种多类情感分析模型。在标注的政治社交媒体帖子数据集上,XGBoost模型测试集F1分数为0.2835,BERT模型为0.2806。结果显示政治话语情感分类的复杂性,为未来多类政治情感分析提供基线。

RTSKG:构建轨道交通站点知识图谱数据集

官方账号X·KOLX:arXiv cs.AI (@Shutong Zhu, Tianxing Wu, Runfeng Liu, Yuang Gu, Xuan He, Yuan Zhu)原文 ↗

RTSKG是一个专门为城市级轨道交通站点任务设计的知识图谱数据集,显式建模了站点、道路段和兴趣点等异构城市实体间的空间与语义交互。该数据集采用统一模式组织数据,并以Linked Data形式在https://w3id.org/rtskg/开放访问。在站点周边商店推荐和知识增强的客流预测两项评估中,RTSKG展现了有效性,表明其能支持城市级轨道交通站点分析。

05

技巧与观点

Tips & Takes
4

LangChain创始人将推Managed Deep Agents 101视频教程

X·KOLX:Harrison Chase (@hwchase17)原文 ↗

LangChain创始人Harrison Chase在X上宣布,正在制作一个名为"Managed Deep Agents 101"的大型视频教程。该教程将深入讲解托管深度智能体的所有核心概念,并参考了docs.langchain.com上的官方文档。他在帖子中询问用户偏好:是想要一个超过2小时的单一视频,还是拆分成12个约10分钟的YouTube播放列表。目前该帖子获得15个赞和1434次浏览,社区正在参与讨论。

让编码智能体做TDD有用吗?实验给出答案

X·KOLX:Martin Fowler (@martinfowler)原文 ↗

Martin Fowler转发Birgitta Böckeler的实验,探讨让编码智能体自行执行测试驱动开发(TDD)是否有效。实验对比了有TDD指令和无TDD指令的智能体表现,发现TDD对智能体并非总是有益。Böckeler分享了具体实验数据和思考,指出某些情况下TDD反而可能拖慢智能体。文章为开发者提供了关于如何配置编码智能体的实用参考。

文本水印原理详解:KGW方法、破解与工程难点

X·KOLX:宝玉 (@dotey)原文 ↗

本文以Claude的水印为例,详解了KGW方法的原理:生成时用密钥和已生成token计算哈希,将词表分为绿组和红组,并提高绿组词被选中的概率。检测时用同一密钥还原分组,若绿组词占比显著超50%则判定带水印。改写可破解水印,但统计模型生成的哈希(如SIR、Adaptive Watermark)能增强鲁棒性。Google在2万条文本的人类反馈实验中称质量下降难以感知,但短文本或高确定性输出(如1+1=2)会失效。工程难点包括流式输出、密钥轮换和代码类输出的限制。

15
今日事件
3
一手报道
4
新模型
11
信源
AITOP · 编辑系统自动生成