VOL.2026.08.20·222 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月二十日 星期四DAILY · 每早八时
01

模型发布/更新

Model Releases
5

CABLE:通过互补前导链接扩展记忆检索范围

官方一手X·KOLX:arXiv: DeepSeek (@Zheling Tan, Jin Gao, Dequan Wang)原文 ↗

CABLE是一种插件式内存增强方法,专为解决LLM代理长期记忆中的证据可达性问题。该方法在LoCoMo和MA-LongMemEval基准测试中使用Qwen3.5-27B、DeepSeek-chat和GPT-4o-mini进行评估。CABLE通过构建稀疏的推理相关关联,而非重复主机检索器已覆盖的内容,显著提升了跨记忆和会话的证据检索能力。在开放域、多会话和偏好导向问题类别中,CABLE实现了最大的性能提升。

02

产品发布/更新

Product
5

RadixArk发布开源强化学习框架Miles v0.1

X·KOLX:Aravind Srinivas (@AravSrinivas)原文 ↗

RadixArk公司发布了Miles v0.1,这是一个开源的强化学习框架,专门用于训练LLM和多模态模型。该框架已在过去9个月内有72名贡献者提交了1,326次代码提交,并进行了85个GPU端到端CI测试。Miles已在Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2等前沿开源模型上进行了实战测试。目前已有包括humansand、periodiclabs等多家公司在NVIDIA和AMD硬件上使用Miles进行前沿模型开发和生产强化学习工作负载。

10 倍词元容量:Cerebras 推出 WSE-3 Turbo 芯片与 CS-4 系统

官方IT之家原文 ↗

Cerebras推出新一代芯片WSE-3 Turbo和基于该芯片的CS-4系统,与上代CS-3相比带来10倍词元容量和2倍速度。WSE-3 Turbo集成90万个核心和44GB SRAM片上缓存,其FP16稀疏AI算力、内存带宽、片上互联带宽、I/O带宽均实现翻倍。CS-4系统在OpenAI GPT-OSS模型上拥有4465 Token/s的词元交付速度,是GPU方案的30倍,较CS-3提升93%。对于超高参数模型,CS-4的2μs低延迟晶圆间互连能在10T规模上实现超1000 Token/s的词元输出。

03

行业动态

Industry
5
04

论文研究

Research
5

DeepSeek Harness安全评估:间接提示注入抵抗性研究

官方一手X·KOLX:arXiv: DeepSeek (@Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo)原文 ↗

研究使用AI-Infra-Guard工具对DeepSeek Harness进行间接提示注入安全评估。实验覆盖16个间接内容通道、35个负载目标和12种攻击方法,共执行14,560次受控测试。评估采用RuleJudge和LLMJudge两种判断方法,发现文本模式下假完成攻击成功率最高达17.0%,文件模式下隐藏Unicode攻击成功率高达25.5%。研究分析了DSH工具结果处理机制,确定了应在不受信任内容和敏感操作间设置的控制措施。

Bounded-State Restoration: 解耦本地恢复与外部状态

官方一手X·KOLX:arXiv: DeepSeek (@Zixuan Li)原文 ↗

论文提出Bounded-State Restoration(BSR)方法,分离完整发现与本地驻留。在DeepSeek-V4-Flash模型测试中,外部状态达31.277 GiB/rank时,L1 RWS仅保持500.75 MiB/rank,实现63.959倍的外部到实时暂存比例。BSR通过最多W个块的窗口安装确认状态,在辅助状态有界的情况下,恢复容量为O(W)。SSD优化将512K恢复TTFT从43.1降至17.6秒,不改变RWS大小。

能力中心化图像生成数据设计研究

官方账号X·KOLX:arXiv cs.AI (@Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen)原文 ↗

研究人员提出能力驱动的数据基础设施,构建了440M图像的T2I语料库和120M编辑对。该框架包含三个专门数据引擎,为文本-图像接地、图像间转换和图像-知识关联提供监督。基于此,团队训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench评估中展现广泛视觉覆盖和多功能渲染能力。

低资源语言中的思考:SFT构建、RL修复与准确率盲区

官方一手X·KOLX:arXiv: OpenAI (@Ayoub Kirouane, Christos Petrocheilos)原文 ↗

研究对三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA,3.6-4.0B参数)进行微调,使其在低资源语言中推理。准确率基准显示几乎无变化,基准本身存在噪声(随机种子变动导致分数变化7.7点)。基础模型从不使用希腊语思考(0/1000推理轨迹),而SFT后98%的推理使用问题语言,且四个模型的语法判断均有提升。SFT无法修复自身缺陷,但强化学习可显著改善格式跳过和答案泄漏问题。

结合已知物理的流动匹配能量:PDE场生成、OOD检测与逆问题

官方账号X·KOLX:arXiv cs.LG (@Yixuan Sun, Anirban Samaddar, Sandeep Madireddy)原文 ↗

研究提出了一种基于流动匹配的模型,通过势诱导速度产生显式标量能量,其梯度恰好是转换后的学习评分函数。该方法在PDE场生成任务中实现了能量校正的数据生成,相比传统流动ODE基线,降低了PDE残差和谱距离。论文展示了能量函数可作为分布外(OOD)检测的评分工具,通过结合数据能量和基于物理的能量提高检测准确率。在逆问题应用中,研究将能量与二次观测似然组合形成后验能量,作为推理时明确选择的家族目标。

05

技巧与观点

Tips & Takes
5

StagedWorkspace:知识工作智能体的版本化工作空间

官方账号X·KOLX:arXiv cs.AI (@Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi Lian)原文 ↗

StagedWorkspace是为知识工作智能体设计的版本化工作空间,解决了智能体在处理代码、文档等数字工件时的版本管理问题。在OfficeQA Pro和APEX-Agents基准测试中,双解析/原生访问方式将OfficeQA Pass@1提高了8.3-12.1分,APEX平均评分提高了4.7-9.2分。SW-AGENT在Gemini 3.1 Pro上获得63.9%的OfficeQA分数,在GPT-5.4 Nano上获得42.1的APEX分数,显著高于同模型的已发布分数。

Claude辅助转录后探讨代码行与概念完整性

官方账号官方Simon Willison’s Weblog原文 ↗

使用Claude进行轻量修改后的转录表明,在某些情况下,代码行数可作为AI辅助软件开发效率的参考指标,源自约35分钟的对话节选内容;若代码质量(如经过调试且可维护的生产级代码)维持一致,产出一千行此类代码对生产力提升极具价值;但要达成此效果,需大量工程经验和专业知识,这是资深工程师的核心特质;此外,团队协作仍具必要性——新的制约因素是认知容量,单人难以驾驭百倍于前的代码规模。

170万粉AI博主的Codex工作流:将重复劳动变Skills

X·KOLX:shao__meng (@shao__meng)原文 ↗

拥有170万粉丝的AI创作者@rileybrown公开了其Codex工作流,通过Supadata API一秒获取YouTube视频文字稿,30秒完成整个频道竞品研究。他使用Remotion插件生成动画图形,Excalidraw图表skill将10分钟口述转化为9页图表,并通过AI换脸技术制作缩略图。工作流强调以结果为导向迭代Skills,组合串联不同功能,每周产出4条长视频和5条短视频。

222
今日事件
58
一手报道
52
新模型
79
信源
AITOP · 编辑系统自动生成