VOL.2026.07.22·283 STORIES·AITOP DAILY

AITOP日报

二〇二六年七月二十二日 星期三DAILY · 每早八时
01

模型发布/更新

Model Releases
5

CriPO:基于自蒸馏增强评分RL,解决优化信号丢失问题

官方账号X·KOLX:arXiv cs.AI (@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang)原文 ↗

论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。

poolsideai 发布 Laguna S 2.1:118B MoE 开源模型,8B 激活

官方账号X·KOLX:NVIDIA AI (@NVIDIAAI)原文 ↗

poolsideai 发布了最新开源模型 Laguna S 2.1,总参数量 118B,采用 MoE 架构,每个 token 仅激活 8B 参数。该模型支持 1M token 上下文窗口,并提供思考与免思考两种模式。权重已在 Hugging Face 以 OpenMDW-1.1 许可证开放,可在单台 NVIDIA DGX Spark 上本地运行。Laguna S 2.1 在性能上可与参数量大数倍的模型竞争。

Google发布Gemini 3.6 Flash等三款新模型,更便宜更快更省token

X·KOLX:宝玉 (@dotey)原文 ↗

Google发布了Gemini 3.6 Flash、3.5 Flash Lite和3.5 Flash Cyber三款新模型。Gemini 3.6 Flash输出定价从每百万token $9降至$7.5,生成速度达304 tokens/s(前代165 tokens/s),在Artificial Analysis Index上平均少用17%输出token。OSWorld-Verified计算机使用能力从78.4%提升至83%,知识工作基准GDPval-AA得分从1349升至1421。3.5 Flash Lite定价$0.30/$2.50适合高吞吐场景,3.5 Flash Cyber专注网络安全。Gemini 3.5 Pro仍延迟发布,仅对部分合作伙伴开放。

腾讯混元发布科学发现智能体 Hyra,能够递归自我改进

官方IT之家原文 ↗

腾讯混元推出 Hyra-1.0,一个专为性能导向研究与工程任务打造的智能体,具备递归自我改进能力。它能在真实 AI 研发流水线、自然科学及工业场景中学习进化。在 2D 图像转 3D 模型任务中,Hyra 通过多轮探索修改代码和参数,使用 VLM judge 评估轮廓、比例等维度,生成结果比 Claude Code goal 模式更接近参考图像且更符合审美。

02

产品发布/更新

Product
5

LangChain 推出 Cursor 代理会话 tracing 插件,支持 LangSmith 结构化追踪

官方账号X·KOLX:LangChain (@LangChainAI)原文 ↗

LangChain 发布了一个 tracing 插件,能将每个 @cursor_ai 代理会话转换为 LangSmith 中的结构化 trace,包含模型运行、每个工具调用以及嵌套子代理工作。附件会被恢复并内联渲染。这是系列视频的第三个,之前有 Claude Code 和 Codex 的 trace,三者使用相同 schema,可在一个地方对比。

Weaviate 推出 per-query profiling 精准定位查询瓶颈

X·KOLX:Weaviate (@weaviate_io)原文 ↗

Weaviate 新增 per-query profiling 功能,通过一个 opt-in 标志即可在单次查询中获取各阶段耗时,如 vector_search_took、filters_build_allow_list_took 等。例如一个示例 profile 显示 48.2ms 总耗时中 36.8ms 用于读取对象,8.4ms 在向量搜索,2.1ms 构建过滤允许列表,说明瓶颈在存储而非 HNSW 参数。该功能无需重启或等待慢查询重现,自动聚合多分片多节点数据,返回 cluster-wide 视图。

03

行业动态

Industry
3

姚金刚开源国内8大AI平台搜索数据集,含620个问题21万引用

X·KOLX:Yangyi (@Yangyixxxx)原文 ↗

姚金刚与好友拔刀刘开源了国内8个AI平台(豆包、DeepSeek、元宝、千问、Kimi、文心、百度AI等)的搜索数据集,包含620个标准问题、214,119条AI引用观察,去重后保留189,845条。数据覆盖6个研究维度、31种问题类型,引用来源归并为9,878个规范域名、107,659个规范页面。初步分析显示,Top10信源贡献了41.47%的去重引用,抖音、腾讯网、今日头条、百度百科排前四;平台与社区类信源仅占4.68%域名却获29.63%引用。跨平台Jaccard相似度最高仅34.94%,表明各平台引用偏好差异显著。

Kimi模型性能出色,开源策略引发争议

X·KOLX:AI Will (@FinanceYF5)原文 ↗

Dean W. Ball 评价 Kimi 模型性能与 2026 年 Q1 最佳公开模型相当,且 token 消耗大、运行成本不低。他惊讶于中国允许开源如此强的模型,认为中国 75% 因战略短视、25% 因算力受限和出口导向。他指出开源模型本质上减速主义,可能导向 AI 共产主义这一国家提供的数字公共基础设施。作者警告这种未来是反乌托邦的,并质疑加速主义者为何支持开源。

04

论文研究

Research
5

TurboVec:基于Codebook-Oblivious量化的企业RAG高效私有检索

官方一手X·KOLX:arXiv: OpenAI (@Navnit Shukla, Kamal Pandey, Omsankar Tiwari)原文 ↗

TurboVec基于TurboQuant的4-bit标量量化,在DBpedia OpenAI嵌入基准(d=1536, 100K-999K向量)上,Recall@5比同内存的FAISS PQ高8.5-8.9个百分点。对比HNSW(R@5=0.991)和IVF-PQ(R@5=0.840),TurboQuant无需训练即达更高召回。在Snowpark Container Services上,100K向量中位数延迟11ms,而暴力扫描为707ms。内核级过滤在10-1000租户下Recall@10为0.86-0.93,远高于后过滤的0.09-0.19。量化设计使成员推断准确率降至随机水平(50.0%),而PQ为57.3%。

训练内存回归:Megatron-Core禁止MLA吸收模式的原因及LAGA修复

官方一手X·KOLX:arXiv: DeepSeek (@Changzheng Ma)原文 ↗

论文揭示Megatron-Core中MLA吸收模式被禁止训练的原因:在DeepSeek-V3规模(n_h=128, seq=16384, SP=8)下,其激活内存比显式形式膨胀20-34%,最高达9.2 GB(eager kernel)或19.2 GB(fused kernel)。该限制在A100上交叉验证,原因在于中间变量维度为n_h×d_kv而非每头K/V。论文提出LAGA方法,在8x Ascend 910B上保持吸收模式的潜变量通信,但本地重建每头K/V:通信削减1.98倍,内存仅增加0.5%,SP=1时位精确,SP=2-8时误差≤1e-3,注意力块吞吐提升1.04-1.06x(单节点)和1.07-1.24x(跨节点)。

针对多跳RAG智能体的显著性诱导:威胁与防御

官方一手X·KOLX:arXiv: DeepSeek (@Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou)原文 ↗

论文识别出多跳RAG系统的新攻击面——显著性诱导,通过调整检索事实的位置、强调和语义框架来误导推理,即使所有事实真实且无指令注入。定义六类显著性编辑操作符,在SalientWiki-MH基准上对GPT、Claude、Gemini、DeepSeek、Qwen五个模型族和ReAct、Reflexion、tool-calling三种架构评估,30%编辑预算下攻击成功率83.3%。最强基线防御后ASR仍达75.7%;提出的Salience Normalization防御将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。

MADA-RL: 面向紧凑模型高效推理的多智能体辩论强化学习

官方一手X·KOLX:arXiv: DeepSeek (@Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma)原文 ↗

MADA-RL是一个针对参数≤4B紧凑模型的后训练框架,通过LoRA微调少量参数,将模型分为生成器和评论家角色。其核心是反事实评论家优势:动态基线使评论家优化方向为改进生成器共识而非简单复现正确答案。在五个数学推理基准上,DeepSeek-R1-Distill-Qwen-1.5B模型准确率从39.9%提升至41.9%(+2.0点,p<0.001),可训练参数仅为全微调基线的1/16。该方法接近但未超越使用更大数据集的DeepScaleR和STILL-3,分析表明训练后的评论家更擅长纠正生成器错误。

05

技巧与观点

Tips & Takes
5

Karpathy分享语音输入技巧:10分钟意识流让LLM更懂你

X·KOLX:elvis (@omarsar0)原文 ↗

Andrej Karpathy在推文中分享了一个多模态提示技巧:当用户懒得打字时,可切换至语音输入并进行约10分钟的意识流独白。他观察到LLM能从杂乱语音中重建思路,并以更清晰的形式回应用户的混乱思考。这种方法能提升与模型的理解对齐,减少后续需要修正的内容。Karpathy还建议在开头声明“切换到语音识别,抱歉有错字”以明确模式。

Claude Code系统提示词削减80%的背后方法

X·KOLX:shao__meng (@shao__meng)原文 ↗

Claude Code产品负责人Cat Wu和工程师Thariq Shihipar在AI Engineer World's Fair访谈中透露,针对Fable 5和Opus 4.8等前沿模型,系统提示词被削减了80%。核心经验包括:删除few-shot示例反而提升效果,因为模型比示例更具创造力;减少“不要做X”的禁令,增加上下文;每条指令需确保100%成立,否则让模型自行判断。Cat Wu指出,提示词应像被善意的人误读那样软化措辞,而Simon Willison补充,这套方法仅适用于Opus/Fable级别模型,小模型如Haiku仍需详细提示词。

283
今日事件
62
一手报道
88
新模型
92
信源
AITOP · 编辑系统自动生成