CriPO:基于自蒸馏增强评分RL,解决优化信号丢失问题
论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。
论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。
NVIDIA Blackwell Ultra 在预训练 671B 参数的 DeepSeek-V3 模型上达到每 GPU 1648 TFLOPS 的性能。这一数字约为上一代 GPU 性能的 3 倍。该成果通过 Megatron-Core、TorchTitan 和 JAX 等框架的协同设计与持续软件优化实现。Blackwell Ultra 在该基准测试中刷新了世界纪录。
poolsideai 发布了最新开源模型 Laguna S 2.1,总参数量 118B,采用 MoE 架构,每个 token 仅激活 8B 参数。该模型支持 1M token 上下文窗口,并提供思考与免思考两种模式。权重已在 Hugging Face 以 OpenMDW-1.1 许可证开放,可在单台 NVIDIA DGX Spark 上本地运行。Laguna S 2.1 在性能上可与参数量大数倍的模型竞争。
Google发布了Gemini 3.6 Flash、3.5 Flash Lite和3.5 Flash Cyber三款新模型。Gemini 3.6 Flash输出定价从每百万token $9降至$7.5,生成速度达304 tokens/s(前代165 tokens/s),在Artificial Analysis Index上平均少用17%输出token。OSWorld-Verified计算机使用能力从78.4%提升至83%,知识工作基准GDPval-AA得分从1349升至1421。3.5 Flash Lite定价$0.30/$2.50适合高吞吐场景,3.5 Flash Cyber专注网络安全。Gemini 3.5 Pro仍延迟发布,仅对部分合作伙伴开放。
腾讯混元推出 Hyra-1.0,一个专为性能导向研究与工程任务打造的智能体,具备递归自我改进能力。它能在真实 AI 研发流水线、自然科学及工业场景中学习进化。在 2D 图像转 3D 模型任务中,Hyra 通过多轮探索修改代码和参数,使用 VLM judge 评估轮廓、比例等维度,生成结果比 Claude Code goal 模式更接近参考图像且更符合审美。
OpenAI 推出新功能,Codex Code Review 现在支持在 AGENTS.md 文件中定义自定义仓库规则。用户可以将审查者反复提到的常见问题写为简洁规则,让 Codex 捕获仓库特定问题,即使相关上下文被隔离。该功能提升了代码审查的准确性和针对性。
LangChain 发布了一个 tracing 插件,能将每个 @cursor_ai 代理会话转换为 LangSmith 中的结构化 trace,包含模型运行、每个工具调用以及嵌套子代理工作。附件会被恢复并内联渲染。这是系列视频的第三个,之前有 Claude Code 和 Codex 的 trace,三者使用相同 schema,可在一个地方对比。
Weaviate 新增 per-query profiling 功能,通过一个 opt-in 标志即可在单次查询中获取各阶段耗时,如 vector_search_took、filters_build_allow_list_took 等。例如一个示例 profile 显示 48.2ms 总耗时中 36.8ms 用于读取对象,8.4ms 在向量搜索,2.1ms 构建过滤允许列表,说明瓶颈在存储而非 HNSW 参数。该功能无需重启或等待慢查询重现,自动聚合多分片多节点数据,返回 cluster-wide 视图。
Marcel Rød 发布了 Gigatoken,自称是世界上最快的 tokenizer 实现。该实现比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快约 100 倍,而这些基线已经是多线程 Rust 实现。Gigatoken 适用于大多数 tokenizer 定义和机器。Marcel 也是斯坦福 CS 336 课程(从头实现 LLM)的合著者。
OpenAI Devs 宣布侧边聊天和子代理的改进:活跃状态现在显示更快,排队后续消息可以自动转为侧边聊天,无需手动复制粘贴。这项更新让多任务跟踪更流畅。用户反馈中已有 8 个点赞和 706 次查看。
来自@trychroma创始人Jeff Huber提出的12条原则,核心是“拥有上下文,租用智能”。旧公司围绕人类执行力设计,新公司围绕人类品味与判断力设计。他建议任何新任务先尝试教会Agent做,教不会再招人,并制定评分卡来检验Agent产出。公司应存储Agent执行轨迹用于改进,将人的角色从执行者变为知识源。
姚金刚与好友拔刀刘开源了国内8个AI平台(豆包、DeepSeek、元宝、千问、Kimi、文心、百度AI等)的搜索数据集,包含620个标准问题、214,119条AI引用观察,去重后保留189,845条。数据覆盖6个研究维度、31种问题类型,引用来源归并为9,878个规范域名、107,659个规范页面。初步分析显示,Top10信源贡献了41.47%的去重引用,抖音、腾讯网、今日头条、百度百科排前四;平台与社区类信源仅占4.68%域名却获29.63%引用。跨平台Jaccard相似度最高仅34.94%,表明各平台引用偏好差异显著。
Dean W. Ball 评价 Kimi 模型性能与 2026 年 Q1 最佳公开模型相当,且 token 消耗大、运行成本不低。他惊讶于中国允许开源如此强的模型,认为中国 75% 因战略短视、25% 因算力受限和出口导向。他指出开源模型本质上减速主义,可能导向 AI 共产主义这一国家提供的数字公共基础设施。作者警告这种未来是反乌托邦的,并质疑加速主义者为何支持开源。
TurboVec基于TurboQuant的4-bit标量量化,在DBpedia OpenAI嵌入基准(d=1536, 100K-999K向量)上,Recall@5比同内存的FAISS PQ高8.5-8.9个百分点。对比HNSW(R@5=0.991)和IVF-PQ(R@5=0.840),TurboQuant无需训练即达更高召回。在Snowpark Container Services上,100K向量中位数延迟11ms,而暴力扫描为707ms。内核级过滤在10-1000租户下Recall@10为0.86-0.93,远高于后过滤的0.09-0.19。量化设计使成员推断准确率降至随机水平(50.0%),而PQ为57.3%。
论文揭示Megatron-Core中MLA吸收模式被禁止训练的原因:在DeepSeek-V3规模(n_h=128, seq=16384, SP=8)下,其激活内存比显式形式膨胀20-34%,最高达9.2 GB(eager kernel)或19.2 GB(fused kernel)。该限制在A100上交叉验证,原因在于中间变量维度为n_h×d_kv而非每头K/V。论文提出LAGA方法,在8x Ascend 910B上保持吸收模式的潜变量通信,但本地重建每头K/V:通信削减1.98倍,内存仅增加0.5%,SP=1时位精确,SP=2-8时误差≤1e-3,注意力块吞吐提升1.04-1.06x(单节点)和1.07-1.24x(跨节点)。
论文识别出多跳RAG系统的新攻击面——显著性诱导,通过调整检索事实的位置、强调和语义框架来误导推理,即使所有事实真实且无指令注入。定义六类显著性编辑操作符,在SalientWiki-MH基准上对GPT、Claude、Gemini、DeepSeek、Qwen五个模型族和ReAct、Reflexion、tool-calling三种架构评估,30%编辑预算下攻击成功率83.3%。最强基线防御后ASR仍达75.7%;提出的Salience Normalization防御将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。
MADA-RL是一个针对参数≤4B紧凑模型的后训练框架,通过LoRA微调少量参数,将模型分为生成器和评论家角色。其核心是反事实评论家优势:动态基线使评论家优化方向为改进生成器共识而非简单复现正确答案。在五个数学推理基准上,DeepSeek-R1-Distill-Qwen-1.5B模型准确率从39.9%提升至41.9%(+2.0点,p<0.001),可训练参数仅为全微调基线的1/16。该方法接近但未超越使用更大数据集的DeepScaleR和STILL-3,分析表明训练后的评论家更擅长纠正生成器错误。
MIT研究人员提出一种新算法,能在指数级更少的采样步骤内达到与标准扩散模型相同的精度。该算法可大幅提升图像生成等扩散AI系统的效率。相关论文在ICML 2023荣获杰出论文奖(Outstanding Paper)。
Anthropic工程师Andrej Karpathy指出当前AI领域最大错误是强迫智能体工作而不先理解底层模型。他回忆2016年在OpenAI犯过同样错误,因此浪费了5年时间。Karpathy强调演示容易但产品化需十年,自动驾驶已验证这一点。他认为智能体不是产品,模型基础才是,打好基础后智能体会自然涌现。
Andrej Karpathy在推文中分享了一个多模态提示技巧:当用户懒得打字时,可切换至语音输入并进行约10分钟的意识流独白。他观察到LLM能从杂乱语音中重建思路,并以更清晰的形式回应用户的混乱思考。这种方法能提升与模型的理解对齐,减少后续需要修正的内容。Karpathy还建议在开头声明“切换到语音识别,抱歉有错字”以明确模式。
本文介绍NVIDIA srt-slurm框架,使用srtctl将YAML声明式配置转换为可重复的SLURM基准工作流。在Google Colab中配置集群并运行内置与自定义配方。通过参数扫描和Pareto分析,建模分离预填充(prefill)和解码(decode)部署的性能权衡。
Claude Code产品负责人Cat Wu和工程师Thariq Shihipar在AI Engineer World's Fair访谈中透露,针对Fable 5和Opus 4.8等前沿模型,系统提示词被削减了80%。核心经验包括:删除few-shot示例反而提升效果,因为模型比示例更具创造力;减少“不要做X”的禁令,增加上下文;每条指令需确保100%成立,否则让模型自行判断。Cat Wu指出,提示词应像被善意的人误读那样软化措辞,而Simon Willison补充,这套方法仅适用于Opus/Fable级别模型,小模型如Haiku仍需详细提示词。
Pi-Agent教程共10章,逐章解析Agent Loop、工具系统、消息系统、事件驱动、会话管理和上下文工程。每章从概念定义、源码实现、设计意图三层展开。提供三种阅读方式:Web在线版(带三栏配图)、本地Markdown和PDF离线版。