这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
AI领域新突破,模型与算法创新迭起
2026年7月22日 AI领域再创新高,从高效私有检索到模型推理控制,多领域成果斐然。TurboVec私有检索效率提升,Megatron-Core内存优化,显著性诱导攻击与防御,MADA-RL高效推理,温度缩放误差代理,编码智能体研究,图像感知相似度度量,MIT扩散模型加速,CriPO优化信号丢失,FlashRT多模态应用部署,自动发现系统适应性选择,LLM中谄媚与线索诱导偏差,视觉导航安全边际学习,LLM推理过程细粒度控制,不变和可迁移潜在因子发现,机器人控制高效视觉表示,多模态视频虚假信息检测,NVIDIA Blackwell Ultra性能刷新,Codex Code Review新增自定义仓库规则,AI Native团队构建原则,poolsideai开源大模型Laguna S 2.1,三体散射建模单步生成,LangChain推出Cursor代理会话tracing插件,边缘EEG低延迟分类差分逻辑门网络。
模型发布/更新
5 篇NVIDIA 的 Blackwell Ultra 训练 DeepSeek-V3 671B 比上一代快 3 倍,每 GPU 跑到 1648 TFLOPS,优化太狠了。
poolside 新出的 Laguna S 2.1 开源又高效,118B 模型只激活 8B 就能跑,还支持 1M 上下文,值得一试。
Google新出的3.6 Flash更便宜更快还省token,Agent工作流速度翻倍,编程助手场景很合适,推荐试试。
产品发布/更新
5 篇Codex 代码审查现在能用 AGENTS.md 配置你的仓库专属规则了。把团队常见的检查点写进去,Codex 就能帮你自动抓私有仓库的特有问题。
想对比 Cursor、Claude Code、Codex 的代理行为?LangChain 出了个插件,把它们的 trace 统一到 LangSmith 里,方便你直接看模型和工具调用链。
Marcel Rød 搞了个 Gigatoken,比 HuggingFace 快上千倍,比 tiktoken 快百倍,跑 tokenizer 的抓紧试试。
行业动态
3 篇Dean W. Ball 细评 Kimi:它和 2026 年初最强公开模型打平,还分析了中国为啥愿意放行开源,以及开源模型最终可能走向国家控制的 AI 共产主义,观点很猛。
论文研究
5 篇这篇论文解释了为什么Megatron-Core的MLA吸收模式在训练时会导致内存暴增,还给出了一个叫LAGA的修复方法,通信更省,速度和内存几乎没损失。
技巧与观点
5 篇想搞分布式LLM基准测试?NVIDIA这个srt-slurm框架让你用YAML写配置,一键跑SLURM,还能做参数扫描和Pareto分析,超实用。