CXL与稀疏注意力:AI推理效率革命
2026年6月19日,AI领域迎来推理效率、模型透明度与新范式的多重突破。CXL加速稀疏注意力系统SAC实现2.1倍吞吐量提升与9.7倍TTFT降低,结合亚毫秒级执行状态恢复和开源模型成本降低近6倍,大幅优化推理性能。模型透明度与安全性方面,DiffusionGemma通过可解释瓶颈将不透明性降至Gemma 4的1.1倍,CWE-Trace揭示微调LLM在漏洞检测中仅达52.1%准确率,Contagion Networks量化评估偏差传播系数0.157-0.352。新模型与新范式涌现:Laguna M.1以225B MoE专攻智能体编码,Lie-Algebra Attention将token定义为矩阵群元素,UNIEGO通过多教师蒸馏统一自我中心视频表示。
模型发布/更新
4 篇poolside刚发的225B MoE模型Laguna M.1,专为智能体编码设计,SGLang直接跑起来了,在SWE-bench上很强。
OpenAI 的 o3 Deep Research 模型帮医生翻出了 376 个陈年疑难病例,找出了 18 种之前漏诊的病。有个女孩从 9 岁查到 28 岁,终于有了答案。这 AI 真的能救命。
产品发布/更新
4 篇Perplexity给自家Agent装了个能记住工作过程、夜里自学的大脑,据说测试下来又快又准还省钱。
OpenAI Codex 这次不用你写指令了,Mac 上演示一遍操作就能生成可复用的 Skill,下次改改参数自动跑,报销填单之类的好用了。
AWS又出新东西了,AgentCore harness让你只用两个API,几秒就能跑起一个能读文件、写代码、浏览网页、换模型的智能体,还自带追踪和托管环境,省心得很。
Claude Code 能把终端里的调试记录、PR 走查一键变成网页发给队友,不用再口述解释 agent 做了什么,适合团队协作。
行业动态
4 篇DecagonAI 把语音成本砍到原来的1/6,延迟还压到400ms以下,实时语音项目可以参考他们迁移开源模型的做法。
想知道为什么买更多 GPU 不灵了?Anthropic 是怎么靠文化和准备搞定编码的?AMP 创始人讲得特别透,全是内行视角的干货。
AT&T、Meta这些大公司发现AI账单太贵了,开始限制员工用量,Uber四个月就花完一年预算,连工程师一个人每月就要烧掉2000美元,该省省了。
论文研究
4 篇技巧与观点
3 篇手把手教你用Salesforce CodeGen写Python函数,还能自动验证和重排序,适合想提升代码生成质量的开发者。
AWS 教你用 CloudWatch 盯着 SageMaker 上的生成式 AI 推理,有详细指标和仪表盘,调性能抓问题都好使。