想看看3B小模型怎么打平千亿级大模型?VibeThinker-3B用AIME 94.3分、LiveCodeBench 80.2%的成绩告诉你,小模型也能杀进顶级推理梯队。
小模型逆袭,推理新突破与安全攻防战
2026年6月16日,AI领域小模型与推理优化成为焦点。VibeThinker-3B以3B参数在AIME26上达94.3分,逼近旗舰模型;DFlash+Spec V2推测解码将LLM吞吐量提升4.3倍。ASSAY框架分离技能生成与筛选,显著提升智能体任务完成率。安全方面,RING攻击利用差分隐私隐藏恶意更新,攻破联邦学习防御;KVEraser实现高效局部上下文擦除。理论研究发现质量-效用悖论:小模型用自身生成数据训练效果优于Oracle精炼。
模型发布/更新
5 篇LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!
阿里云一口气发了三个机器人基础模型:导航、操作、世界模型,每个都能单独用,还能组合。Qwen-RobotManip在3.8万小时数据上预训练,挺实在的。
产品发布/更新
5 篇vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。
Vercel 开源了这套实现,让 Claude Code 等代理在沙箱里改代码时直接给你展示步骤、Diff 和测试结果,不用只看 Markdown 了。
腾讯云给AI agent加了时间倒流,Cube Sandbox现在能快照、克隆、回滚,100毫秒回滚到出事前,还能秒级克隆一堆独立沙盒,自己就能部署。
行业动态
5 篇Google Cloud搞了个OKF,用Markdown加YAML给AI Agent喂知识,比RAG更结构化。有代码和工具可直接上手。
论文研究
5 篇这篇论文讲了对Anthropic等用的越狱检测防御框架的投毒攻击方法,投毒率才1%就能让检测器几乎失效,搞安全的一定要看。
这篇论文提出了 EPS 方法,能更高效准确地求解线性逆问题,在多个基准上表现优异,且计算开销低。
技巧与观点
5 篇Addy Osmani 用四份硬数据和实战框架告诉你,AI 生成代码后怎么审才靠谱——不是跑一个工具,而是跑几个不同性格的,人只做最终裁决。
有个开发者自己写了一套代码,把M4芯片的AI训练能力全开出来了,不用苹果官方工具,跑到了15.8TFLOPS。想用iPad或Mac训练模型的人可以看看。