全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

12:06

12:06

arXiv: DeepSeek@Mehmet Iscan

针对参数不超过1.5B的冻结小代码模型，研究在无需微调下通过后验验证操作提升程序正确性的效果。在匹配计算量的泄密自由协议下，评估了26种语义后验算子（选择、验证、修复、消除等），均未能在HumanEval+和MBPP+上超越Best-of-N (BoN)的留出准确率。研究发现覆盖墙、能力剪刀差和空共识陷阱是根本原因。唯一带来精度提升的算子M1通过表达层恢复标准提取器丢弃的正确程序，使DeepSeek-Coder-1.3B在HumanEval+上多解+12题（p=2.4e-4），且零伤害。自适应共识早停（ACE）节省约19%计算量且无伤害。

论文 DeepSeek-Coder HumanEval+MBPP+小代码模型后验验证

推荐理由：这篇论文测了26种后验操作，结论是除了M1都没跑过最朴素的BoN。M1靠恢复被遗漏的正确代码，让DeepSeek-Coder-1.3B在HumanEval+上多解对12题，值得搞代码生成的同学看看。

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？