全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

11:49

11:49

rohanpaul_ai@rohanpaul_ai

一项新研究指出，LLM 作为安全裁判时，对同一答案的翻译或改写版本可能给出不同安全判决。问题在于许多 AI 团队依赖 LLM 判断模型回答是否安全，但安全并非简单的二元问题。论文提出压力测试：将相同答案翻译或改写后展示给裁判，检查判决是否一致。裁判在暴力或极端内容等明显有害场景表现较好，但在金融建议、信用评估等依赖上下文和判断的场景中表现脆弱。不同裁判之间分歧大，高原始一致性可能掩盖低真实可靠性。

论文 LLM 安全裁判模型一致性压力测试 arxiv

推荐理由：做 AI 安全评测的团队会直接受影响——你的安全裁判可能比想象中更不可靠，建议点开看看测试方法。

5月17日

11:51

11:51

elvis@omarsar0

精选

一篇关于工具使用智能体的可解释性论文揭示了模型在认知与行动之间的脱节：模型内部状态显示它知道应该调用工具，但在实际输出中却未能执行。这种不匹配率在26%到54%之间，且完全集中在认知到行动的转换阶段，而非认知本身。研究发现，模型内部的方向是可解码的，但后层最后一个token的表示几乎与产生的行动正交，导致信号丢失。该工作试图预测哪些干预措施有效，哪些无效。对于在工具调用提示上做A/B测试却遇到奇怪上限的开发者，这篇论文可能提供了很好的解释。

论文可解释性工具调用智能体认知-行动脱节 arxiv

推荐理由：做工具调用智能体开发的团队，如果遇到模型明明知道该用工具却就是不调用的怪现象，这篇论文直接点出了后层几何结构的根本原因，值得一读。