全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

10:13

10:13

arXiv cs.AI@Ali Elahi, Barbara Di Eugenio

现有自然语言处理（NLP）方法中，置信度用于可靠性、监督和下游决策，但尚无方法为多智能体系统的输出生成或评估置信度。本文提出三种协议，通过将原始置信度信号跨模型可比化，再经软投票或贝叶斯融合聚合，输出最终答案及单一聚合置信度。实验表明，聚合置信度的判别能力（AUARC）显著优于最佳单智能体或标准辩论基线，而正确性（F1分数）保持稳定，并恢复了多智能体辩论在模糊任务上的损失。研究分析了序列概率和自报告两种估计器，以及参数与非参数校准器，发现校准可提升F1，而AUARC对校准依赖较小。在五个基准和四种任务类型上，评估了六组同质和异质辩论对，覆盖不同模型能力和规模。

论文多智能体置信度聚合 NLP 贝叶斯融合辩论协议

推荐理由：多智能体系统终于有了统一的置信度评估方法，做NLP系统可靠性或智能体协作的团队可以直接参考协议设计，提升系统可信度。

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？