全部 AI 动态 · AI 热点

6月19日

09:53

09:53

arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi

论文使用Qwen2.5-7B-Instruct对比了零样本、仅SFT、仅RAG和SFT+RAG混合四种方法在安大略住宅租赁法条文引用上的效果。混合方法以0.481精确匹配（节+条）取得最高分，且将幻觉降至零。SFT提升了高召回候选集中条款选择的鲁棒性，而仅用bge-small嵌入就超越了更大专用检索模型。扩大训练集未带来提升，0.70目标尚未达到。

论文 Qwen2.5-7B RAG SFT 零幻觉法律引用

推荐理由：这篇论文用Qwen2.5-7B做了个四路对比，发现微调加检索混合方案在法条引用上精确匹配0.481还零幻觉，比纯微调或纯检索都强，而且用轻量bge-small就够用。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

11:55

11:55

arXiv: DeepSeek@Zaifu Zhan, Shuang Zhou, Rui Zhang

提出一种多智能体互审推理方法，让多个LLM独立生成链式推理与候选答案，再互相评审事实正确性与逻辑合理性，选择最高分推理链输出最终答案。在Llama-3.1-8B、Qwen2.5-7B、Phi-4、DeepSeek-LLM-7B、GPT-oss-20B五个模型上对HeadQA、MedQA-USMLE、PubMedQA三个基准测试，平均准确率达0.820，超过单模型最佳0.777和多数投票集成最高0.789。评审可靠性高，能有效区分优质与低质推理链。

论文 Llama-3.1-8B Qwen2.5-7B Phi-4 DeepSeek-LLM-7B 多智能体推理模型

推荐理由：这篇论文让多个AI模型互相评审对方的思考过程，医学问答准确率比单模型高5个百分点，比投票集成也高3个百分点，有意思。

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？