09:53arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi论文使用Qwen2.5-7B-Instruct对比了零样本、仅SFT、仅RAG和SFT+RAG混合四种方法在安大略住宅租赁法条文引用上的效果。混合方法以0.481精确匹配(节+条)取得最高分,且将幻觉降至零。SFT提升了高召回候选集中条款选择的鲁棒性,而仅用bge-small嵌入就超越了更大专用检索模型。扩大训练集未带来提升,0.70目标尚未达到。论文Qwen2.5-7BRAGSFT零幻觉法律引用推荐理由:这篇论文用Qwen2.5-7B做了个四路对比,发现微调加检索混合方案在法条引用上精确匹配0.481还零幻觉,比纯微调或纯检索都强,而且用轻量bge-small就够用。原文
11:55arXiv: DeepSeek@Zaifu Zhan, Shuang Zhou, Rui Zhang提出一种多智能体互审推理方法,让多个LLM独立生成链式推理与候选答案,再互相评审事实正确性与逻辑合理性,选择最高分推理链输出最终答案。在Llama-3.1-8B、Qwen2.5-7B、Phi-4、DeepSeek-LLM-7B、GPT-oss-20B五个模型上对HeadQA、MedQA-USMLE、PubMedQA三个基准测试,平均准确率达0.820,超过单模型最佳0.777和多数投票集成最高0.789。评审可靠性高,能有效区分优质与低质推理链。论文Llama-3.1-8BQwen2.5-7BPhi-4DeepSeek-LLM-7B多智能体推理模型推荐理由:这篇论文让多个AI模型互相评审对方的思考过程,医学问答准确率比单模型高5个百分点,比投票集成也高3个百分点,有意思。原文