论文Agent 与开发者20:141,042 题哥伦比亚法律基准:LLM 引用法条近半数有错哥伦比亚法律考了 15 个模型,Gemini 3.1 Pro 选择题 0.905 但写答案正确率不到 0.45,引用的法条一半是编的,做法律 AI 的都该看看。#Gemini#法律AI#基准测试#LLM评测aarXiv cs.AI@Rubén Manrique 等 6 人原文稍后读已读值得跟进有用关注 Gemini
论文Agent 与开发者10:08研究检验模型拒绝候选理由是否真能影响其选择模型说你没导演所以不选你,把导演资料塞回去它真会改主意吗?这篇把六个开源模型测了个遍,答案是……内容只占一部分。#2WikiMultihopQA#开源模型#LLM评测#可解释性aarXiv cs.LG@Archit Rastogi原文稍后读已读值得跟进有用关注 2WikiMultihopQA
论文10:18optstop:用贝叶斯最优停止为LLM评测省算力跑大模型评测总烧钱?这个框架能省下最多97%的采样次数,结论还一样,做评测的人值得看看。#optstop#贝叶斯推断#LLM评测#采样优化aarXiv cs.AI@Toby D. Pilditch原文稍后读已读值得跟进有用关注 optstop