#LLM评估
AWS 分享了在 Bedrock 上做 LLM 质量评估的五个具体技术,跨账号故障切换和流式评估都能直接抄进自己项目,数值准确率能到 99%。
LangChain 把 Jev-as-a-judge 接进了 LangSmith,生产 trace 全量打分、不用抽样、成本不涨,做 LLM 评估的可以上手。
这篇论文给科学问题生成系统立了个可证伪的考试:用未来文献打分。证据结构优先的生成器比纯 LLM 提示更靠谱,还发现 LLM 评委互相打分虚高,值得做科研工具的人看看。
想学 LLM 评估的别错过,Dor Cohen 会讲 monday.com 怎么用 LangSmith 同时跑线上和离线评测,10 月 13 日伦敦见。
这篇论文梳理了LLM评估与安全之间测量问题的八大证据流,还审计了10个模型,发现很多看似安全差距其实来自信息披露。搞模型安全的人值得看看怎么避免被表面指标骗到。
Qdrant CTO分享了未来架构怎么省掉云端来回;Panel聊了Agent不跑检索的坑,还有用同个模型判自己作业的槽点,做AI的都该看看。
BINEVAL把LLM评估拆成一堆“是/否”问题,结果好理解、易调试,在事实一致性上比UniEval还准,还能自己优化提示词。
做计算化学或药物设计的团队终于有了评估LLM超分子推理能力的标准测试——SupraBench覆盖了结合亲和力预测等关键任务,想验证LLM在化学领域实用性的研究者可以直接用。
做LLM评估和科学推理研究的团队终于有了一个能独立控制提取与推理难度的基准,可以精准诊断模型短板。想了解自家模型在科学推理上到底弱在哪,建议直接看这篇。
做LLM评估的团队终于有了一个公平且高效的基准测试方案——只需微调极少量参数就能剥离格式干扰,直接测出模型真实知识水平。做预训练或模型选型的开发者值得一试,能省下大量后训练成本。
做科学创新评估或使用 LLM 辅助审稿的团队,这篇论文揭示了 LLM 裁判的盲区——它可能高估新颖性,导致误判。建议点开了解 RQ-Bench 的测试方法,避免在关键评估中踩坑。
做奖励模型或 LLM 评估的团队终于有了一个轻量级替代方案——不用每次生成评分标准,而是合成可复用的评估技能,效果还比传统方法好很多,值得在 RewardBench 上跑一下自己的模型。
形式化验证团队终于有了LLM能力的基准数据——当前模型无法可靠生成TLA+规范,但渐进式提示和推理对齐是突破口,做形式化方法或分布式系统验证的开发者值得关注。
做LLM评估或模型对齐的团队会关心:这篇论文给出了在有限标注预算下选择校准策略的实用指南,建议直接参考其机制图来优化你的法官面板配置。
这篇论文戳破了 LLM 排行榜的统计幻觉——很多排名差异其实不显著,做模型评估的团队和关注排行榜的开发者看完会重新审视自己的比较方法。建议点开,避免被虚假的排名差异误导。
这个基准测试戳中了AI科研助手的关键短板——无法判断研究想法的可行性,做自动化科研或依赖LLM审稿的团队值得关注,看完会重新评估AI在科研流程中的角色。
这项研究戳穿了搜索智能体的真实能力——它们可能只是在验证已知信息而非真正搜索。做搜索Agent或评估AI检索能力的团队,值得看看LiveBrowseComp这个新基准,避免被静态测试误导。
这个基准直击LLM科学推理的软肋——从数据中归纳规律而非回忆知识,做AI评估或科学模拟的团队值得关注,它暴露了当前模型在长程推理和实验设计上的真实短板。