02:15官方账号LangChain@LangChainAI精选LangChain 探索让代理评估自动化,借助仓库上下文和生成轨迹构建评估系统。该方案支持在可重复的环境里测试这些评估。整个过程还能让开发者持续了解情况。技巧LangChain智能体提示词工程推荐理由:LangChain 发了这活动,教大家用仓库和轨迹做代理评估,比传统方法更高效,想学自动化评估的去参加。原文稍后读已读值得跟进有用关注 LangChain
12:04官方账号arXiv cs.AI@Noam Koren, Roy Bar-Haim, Abigail Goldsteen该研究提出一种无参考评估框架,利用LLM评判员从一致性、复杂度和策略覆盖三个维度检查对话代理基准质量。框架与独立人工标注结果吻合,并在不同能力LLM生成的基准及受控降质扰动的基准上验证了区分效果。实验表明该指标能稳定区分基准质量等级,且适用于手工精选基准。论文基准评估对话代理LLM评判推荐理由:这篇论文教你如何判断一个评测集靠不靠谱,用LLM当裁判自动挑毛病,省人工还靠谱。原文稍后读已读值得跟进有用关注 基准评估
11:25官方账号arXiv cs.LG@Bertil Braun, Martin Forell这篇论文提出用多个LLM对输出做两两比较、再用Elo评分生成排名的评估框架。通过可调的同意阈值,从全票一致到多数投票,控制评估置信度与覆盖率。作者在科学摘要生成的胜任力画像上做了验证,自动排名与专家判断相关性良好。相比人工评估显著减少干预成本,且不依赖参考标准。论文编号为arXiv:2607.28282v1。论文LLM评估Elo评分自动化评估推荐理由:多模型两两PK加Elo计分来评LLM输出,能调阈值控严格度,科学摘要上跟专家判断挺接近。原文稍后读已读值得跟进有用关注 LLM评估
22:51Philipp Schmid@_philschmid精选Phil Schmid在aiDotEngineer世博会上分享了为何依赖直觉检查智能体技能会导致生产故障,并提出了自动化评估方案。他建议添加负面测试用例以防止无关提示的关键词劫持。技能文件超过500行会降低模型推理质量,应保持精简。使用毫秒级正则断言在10-20个生产提示上验证结果。通过消融测试比较有/无技能时的表现,判断何时可退役技能。技巧智能体自动化评估测试推荐理由:别再靠感觉测智能体了,Phil Schmid告诉你用负面用例、500行限制和毫秒级正则来搞自动化评估,实用干货。原文稍后读已读值得跟进有用关注 智能体
10:50官方账号arXiv cs.AI@Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, Felix Henninger, Stefan Rose, Sarah Ball, Bolei Ma, Frauke Kreuter, Markus Weinmann, Stefan Feuerriegel社会科学和行为科学中的可重复性评估通常依赖独立研究人员重新分析原始数据,成本高且难以规模化。本研究使用 76 篇已发表研究,让 LLM 自动生成分析并与原始结果及人工再分析对比。结果显示,LLM 在 41% 的研究中恢复了原始效应量(Cohen's d 容忍度 ±0.05),而人工再分析仅为 34%;在定性结论一致性上,LLM 达到 96%,人工为 74%。这表明 LLM 可作为可扩展的自动化可重复性评估工具,为系统审计实证结果奠定基础。论文LLM可重复性社会科学推荐理由:社会科学研究者终于有了低成本的重复性验证工具——LLM 比人工更高效且更一致,做元分析或期刊审稿的团队可以直接用这套方法。原文稍后读已读值得跟进有用关注 LLM
10:07官方一手arXiv: OpenAI@Yashwardhan Chaudhuri, Sanyam Jain, Paridhi Mundra精选E3是一个自动化的论文评审助手,旨在帮助审稿人和工程团队识别论文中的技术问题。它能够报告问题的性质、位置、对贡献的影响以及解决所需的证据,涵盖未支持的声明、缺失的消融实验、弱基线、隐藏假设、有效性威胁和数据泄露风险。为了无污染地评估E3,研究采用了issue级回测协议:只使用训练截止日期后的论文,并由一个观察匿名评审的元法官标记每个问题来源对为“捕获”、“部分”或“遗漏”。在100篇ICLR 2026论文和4598个问题行的测试中,E3在所有聚合指标上实现了最高召回率,部分包含召回率达90.2%,比GPT高15.5个百分点,比Claude高17.1个百分点,比人类评审高29.2个百分点。E3还恢复了人类评审提出的89.6%的问题,并额外发现了1635个被人类遗漏的问题。论文论文评审自动化评估回测协议推荐理由:E3解决了论文评审中遗漏关键技术问题的痛点,做学术评审或论文质量控制的团队可以直接用这套开源工具提升效率,建议点开看看具体实现。原文稍后读已读值得跟进有用关注 论文评审