8月25日
03:06
8月21日
10:59
10:59官方账号arXiv cs.LG@Julian Oelhaf, Georg Kordowich, Paula Andrea Pérez-Toro, Christian Bergler, Johann Jäger, Andreas Maier, Siming Bayer
本文提出一个标准化框架,将评估设计视为科学贡献的一部分,定义了七个研究维度。在PROTECT-90电磁瞬变基准测试中,多层感知器(MLP)在分类任务上达到0.991的F1分数,定位误差为10.20%。框架将评估假设转化为可重复的证据,为更可比、可审计的评估和未来认证评估提供基础。
推荐理由:这篇论文提出了一个评估电力系统保护机器学习的标准化框架,对于想要了解如何更准确评估此类模型的人来说是个好资源。
8月14日
02:16
02:16Harrison Chase@hwchase17
精选
LangChain创始人Harrison Chase在红杉活动上提出智能体由框架、模型和上下文三部分组成。他认为若使用场景偏离模型训练分布,越应自建框架。他验证了LangSmith Engine的评估功能,并展示了如何通过追踪、数据飞轮优化性能。视频中还讨论了为何可观测性常被低估。

推荐理由:红杉活动上,LangChain创始人聊了智能体三件套:框架、模型、上下文。他说越偏离模型训练数据,越该自己造框架。还演示了LangSmith Engine怎么做评估。
8月11日
22:10
22:10官方账号LangChain@LangChainAI
LangChain 宣布举办一场关于语音智能体评估的网络研讨会。研讨会将涵盖执行、结果和体验三个维度,包括工具使用、任务完成、延迟、中断和对话摩擦等评估指标。活动详情可在 events.langchain.com 查看。

推荐理由:做语音智能体的朋友可以看看,LangChain 这场会讲怎么从执行、结果到体验全面评估,比单看任务完成率更实用。
7月29日
00:43
00:43官方账号Fei-Fei Li@drfeifei
精选
李飞飞指出,Sim-to-real对齐仿真能在虚拟和物理世界中复现相同的失败行为和结果。仿真不仅记录任务设置或最终成功标签,还再现了导致策略成功或失败的条件。该方法实现了更快的迭代速度、更广的测试覆盖和显著更低的成本。
推荐理由:李飞飞团队用仿真模拟真实失败场景,省掉大量真实测试,迭代快还省钱,做AI评估的可以看看。
7月23日
22:11
22:11官方账号LangChain@LangChainAI
精选
推理成本降低使企业能更经济地运行专业智能体。LangChain指出团队可为特定领域创建专属智能体。通过评估(evals)和追踪(traces)可量化性能,并随工作流变化灵活调整框架。这一趋势推动了多智能体系统在生产环境的实际部署。
事件专题

推荐理由:LangChain告诉你,现在搞专业AI智能体更划算了,成本低了就能直接上生产,用evals和traces调优。
03:39
7月15日
03:58
03:58官方账号Perplexity@perplexity_ai
精选
WANDR是一个评测基准,用于测试智能体发现大规模实体集并验证每个实体特定事实的能力。该基准提供密集且可解释的评估信号,能揭示智能体在哪个环节失败。其流程还可作为半自动训练数据工厂。由Perplexity AI发布。

推荐理由:Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
7月9日
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
7月3日
09:57
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani
该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。
推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
6月29日
08:16
6月26日
23:57
23:57官方账号LangChain@LangChainAI
LangChain 将于6月29日至7月2日在旧金山 AI Engineer World's Fair 设展台(U-G19)。团队将现场交流生产环境中智能体工作流及评估设置。欢迎参会者前往探讨实际部署与评测方案。

推荐理由:LangChain 团队在旧金山 AI Fair 设摊,聊聊智能体生产部署和评估,想去交流的记得去 U-G19 找他们。
6月12日
21:51
21:51Qdrant@qdrant_engine
本文介绍如何使用 Qdrant 和 Evret 构建检索系统评估流程,涵盖构建基准、衡量检索质量、评估相关性和排序性能,以及超越“看起来有效”的测试。随着 RAG 和检索系统在生产 AI 应用中日益关键,评估变得与检索本身同等重要。

推荐理由:做 RAG 或检索系统的开发者终于有了可落地的评估方法论——Qdrant + Evret 的组合让你从“感觉还行”到“数据说话”,建议直接跟着指南搭建你的评估流水线。
6月9日
23:49
23:49官方账号LangChain@LangChainAI
LangSmith 推出全链路追踪功能,覆盖每一次工具调用、检索步骤和推理节点。该功能为组织提供完整的审计追踪和可解释性层,并作为运行评估的基础。用户可以获得逐篇文章的详细分解。这有助于提升 AI 应用的透明度和调试效率。
推荐理由:做 AI 应用开发和运维的团队终于有了可审计的全链路追踪——LangSmith 覆盖工具调用和推理节点,建议直接集成到工作流中。