8月13日
22:43
8月5日
10:09
7月14日
09:56
09:56官方账号arXiv cs.AI@Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao
论文提出一个模块化、可扩展的评估框架,旨在系统评估和增强大语言模型在心理健康领域的对齐表现。该框架集成了正念、同情、非二元推理等沉思原则,可无缝接入新模型、评估指标和基准。实验重现了现有SOTA结果,并通过灵活组合模型、指标和基准实现公平交叉评估。框架设计领域无关,可扩展至决策、道德推理与人-AI协作等场景。
推荐理由:一篇论文搞了个模块化框架,用沉思原则来评估和提升LLM在心理健康领域的对齐,还能套用到其他领域。
7月10日
00:59
00:59官方账号LangChain@LangChainAI
Palash Shah将分享如何利用LangSmith Engine构建自我改进Agent,将生产追踪转化为持久记忆更新以持续优化Agent行为。Clay团队将展示其Agent评估框架(eval harness)的实现细节。活动由LangChain和Clay联合主办,在Luma上开放RSVP报名。

推荐理由:想了解LangChain的自我改进Agent和Clay的评估工具?这场线下Meetup有干货,Palash和Clay团队亲自讲原理和实现。
7月2日
23:32
6月24日
04:15
04:15官方一手OpenAI Blog博客/媒体
OpenAI通过Appia Foundation推动建立先进AI的共享标准,重点支持评估框架、安全实践及全球合作。该举措旨在促进AI行业在安全评估和透明度方面的统一规范。Appia Foundation作为一个跨组织协作平台,已吸引多家AI研究机构参与。
事件专题

推荐理由:OpenAI牵头搞行业标准,从评估框架到安全实践,帮大家少踩坑,全球合作一起定规矩。
6月5日
6月1日
5月26日
12:12
12:12官方一手arXiv: OpenAI@Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard
精选
这篇综述系统分析了 LLM-as-a-Judge 在医疗领域的应用现状,涵盖临床决策支持、自然语言处理、医学问答和医疗沟通等场景。研究检索了 2023 年 1 月至 2026 年 2 月的 541 篇文献,最终纳入 134 项研究。OpenAI 模型是最常用的评判者,提示工程几乎出现在所有研究中,集成、多智能体和检索增强设计是常见扩展。在报告人类验证的研究中,LLM 评判者与专家判断呈现中等到强对齐,但可靠性因任务而异。该综述认为 LLM-as-a-Judge 是可扩展的医疗 AI 评估框架,但其临床价值取决于模型设计和严格验证。
事件专题

推荐理由:医疗 AI 评估一直缺乏规模化手段,这篇综述系统梳理了 LLM-as-a-Judge 在临床场景的落地情况,做医疗 AI 开发或评估的团队可以快速了解当前方法的有效性和局限。
5月22日
08:06
5月18日
11:58
11:58官方账号arXiv cs.AI@Adrienne Deganutti, Dingning Cao, Jaejung Seol, Elad Hirsch, Purvanshi Mehta
精选
生成式视频模型在设计动画任务中应用渐广,但缺乏标准化评估体系。与自然视频不同,设计动画需满足结构化约束:特定组件按指定运动类型、方向、速度和时序动画,非动画区域保持稳定,布局结构不变。本文提出全自动评估框架,涵盖布局保真度、运动正确性、时间质量和内容保真度四个维度,消除主观人工评估依赖,为领域进展提供统一基准。
推荐理由:做设计动画生成或视频评估的团队终于有了可复用的自动化评测标准,不用再靠人工打分——建议直接参考框架搭建自己的评测流程。
5月14日
13:26
13:26官方账号arXiv cs.LG@Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara
精选
EVA-Bench 是一个全新的端到端评估框架,专门用于测试语音智能体(Voice Agents)在真实对话场景中的表现。它解决了现有基准无法同时模拟动态对话和全面衡量语音特有失败模式的问题。框架包含 213 个企业级场景,并引入两个复合指标:EVA-A(准确性)和 EVA-X(体验),分别评估任务完成度、忠实度、语音保真度以及对话流畅性、简洁性和轮次时机。在 12 个系统上的测试显示,没有系统能同时在两个指标上超过 0.5,且峰值性能与可靠性能差距显著。该框架已开源,为语音智能体的标准化评估提供了新工具。
推荐理由:做语音智能体或对话系统的团队终于有了一个能同时测准确性和体验感的基准——EVA-Bench 覆盖了企业场景和噪声鲁棒性,直接帮你对比不同架构的优劣,建议点开看看具体指标设计。