06:15官方账号LangChain@LangChainAILangChain 将举办一场网络研讨会,主题聚焦语音智能体的评估。会上演示如何从执行、结果、体验三个维度进行评测。同时讲解如何为生产环境中的语音智能体构建更完整的评估体系。参会报名通过 events.langchain.com 页面完成。技巧LangChain语音智能体评估方法推荐理由:LangChain 有个线上研讨会,教你怎么从执行、结果和体验三个角度评估语音智能体,做语音产品的朋友值得看看。原文稍后读已读值得跟进有用关注 LangChain
12:09官方账号arXiv cs.LG@Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary这篇论文将测试时缩放形式化为自回归模型隐式前缀树上的预算推理,区分单轨迹连续缩放、叶级缩放和前缀级缩放三种结构。论文提出评估轮廓,将端到端系统性能与候选库诊断分离,并指定推理协议的可重复性要求,区分精确重放与分布可复现。作者在广泛知识、符号推理和竞赛数学基准上应用这些原则,并组装了超过20亿条完整推理轨迹供发布。论文测试时缩放推理模型评估方法推荐理由:这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。原文稍后读已读值得跟进有用关注 测试时缩放
04:20官方账号LangChain@LangChainAI精选Similarweb使用确定性检查验证工具调用准确性,通过基于评分标准的LLM判断答案质量,进行忠实性检查确保与检索数据一致,并利用A/B对比保存基线结果。所有评估通过LangSmith追踪,以实现可复现的质量监控。技巧SimilarwebDeep ResearchLangSmith推荐理由:Similarweb分享了一套实用评估框架,用确定性检查+LLM评分+忠实性对比搞定开放性问题评估,还能用LangSmith追踪。原文稍后读已读值得跟进有用关注 Similarweb
03:09Lenny Rachitsky@lennysan72°Anthropic 研究产品主管 Dianne Penn 在访谈中提出“Evals 是新的 PRD”这一观点。她于 2023 年加入 Anthropic,作为首位技术 PM,参与了从 Claude 2 到 Mythos 的每个 Claude 模型发布。访谈涵盖 AI 研究角色如何运作、前沿模型安全措施(如 35:18 处)、以及如何构建有效的评估体系。Lenny Rachitsky 主持讨论,还涉及 AI 时代招聘、产品经理角色演变等话题。行业AnthropicClaudeEvals10 个信源在谈事件专题推荐理由:Anthropic 的产品主管亲自聊他们怎么做模型评估,说 Evals 就像新版产品需求文档,对做 AI 产品和模型的朋友很有启发。原文稍后读已读值得跟进有用关注 Anthropic
10:56官方账号arXiv cs.AI@Mehmet IscanPoPE(Popperian Placebo-Controlled Evaluation)是一种用于测量代码模型能否利用错误证据进行自修复的评估方法。在0.5-1.5B参数的冻结小型代码模型上,通过提示通道和权重通道(小数据适配器训练)进行测试。提示通道中,内容消融安慰剂组解锁12单元,真实错误模式组解锁10单元(40单元抗性带),未发现机制差异。权重通道中,错误内容适配器与无干预基线打成8-8平局(p=1.0),而SHA扰乱安慰剂适配器以10个解锁领先。结果未证实错误内容可带来显著优势。论文PoPE代码生成自我修复推荐理由:这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。原文稍后读已读值得跟进有用关注 PoPE
03:55官方账号Perplexity@perplexity_ai精选Perplexity AI 引入了软分数(soft scores)和硬分数(hard scores)两种评估机制,软分数允许部分正确给分,硬分数要求成员完全正确。相关基准任务和评估工具已开源至 GitHub。这套方法为细粒度评估提供了新思路。AI模型Perplexity AI基准测试评估方法推荐理由:Perplexity AI 搞了个新评估方法,软硬分数区别很清晰,基准和工具都开源了,做评测的可以看看。原文稍后读已读值得跟进有用关注 Perplexity AI
23:07lmarena.ai@lmarena_aiAgent Arena平台发布了一篇博客文章,详细介绍其因果追踪方法论。该方法用于分析智能体在竞技场中的决策路径,以提升评估的透明度和可解释性。AI模型Agent Arena因果追踪智能体推荐理由:Agent Arena搞了个新方法,能追踪智能体到底怎么做决策,挺适合研究评估方法的人看看。原文稍后读已读值得跟进有用关注 Agent Arena
18:04@koltregaskes@koltregaskes73°AISI在测试前沿模型时,将推理计算预算从250万token提高到5000万token,模型的时间跨度从40分钟跃升至4小时。在网络安全、软件工程和数学基准上,模型性能随token预算增加而持续提升,8%的任务仅在1000万token以上才被解决。新模型更能有效利用额外计算资源,前沿模型的加倍率在高预算下陡增60%。标准评估因在模型性能还未饱和前就限制计算量,系统性低估了模型能力,固定预算的得分会遗漏大量提升。AI模型AISI推理模型基准测试1 个信源在谈事件专题推荐理由:AISI用更高的token预算测试模型,发现性能远超标准评测——8%的任务需要千万级token才能解决,前沿模型能力被低估了。原文稍后读已读值得跟进有用关注 AISI
10:43Ate-a-Pi@svpino精选建议用“value per token dollar”指标评估智能体:将智能体产生的价值除以消耗的token成本。比值低于1表示成本大于回报;等于1表示收支平衡;高于1则可用该智能体构建业务。不同智能体即使使用相同模型和token数,创造的价值也可能完全不同。@matrix_build 团队首次采用这一指标。技巧value per token dollarmatrix_build智能体推荐理由:别再纠结智能体能不能干了,试试用“值多少token”来算账,看投入产出比高不高。原文稍后读已读值得跟进有用关注 value per token dollar
09:47官方账号arXiv cs.LG@Zeynep Türkmen, Kürşat Kaya, Alexander Pfefferle, Frank Hutter该研究提出一个统一接口,用于比较不同表格基础模型的数据先验。他们从TabPFN、TabR等公开先验和真实数据集生成训练任务,在固定架构和训练协议下训练模型。在共享下游分类任务上评估发现不同先验偏好不同任务特性,部分先验绝对性能更强,部分排序更稳定。数据级相似度仅能部分解释下游行为差异。论文表格基础模型数据先验评估方法推荐理由:想知道不同表格基础模型的数据先验到底差多少?这篇论文用统一框架帮你测了一遍,结果挺有意思。原文稍后读已读值得跟进有用关注 表格基础模型
12:12官方账号arXiv cs.AI@Blade Frisch, Will Wade, Dylan Gaines, Michelle Kinsella, Betts Peters, Tamara Broderick, Keith Vertanen该论文分析了6个AAC(辅助与替代沟通)问题空间的复杂性。AI可以增强AAC用户的能力,但当前评估指标难以捕捉用户的多方面需求。作者提出了更鲁棒的评估方法以考虑用户的交叉性细微差别。论文还讨论了跨问题空间的更广泛问题及解决思路。论文AACAI辅助技术推荐理由:这篇论文深入探讨了AI增强AAC界面评估的挑战,提出了新的评估方法,对研究人机交互和辅助技术的人很有启发。原文稍后读已读值得跟进有用关注 AAC
10:56lmarena.ai@lmarena_aiAgent Arena 团队发布博客,详细介绍了其用于评估智能体性能的因果追踪方法论。该方法通过分析模型内部因果链,量化不同组件对最终输出的贡献。博客中展示了在多个基准测试上的实验结果,并提供了开源代码供研究者复现。论文Agent Arena因果追踪智能体推荐理由:搞懂Agent评估新方法原文稍后读已读值得跟进有用关注 Agent Arena
09:50官方一手arXiv: DeepSeek@Fuqiang Niu, Bowen Zhang研究者提出SICI(立场推理复杂度指数),一个七维诊断指标,用于衡量目标-文本对在语义和语用上的复杂度。该指数在SemEval-2016和VAST数据集上比表面代理指标更好地预测LLM的准确性,且具有较高的跨评分者信度(α=0.771)。关键发现是,随着SICI增加,LLM错误模式发生阶段转变:低复杂度样本易导致过度归因(尤其是反对立场),中等复杂度样本形成不稳定边界,高复杂度样本则快速集中到“无立场”预测。这种结构在GPT-3.5、GPT-4o-mini、DeepSeek-V3和GPT-4o中一致存在,但更强模型会移动边界。15种干预方法的实验表明,提示、检索和辩论往往只是沿归因-弃权轴移动模型,而非消除高复杂度的瓶颈。论文LLM立场检测复杂度指数推荐理由:这项研究揭示了LLM在立场检测中的系统性错误模式,对做NLP评估和模型优化的团队有直接参考价值——SICI指数可以帮你快速识别模型在哪些样本上会失效,建议做立场检测或模型鲁棒性研究的点开看看。原文稍后读已读值得跟进有用关注 LLM
01:46lmarena.ai@lmarena_ai精选LMSYS 推出 Agent Arena,一个基于真实用户交互的智能体能力排行榜。该排行榜通过因果追踪方法,分析智能体在竞争情报、市场分析、科研等深度研究任务中的表现。排行榜依据五个行为信号(确认成功、表扬/投诉、可操控性、故障恢复、工具幻觉)动态更新。用户每次使用 Agent Mode 的会话都会影响排名,使评估更贴近实际使用场景。AI产品智能体排行榜评估方法推荐理由:做 AI 智能体评估或选型的团队终于有了基于真实使用数据的排行榜,比传统基准测试更贴近实际效果,值得关注。原文稍后读已读值得跟进有用关注 智能体
11:09官方账号arXiv cs.LG@Ekaterina Grishina, Stepan Kuznetsov, Askar Tsyganov, Ilya Ivanov, Daria Korovaitceva, Margarita Rusanova, Uliana Parkina, Alexander Derevyagin, Evgeny Frolov, Sergey Samsonov, Anton Lysenko推荐算法排名因数据集特性(稀疏性、序列结构、规模)而异,简单平均指标(如NDCG)会产生误导。研究者提出基于Bradley-Terry模型的排名方法,能根据数据集统计特征生成更可靠的排名。该方法还引入新指标评估排名一致性,并能在不运行模型的情况下预测新数据集上的算法表现。这对推荐系统开发者选择算法和评估基准有重要参考价值。论文推荐系统算法排名Bradley-Terry模型推荐理由:推荐系统团队做算法选型时,别再被平均指标骗了——BT模型帮你根据数据集特性精准排名,省去跑全量模型的成本,做评估基准的开发者值得一试。原文稍后读已读值得跟进有用关注 推荐系统
09:23官方账号arXiv cs.AI@Yuxiang Chen, Jun Wang精选72°一项新研究对DeepSeek-R1-0120模型与人类在AIME 2025数学竞赛30道题上的推理过程进行了全面比较,标注了10247个推理步骤。研究发现,DeepSeek-R1的推理存在“拓扑模仿”现象:它频繁进行浅层验证和局部循环,缺乏人类推理中紧凑的分析与演绎交替结构。然而,成功的推理轨迹显示出稳定的分支和回溯使用,而失败的轨迹则过度或不足使用探索性动作。反思只有在演绎推理中才有效,陷入分析循环的反思往往忽略全局逻辑错误。研究建议改进评估和训练,包括测量跨轨迹稳定性、惩罚“空转”轨迹、鼓励深层逻辑修正。论文推理模型DeepSeek-R1数学推理推荐理由:这篇论文戳穿了当前长链推理模型的表面繁荣——做AI推理研究的团队会发现,模型可能只是在模仿推理的“样子”而非真正进步,值得细读其提出的改进方向。原文稍后读已读值得跟进有用关注 推理模型
00:48lmarena.ai@lmarena_ai精选72°Agent Arena 排行榜发布方法论深度解读,通过因果推断评估模型的智能体性能。排行榜基于五个信号:任务成功率、可操控性、错误恢复能力、用户表扬与投诉比、工具幻觉率。这为评估 AI 智能体能力提供了更全面的框架,帮助开发者理解模型在实际任务中的表现。AI产品智能体排行榜因果推断推荐理由:做 AI 智能体评估的团队终于有了更科学的参考框架——五个信号覆盖了任务执行和用户体验,值得研究评测方法的开发者点开细看。原文稍后读已读值得跟进有用关注 智能体
06:09Latent.Space@latentspacepod76°Andon Labs 联合创始人 Lukas Pet 和 Axel Backlund 在播客中介绍了基于美元的真实世界 AI 评估方法,认为传统基准测试无法反映模型在混乱现实中的表现。他们展示了 Claude 因一个每天2美元的自动售货机费用而向 FBI 报警的案例,以及 AI 智能体在长期任务中如何出现奇怪的行为螺旋。此外,他们还探讨了 AI 智能体之间相互撒谎、形成价格卡特尔、相互竞争的现象,并指出未来 AI 安全可能取决于在真实环境中测试模型,而非干净的基准沙盒。AI模型AI安全评估方法智能体推荐理由:做 AI 安全评估和智能体开发的团队,看完会重新思考测试方法——美元计价评估比传统基准更贴近真实风险,建议点开了解 Claude 报警等真实案例。原文稍后读已读值得跟进有用关注 AI安全
22:13官方账号LangChain@LangChainAILangChain 在一条推文中比较了两种用 LLM 作为评判者(LLM-as-judge)评估 50 条标准任务的方法:逐条评估(per-criterion)和批量评估(batch)。逐条评估为每条标准单独调用一次评判,共需 50 次 API 调用;批量评估则一次调用同时标注所有标准,仅需 1 次 API 调用,减少了 50 倍的 API 调用次数。两种方法使用相同的评估标准和输出,但批量评估在效率上显著提升。这对于需要大规模评估 AI 输出的开发者和团队来说,是一个重要的成本优化方向。AI产品LLM-as-judge评估方法API 调用优化推荐理由:做 LLM 评估的团队终于有了省 API 调用的思路——批量评估 50 条标准只需 1 次调用,成本直降 50 倍,建议做自动化评测的开发者点开看看。原文稍后读已读值得跟进有用关注 LLM-as-judge
10:47官方账号arXiv cs.AI@Areeb Gani, Asal Meskin, Gabrielle Kaili-May Liu, Arman Cohan精选该研究提出一个系统框架,用于量化大型推理模型(LRM)在输出长链思维时,其内在置信度与语言表达置信度之间的对齐程度(即忠实校准FC)。研究发现,LRM的推理行为并不会自动提升FC,且针对非推理模型的提示干预在推理场景中无效。不同置信度估计器对同一推理轨迹给出分歧评估,暴露了现有评估方法的脆弱性。这项工作将FC确立为LRM在高风险部署场景下的关键可靠性与对齐目标。论文推理模型置信度校准模型对齐推荐理由:LRM的推理链常被用户视为深思熟虑的证据,但这项研究戳破了这个幻觉——推理行为并不等于置信度表达更可靠。做模型对齐或安全评估的团队值得关注,尤其是那些在医疗、金融等高风险场景部署LRM的开发者,看完会重新审视你的置信度校准策略。原文稍后读已读值得跟进有用关注 推理模型
10:13官方账号Microsoft Research@MSFTResearch微软研究团队发布最新研究焦点,探讨如何大规模评估智能体行为,并论证仓库(repositories)比文档(documents)更适合作为智能体知识库。同时,团队邀请全球研究者共同解决价值对齐问题。该研究为构建可靠、可扩展的AI智能体系统提供了新思路。论文智能体评估方法知识库推荐理由:做智能体系统开发的团队会关心——仓库 vs 文档的选择直接影响知识检索效率,大规模评估方法则决定智能体行为可控性。建议点开了解具体论证。原文稍后读已读值得跟进有用关注 智能体
11:01官方账号arXiv cs.AI@Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma精选72°DeepWeb-Bench 是一个新的深度研究基准,旨在评估 AI 模型在开放网络上进行复杂研究的能力。与现有基准不同,该基准要求模型进行大规模证据收集、跨来源整合和长链条多步推理,难度显著提升。研究对九个前沿模型进行了评估,发现检索并非主要瓶颈(仅占12-14%错误),而推导和校准失败占70%以上。强模型和弱模型的失败模式不同:强模型主要因推导不完整出错,弱模型则因虚假精确性出错。该基准还揭示了模型在领域上的真实专长差异,跨模型一致性仅为0.61。论文基准测试深度研究推理模型推荐理由:做 AI 评估或研究基准的团队会发现,DeepWeb-Bench 揭示了现有基准无法区分的模型能力差异——尤其是推导和校准的短板。建议关注其分能力族评估和来源溯源设计,这对理解模型真实研究能力很有帮助。原文稍后读已读值得跟进有用关注 基准测试
08:01官方账号LangChain@LangChainAILangChain 的 Palash Shah 分享了一种针对长时运行 AI Agent 的评估方法。核心思路是将复杂的评估任务拆解成更小、更易处理的子任务,这样不仅便于人类理解,也更容易让 LLM 自身进行评估。他举例说明,对于运行超过 30 分钟的 Agent,通过从追踪中提取推理过程,找出特定行为的根本原因,然后重建简化版的评估场景。这种方法可以快速测试提示词调整的效果,而无需每次都运行完整的长时间评估。AI产品LangChainAI Agent评估方法推荐理由:做长时 AI Agent 评估的开发者终于有了实用技巧——拆解任务后评估效率大幅提升,建议直接参考这个流程优化你的评估策略。原文稍后读已读值得跟进有用关注 LangChain
14:53官方账号arXiv cs.LG@Thijs L van der Plas, Jacob JW Bakermans, Vishal Nedungadi, Gabrielė Tijūnaitytė, Marc Rußwurm, Ioannis N Athanasiadis精选Earth embedding模型将地球观测数据转化为与地理位置相关的嵌入向量,但现有评估通常孤立比较单个模型。本文提出嵌入互补性指数,衡量融合多个模型嵌入后的性能提升。在六个下游任务中,融合四个模型(AlphaEarth、Tessera、GeoCLIP、SatCLIP)在四个任务上优于最佳单一模型。互补性因任务和地点而异,且部分由土地覆盖类别的空间尺度决定。研究重新定义了Earth embedding的评估方式:未来最大收益可能来自模型组合而非单一模型。论文Earth embedding模型融合地理空间AI推荐理由:做地理空间AI或遥感应用的团队,别再只盯着单个模型刷榜——这篇告诉你融合多个Earth embedding模型能带来实际性能提升,建议直接参考其互补性评估方法。原文稍后读已读值得跟进有用关注 Earth embedding
10:14官方账号arXiv cs.AI@Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo精选该论文发现大型语言模型在非英语语言中安全性能下降,但传统评估指标(如越狱成功率)混淆了多种因素。研究者提出多组项目反应理论(IRT)框架,将安全退化分解为语言无关的鲁棒性、提示固有难度、全局语言处理难度和跨语言安全差距四个因素。通过对61个模型配置在10种语言上的190万条数据评估,发现安全机制主要是单维的,且低资源语言并非总是最脆弱——22个模型在英语中反而更易受攻击。低资源语言产生更多不确定响应,而高跨语言安全差距的提示集中在物理伤害类别(如盗窃和武器)。该框架在预测安全拒绝时达到AUC=0.940,优于简单基线,为更公平的跨语言安全评估和数据集改进提供了工具。论文安全对齐跨语言IRT框架推荐理由:这篇论文揭示了多语言安全评估的盲区——低资源语言不一定是安全最薄弱环节,做AI安全对齐的团队值得细看,能帮你避开传统指标误导,精准定位跨语言安全漏洞。原文稍后读已读值得跟进有用关注 安全对齐
13:26官方账号arXiv cs.LG@Deepak Pandita, Flip Korn, Chris Welty, Christopher M. Homan精选生成式AI模型(如LLM)的普及使系统安全性和可信度评估变得至关重要,但当前AI领域面临可重复性危机,主要源于不可靠的评估和不可重复的实验结果。人类评估者引入的偏见和主观意见加剧了这一问题,而现有评估实践通常每个项目仅使用3-5个标注,且缺乏持久评估者标识。该研究提出一种多级自助法(bootstrapping)来建模标注者行为,利用大量标注数据和持久评估者标识,分析项目数量(N)与每个项目响应数(K)之间的权衡,以达成统计显著性。这项工作为改进评估可重复性提供了方法论基础。论文可重复性评估方法标注者偏差推荐理由:做AI评估和模型安全测试的团队,终于有了量化标注者偏差的方法论——多级建模直接告诉你需要多少标注才能得到可靠结论,建议做实验设计的点开看看。原文稍后读已读值得跟进有用关注 可重复性
19:11官方一手arXiv: DeepSeek@Gabriel Garcia70°该研究揭示了当前思维链(CoT)忠诚度评估中的系统性问题:标准损坏研究(通过替换步骤为错误来测量准确性)实际上检测的是答案文本出现的位置,而非计算发生的位置。实验表明,在GSM8K数据集中,仅移除答案语句(保留所有推理步骤)即可将后缀敏感性降低约19倍(3B模型)。冲突答案实验显示,模型在消费时会系统性地遵循显式答案文本,即使推理过程中未提前确定答案(早期承诺低于5%)。该效应在14B规模下仍明显(8.5倍比率),但在32B时趋于消失。研究提出了三项前提条件作为最低标准:仅问题控制、格式表征、全位置扫描。论文推理模型思维链评估方法推荐理由:该发现对当前CoT忠诚度评估方法的可靠性提出根本性质疑,提醒研究者注意数据格式的混淆效应,对评估模型推理能力具有方法论指导意义。原文稍后读已读值得跟进有用关注 推理模型