05:42Notion@NotionHQNotion在X平台发布推文,提出“组织如何衡量AI的影响”这一问题。该推文目前获得527次浏览、3个点赞和1次转发。Notion的提问聚焦于企业评估AI实际效果的方法。行业NotionXAI评估推荐理由:Notion在X上抛了个问题:公司到底怎么量AI的产出?目前就是个提问帖,有527个人看过,没给答案,适合讨论。原文稍后读已读值得跟进有用关注 Notion
15:11IT之家(博客/媒体)7 月 31 日,多位用户反馈 Gemini 3.5 Pro 短暂出现在 Arena 平台,约 30 分钟后被移除。用户 Harshith 的截图显示,他只完成了一次 SVG 测试。谷歌于 5 月 19 日发布 Gemini 3.5 系列,首发 3.5 Flash,并计划次月推出 3.5 Pro,但此后多次延迟。这次短暂上线引发外界猜测,官方尚未回应具体原因。AI模型Gemini 3.5 Pro谷歌Arena推荐理由:谷歌跳票几个月的 Gemini 3.5 Pro 突然在盲测平台露脸半小时又被撤,想看看它真实水平的人可以去翻用户截图。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
20:35官方账号Decoder@Maximilian SchreinerMETR(AI安全研究组织)提出了名为“expenditure horizon”的新指标,用于量化AI智能体在解决问题时的成本效益。在NanoGPT speedrun任务上的早期测试显示,AI智能体的成本效益低于人类。该指标存在盲点,例如未计算模型训练成本。随着新一代推理模型的发展,这一评估结果可能被改写。行业METRAI智能体成本效益推荐理由:想精确知道用AI干活到底省不省钱?METR直接算了一笔账,结果初期表现还不咋样。原文稍后读已读值得跟进有用关注 METR
21:44官方一手OpenAI Blog(博客/媒体)精选OpenAI首席财务官Sarah Friar介绍了AI记分卡,通过四个指标衡量AI投资回报:有用工作(排除无用输出)、每成功任务成本(仅计实际解决问题次数)、可靠性(任务完成率)、计算回报(单位计算资源产出)。该框架旨在帮企业避免被速度或流行度误导,聚焦实际经济价值。AI产品OpenAIAI记分卡ROI10 个信源在谈事件专题推荐理由:OpenAI的CFO教你算AI投入产出,不光看快慢,还看可靠性、成本、真干活的效果,比那些虚的指标实在多了。原文稍后读已读值得跟进有用关注 OpenAI
10:01官方账号arXiv cs.AI@Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang该论文分析了使用项目反应理论(IRT)评估AI模型时面临的数据分布不匹配问题。研究基于六个LLM基准(如MMLU、HellaSwag等)的模拟数据,比较了四种估计方法(MML、MCMC、VI、神经伪孪生估计器),在18000种条件下评估其计算可行性和推断可靠性。结果表明,经典估计器在大基准中不可行,而可扩展估计器在小或非正态分布的模型集上会产生不可靠的排名和项目参数推断。研究提出了使用IRT所需的最小样本量和诊断方法。论文IRTAI评估基准测试推荐理由:这篇论文用大量模拟数据告诉你,当前AI基准里的IRT方法可能不可靠,尤其模型少项目多时,别盲目信排名。原文稍后读已读值得跟进有用关注 IRT
02:57Fireworks AI@FireworksAI_HQFireworks AI联合创始人Benny Chen在Stack Overflow Podcast上讨论了评估AI应用的框架。他提出需要平衡定性信号与定量指标。开源评估协议和社区贡献正在推动AI评估标准化。技巧Fireworks AIStack OverflowAI评估推荐理由:Fireworks AI的Benny Chen教你怎么判断AI应用好不好,不是只看指标,还要看定性信号。原文稍后读已读值得跟进有用关注 Fireworks AI
12:46官方账号arXiv cs.AI@Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh该论文提出人类创造力基准(HCB), 收集15000个专业判断覆盖5个创意领域和3个工作流阶段(构思/模型/细化)。HCB将评价分为收敛(如技术正确性)和发散(如美学方向), 发现专业分歧代表真实品味差异而非测量误差。单一质量指标会丢失关键信息: 模型在哪些维度必须正确、哪些维度应保持可操控性。论文Human Creativity Benchmark创意AI评估基准推荐理由:这篇论文用15000个专家评价告诉你, 测AI创意能力不能只看平均分, 分歧本身才是宝藏。原文稍后读已读值得跟进有用关注 Human Creativity Benchmark
22:09官方账号LangChain@LangChainAI精选76°LangChain与Fireworks AI合作,微调阿里Qwen模型构建了trace judge,用于检测生产trace中的“感知错误”。该judge在性能上匹敌或超越前沿模型,同时运行成本降低100倍。相关研究成果已发表在LangChain Labs博客。AI产品LangChainFireworks AIQwen推荐理由:LangChain搞了个低成本trace judge,用阿里Qwen微调,性能不输顶级模型还便宜100倍,做trace监控的可以看看。原文稍后读已读值得跟进有用关注 LangChain
10:56官方账号arXiv cs.LG@Mark A. Anastasio这篇Perspective论文区分了算法创新(在固定问题定义内改进计算实现和性能)与概念创新(重新定义问题、衡量标准、临床相关性)。作者指出当前激励结构、培训路径和发表规范 disproportionately 奖励算法创新,尤其在早期研究者中,而低估了概念贡献。通过医学影像AI的代表性案例,论文展示概念基础不足如何导致目标错位、泛化脆弱和有限现实影响。最后给出针对研究者、导师、审稿人和期刊的可操作建议,以更好地识别和支持概念创新。论文医学影像AI概念创新算法创新推荐理由:想知道医学影像AI领域的科研方向出了问题在哪?这篇Perspective论文直接点出算法竞赛之外的概念缺失,给实验室和期刊提出了改进建议。原文稍后读已读值得跟进有用关注 医学影像AI
11:12官方账号arXiv cs.AI@Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen论文提出Every Eval Ever,首个共享元数据模式和社区众包仓库,用于标准化AI评估结果。该模式将评估表示统一为单一JSON文档,支持从评价工具、论文等多种来源导入,并可存储每个实例的输出以进行细粒度分析。当前社区数据库已包含22,235个模型、2,273个独特基准和31种评估格式。论文还提供了自动转换器,从流行格式和评价工具转换到统一模式。论文Every Eval EverAI评估评估标准化推荐理由:统一了AI评估结果格式原文稍后读已读值得跟进有用关注 Every Eval Ever
10:27官方账号arXiv cs.AI@Lezhi Tan, Tijana Zrnic该论文提出了一种名为“任务可交换性”的统计条件,允许研究人员在合成数据存在偏差和噪声的情况下,仍能进行具有可证明有效性的推断。核心思想是:如果当前研究任务与某些已有真实数据的“历史任务”在数学上可交换,那么就可以利用合成数据来扩展研究,同时保证统计结论的可靠性。作者在公众舆论调查(使用“硅样本”)和AI评估(使用自动评分器)两个场景中验证了该框架。这项工作为社会科学、AI评测等领域安全使用合成数据提供了理论基础。论文合成数据统计推断任务可交换性推荐理由:合成数据在科研中越来越常见,但偏差问题一直让人头疼。这篇论文给出了一个可操作的统计框架,让做社会科学调查或AI评估的研究者可以放心地用合成数据做推断,值得关注。原文稍后读已读值得跟进有用关注 合成数据
12:47官方账号Logan Kilpatrick@OfficialLoganKLogan Kilpatrick 在 X 上发帖指出,目前创建高质量公开 AI 基准测试(benchmarks)存在巨大的信息优势(alpha)。他认为这是一个被低估的机会,因为当前公开基准测试的质量参差不齐,而好的基准测试能有效推动模型评估和行业进步。该帖引发广泛讨论,获得 31 条评论、176 个点赞和 8044 次浏览,反映出社区对这一观点的共鸣。行业基准测试AI评估公开数据推荐理由:做 AI 评估或模型开发的团队,现在投入公开基准测试能抢占先机——Logan 点出了这个被忽视的蓝海,建议关注并尝试创建自己的测试集。原文稍后读已读值得跟进有用关注 基准测试
01:01官方一手OpenAI Blog(博客/媒体)OpenAI 发布了一份关于第三方AI评估的指南,旨在帮助评估者系统性地评估前沿模型的能力、安全防护和有效性。该指南强调了评估的透明性、可重复性和独立性,为第三方评估提供了标准化框架。这对于确保AI系统在部署前得到充分测试、减少潜在风险具有重要意义。指南涵盖了评估设计、执行和报告的关键步骤,是推动AI治理和信任建设的重要一步。行业AI评估安全治理10 个信源在谈事件专题推荐理由:做AI安全评估、模型审计或合规工作的团队可以直接参考这份标准化框架,省去自己摸索评估流程的时间。原文稍后读已读值得跟进有用关注 AI评估
11:45官方账号arXiv cs.AI(学术论文)本文针对当前AI评估中普遍存在的“苹果与橙子”式比较问题,提出了一种可重复的流程,将高层级AI使用用例转化为详细评估场景。该方法通过结构化的AI用例工作表(包含用例、行业、用户、预期结果、预期影响和关键绩效指标六大要素)从领域专家处获取用例,并结合LLM提示与人工审核的三阶段扩展管线,将用例扩展为107个场景。文中以美国金融服务业为例,展示了网络防御、开发者生产力、金融犯罪聚合等用例的转化过程。核心贡献在于通过人工检查点确保场景的操作基础性和人类中心设计原则,为更一致、有意义的AI评估范式提供支持。论文AI评估方法论金融服务业推荐理由:该研究直面AI评估领域的方法论碎片化问题,提出的结构化流程和人类中心设计原则为业界提供了可操作的标准化评估框架,尤其对金融等高风险行业的AI系统评估具有直接参考价值。原文稍后读已读值得跟进有用关注 AI评估