8月24日
8月19日
8月13日
18:08
17:45
17:45OpenRouter@OpenRouterAI
OpenRouter 在推特上为旗下模型评估工具 Ori Eval 征求开发者反馈,可私信 @jjacky。该工具的目标是帮开发者从 openrouter.ai/ori/eval 页面找到当前最合适的模型。目前这条推文已有 294 次查看,但暂无评论和转发。
推荐理由:OpenRouter 想继续打磨 Ori Eval,所以跑来问开发者要啥。你要是为选模型发愁,可以去他们的评估页试试。
8月2日
09:19
09:19Gary Marcus@GaryMarcus
Anthropic技术员工Jess Yan表示,模型与harness无法分离,分离就会损失性能。她认为测试模型时必须搭配harness进行,且会选择Anthropic自建的harness。Gary Marcus转发该言论,称这是神经符号AI的胜利。
事件专题

推荐理由:Gary Marcus转发Anthropic员工的话:模型和harness拆不开,测试必须连着一起测。神经符号AI派觉得这是胜利。
8月1日
07:21
07:21官方账号Simon Willison@simonw
精选
Simon Willison 与 Prime Radiant 合作推出新工具 smevals,用于在命令行运行针对模型、测试框架和提示词的小型评估套件。用户可通过 'uvx smevals docs' 命令直接体验。相关博客文章已在 primeradiant.com 发布,介绍了工具的设计思路。
推荐理由:smevals 是 Simon 和 Prime Radiant 做的小工具,专门跑模型和提示词的评估,一条命令就能用,适合快速看效果。
7月31日
02:23
7月28日
7月25日
04:55
04:55AI Engineer@aiDotEngineer
Arize AI 的 CPO Aparna Dhinakaran 和 CEO Jason Lopatecki 主持 AI x Evals Track 直播。Google DeepMind 的 Philipp Schmid、Character.ai 的 Maor Bril 等嘉宾参与讨论模型评估最佳实践。Snorkel AI、Uber、SonderMind 等公司也分享案例。
事件专题

推荐理由:想学模型评估怎么做?这个直播请了 Arize AI、Google DeepMind、Character.ai 的人,干货管够。
7月22日
04:19
04:19官方一手OpenAI Blog博客/媒体
OpenAI和Hugging Face联合分析了一起针对AI模型评估流程的安全事件。事件暴露了攻击者具备高级网络能力,可能涉及恶意模型或数据。两家公司分享了早期调查结果和防御经验,旨在提升社区对模型评估流程的安全防护意识。
事件专题

推荐理由:OpenAI和Hugging Face合作复盘模型评估时的安全漏洞,看看他们发现了什么高级攻击手段,对搞AI安全的有用。
7月2日
10:12
10:12官方一手arXiv: DeepSeek@Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich
一项研究评估了GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993道PSM I风格Scrum认证题上的表现,使用零样本、链式思考和源接地三种提示策略。Gemini 3 Flash准确率最高,GPT-5 mini次之,DeepSeek Chat 3.2最低。模型在单选题上表现最好,但在多选题和判断题上错误更多。定性分析发现错误系统性源于过度泛化、限制性措辞和复合干扰项。
推荐理由:想了解GPT-5 mini、Gemini 3 Flash、DeepSeek Chat谁更适合Scrum考试?这篇论文用993道真题实测了准确率和稳定性,还分析了典型错误原因。
02:14