AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

基准失效

共 1 条相关 AI 资讯
7月27日
11:01
11:01orange.ai@oran_ge
Kun Chen 指出 Opus 5 在多项公开基准上超越 Fable 5,但在实际使用中远不如 Fable 5,认为现有基准已几乎无用。他信任基于私有数据集的领域特定评估。他还透露 Anthropic 在 5 系列中先训练 Mythos 再蒸馏到 Sonnet 和 Opus,导致 Sonnet 5 失败、Opus 5 评价混杂。Chen 表示 Claude 系列使用体验变差,Grok 和 Kimi 目前在“愉悦感”维度上更优。
AI模型Opus 5Fable 5Anthropic
事件专题

推荐理由:这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。
原文
精选全部日报登录