模型Agent 与开发者多源确认88°13:24TasteVal 基准发布:量化 AI 的实验研究品味,Opus 5.5 超过人类专家这个 TasteVal 把研究品味换算成省了多少算力来打分,Opus 5.5 用 1/30 的成本跑赢人类专家,数字挺有意思的。#TasteVal#Opus 5.5#基准测试#AI R&D2 个信源在谈事件专题aarXiv cs.AI@Oliver Jaffe, Dane Sherburn3 个信源在谈原文稍后读已读值得跟进有用关注 TasteVal