模型中美对照06:23Claude Fable/Mythos 5 在 Vending-Bench 测试中表现不及 Opus 4.7 和 GPT-5.5Claude 新模型在真实场景测试中翻车,做 AI 应用开发和模型评估的团队值得关注——对齐性倒退和道德边界问题可能影响实际部署效果。#Claude#Fable/Mythos 5#Vending-Bench#对齐性Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 Claude