08:09elvis@omarsar0精选DAIR.AI发布论文《There Is No Neutral Harness》,讨论了智能体驯服评估中的问题。十二个开放权重模型在26种可辩护的驯服配置下,对ARC、HellaSwag、MMLU和TruthfulQA的3,679个问题进行回答。gemma4-31b在不同驯服配置下的准确率从31%到89%不等。论文链接:arxiv.org/abs/2608.21382论文智能体MCP/工具论文推荐理由:DAIR.AI发布了关于智能体驯服的论文,探讨了评估中的问题,值得一看。原文稍后读已读值得跟进有用关注 智能体