11:22
官方账号arXiv cs.AI@Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen Mercor联手Ramp发布APEX-Accounting,内含160个会计任务,覆盖对账、费用计提等真实工作。九个前沿模型参与测试,Claude-Fable-5 (Max)以56.4% Mean Criteria@3领先Muse-Spark-1.1 (xHigh)的52.6%。最高Pass@8仅21.5%(Muse-Spark-1.1),GPT-5.6-Sol (Max+Pro)的Pass^8为2.6%。实验发现辛普森悖论:提高token预算提升总分,但预算受限时高token消耗任务得分更低。
推荐理由:想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。