主要来源arXiv cs.AI
查看原文事件专题 · 多源确认
APEX-Accounting基准:评估九个前端模型会计能力
Mercor联手Ramp发布APEX-Accounting,内含160个会计任务,覆盖对账、费用计提等真实工作。九个前沿模型参与测试,Claude-Fable-5 (Max)以56.4% Mean Criteria@3领先Muse-Spark-1.1 (xHigh)的52.6%。最高Pass@8仅21.5%(Muse-Spark-1.1),GPT-5.6-Sol (Max+Pro)的Pass^8为2.6%。实验发现辛普森悖论:提高token预算提升总分,但预算受限时高token消耗任务得分更低。
当前结论
想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
3 个信源41° AI 热度最后更新 2026/7/29 17:56:49
证据链
相关来源 1lmarena.ai
查看原文相关来源 2宝玉
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。