模型多源确认11:22APEX-Accounting基准:评估九个前端模型会计能力想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。#APEX-Accounting#Claude-Fable-5#Muse-Spark-1.1#会计自动化2 个信源在谈事件专题aarXiv cs.AI@Julien Benchek 等 11 人3 个信源在谈原文稍后读已读值得跟进有用关注 APEX-Accounting
行业多源确认10:51模型盲猜答案揭晓:Kimi K3等四个模型名看看网友猜模型有多难,这四个名字你听过吗?#Kimi K3#Qwen 3.8 Max-Preview#GPT-SOl-5.6#Claude-Fable-510 个信源在谈事件专题berryxia@berryxia11 个信源在谈原文稍后读已读值得跟进有用关注 Kimi K3
模型中美对照多源确认78°23:20多个模型在IMO 2026获满分,国产模型Qwen3.8和Kimi K3表现出色国产模型Qwen3.8和Kimi K3在IMO 2026中拿了满分,速度还很快,想看看它们数学推理能力有多强?#GPT-SOL-5.6-High#Qwen3.8-Max-Preview#KIMI K3#推理模型10 个信源在谈事件专题berryxia@berryxia11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-SOL-5.6-High