行业中美对照多源确认21:30DeepSeek V4.1 Flash 发布后,中美顶尖模型 LiveBench 差距缩至 3%DeepSeek V4.1 Flash 把和 Anthropic 的跑分差距从 15% 追到只剩 3%,想知道中美模型现在差多少的看这篇。#DeepSeek#LiveBench#Anthropic#V4.1 Flash10 个信源在谈事件专题IIT之家11 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek
模型中美对照多源确认01:39民间AI排行榜单新鲜出炉,Fable 5.1仅排第三B站UP主做的这个民间测试很有意思,用各种贴近现实、条件更苛刻的场景测试大模型,看它们能不能真正干活,而不是只看跑分有多好看。#GPT-6#GML-5.3#Claude Fable#MMLU10 个信源在谈事件专题掘金本周最热@石小石Orz11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
论文13:05前沿AI评估的贝叶斯推断与决策审计这篇论文用贝叶斯方法检查了LiveBench等公共AI评估档案,发现很多宣称有问题,帮你判断哪些基准成绩可信。#LiveBench#Open LLM Leaderboard#贝叶斯推断#AI评估审计aarXiv cs.AI@Yanan Long原文稍后读已读值得跟进有用关注 LiveBench