技巧多源确认精选

B站「AI无限竞技场」用真实场景评测大模型,GPT6-Astra登顶

随着大模型能力提升,作为 AI 自媒体,现在很头疼如何评测模型。 为了能让普通人看懂,大家只能选鹈鹕骑自行车、Threejs 3D游戏、Fancy的前端效果、各种精美PPT来告诉大家:这个模型不错。...

精选理由

B站搞了个「AI无限竞技场」,让UP主用真实任务测试AI模型,比如给个屎山代码项目让模型PK,或者让不同模型玩狼人杀。比那些刷分、炫技的评测靠谱多了。

B站发起「AI无限竞技场」活动,让UP主用真实任务测试AI模型。活动收录190个视频,测试包括代码编程、量化交易、3D建模等场景。投稿者多为模型评测高手,如牙医老师、oil欧呦。榜单前三名是GPT6-Astra、Fable 5.1、GLM-5.3。

原文 · 向阳乔木

随着大模型能力提升,作为 AI 自媒体,现在很头疼如何评测模型。 为了能让普通人看懂,大家只能选鹈鹕骑自行车、Threejs 3D游戏、Fancy的前端效果、各种精美PPT来告诉大家:这个模型不错。...

随着大模型能力提升,作为 AI 自媒体,现在很头疼如何评测模型。 为了能让普通人看懂,大家只能选鹈鹕骑自行车、Threejs 3D游戏、Fancy的前端效果、各种精美PPT来告诉大家:这个模型不错。 另一方面,看起来专业的大模型 Benchmark 也开始失效,各种刷榜、刷Openrouter用量。 加上题目污染和大模型自身的奖励黑客,从这些数据也很难看出哪个模型真能干活儿。 个人觉得比较好的方式是真实场景实测,而不是炫技、刷分。 最好一镜到底,直接看用什么Harness,用什么模型,写了什么Prompt,OneShot 输出质量,几轮迭代后的效果。 最近看B站搞的评测活动就很好,叫「AI无限竞技场」。 别看榜单,也别刷题,直接让UP主用真实任务测试。 B站可以说是中国的Youtube,且用户更年轻,更有活力,更有脑洞。 有次天津 AI 圈聚会,知名 大V 丁师傅( @dingyi )跟我说,X上那些玩AIGC的作品,跟B站完全没法比... 想开眼界,多刷刷B站,高手如云。 果然,我看了下B站的『AI无限竞技场』上的投稿作品,不得不佩服大家的思路和想象力。 从代码编程、游戏竞技、知识问答,再到空间建模、网文写作、生活决策,各个方向角度都有up主评测。 比如给一个牛x的屎山代码项目,让各 AI 模型 PK,看哪个模型最适合干这种脏活儿。 还有让不同 AI 做量化交易,看哪个真能替你赚钱,哪个让你亏到没裤衩。 让不同 AI 玩狼人杀,看哪个先出局,哪个能挺到最后。 让不同 AI 生成 3D 白模,看哪个模型又好又便宜。 ... 看了下投稿的up主,有X上大家耳熟能详广受好评的牙医老师( @karminski3 )、还有我线下刚见过的oil欧呦( @I_am_oil_oil )同学,都是模型评测圈的一线高手。 B站果然权威,能号召这么多牛逼 up 主开脑洞、做评测。也方便大家了解不同场景中,哪个模型才是SOTA。 忍不住写了个爬虫,把目前所有参赛项目都抓了下,放到了我的Github仓库。 共收录了40个主题、 190 个视频、33 位 UP 主的作品。 总共参赛模型有100多个(我咋没用过这么多?) 不过榜单前几名和我个人使用体感一致: 当下排名第一的模型是GPT6-Astra、第二是Fable 5.1 、第三是GLM-5.3。 不知道过段时间会有什么变化,听说Gemini4、Grok4.7 都快出了。 Github地址见评论区,内容相当精彩,建议收藏。 #AI无限竞技场 #B站 #AI 💬 1 🔄 0 ❤️ 5 👀 1077 📊 2 ⚡