27B模型Qwen3.8-27b评测52分,追平Luna和DS V4

太离谱了,一个27B的模型,智能达到了 Luna 和 DS V4 的水平??? 这要么就是后训练黑科技,要么就是 bench 被 hack 了

精选理由

看看这个27B小模型,用3000美元硬件就打平了Luna和DS V4,还超了Opus,到底是黑科技还是刷分?

AI 摘要

Qwen3.8-27b在Artificial Analysis评测中拿到52分,追平Luna和DS V4。这个27B参数模型只需3000美元硬件即可运行,却超过了四个月前发布的所有模型,包括Opus。推文作者质疑,这样的成绩要么来自后训练黑科技,要么就是基准测试被操纵。

原文 · orange.ai

太离谱了,一个27B的模型,智能达到了 Luna 和 DS V4 的水平??? 这要么就是后训练黑科技,要么就是 bench 被 hack 了

太离谱了,一个27B的模型,智能达到了 Luna 和 DS V4 的水平??? 这要么就是后训练黑科技,要么就是 bench 被 hack 了 0xSero @0xSero Qwen3.8-27b hits 52 on artificial analysis A model that runs on 3k USD of hardware is beating everything from 4 months ago. Including Opus Permanent underclass is cancelled 🔗 View Quoted Tweet 💬 4 🔄 0 ❤️ 4 👀 1663 📊 3 ⚡

  • 阿里通义 Qwen08-16 07:32原文
  • Simon Willison’s Weblog08-16 22:00原文