精选理由
DeepSeek V4 Flash在谜题基准拿到89.6,赢了Gemini 3.6的89.0,推理表现很亮眼。
在包含940道题的Extended NYT Connections基准上,DeepSeek V4 Flash取得89.6分,位列第一。Gemini 3.6 Flash以89.0分紧随其后。Qwen 3.7 Plus的成绩为74.8分,Gemini 3.5 Flash-Lite为60.4分。Qwen 3.7 Flash和Qwen3.6-35B-A3B分别只拿到43.8和41.6分。
原文 · Geek
以后新模型请到这个区域,不然只能等死。
以后新模型请到这个区域,不然只能等死。 Lech Mazur @LechMazur New results on the 940-puzzle Extended NYT Connections benchmark: DeepSeek V4 Flash: 89.6 Gemini 3.6 Flash: 89.0 Qwen 3.7 Plus: 74.8 Gemini 3.5 Flash-Lite (high): 60.4 Qwen 3.7 Flash: 43.8 Qwen3.6-35B-A3B: 41.6 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 ⚡