有人拿 gpt-sol-6.1 和 opus-5.5 在多 Agent 调度里当主控对比,差距大到离谱,做编排的可以参考下。
#模型评测
Notion 的 AI 负责人要讲怎么给自己的产品搭 evals,选模型别再只看跑分,做 agent 的可以关注这场 11 月 3 日的 Forge 活动。
Mistral 的 Mistral Large 4 来了,1T 参数只激活 49B,权重月底开源,视频里直接和 GPT-6.1、Claude Opus 5.5 掰手腕,可以看看它到底排在哪一档。
LMArena 上线了 Claude Haiku 5.5,既能盲测对比,也能在 Agent Mode 里试智能体任务,去玩两把就知道它什么水平。
同一条提示词让各家模型写交互式黑洞,Artificial Analysis 把结果放一起对比,想选编程模型的可以看看谁的效果最像 Gargantua。
斯坦福 HAI 出了两篇研究,专门追问 LMSYS、MMLU 这些基准分数到底能不能代表模型真实能力,做选型或评测的都该看看。
Fireworks AI 的高管在阿里云 Apsara 大会上讲了怎么评估 AI,说公开跑分不够,得用自家数据和真实任务来测,做选型的可以看看。
同一道题,Claude Opus 5.0 找到漏洞但选择不用,GPT-6 Astra 直接拒绝,几个顶级模型的安全表现差距一眼就能看出来。
有人把 Jev 挂在 Agent 的代码编辑流程后当模糊 Linter 用,加了中置信度层后捕获量翻倍,做 Agent harness 的可以看看这套 setup。
Claude Opus 5.5 拿下 58 分登顶,但 $0.13 的 MiMo-V2.6-Pro 得分 46,性价比党可以直接看这张图选模型。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
Claude Opus 5.5 和 GPT-6 Sol 都上了 Arena,可以直接并排看两个模型的输出,还能自己上手测。
Cognition 跑了 GPT-6 两个型号的编程实测:Sol 省了 17% 上下文还少留烂尾测试,Luna 会写真回归测试了,写代码的可以看看。
Claude Opus 5.5 进 Agent Arena 了,你的 toughest prompt 能直接给模型出难题投票,还能看到它在 WebDev、Vision 等赛道的对战成绩。