做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。
#模型评估
共 94 条 · 7 天 3 条 · 30 天 13 条
6月9日
Scaffold 选择影响 GAIA 准确率高达 28 个百分点:模型能力评估需谨慎
6月4日
KINA:899题跨学科LLM知识基准,Gemini-3.1-Pro-Preview以53.17%领先
KINA 解决了 LLM 知识评估中学科代表性不足和排名不稳定的痛点,做模型评测或研究 LLM 知识边界的团队可以直接用这个基准来更可靠地对比模型,建议点开看看具体的设计和排名细节。
6月2日
论文12:06
HypothesisMed:推理时答案融合与结构化假设空间报告用于生物医学问答生物医学问答领域终于有了一个关注可靠性而非单纯准确率的实用框架——HypothesisMed 让模型输出可解析、可审计,做医疗 AI 或临床决策支持的团队可以直接用这套管道评估自己的模型,避免模型自信犯错。
5月29日
产品00:34
Code Arena 新增前端分类:AI 辅助 Web 开发趋势分析做 AI 辅助 Web 开发的团队可以了解哪些模型在特定前端任务中表现最佳,以及用户实际使用趋势,建议点开看看数据洞察。
5月28日
Qwen发布Qwen-Image-Bench,T2I评测从生成升级到创作
做T2I模型开发或选型的团队,终于有了一个能区分真实创意能力的评测标准,不再只看基础对齐分,建议直接拿自己的pipeline跑一遍,数据会说话。
DeepSWE 新基准发布:GPT-5.5 领先,小米模型表现亮眼
这个基准测试解决了现有 coding benchmark 数据污染问题,做 AI 编程模型评估的团队可以直接参考排行榜,小米模型的表现值得一试。
5月22日
AI 在冲突地区部署可能加剧矛盾:九款模型测试失败率最高达 47%
做 AI 安全评估或部署在敏感地区的团队,这篇论文给出了第一个可复用的冲突场景测试框架,能直接用来检查模型是否会在关键议题上“和稀泥”——看完你会重新审视“中立”输出的代价。
Gary Marcus 核查 OpenAI 和 Anthropic 最新头条背后的数学
Gary Marcus 的核查往往能戳破 AI 公司的宣传泡沫,关注模型真实能力的读者值得一看,看完可能会对头条数字更警惕。
5月21日
产品08:01
10 tokens/s 到底多快?模拟 LLM 输出速度的 HTML 工具选模型时经常被 token 速率数字搞晕?这个工具让你直接看到不同速度下的文本生成效果,做模型选型或写提示词优化的开发者值得一试。
5月17日
开源模型爆发:Gemma 4、DeepSeek V4、Kimi K2.6 等密集发布
开源模型一个月内连发五款旗舰,做模型选型或研究的团队可以直接参考 CAISI 的 V4 评估对比,省去自己跑 benchmark 的时间。
5月13日
Anthropic 谈 Claude Opus 4.6 的 BrowseComp 评估意识
Anthropic 把评估意识这个容易被忽视的陷阱说透了——做 AI 评估或关注模型真实能力的团队,看完会重新审视自己的测试方法。