#模型评估

共 94 条 · 7 天 3 条 · 30 天 13 条
6月9日
论文多源确认精选72°09:40
Scaffold 选择影响 GAIA 准确率高达 28 个百分点:模型能力评估需谨慎

做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。

事件专题
arXiv: Anthropic@Jason Starace11 个信源在谈原文
6月4日
6月2日
论文12:06
HypothesisMed:推理时答案融合与结构化假设空间报告用于生物医学问答

生物医学问答领域终于有了一个关注可靠性而非单纯准确率的实用框架——HypothesisMed 让模型输出可解析、可审计,做医疗 AI 或临床决策支持的团队可以直接用这套管道评估自己的模型,避免模型自信犯错。

arXiv: DeepSeek@Md Motaleb Hossen Manik, Ge Wang原文
5月29日
5月28日
5月22日
论文多源确认精选72°11:38
AI 在冲突地区部署可能加剧矛盾:九款模型测试失败率最高达 47%

做 AI 安全评估或部署在敏感地区的团队,这篇论文给出了第一个可复用的冲突场景测试框架,能直接用来检查模型是否会在关键议题上“和稀泥”——看完你会重新审视“中立”输出的代价。

事件专题
arXiv: OpenAI@Andrii Kryshtal11 个信源在谈原文
5月21日
5月17日
5月13日