Bench在人工智能领域通常指基准测试(Benchmark),是评估AI模型、算法或系统性能的标准测试集。近期,多个新型基准测试被提出并取得进展,反映了AI评估体系的不断完善。
Bench
general · 首次出现 2026-05-22 · 最近出现 2026-09-11 · 累计提及 673
综述
相关报道
10 条在档- OpenAI 推出 GPT-Live-1 实时语音模型 API,支持打断处理与工具调用IT之家
- Deepseek-V4.1-Flash 在 Fireworks 上正式发布Fireworks AI
- OpenAI GPT-Live-1 的语音代理在 Tau3 测试中表现优于 GPT-Realtime-2.1@OpenAIDevs
- CoRA-NAS框架提升神经架构搜索效率arXiv cs.LG
- Deepseek-V4.1-Flash 模型上线 Fireworks 平台Fireworks AI
- VIP-Router实现视觉标记自适应剪裁arXiv cs.AI
- DiSCo框架评估LLM文化偏好偏见arXiv cs.AI
- ExecCritic:测试与修复分离的智能体框架arXiv cs.AI
- SAEScientist-Bench:AI代理能否自主进行SAE可解释性研究arXiv cs.AI
- 多领域模型训练中的领域覆盖优化研究arXiv cs.AI