GPQA(Generative Pre-trained Question Answering)是一个专注于评估大语言模型在复杂多步推理任务上表现的数据集,尤其侧重于物理、化学、生物等科学领域的深度知识理解与逻辑推理能力,常被用作衡量模型专业领域智能的关键基准。随着大语言模型参数规模与能力的提升,GPQA的测试结果已成为业界评估模型是否具备“专家级”推理能力的重要参考。
GPQA
product · 首次出现 2026-05-22 · 最近出现 2026-09-11 · 累计提及 37
综述
相关报道
10 条在档- 华为正式开源 openPangu-2.0-Pro:昇腾训练的 505B MoE 模型shao__meng
- Moonshot AI 开源 Kimi-K3 多模态代理模型,2.8T 参数SuperTechFans
- GRADE:门控路由与自适应深度实现高效多智能体推理arXiv cs.LG
- OpenAI发布GPT-Live:全双工语音模型,可调用GPT-5.5实时生成UI小互
- OpenAI 发布 GPT-Live 全双工语音模型,可调用 GPT-5.5 并生成实时 UI小互
- 英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑IT之家
- DemoPSD:分歧调节的策略自蒸馏arXiv cs.AI
- Qwen3.6-27B-NVFP4发布,vLLM支持Blackwell GPU推理vLLM
- Theoria:基于非正式推理状态的改写接受性验证arXiv cs.AI
- OpenRouter 持续运行开放权重模型基准测试并公布排名OpenRouter