MBPP是一种专注于程序设计的基准数据集,常被用来评估各类大模型在程序设计任务上的表现,是人工智能领域研究热点之一。
MBPP
product · 首次出现 2026-05-22 · 最近出现 2026-09-02 · 累计提及 17
综述
相关报道
10 条在档- 潜在递归思想:冻结大模型的推理方法arXiv cs.AI
- 代码生成中提示词的作用评估arXiv cs.AI
- MineValiCoder:基于测试用例质量挖掘与二分图互验的可靠代码生成arXiv cs.AI
- 掩码感知策略梯度提升扩散语言模型推理能力arXiv cs.AI
- 谁给评分者评分?面向自提升LLM智能体共进化评估指标与技能arXiv cs.AI
- 免费AI编码模型DeepSeek-Coder-V2登顶全球排行榜量子位
- 多轮LLM编程对话中的回归累积问题研究arXiv: DeepSeek
- 伪造而非暴露:对冻结小代码模型中自我修复反馈的内部预先注册安慰剂对照分解arXiv cs.LG
- vLLM 集成 DFlash 投机解码,Gemma-4 31B 吞吐量提升最高 5.8 倍vLLM
- 无信号选择与表达恢复:冻结小代码模型后验验证算子测量研究arXiv: DeepSeek