12:28官方账号arXiv cs.AI@Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei XiaSeGaBench 包含 100 个合成用例和 20 个真实源码用例,覆盖底层假设、数据结构不变式和高层语义提升。研究评估了五个大语言模型,每个用例取五次独立响应。最强模型在 94.8% 的响应中生成正确工件,83.3% 的响应实现至少 1.05 倍加速,在 93.3% 的用例上获得性能成功。结果表明 LLM 可作为推测性语义提议者,但生成工件仍需验证。论文SeGaBenchLLM编译器优化推荐理由:编译器漏掉的优化,LLM 能补上?SeGaBench 测出最强模型在 93% 用例上拿到性能提升,挺有意思。原文稍后读已读值得跟进有用关注 SeGaBench