8月28日
18:07
18:07官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng
精选73°
MCR-Bench是首个缺陷状态感知的多轮代码审查基准,覆盖5种编程语言,包含2269个真实世界多轮代码审查任务。实验显示主流大模型在缺陷检测和生命周期状态跟踪方面能力有限,随着交互轮次增加性能显著下降。模型在不同缺陷类型和严重程度上表现差异大,语义复杂或低显著性缺陷更易被遗漏。
推荐理由:MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。