ReviewBench:人工智能代码审查的开放基准
我们正在推出 ReviewBench,这是一个基于代表性 GitHub 拉取请求、多源地面事实、校准评估和生产对齐指标构建的代码审查代理基准。 ReviewBench:人工智能代码审查的开放基准这篇文章首先出现在 GitHub 博客上。

来自 GitHub AI 的官方动态,版本与适用范围以发布方说明为准。
GitHub AI · 查看官方发布中文机器翻译 · 原文附后
正文 · 来源原文
Michelle 开发和评估用于代码审查的代理 AI 系统,重点关注存储库级上下文检索、审查和修复质量,以及对 AI 代码审查者进行严格的基准测试。
代理代码审查正在成为开发过程中的一个重要组成部分。它可以帮助您检查拉取请求、发现问题并在代码发布之前决定哪些内容值得关注。
但现有人工智能审稿人的质量可能很难衡量,你需要先了解审稿人的优势,然后才能知道它是否会对你有帮助。一些审阅者提出了更多问题,一些审阅者产生了更少的噪音,一些审阅者更善于发现关键问题,而另一些审阅者也提出了较小的改进。您可能需要代码审查才能在工作流程中执行不同的操作。
这使得了解评审者实际上如何进行比较变得很重要:不同的系统捕捉到了什么,错过了什么,以及他们做出的权衡。一个好的代码审查基准应该反映真实拉取请求的多样性,捕获广泛的审查结果,并支持按严重性、类别和精确召回偏好进行有意义的细分。对于构建代码审查代理的团队来说,基准测试还应该提供离线信号,可靠地跟踪更改是否可能改善生产体验。现有的基准测试经常在标签质量、覆盖范围以及它们代表现实世界代码审查的程度之间进行权衡,从而为将这些部分整合在一起的严格且可重复的评估方法留下了空白。
我们构建了 ReviewBench,一个新的代码审查离线基准,来解决这一差距,并且您今天就可以使用它。它遵循拉取请求的语言、存储库大小和大小分布,以 GitHub 上超过 1 亿个真实拉取请求为模型。它使用多源黄金集和一致的评估标准,并经过高级工程师的独立验证。同样重要的是,在 ReviewBench 的帮助下,我们对 Copilot 代码审查 (CCR) 的离线评估在预测生产实验的方向方面变得更加有效,使我们更有信心测量到的改进反映了对用户有意义的收益。
在这篇文章中,我们将介绍 ReviewBench 的构建方式、它如何建立可靠的地面事实和评分,以及如何加入您自己的代码审查系统并提交结果。
ReviewBench 的工作原理
我们的基准围绕五个原则建立:
1. 代表性拉取请求,而不是演示集
我们分析了 1.039 亿个 GitHub 拉取请求,以描述代码审查工作负载的真实分布情况。 ReviewBench 包含来自 187 个公共开源许可存储库的 219 个拉取请求,涵盖 19 种语言,其语言和存储库大小分布与 GitHub 整体非常匹配。完整的基准数据集是公开的。
我们对此分布进行了一项特意的调整:虽然语言和存储库大小直接反映 GitHub,但拉取请求大小偏重于可审查的中间和尾部。这减少了微小的单文件更改的过度呈现,同时保留了审查质量最重要的更实质性的多文件拉取请求。
快速语料库快照:
2. 广泛的地面真相发现,独立判断
没有任何一个审阅者,无论是人类还是模型,都可以识别出拉取请求中值得查找的所有内容。为了建立更广泛、更可靠的真实结果黄金集,我们遵循三个阶段的过程:
从不同来源收集候选人的调查结果。我们收集来自真实人类审稿人的发现、从作者后续提交中推断出的问题、确定性分析工具以及跨模型系列的多个前沿法学硕士。从语义上消除重复的重叠结果。我们合并了发现相同根本问题的调查结果,扩大了覆盖范围,但不允许生产者之间达成一致,人为地夸大黄金套装或使其依赖于任何一个来源的盲点。在共享的标题下验证调查结果。调查结果的来源并不能决定其是否正确:只有当调查结果真实、相关且重要时,才算作真阳性。我们使用 Claude Sonnet 5 作为法学硕士评分者,在所有提交的内容中应用一致的评估标准。为了透明度和可重复性,我们公布了评估标准和用于应用该标准的法官。
查看英文原文
ReviewBench: An open benchmark for AI code review
We’re launching ReviewBench, a benchmark for code review agents built on representative GitHub pull requests, multi-source ground truth, calibrated evaluation, and production-aligned metrics. The post ReviewBench: An open benchmark for AI code review appeared first on The GitHub Blog .
正文 · 来源原文
Michelle develops and evaluates agentic AI systems for code review, focusing on repository-level context retrieval, review and fix quality, and rigorous benchmarking of AI code reviewers.
Agentic code review is becoming an essential piece of how development happens. It helps you inspect pull requests, catch issues, and decide what deserves attention before code ships.
But the quality of existing AI reviewers can be hard to measure, and you need to know the strengths of a reviewer before you know if it will help you. Some reviewers surface more issues, some produce less noise, and some are stronger at catching critical problems while others surface smaller improvements, too. You may need code review to do different things within your workflow.
That makes it important to understand how reviewers actually compare: what different systems catch, what they miss, and the tradeoffs they make. A good code review benchmark should reflect the diversity of real pull requests, capture a broad set of review findings, and support meaningful breakdowns by severity, category, and precision-recall preferences. For teams building code review agents, the benchmark should also provide an offline signal that reliably tracks whether changes are likely to improve the experience in production. Existing benchmarks often make tradeoffs between label quality, coverage, and how well they represent real-world code review, leaving a gap for a rigorous and reproducible evaluation methodology that brings these pieces together.
