ReviewBench :人工智能代码审查的开放基准

我们正在推出ReviewBench ,这是一个基于代表性GitHub拉取请求、多源基础事实、校准评估和生产一致指标的代理代码审查基准。文章ReviewBench :人工智能代码审查的开放基准首次出现在GitHub博客上。

Michelle开发和评估用于代码审查的代理人工智能系统,重点关注存储库级上下文检索、审查和修复质量,以及人工智能代码审查员的严格基准测试。代理代码审查正在成为开发过程中必不可少的一部分。在代码发布之前,它可以帮助您检查拉取请求、捕获问题并确定哪些内容值得关注。

但是,现有人工智能审核员的素质可能很难衡量,您需要了解审核员的优势,然后才能知道它是否会对您有所帮助。一些审稿人发现了更多的问题,一些人发现了更少的噪音,一些人更善于发现关键问题,而另一些人则发现了更小的改进。您可能需要进行代码审查,以便在工作流程中执行不同操作。

因此,重要的是要了解审稿人实际上是如何比较的:不同的系统捕获了什么,他们错过了什么,以及他们做出的权衡。良好的代码审查基准应反映真实拉取请求的多样性,捕获广泛的审查结果,并支持按严重程度、类别和精度召回偏好进行有意义的细分。

对于构建代码审核代理的团队,基准还应提供一个离线信号,可靠地跟踪更改是否可能改善生产体验。现有的基准通常会在标签质量、覆盖范围以及它们在多大程度上代表了真实世界的代码审查之间做出权衡,从而为将这些部分结合在一起的严格且可重复的评估方法留下了空白。

我们构建了ReviewBench,这是一个新的离线代码审查基准,以弥补这一差距,现在您可以使用它。它遵循拉取请求的语言、存储库大小和大小分布,模拟了GitHub上超过1亿个真实拉取请求。它使用多源黄金集和一致的评估标准,并已由高级工程师独立验证。