跳到正文
原文
GitHub Blog· Michelle Zhou·· 2 小时前精选AI 评分73

GitHub 发布用于评估 AI 代码审查代理的开放基准 ReviewBench

ReviewBench: An open benchmark for AI code review

AI 导读

GitHub 发布 ReviewBench 开放基准研究预览,用于评估 AI 代码审查代理,语料包含来自 187 个开源许可仓库的 219 个公开拉取请求,覆盖 19 种语言。该基准提供 grounded 与 augmented 两类指标,支持按严重性、类别和精确率—召回率偏好分析;GitHub 称其用于 Copilot code review 时,离线变化方向与后续生产实验一致。

推荐理由

提供公开数据集、评测指标、评审模型和提交流程,便于团队复现实验并按严重性、类别及精确率—召回率偏好比较代码审查代理。

来源:GitHub Blog · github.blog