GitHub Blog· Michelle Zhou·· 2 小时前精选AI 评分73
GitHub 发布用于评估 AI 代码审查代理的开放基准 ReviewBench
ReviewBench: An open benchmark for AI code review
AI 导读
GitHub 发布 ReviewBench 开放基准研究预览,用于评估 AI 代码审查代理,语料包含来自 187 个开源许可仓库的 219 个公开拉取请求,覆盖 19 种语言。该基准提供 grounded 与 augmented 两类指标,支持按严重性、类别和精确率—召回率偏好分析;GitHub 称其用于 Copilot code review 时,离线变化方向与后续生产实验一致。
推荐理由
提供公开数据集、评测指标、评审模型和提交流程,便于团队复现实验并按严重性、类别及精确率—召回率偏好比较代码审查代理。
来源:GitHub Blog · github.blog