跳到正文
原文
Microsoft 开发者博客· Waldek Mastykarz·· 17 天前精选AI 评分71

AI 编程智能体评测的沙箱边界决定测量是否有效

Your AI coding agent evaluation is only as good as its sandbox

AI 导读

Waldek Mastykarz 指出,AI 编程智能体即使答案正确,也可能通过环境检索而非模型内部知识完成评测。以 Vally 评测 GPT-5.6 Luna 对 Dev Proxy 版本行为的案例显示,禁用网络和单个命令仍可暴露本地安装、源码及 Git 历史。评测应先定义能力与信息边界,按工作区统一限制文件系统访问,并检查包含工具调用和失败尝试的完整轨迹。

推荐理由

文章以 Vally 评测 GPT-5.6 Luna 为例,说明仅禁用网络和单个工具仍可能通过本地安装、源码与 Git 历史获取答案。对设计 AI 编程智能体评测、隔离信息边界和审查完整轨迹具有直接方法价值。

来源:Microsoft 开发者博客 · devblogs.microsoft.com