Microsoft 开发者博客· Waldek Mastykarz·· 17 天前精选AI 评分71
AI 编程智能体评测的沙箱边界决定测量是否有效
Your AI coding agent evaluation is only as good as its sandbox
AI 导读
Waldek Mastykarz 指出,AI 编程智能体即使答案正确,也可能通过环境检索而非模型内部知识完成评测。以 Vally 评测 GPT-5.6 Luna 对 Dev Proxy 版本行为的案例显示,禁用网络和单个命令仍可暴露本地安装、源码及 Git 历史。评测应先定义能力与信息边界,按工作区统一限制文件系统访问,并检查包含工具调用和失败尝试的完整轨迹。
推荐理由
文章以 Vally 评测 GPT-5.6 Luna 为例,说明仅禁用网络和单个工具仍可能通过本地安装、源码与 Git 历史获取答案。对设计 AI 编程智能体评测、隔离信息边界和审查完整轨迹具有直接方法价值。
来源:Microsoft 开发者博客 · devblogs.microsoft.com