跳到正文
原文
Hugging Face Blog·· 1 天前精选AI 评分77

ThinkingBox 评测 AI 智能体留下的终态与重复可靠性

The Agent Said It Was Done. The Database Disagreed.

AI 导读

Microsoft 与 Hugging Face 通过 ThinkingBox 评测 AI 智能体留下的后端终态与副作用,而非仅检查回复和工具调用。基准覆盖507个有状态业务流程,每项针对不同 LLM 模型独立运行20次;约79.9%的失败被归为工具处理问题。

推荐理由

以数据库终态和可执行断言替代工具调用表象,并结合20次重复测试、失败分类与成本指标,可用于智能体选型及评测设计。

来源:Hugging Face Blog · huggingface.co