Hugging Face Blog·· 1 天前精选AI 评分77
ThinkingBox 评测 AI 智能体留下的终态与重复可靠性
The Agent Said It Was Done. The Database Disagreed.
AI 导读
Microsoft 与 Hugging Face 通过 ThinkingBox 评测 AI 智能体留下的后端终态与副作用,而非仅检查回复和工具调用。基准覆盖507个有状态业务流程,每项针对不同 LLM 模型独立运行20次;约79.9%的失败被归为工具处理问题。
推荐理由
以数据库终态和可执行断言替代工具调用表象,并结合20次重复测试、失败分类与成本指标,可用于智能体选型及评测设计。
来源:Hugging Face Blog · huggingface.co