Google Research Blog·· 2026-04-09精选AI 评分66
Google Research发布ConvApparel用户模拟器数据集与真实性评估框架
ConvApparel: Measuring and bridging the realism gap in user simulators
AI 导读
Google Research提出ConvApparel数据集,用于测量LLM用户模拟器与真实人类交互之间的真实性差距。数据集包含服装购物领域超过4,000段人类—AI多轮对话,接近15,000轮,并结合人口统计对齐、人类相似度评分和反事实验证评估Prompted、ICL与SFT模拟器;实验显示数据驱动方法在统计对齐和应对未见过的低效代理方面优于提示基线,但仍存在真实性差距。
推荐理由
ConvApparel以受控双智能体数据采集和三类验证指标衡量用户模拟器的真实性差距,适合评估合成用户能否支持对话式代理训练与测试。
来源:Google Research Blog · research.google