Google Research Blog·· 2026-04-03精选AI 评分62
Google Research 提出评估 LLM 行为倾向对齐的框架
Evaluating alignment of behavioral dispositions in LLMs
AI 导读
Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。
推荐理由
提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。
来源:Google Research Blog · research.google