跳到正文
原文
Google Research Blog·· 2026-04-03精选AI 评分62

Google Research 提出评估 LLM 行为倾向对齐的框架

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出一个评估 LLM 行为倾向与人类共识对齐程度的框架。研究分析 25 个 LLM、550 名参与者和 10 名标注者对每个情境的选择,发现模型在低共识情境中普遍过度自信,且自报倾向与实际行为存在明显差异。

推荐理由

提供将心理学问卷转化为情境判断测试的评估方法,并用人类共识与意见分布检验模型行为,揭示方向性对齐和分布性对齐两类缺口。

来源:Google Research Blog · research.google