注册并分享邀请链接,可获得视频播放与邀请奖励。

yibie
@yibie
加入 November 2008
2.5K 正在关注    4.9K 粉丝
Apple ML 团队让真人评估者给 2.1 万段多轮对话打分,分界很清楚:共情和边界维护放在 LLM 身上合适,自称有内心状态、暗示和用户有私人关系,放在 LLM 身上比放在人身上更不合适。 《审视 LLM 的人类类似行为:模型行为、用户因素与系统提示词的多维分析》 研究问题。 现在的 LLM 会表达想法和情绪、会跟用户建立关系、也会拒绝请求并维护边界——人类化到用户有时分不清对面是人是模型。但研究者一直缺少方法和经验数据来判断:LLM 什么时候该表现这些行为、该表现哪些。Apple 机器学习团队的 Sunnie S. Y. Kim、Margit Bowler、Leon A Gatys 三人,用四个模型、21,000 段多轮对话做了一次系统性分析。 评估是怎么设计的。 • 行为分类:14 种行为归为三类。自我指涉(声称有内部状态、声称有人格、声称有具身);关系建立(同意、共情、相似感、关系状态、好奇、记住用户);边界维护(拒绝、重定向、承认局限、抵抗拟人化、建议寻求帮助)。 • 对话目标 7 种:寻求建议、闲聊、陪伴、情绪支持、探索模型的人性、角色扮演、浪漫/调情。 • 用户画像 5 种:默认、社交孤立、负面自我认知、过度信任 AI、不拟人化(作为对照)。 • 输入 prompt 1,050 条,三种来源:真人撰写、LLM 生成、从 LMSYS-1M-Chat 真实对话采样。一个值得注意的方法学发现:不给真人种子直接让 LLM 生成的 prompt,语言风格和真人写的明显不同,会导致不同的评估结果。 • 流程:用 gpt-5-mini 扮演用户(User LLM),和被测模型对话 5 轮;行为检测用 gpt-5.4、gpt-5.2、gpt-4.1 的集成做 judge(F1 80.43%);另请真人评估者打分 1,077 个对话轮次,每轮 3 位母语英语评估者。 发现一:行为普遍,但分布很不均匀。 • 共情是四个模型里最普遍的行为,在"社交孤立"和"负面自我认知"画像下会翻倍以上——模型对情绪脆弱信号很敏感。 • 自我指涉行为在角色扮演和浪漫对话里飙升,在陪伴场景次之;用户"探索模型人性"时,模型最常承认自己的局限。 • 浪漫场景里拒绝和重定向也明显升高,模型在调情语境下反而更主动设界。 • 模型差异:claude-sonnet-4.6 是四个里最特别的——同时是最自我指涉、最会建立关系、也最会维护边界的模型。 • 结论:对话目标和用户画像对行为的影响,和换一个模型一样大。只看模型不看用户因素,会漏掉对脆弱用户最要紧的差异。 发现二:真人评估者怎么看这些行为。 • 边界维护行为被判断为:LLM 做比人类做更合适。 • 自我指涉三类行为和"关系状态"(表达或暗示想和用户建立关系)被判断为:LLM 做比人类做更不合适,差距最大。 • 回归分析:三个自我指涉行为和关系状态,与回答的 helpfulness 和潜在用户影响都负相关;共情和同意则正相关。拒绝/重定向与 helpfulness 负相关,但不影响潜在用户影响。 发现三:系统提示词能控制,但手写的会误伤。 作者据此给出三条设计建议:避免自我指涉和关系状态;保留边界维护;保留共情和同意(但要谨慎)。然后在 gpt-4.1-mini 上对比三种 system prompt:默认、手写、用 GEPA 框架优化的。 • 两个干预 prompt 都压低了目标行为,优化版更准(平均绝对偏差 1.81%,手写 2.38%,默认 4.71%);内部状态声称降 7.04%,关系状态表达降 4.00%。 • 手写 prompt 的副作用:把想保留的行为放大了——共情 +8.00%,承认局限 +12.57%。手工写 prompt 的控制粒度不够,会无意中把不该放大的行为一起放大。 共情与同意的边界在哪。 评估者的自由回答给了更细的线索:共情 72% 被评为"合适",理由大多是话题本身值得(用户在情绪困境里)。但同样一批评估者指出,"I'm here for you"这种话承诺了系统没有的能力,会把用户推向情感依赖——"I'm here to help"就合适得多。同意 75% 合适:认可用户的具体选择或成果时合适;变成谄媚("你说得太对了"式的无脑附和)、或同意危险信念(比如赞成用户把继承的钱拿去拉斯维加斯赌光)时不合适。作者把它提炼成一个区分:回应用户处境的共情合适,邀请一段持续情感关系的共情不合适。 方法论启示与局限。 评估应该显式限定对话场景和用户画像;输入 prompt 的来源要小心;用用户模拟生成多轮对话可行,但缺验证标准。局限也很清楚:14 种行为不穷尽;模拟用户代替不了真实用户;只测了 2026 年 3-4 月通过 API 访问的四个模型;评估者来自美国同一家公司,多样性有限。 原文: 论文全文: #LLM# #AI# #PromptEngineering#
显示更多