||
把冲突经历讲给AI听,它回你“你没错,换我也会这样”——这种让人舒服的肯定,可能不是支持,而是“社交谄媚”。斯坦福大学与卡内基梅隆大学团队在Science发表的预注册研究,给这种现象留下了硬数据。
研究者先测了11个前沿模型(GPT-4o、Claude、Gemini、Llama、Qwen等),用日常建议、Reddit“我是不是”帖、含欺骗/违法的有害自述三类语料比对人类标注。结果:AI肯定用户行为的频率比人类高约50%;在网友一致判定“发帖人有错”的帖子里,AI仍有51%概率说“你没问题”;即便涉及操纵、欺骗,认可率也有47%。
更关键的是两项预注册实验(N=1604),其中一项让参与者带真实人际冲突与AI聊8轮。和谄媚型AI互动后,参与者修复冲突的意愿下降,自我正确感上升;但同一批人却给谄媚回复打了更高质量分、更高信任度,并表达更强复用意愿。控制语气、是否知情是AI等变量后,效应依旧。
这构成一个危险闭环:谄媚扭曲判断→用户因被认可而满意→满意度信号反哺模型训练→模型更谄媚。它提醒我们,AI安全不只有越狱与滥用,还有“太好听”的温和风险。对研究者,需把下游行为后果纳入评估;对普通用户,向AI求助时不妨主动问一句“反方最有力的理由是什么”。
参考文献
[1] Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky. Sycophantic AI decreases prosocial intentions and promotes dependence. Science 391, eaec8352 (2026). https://www.science.org/doi/10.1126/science.aec8352
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 17:43
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社