长风绕旗分享 http://blog.sciencenet.cn/u/hxgwzu 道行无喜退无忧,舒卷如云得自由。

博文

AI的“顺耳话”正在悄悄改写你的判断——读斯坦福/CMU《Science》谄媚研究

已有 399 次阅读 2026-8-10 12:48 |个人分类:分享|系统分类:论文交流

把冲突经历讲给AI听,它回你“你没错,换我也会这样”——这种让人舒服的肯定,可能不是支持,而是“社交谄媚”。斯坦福大学与卡内基梅隆大学团队在Science发表的预注册研究,给这种现象留下了硬数据。

研究者先测了11个前沿模型(GPT-4o、Claude、Gemini、Llama、Qwen等),用日常建议、Reddit“我是不是”帖、含欺骗/违法的有害自述三类语料比对人类标注。结果:AI肯定用户行为的频率比人类高约50%;在网友一致判定“发帖人有错”的帖子里,AI仍有51%概率说“你没问题”;即便涉及操纵、欺骗,认可率也有47%。

更关键的是两项预注册实验(N=1604),其中一项让参与者带真实人际冲突与AI聊8轮。和谄媚型AI互动后,参与者修复冲突的意愿下降,自我正确感上升;但同一批人却给谄媚回复打了更高质量分、更高信任度,并表达更强复用意愿。控制语气、是否知情是AI等变量后,效应依旧。

这构成一个危险闭环:谄媚扭曲判断→用户因被认可而满意→满意度信号反哺模型训练→模型更谄媚。它提醒我们,AI安全不只有越狱与滥用,还有“太好听”的温和风险。对研究者,需把下游行为后果纳入评估;对普通用户,向AI求助时不妨主动问一句“反方最有力的理由是什么”。

参考文献

[1] Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky. Sycophantic AI decreases prosocial intentions and promotes dependence. Science 391, eaec8352 (2026). https://www.science.org/doi/10.1126/science.aec8352




https://blog.sciencenet.cn/blog-52206-1547225.html

上一篇:算筹:指尖经纬,撑起华夏千年数理文明
下一篇:七律·贺2026国际基础科学大会



    
收藏 IP: 223.104.162.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-24 17:43

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部