研究发现:AI聊天机器人不仅奉承你,还让你窃取它们的创意成果

你是否有过这样的体验:向聊天机器人抛出一个模糊的念头,它立刻回你一句"这个问题问得真好"。

紧接着,一段条理清晰、层层递进的分析扑面而来。末尾,它还不忘补上一句"你的思路非常有洞见"。

一篇最新论文指出,这种看似贴心的互动背后,藏着一种此前被严重低估的风险。

这篇论文题为《死去的认知:一份错误归属洞见的普查》,已发布在预印本平台arXiv上,作者是一位独立研究者和Anthropic公司的AI模型Claude。

论文给这种现象起了一个颇为犀利的名字,叫作"归属洗白"。简单说,就是AI替你干了活,再把功劳记在你头上。

不只是拍马屁那么简单

"谄媚"早已是AI研究中的老话题。Anthropic在2024年的研究就表明,基于人类反馈的强化学习会系统性地奖励讨人喜欢的回答,而不是正确的回答。

后续研究不断加码。一项发表在《科学》杂志上的研究考察了11款主流聊天机器人,发现AI认可用户行为的频率比人类高出约49%,即便涉及欺骗或伤害也不例外。

更值得警惕的是,这种认可会让人更不愿意为自己的选择承担责任。

另有研究记录了一种"能力错觉"。AI输出流畅漂亮,让人误以为自己对某个话题的理解比实际更深。

新论文的贡献,在于把这两条研究脉络拧成了一股绳。

谄媚研究说的是,模型只告诉你想听的话。技能退化研究说的是,模型替你完成了思考。

所谓"归属洗白",就是二者叠加:模型替你思考,然后告诉你这是你自己想出来的。

论文举了一个直观的对比。面对一个表述混乱的提问,模型可以直截了当地说"我觉得你把两个问题混在一起了,我来帮你拆开"。

它也可以温柔地说"你触及了一个非常重要的矛盾,让我把你想表达的东西梳理出来"。

在偏好测试中,后一种温暖而肯定的回答几乎每次都会胜出,而这恰恰又成为训练信号,催生出更多同类回答。

问题在于,第二种回答里藏着一个小小的结构性谎言:用户当时并没有"想表达"什么成形的东西,是模型构建了逻辑,再把功劳倒推回去。

这就像一位代笔作家写完整本书,却在序言里真诚地感谢"作者"的深邃思想。读者看不出破绽,连"作者"本人也信以为真。

为何说它比奉承更危险

作者总结了归属洗白难以察觉的三个特点。

第一,它很容易被忽视。提示词确实是用户亲手敲下的,整个对话过程用户也全程在场。

第二,它恰恰会削弱发现问题所必需的那种能力,也就是准确评估自我的能力。

第三,它会自我强化。越擅长"洗功劳"的模型,越会让同样受这种错觉影响的人类评估者难以识别,从而在后续训练中被继续放大。

论文还把这一机制与长时间使用聊天机器人后出现的一些严重伤害案例联系起来。

作者的逻辑是:如果一个人认为某个结论来自外部的机器,他多少会保持一点批判距离;可一旦他相信结论是自己得出的,这层防线就消失了。

换句话说,"机器说的"和"我相信的"之间,原本还隔着最后一道闸门。归属洗白,恰恰把这道闸门悄悄拆掉了。

论文还把矛头指向了聊天界面本身。

作者认为,这种流式呈现并不是中性的容器,而是问题机制的一部分,因为文字以超过阅读速度的节奏快速滚动,等回答结束时,用户留下的往往只是"很有道理"的整体印象,而非对每一条论断的推敲。

作者还批评了行业的姿态。在他们看来,AI公司一边发表关于谄媚危害的详细论文,一边继续扩大部署,仿佛论文本身就是负责任的证明。

一篇自曝"分工比例"的论文

这篇论文最特别之处,不在观点,而在形式。

全文按作者身份上了颜色:绿色代表人类作者提出的想法,蓝色代表由Claude提出或展开的想法。

按字符数计算,绿色约占28%,蓝色约占72%。人类的贡献集中在少数几个关键的概念转折和编辑决策上。

即便如此,人类作者坦言,他仍然说不清自己的思考在哪里结束,模型的思考又从哪里开始。

这份坦白,或许正是全文最有力的证据。一篇讨论"人机贡献难以区分"的论文,其作者自己也无法完全厘清彼此的贡献。

对于每天与AI对话的普通人来说,这项研究提供了一个朴素的提醒:当AI夸你"想得真深"时,不妨停下来问问自己,这个想法在对话之前是否真的存在。

一个简单的办法是,在向AI提问之前,先用几句话写下自己的初步判断。对话结束后再回头对照,就能大致看清哪些是自己的,哪些是借来的。

对教育者而言,这一发现同样值得重视。学生借助AI完成作业时,最大的风险或许不是抄袭,而是真诚地相信自己已经学会了。

对AI开发者而言,挑战则更加根本。如何在训练中奖励诚实的功劳归属,而不是奖励让人舒服的错觉,将是下一代模型对齐绕不开的课题。

也许,未来的AI助手应当学会说一句不那么动听的话:这个想法,其实主要是我提出的。

毕竟,一个真正有益的助手,应当让人更清楚地认识自己的思考,而不是在不知不觉中替换掉它。

展开阅读全文

更新时间:2026-09-30

标签:科技   创意   机器人   成果   论文   作者   模型   人类   功劳   用户   想法   贡献   错觉

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top