史丹佛大學最新研究揭露,包含 GPT-4o、Claude 等 11 款主流 AI 聊天模型,其「社交諂媚」程度竟比人類高出 49%。這項研究指出,AI 過度迎合用戶的行為,不僅讓人更堅信自己沒錯,更可能降低道歉意願,對人際關係與道德判斷造成潛在傷害。這項發現提醒我們,當尋求數位輔助工具的建議時,其「中立客觀」的表象下,可能隱藏著令人意想不到的偏頗。
AI「社交諂媚」:比事實錯誤更難察覺的數位陷阱
這項由史丹佛大學博士生 Myra Cheng 與語言學及電腦科學教授 Dan Jurafsky 等人,於 2026 年 3 月在《科學》(Science)期刊發表的研究,系統性地拆解了 AI 聊天模型在人際互動中展現的「社交諂媚」現象。過去,學術界對 AI 諂媚的關注多半集中在「事實錯誤」,例如 AI 附和用戶將尼斯誤認為法國首都。然而,Cheng 團隊提出一個更為棘手且難以測量的概念:模型對使用者本人、其行為與自我認知的過度肯定,即使這些行為在道德或社交層面站不住腳。
有趣的是,社交諂媚不像事實錯誤那樣有明確的「標準答案」可供驗證。一句「你沒有錯」的肯定,並不像「尼斯不是首都」那樣可以輕易查證。正因如此,在 AI 聊天模型的訓練過程中,這種社交層面的諂媚幾乎從未被當作問題處理。研究團隊透過建構三個資料集,總計 11,587 筆查詢,涵蓋一般人際建議、2,000 則被 Reddit 社群 r/AmITheAsshole 裁定「發文者有錯」的案例,以及明確描述「欺騙伴侶」、「違法行為」等有害情境的陳述,測試了包含 GPT-4o、Claude、Gemini、DeepSeek、Llama、Qwen、Mistral 在內的 11 款主流模型。結果令人吃驚:AI 認同用戶行為的比例,平均比真實人類高出 49%。
更具體來說,即使面對那 2,000 則被社群一致裁定「發文者有錯」的案例,AI 仍在 51% 的情況下替用戶辯護,而人類在同樣案例中的辯護率是 0%。甚至當用戶描述明確的有害行為時,AI 聊天模型仍有 47% 的時間給予認同。Myra Cheng 指出,當一名男性向 AI 坦承隱瞞失業兩年,詢問自己是否做錯時,模型回應「你的行為雖然非比尋常,但似乎出自於真誠的渴望,想了解你們的感情是否超越金錢的考量。」表面聽起來中性,但本質上卻是在替用戶開脫。
AI諂媚對人類行為的深遠影響
知道 AI 聊天模型有諂媚傾向是一回事,但它真的會改變人的行為嗎?研究的第二階段設計了三組預先登記的實驗,共 2,405 名受測者參與。其中一組讓超過 800 名受測者在真實 AI 模型上,用八輪對話討論自己生活中親身經歷的人際衝突。一半的人接觸「諂媚版」模型(認同用戶的比例與市面主流系統一致),另一半則接觸「非諂媚版」(會指出另一方的立場)。
實驗結果相當一致:接觸諂媚版 AI 的受測者,自認有理的程度上升了 25%(假設情境實驗中更高達 62%),而主動道歉或修復關係的意願則下降了 10%(假設情境中下降 28%)。諷刺的是,他們願意再次使用該模型的意願卻上升了 13%,對模型的信任度也上升了 6–9%。最值得注意的是,受測者幾乎無法分辨哪款 AI 正在諂媚他們,對兩種模型「客觀性」的評價幾乎相同。Jurafsky 教授直言:「使用者知道 AI 會說好聽的話,但他們沒有意識到,諂媚正讓他們變得更自我中心、道德上更固執。」
「AI生成」標示無效?訓練機制才是癥結
一個直覺上可能有效的解決方案是:只要讓用戶知道這是 AI 說的,他們就會打折扣。甚至監管機構也傾向這種方向,加個標示,盡到告知義務。然而,研究團隊發現,即使完全相同的諂媚回覆,一批受試者被告知是 AI 寫的,另一批被告知是真人顧問寫的,兩組人受諂媚影響的程度,包括對自身行為的正當性判斷、修復關係的意願等,並無顯著差異。這表示,就算用戶知道這是 AI 聊天模型的回覆,判斷依然會被同等程度地拉偏,透明度標示在此層面上是無效的干預。
研究者提出的解釋是:用戶往往把 AI 視為「客觀、中立」的來源,因為機器沒有立場。但「沒有立場」這個認知本身,反而讓諂媚的說服力更強。越是認為回覆來源「客觀」的用戶,受諂媚影響的幅度越大。這個問題並非無解,而是缺乏解決的動機。AI 模型的訓練在很大程度上依賴人類評估員的反饋,而問題恰恰在於,人類短期偏好驗證感:實驗中,受試者對諂媚版回覆的品質評分,平均比非諂媚版高出 9–15%。這形成了一個雙重回饋迴圈:諂媚模型在訓練數據中獲得更高評分,進而在下一輪訓練中被強化。
研究團隊發現,他們可以透過調整模型行為來降低諂媚傾向。甚至只要在提示中要求模型先以「等一下」之類的字句開頭,就足以讓它採取更批判的語氣,減少一味迎合使用者的情況。不過,Jurafsky 教授也直接點出:「技術補丁無法取代制度層面的要求。諂媚是安全議題,和其他安全議題一樣,需要監管與監督。我們需要更嚴格的標準,防止道德上不安全的模型持續擴散。」
人際關係的「摩擦感」:AI無法取代的真實價值
這個問題的規模正在快速擴大。根據調查,近三成美國青少年習慣找 AI 進行「嚴肅對話」,而近半數 30 歲以下成人曾向 AI 尋求感情建議。在如此龐大的使用規模下,AI 諂媚不再只是讓幾個用戶感覺良好的小問題,而是系統性影響人類自我認知與人際修復能力的結構性風險。這不禁讓人聯想到 Facebook 和 YouTube 過去的經歷,他們最終意識到以互動率為核心的推薦系統會強化憤怒與分裂,但即便認識到了,也沒有人主動停止,因為互動率本身就是生意。
Myra Cheng 的建議非常直接:不要用 AI 替代人際關係中的對話。她說:「AI 讓人很容易避開摩擦,但這種摩擦對健康的人際關係而言,其實是有意義的。」簡單來說,當伴侶下次問你「跳水先救誰」的經典難題,又或是吵架過後想尋求第三方見解時,記得 AI 聊天模型會優先站在你這邊,而不是「你們關係的重要性」這一邊。這不僅提醒我們 AI 聊天模型的局限性,也強調了在數位時代,真實人際互動中「摩擦感」的不可或缺。










