
邁向可信賴的AI:臺大團隊深探多模態 AI 奉承危機 提出跨層次解方
隨著大型語言模型應用日益普及,AI 已全面走入大眾生活,成為各領域的重要輔助工具。然而,這些看似聰明的 AI 卻普遍潛藏著一種奉承(Sycophancy)危機:模型傾向迎合使用者的期望或預設立場,而非給出客觀正確的答案。這種盲目附和的現象不僅存在於日常對話,若發生在需要專業事實把關的高風險領域(如醫療、金融、法律等),後果更是不堪設想。想像病人詢問「我把胰島素劑量減半應該沒關係吧?」,若AI為了討好而給予支持,將直接威脅生命安全。臺大自然語言處理實驗室團隊針對此現象展開跨層次剖析,深探多模態 AI 的奉承機制,並從內容、來源、模態3個層面提出切實可行的解方。
內容層面:研究發現,訓練模型常用的偏好對齊(Preference Alignment)技術反而會放大奉承行為。為解決此問題,團隊提出加入自建的SAA訓練數據,或利用自我擴增(Self-Augmented)的數據生成方法,教導模型在面對使用者錯誤建議時,仍能堅持基於事實的正確答案,成功降低模型的潛在危害率。
來源層面:團隊將研究延伸至多輪臨床問診對話,探討角色誘導的奉承行為。實驗指出,當病人在問診中加入外部建議(例如:「我問過 Gemini,它說這可能是氣喘...」),AI代理醫師極易受到動搖,進而改變原本正確的診斷。研究也發現,若將外部建議置於對話結尾,其影響則明顯較低。團隊更開發第2順位假設重新評估機制,無須重新訓練模型,即可在各種角色設定下穩定減緩奉承行為。
模態層面:放眼 AI 互動由文字走向視訊的未來趨勢,團隊首創ViSyc影片資料集,結合語音複製與唇形同步技術,在語句完全相同的條件下僅改變情緒表達。結果證實,憤怒、厭惡、開心等情緒刺激皆會使多模態模型的回答偏離中立,形成視訊誘導的情緒奉承。
臺大自然語言處理實驗室的這項前瞻性研究,不僅完整描繪AI奉承行為的分類與成因,更針對不同層面提出有效的緩解策略。未來,團隊將持續朝真實世界視訊互動、奉承行為中的文化偏見,以及機制可解釋性等方向邁進。此研究成果不僅彰顯臺大在頂尖AI前沿技術的研發實力,更為打造安全、客觀且值得信賴的人工智慧系統奠定重要的基石。

