AI 基礎與工具

[AI 使用說明 #2] AI 為什麼會說出煞有其事的謊言?辨別與應對幻覺的方法

我請 AI 調查資料,它給了我一份連論文標題和作者都列出的漂亮清單,但搜尋後才發現,那些論文根本不存在。如果你曾經使用過 AI,應該至少有過一次類似經驗。

閱讀 4 分鐘
[AI 使用說明 #2] AI 為什麼會說出煞有其事的謊言?辨別與應對幻覺的方法 封面圖

我請 AI 調查資料,它給了我一份連論文標題和作者都列出的漂亮清單,但搜尋後才發現,那些論文根本不存在。如果你曾經使用過 AI,應該至少有過一次類似經驗。這種 AI 把非事實內容生成得像事實一樣的現象,稱為幻覺(Hallucination)。本篇將整理幻覺為何產生、哪些回答值得懷疑,以及如何降低幻覺。

幻覺不是錯誤,而是原理所產生的副作用

如第 1 篇所見,AI 不是尋找正確答案的機器,而是產生看似合理的下一個詞的機器。但合理性與事實性是不同的標準。

在「關於 OO 的代表性論文是」這句話後面,接上作者姓名和看似合理的論文標題很自然。AI 會忠實遵循這種自然性。如果論文確實存在,那當然最好;但若訓練資料中沒有正確資訊,或資訊模糊,就會產生格式完美的虛假內容。AI 學過無數種論文引用格式,因此格式像真的,只有內容是假的。

更棘手的是它的態度。人們談論不知道的事時,會用「可能是」「我不太確定」來保留餘地;但 AI 即使在編造內容,也會用充滿自信的句子表達。由於語氣的自信與內容的正確性彼此獨立,無法只靠語氣篩出幻覺。

降低幻覺的努力仍在持續,也越來越強調訓練模型在不知道時回答不知道。不過,很難說「只要是最新模型就一定比較不容易出錯」。開發商公開的評估中,也有新模型在人物與事實問題上反而比舊模型更常編造內容的案例。比模型世代更可靠的降低幻覺方法,是附上後文會介紹的佐證資料。無論如何,「現在的 AI 不會出錯」是最危險的假設。

AI 幻覺產生路徑圖:訓練資料不足時,以格式模式填補空白並產生虛假回答
訓練資料模糊時,AI 會用格式模式填補空白。語氣則總是信心滿滿。

應該懷疑的 4 種回答

不可能活在懷疑所有回答的日子裡,因此了解容易產生幻覺的地方很實用。

**1. 具體的專有名詞與數字。**論文標題、書籍頁碼、法律條文編號、統計數值、判例名稱。格式看似合理,但是否真實存在是另一回事。尤其當你要求「告訴我來源」時,產生的來源正是最常被編造的項目。

2. 最新資訊。 受到第 1 篇提到的知識截止時間影響,未經網路搜尋回答的最新議題可能已過時或是編造的。價格、行程、人事資訊等經常變動的資料就是代表例子。

**3. 狹窄且冷門的主題。**訓練資料豐富的主題(知名歷史、廣泛使用的技術)通常比較準確;資料越少的主題(地區資訊、公司內部用語、無名人物),就越容易用想像填補空白。

**4. 被引導的前提。**如果問題包含錯誤前提,例如「告訴我世宗大王丟擲智慧型手機的事件」,AI 可能不糾正前提,反而配合前提編造故事。問題越是充滿自信,AI 也越會順著回答。現在的模型遇到這類知名例子通常會糾正,但在較不熟悉的主題上仍可能順著錯誤前提回答。

應對方法:降低驗證成本

應對幻覺的基本策略不是「不相信 AI」,而是只挑選出錯時影響很大的資訊進行驗證

**第一,開啟網路搜尋後再提問。**現在的 AI 服務都有網路搜尋模式。讓 AI 根據搜尋結果回答,可以大幅降低幻覺。更重要的是,你可以點擊來源連結,確認它是否真的導向存在的頁面。不過,連結打得開並不代表結束,還要確認該頁面是否真的寫了那些內容。因為連結可能是真的,但摘要可能是錯的。

**第二,直接提供佐證資料。**例如要 AI 摘要合約,就附上合約檔案。讓 AI 根據你提供的資料,而不是自己的記憶回答,是降低幻覺最可靠的方法。這個方法會在第 4 篇詳細介紹。

**第三,試著動搖它的自信。**如果是重要回答,可以追問:「真的嗎?如果不確定,就說你不知道。」如果是幻覺,AI 有時會進行更正。但這個方法也不完美,AI 也可能把正確答案更正成錯誤答案。終究只是輔助手段。

**第四,依用途調整驗證強度。**如果是點子腦力激盪或撰寫草稿,即使有幻覺,影響也不大。相反地,在合約、醫療、法律、投資等出錯會造成損失的領域,AI 回答只能當作起點,務必向原文與專家確認。

AI 回答驗證流程圖:判斷是否為重要資訊後,進行網路搜尋與原文確認
不可能驗證所有回答,因此只挑選出錯時會造成嚴重影響的資訊確認。

總結

  • 幻覺不是故障,而是「生成看似合理的句子」這項原理的副作用。
  • 充滿自信的語氣不是正確性的證據。
  • 對專有名詞、數字、來源、最新資訊與冷門主題尤其要保持懷疑。
  • 透過網路搜尋與附加資料補上依據,並只挑選重要資訊進行驗證。

幻覺故事的結論不是「所以不要使用 AI」。了解幻覺的特性後,就能看出哪些事情可以放心交給 AI。接著,在這條界線內提升成果品質的關鍵,就是提問的方法,也就是提示詞。下一篇將介紹讓同一個問題得到不同回答的 4 個提示詞基本功。

延伸閱讀