輕鬆的 AI 新聞 EASY · AI · NEWS
AI 的真相
2026.09.14 · 週一 約 4 分鐘 長文

這篇是我跟 AI 一起寫的,怎麼寫的見 關於

ChatGPT一直回答錯,問題通常出在哪裡?

ChatGPT常常一臉肯定地給錯答案,通常不是你運氣差。這篇講清楚三個最常見的原因:訓練時的打分方式、知識停在某個時間點、還有你問的方式,並附上幾個自己就能做的查證步驟。

本文目錄
  1. 為什麼它寧可亂猜,也不說不知道?
  2. 它是不是不知道最近發生的事?
  3. 問題會不會出在我問的方式?
  4. 答案講得很有自信,要怎麼查證?
  5. 如果只記得三件事

答錯的時候,通常是方式造成的,它從一開始就被練成寧可亂猜,也不肯承認自己不知道。Nature期刊今年四月刊出一篇研究,作者是OpenAI的Kalai、Nachum跟喬治亞理工的Vempala,裡面舉了一個例子:如果某些人的生日在訓練資料裡只出現過一次,模型光靠這種資料量,至少會在20%的類似問題上編出一個錯的答案,而不是老實說不知道。

這不是某一版比較笨造成的問題,換新款也很難根治。這篇要講清楚三個最常見的原因:訓練時的打分方式、知識本來就停在某個時間點、還有你問的方式夠不夠清楚。講完原因,再給幾個自己就能做的查證方法,下次它答得特別順的時候,你也看得出該不該多查一次。

為什麼它寧可亂猜,也不說不知道?

因為訓練時的打分方式,把猜對算加分,猜錯跟空白都算零分,於是猜一個答案永遠比交白卷划算。研究把這件事比喻成學生考試遇到不會的題:蒙一個答案,蒙對了加分,蒙錯了跟空白交卷同樣是零分。既然結果一樣,理性的做法自然是每題都蒙,蒙對的次數總會比乖乖空白多。

AI訓練評分的方式,長期以來也是照這個邏輯設計,它學到的就是同一套策略:給一個聽起來合理的答案,比承認沒把握划算得多。整套評分制度的骨架長這樣,換一款新的模型,照樣會遇到同一個毛病。

對你來說,這代表越冷門、細節越小的問題,它出包的機率越高。常見的知識在訓練資料裡重複出現過太多次,猜都猜得到;反倒是只出現過一兩次的細節,最容易被它編一個聽起來合理的版本出來。

那如果它根本沒學過那件事,又會是什麼狀況?

AI不確定時的兩條路:照樣猜一個答案蒙對加分蒙錯不扣分,跟老實承認不知道現行評分通常也是零分,兩條路的分數一樣,理性選擇自然是每次都猜

它是不是不知道最近發生的事?

沒錯,它的知識確實停在某一個時間點,那之後發生的事,它本來就沒學過,除非你的問題觸發了它連網搜尋。每一款模型都是拿某個時間點之前收集到的資料訓練出來的,訓練跑完到真正上線給你用,中間通常還要再等好幾個月,等你打開它的時候,它腦子裡的世界已經比現在舊了一截。

碰到牽涉到最近價格、法規、時事的問題,最保險的做法是先確認自己有沒有打開連網搜尋(現在ChatGPT、Gemini這些主流工具都有這個選項),或者乾脆自己動手查一次,不要照單全收它憑舊資料給的答案。問它現在實施的規定、正在進行的計畫、還在賣的方案,得到的答案有時候還停在它訓練當時那個版本,跟你眼前看到的現況對不上。

知道時間點卡在哪只是第一層,另一個更常見的狀況,跟時間一點關係都沒有。

問題會不會出在我問的方式?

常常是。你給的背景越少,它就用越普遍的假設去回答,那個假設十次有八次不是你要的情境。同一句「這樣可以嗎」丟給它,它不知道你問的是報價單、程式碼還是行程安排,只能挑一個最常見的猜測去回答,答案聽起來通順,套到你真正的情境裡卻對不上。

你可能覺得,問法能差到哪去,同一句話問誰都應該給差不多的答案才對。差別出在它拿到多少線索:它沒有辦法讀你腦中的畫面,只看得到你打的那幾行字,你是誰、想要什麼結果、有什麼限制,講清楚跟不講,答案差很多。之前寫過的〈為什麼AI老是忘記你講過的話〉裡也提過類似的道理,給它多一點背景,答案會實用很多(見搞懂原理,用得更順手)。差別只在於,那次是因為它沒有記憶,這次是你一開始就沒把背景鋪好,解法卻是同一件事:先把該講的講清楚。

背景鋪好了,答案準了大半,但還有一件事沒解決:它講得再自信,也不代表它是對的。

問法差在哪:背景給得少時AI用最常見的假設回答、答案聽起來對卻用不上、要來回追問好幾輪;背景給得清楚時AI順著你的情況回答、答案改一兩句就能用、一次就講到重點

答案講得很有自信,要怎麼查證?

越是聽起來斬釘截鐵的句子,越值得你多看一眼,因為它的自信程度跟答案的正確程度,是兩件不相干的事。它不會因為沒把握就講得結結巴巴,語氣一樣流暢,錯的時候也一樣流暢。

有幾個做法你自己就能做。先直接問它「這句你有多確定、根據什麼」,逼它把沒把握的地方自己標出來,通常比你逐句去挑更快。把一個大問題拆成幾個能各自查證的小事實,比整段話一次信或一次不信容易抓漏洞。牽涉到金額、日期、法規這類會實際影響你決定的資訊,自己找一個獨立管道對一次,不要單靠它給的那個版本。純聊天閒聊不用每句都查,但只要答案會拿去做決定,多花一分鐘查證,比事後收拾划算。

一間店的營業時間、一種藥的劑量、一條法規的最新條文,這種資料量小、細節又具體的東西,正是它最容易編出一個聽起來合理版本的地方,跟前面提到的生日例子是同一個道理。

查證AI答案的做法:先問它有多確定,請AI自己標出沒把握或引用不到來源的地方;拆成小問題,把大問題拆成幾個能個別查證的小事實;換一個管道核對,金額日期法規類資訊自己找一個獨立來源對一次;問題越重要越要查,純聊天不用每句都查但牽涉到錢或健康的一定要

如果只記得三件事

  • 它答錯的原因通常是訓練時的打分方式獎勵猜、不獎勵承認不知道,越冷門的問題越容易被它編一個聽起來合理的答案。
  • 問題牽涉到最近發生的事,先確認自己有沒有打開連網搜尋,它腦子裡的知識本來就停在訓練當時那個時間點。
  • 給的背景越具體,答案越準;一句話講不清楚,多補兩句你是誰、想要什麼結果、有什麼限制。
  • 越是講得斬釘截鐵的地方,越值得自己動手查一次,尤其是牽涉到錢、健康、法規的事。

它講得順不代表它是對的,下次答得特別乾脆,先留一秒鐘查一下,通常就夠了。

拿去用:AI 名詞對照表 把常聽到但講不清楚的詞,一次查清楚