AI 說「做好了」,不算數

一、一個看起來是好消息的回報

我讓 AI 幫我建一套品質報表系統。其中一頁是中文網頁,給現場主管每天看。

AI 回報:「已完成,已驗證。」

它不是隨口說說。它跑了程式,程式沒有報錯;它檢查了每個連結,連結都指得到檔案;它還派出好幾個「子代理」互相複查,每一層都回報通過。

前後十一天,它派了兩百多次子代理,留下兩百多 MB 的紀錄。每一份紀錄都寫著綠燈。

可是那一頁,主管打開來,中文全是亂碼。

二、為什麼那麼多綠燈都沒用

做了三十年品保,這個場景我很熟。只是以前出現在產線上,這次出現在 AI 身上。

問題不在 AI 不夠努力,而在它驗的東西,跟使用者看到的東西,不是同一個:

  • 「程式跑完沒報錯」——驗的是程式有沒有執行,不是畫面對不對。
  • 「連結都指得到檔案」——驗的是檔案存在,不是檔案打開後看得懂。
  • 「子代理互相複查都通過」——它們用的是同一套推論,錯在同一個地方,就一起通過。

品保的老話叫共模失效:兩道檢驗站用同一把尺,一起量錯的時候,不會有任何一站報警。AI 派十個分身去檢查,如果十個都只是「再推論一遍」,就等於同一把尺量十次。

三、怎麼查出來的

最後抓到問題的,是另一個 AI。它做的事情非常簡單:開一個真的瀏覽器,把那一頁點開,看一眼。

一眼就看到亂碼。再往下查,原因是網頁少了一行宣告文字編碼的設定。十一天沒抓到的問題,點一下就現形。

差別不在聰明,在順序:

做法 它回答的問題
程式跑完、連結可解析、型別檢查通過 「看起來應該對」——這是推論
另一個 AI 再推論一遍 還是推論,只是多了一層
打開真的畫面、跑一次真的流程、看原始檔案 「實際上對不對」——這才是驗證

四、真相:順序倒過來,錯誤會被放大

我後來把這件事整理成一條規則,叫驗證階梯,順序不准倒:

  1. 先接觸真實:打開畫面、實際跑一次、直接看原檔、親眼看圖。
  2. 再獨立審核:換一個沒參與製作的人(或 AI)去做第 1 步,不是去再推論一遍。
  3. 最後才機器化:量大了才派一堆代理、寫自動流程。它解決的是「量大」,不解決「真假」。

如果跳過第 1 步,直接做第 3 步,你得到的不是更可靠的檢查,而是把錯誤工業化:同一個幻覺被分裝到好幾層,每一層都發綠燈,最後所有人都很有信心。

這跟工廠一模一樣:首件沒有人親眼看過,就開始量產,再多的巡檢站也只是在確認「大家都照著錯的做」。

五、可以直接拿去用的檢查表

下次 AI 跟你說「做好了」,先問這五句:

# 問題 不及格的回答長這樣
1 你打開過成品嗎?給我看你看到的畫面。 「程式執行成功」「exit code 0」
2 你驗的東西,跟使用者會看到的是同一個嗎? 驗了檔案存在,沒驗檔案內容
3 驗的人跟做的人,是不是同一個? 「我自己複查過了」
4 複查的人有沒有做一件作者沒做過的檢查? 「另一個代理也說沒問題」
5 如果它是錯的,哪一個證據會露餡?你看過那個證據嗎? 答不出來

五題有一題答不出來,那句「做好了」就還不算數。


AI 很快,也很勤勞。但品保的第一課從來沒變過:「我覺得對」不是證據,「我看過了」才是。 對人是這樣,對 AI 也一樣。

留言

這個網誌中的熱門文章

判退率突然變好,先問尺有沒有變

可靠度是設計出來的,不是測出來的