AI 說「做好了」,不算數
一、一個看起來是好消息的回報
我讓 AI 幫我建一套品質報表系統。其中一頁是中文網頁,給現場主管每天看。
AI 回報:「已完成,已驗證。」
它不是隨口說說。它跑了程式,程式沒有報錯;它檢查了每個連結,連結都指得到檔案;它還派出好幾個「子代理」互相複查,每一層都回報通過。
前後十一天,它派了兩百多次子代理,留下兩百多 MB 的紀錄。每一份紀錄都寫著綠燈。
可是那一頁,主管打開來,中文全是亂碼。
二、為什麼那麼多綠燈都沒用
做了三十年品保,這個場景我很熟。只是以前出現在產線上,這次出現在 AI 身上。
問題不在 AI 不夠努力,而在它驗的東西,跟使用者看到的東西,不是同一個:
- 「程式跑完沒報錯」——驗的是程式有沒有執行,不是畫面對不對。
- 「連結都指得到檔案」——驗的是檔案存在,不是檔案打開後看得懂。
- 「子代理互相複查都通過」——它們用的是同一套推論,錯在同一個地方,就一起通過。
品保的老話叫共模失效:兩道檢驗站用同一把尺,一起量錯的時候,不會有任何一站報警。AI 派十個分身去檢查,如果十個都只是「再推論一遍」,就等於同一把尺量十次。
三、怎麼查出來的
最後抓到問題的,是另一個 AI。它做的事情非常簡單:開一個真的瀏覽器,把那一頁點開,看一眼。
一眼就看到亂碼。再往下查,原因是網頁少了一行宣告文字編碼的設定。十一天沒抓到的問題,點一下就現形。
差別不在聰明,在順序:
| 做法 | 它回答的問題 |
|---|---|
| 程式跑完、連結可解析、型別檢查通過 | 「看起來應該對」——這是推論 |
| 另一個 AI 再推論一遍 | 還是推論,只是多了一層 |
| 打開真的畫面、跑一次真的流程、看原始檔案 | 「實際上對不對」——這才是驗證 |
四、真相:順序倒過來,錯誤會被放大
我後來把這件事整理成一條規則,叫驗證階梯,順序不准倒:
- 先接觸真實:打開畫面、實際跑一次、直接看原檔、親眼看圖。
- 再獨立審核:換一個沒參與製作的人(或 AI)去做第 1 步,不是去再推論一遍。
- 最後才機器化:量大了才派一堆代理、寫自動流程。它解決的是「量大」,不解決「真假」。
如果跳過第 1 步,直接做第 3 步,你得到的不是更可靠的檢查,而是把錯誤工業化:同一個幻覺被分裝到好幾層,每一層都發綠燈,最後所有人都很有信心。
這跟工廠一模一樣:首件沒有人親眼看過,就開始量產,再多的巡檢站也只是在確認「大家都照著錯的做」。
五、可以直接拿去用的檢查表
下次 AI 跟你說「做好了」,先問這五句:
| # | 問題 | 不及格的回答長這樣 |
|---|---|---|
| 1 | 你打開過成品嗎?給我看你看到的畫面。 | 「程式執行成功」「exit code 0」 |
| 2 | 你驗的東西,跟使用者會看到的是同一個嗎? | 驗了檔案存在,沒驗檔案內容 |
| 3 | 驗的人跟做的人,是不是同一個? | 「我自己複查過了」 |
| 4 | 複查的人有沒有做一件作者沒做過的檢查? | 「另一個代理也說沒問題」 |
| 5 | 如果它是錯的,哪一個證據會露餡?你看過那個證據嗎? | 答不出來 |
五題有一題答不出來,那句「做好了」就還不算數。
AI 很快,也很勤勞。但品保的第一課從來沒變過:「我覺得對」不是證據,「我看過了」才是。 對人是這樣,對 AI 也一樣。
留言
張貼留言