發表文章

目前顯示的是有「AI 品保」標籤的文章

AI 說「做好了」,不算數

一、一個看起來是好消息的回報 我讓 AI 幫我建一套品質報表系統。其中一頁是中文網頁,給現場主管每天看。 AI 回報:「已完成,已驗證。」 它不是隨口說說。它跑了程式,程式沒有報錯;它檢查了每個連結,連結都指得到檔案;它還派出好幾個「子代理」互相複查,每一層都回報通過。 前後十一天,它派了兩百多次子代理,留下兩百多 MB 的紀錄。每一份紀錄都寫著綠燈。 可是那一頁,主管打開來,中文全是亂碼。 二、為什麼那麼多綠燈都沒用 做了三十年品保,這個場景我很熟。只是以前出現在產線上,這次出現在 AI 身上。 問題不在 AI 不夠努力,而在它 驗的東西,跟使用者看到的東西,不是同一個 : 「程式跑完沒報錯」——驗的是程式有沒有執行,不是畫面對不對。 「連結都指得到檔案」——驗的是檔案存在,不是檔案打開後看得懂。 「子代理互相複查都通過」——它們用的是同一套推論,錯在同一個地方,就一起通過。 品保的老話叫 共模失效 :兩道檢驗站用同一把尺,一起量錯的時候,不會有任何一站報警。AI 派十個分身去檢查,如果十個都只是「再推論一遍」,就等於同一把尺量十次。 三、怎麼查出來的 最後抓到問題的,是另一個 AI。它做的事情非常簡單: 開一個真的瀏覽器,把那一頁點開,看一眼。 一眼就看到亂碼。再往下查,原因是網頁少了一行宣告文字編碼的設定。十一天沒抓到的問題,點一下就現形。 差別不在聰明,在 順序 : 做法 它回答的問題 程式跑完、連結可解析、型別檢查通過 「看起來應該對」——這是推論 另一個 AI 再推論一遍 還是推論,只是多了一層 打開真的畫面、跑一次真的流程、看原始檔案 「實際上對不對」——這才是驗證 四、真相:順序倒過來,錯誤會被放大 我後來把這件事整理成一條規則,叫 驗證階梯 ,順序不准倒: 先接觸真實 :打開畫面、實際跑一次、直接看原檔、親眼看圖。 再獨立審核 :換一個沒參與製作的人(或 AI)去做第 1 步,不是去再推論一遍。 最後才機器化 :量大了才派一堆代理、寫自動流程。它解決的是「量大」,不解決「真假」。 如果跳過第 1 步,直接做第 3 步,你得到的不是更可靠的檢查,而是 把錯誤工業化 :同一個幻覺被分裝到好幾層,每一層都發綠燈,最後所有人都很有信心。 這跟工廠一模一樣:首件...