這篇在講什麼
有位學員在講座上問了一個很好的問題。他做了一份 150 頁的教材簡報,先用一家模型反覆檢查內容、結構、章節順序,改了十幾次,覺得差不多了;換另一家模型審一遍,竟然找出內容裡的標準規範錯誤,而原本那家開了深度思考也沒抓到。他後來查出來,問題是兩套國際標準的差異。
他反覆做了超過十次,兩家都用最新模型、都開了深度思考,結果還是有落差。就這個案例看,問題比較像是材料、指令與機制的設計,不是靠換更強的模型能解決的;但也不能只憑一個案例就完全排除模型能力這一項。
我的判斷是:長文件出錯,通常是三層設計沒做,而多數人只做了第一層,甚至第一層也沒做。這篇把三層拆開來講,並且給你一段比「再跑一次」更有效的提示詞。
這篇分三段:
- 第一到第二節:為什麼反覆重跑沒有用,三層設計是哪三層
- 第三到第五節:每一層具體怎麼做,含可以直接複製的做法
- 第六到第八節:出錯之後怎麼判斷是哪一種問題、跑幾輪要停、怎麼把這套變成 AI 自己會跑的流程
- 要用 AI 檢查長文件的人:教材、報告、規範、合約、標書
- 已經換過模型、開過深度思考,結果還是不放心的人
- 想把一次性的檢查,變成下次可以重複用的流程的人
- (第五節與第七節不限長文件,任何會跟 AI 反覆來回修改的人都用得上)
- 三層檢查的順序與各層的判準
- 兩種切法互相覆蓋的做法,以及為什麼一種切法不夠
- 一段可直接複製的提示詞,用來跟 AI 討論它為什麼會出錯
一、為什麼反覆重跑十幾次沒有用
先講一個直覺上很難接受的事實:同一份材料、同一個模型、同一種問法,跑第十次跟跑第二次,通常不會有本質差別。每一次的字句會不一樣,偶爾也會多抓到一兩處,但同一層的盲點不會因為多跑幾次就自己消失。原因有三個,而且它們是不同層的問題。
AI 讀到的東西跟你看到的不一樣。這是資料清理要解決的。
一次讀太多,它會漏。這是分區塊要解決的。
同一個模型會沿用同一套偏好,它覺得對的地方,回頭審還是覺得對。這是換一家模型要解決的。
反覆重跑,只是在同一層裡面繞。你重跑十次,材料還是那份難讀的材料、切法還是那個一次吞完的切法、視角還是同一個視角。
二、第一層:材料,先確認它讀到的跟你看到的一樣
這一層官網已經有兩篇寫得很完整,直接給你連結:
- 為什麼要把資料拆成卡片:從 PDF 難讀到 AI 檢索的卡片化教學:PDF 與 PPT 為什麼是給人看的印刷格式、AI 讀起來是座標與程式碼,以及怎麼拆。150 頁 PPT 實際怎麼轉,看這篇。
- AI 時代怎麼整理資料,讓文件變成可用的系統:清理完之後怎麼整理成人跟 AI 都能操作的系統。
所以這裡不重複,只補三件跟「審查」直接相關的事。
嚴肅規範類的內容要優先清理
教材、法規、標準、合約這一類,錯一個版本號、錯一個標準代號,整段結論就跟著錯,而且錯得很像對的。這種內容我一律建議先轉成純文字的 Markdown 檔,把章節架構跟內容檢索一起整理出來,再交給 AI 分析。轉出來的是給 AI 讀的可檢索副本,原檔要留著:表格、圖片裡的字、頁尾註解這些東西轉檔時最容易掉,所以下一段的抽樣核對要回原檔比對。
清理完要做一次抽樣核對
不要清完就直接開始審。隨機挑三到五個地方,回頭跟原檔核對一次:表格有沒有跳列、頁尾註解有沒有被吃掉、圖片裡的文字有沒有完全消失。這一步花五分鐘,可以省掉後面十次白跑。
把「出處」變成規則的一部分
這是那位學員的案例給我的啟發:既然錯的是規範版本,那就在檢查規則裡要求它標出處。
這段話的作用是把它「順口說出來」的東西,變成必須舉證的東西。沒有出處的說法會自己浮出來。
這一層的關鍵在第三種情況。多數規範類的錯誤不是憑空捏造,是在兩套都成立的東西之間選錯了一套,而它選的時候不會告訴你它做過選擇。你要做的是把「選擇」這件事變成必須回報的動作。
三、第二層:切法,而且不要只用一種
第二層的問題是:一次讀太多,它會用跳的。
一份一百多頁的東西整份丟進去,前面讀得很清楚,讀到後面就開始略過。所以要分區塊。但真正的關鍵在下一句:區塊不要用同一種分法。
十個章節就分十次,一個章節分析一次,最後再把十個章節的結果做一次大統整。
死角:跨章節的矛盾看不到,例如第二章跟第八章講同一件事但說法不一樣。
先請它把這十個章節拆成五個主題,再用五個主題各跑一次。
死角:章節內部的順序問題看不到,例如由淺入深的鋪陳斷掉了。
兩種切法蓋的區域不一樣,重疊起來才有覆蓋率。這是「用兩種以上不同分法」真正的意思,不是同一種切法跑兩次。
四、第三層:視角,讓兩家各跑一輪再交叉
第三層才是換模型。
做法是:兩種切法各讓兩家模型跑一輪,然後把兩邊的結果交叉一次。這樣你手上會有四份結果,交叉之後剩下的分歧,通常就是真正需要人判斷的地方。
那位學員的經驗剛好是這一層的證明:兩家模型都用最新版、都開深度思考、反覆做了超過十次,結果還是有差異。
我自己的補充是:不同模型的權重不一樣,盲點也不一樣。這不是誰比較強的問題,是他們在意的東西不同。
五、比再跑一次更有效的一步:跟它討論為什麼會錯
這是我覺得最多人漏掉的一步。
發現錯誤之後,多數人的反應是「你再檢查一次」。但錯誤已經發生了,重跑只是換一次骰子。更有效的是直接跟它討論這件事本身。
我在課堂上念的是這一段:
這段話有兩個作用。
- 把問題換一層:從「這一次錯了」變成「我們要設計一套不會再錯的流程」。你拿到的不是一次修正,是一份可以留下來的檢查設計。
- 逼出它自己知道、但你沒問就不會講的限制:例如哪一段其實它沒有把握、哪一種比對它做不到、哪些內容需要外部資料才能驗證。
六、出錯的三種來源,先分清楚是哪一種
跟它討論完,你會需要判斷問題屬於哪一種,因為三種的處理方式完全不同。
特徵:它做的事情跟你要的不一樣,但它做得很認真。
處理:把判準、範圍、輸出格式寫清楚。
特徵:它做對了這次,但下次同樣情況又漏。
處理:把檢查點、順序、停止條件寫成規則。
特徵:換模型、換切法、換問法都一樣錯。
處理:這一段改用人審,或改用能查證的外部資料。
那位學員的 150 頁教材,看起來不像是超出模型的閱讀範圍,所以我判斷它落在前兩種,是指令跟機制的問題。要補一句:頁數不能直接換算成模型讀得下多少,真正影響的是清理之後的文字量與格式,所以這是就這個案例的判斷,不是通則。
七、跑幾輪要停
還有一個問題比「怎麼審」更容易被漏掉:修正幾次要停。
如果你只跟它說「按照我的標準去修正」,沒有給次數上限,它會一直修到它覺得好為止。結果通常是兩種:費用一直往上,或是越修越歪。
我自己的工作以文件分析推理為主,經驗值是兩到三輪。這裡的一輪指的是:
- 第一輪:A 審完 B,B 也審完 A
- 第二輪:A 依照 B 的建議再跑一次,B 依照 A 的建議再跑一次,然後互相再審一遍
判斷「該停了」有一個很簡單的方法:同一個問題連續兩到三次都卡在同一個地方,就停下來回報,不要再跑。
停下來之後要做的是回頭看規則少寫了什麼。通常是這三種:
- 判準沒定義:什麼叫做「正確」,你沒說。
- 例外沒規定:遇到規則沒寫到的情況怎麼辦,你沒說。
- 出處沒要求:憑什麼說這是對的,你沒要求它舉證。
八、最後一步:把這套變成它自己會跑的流程
做到這裡,你手上已經有一套完整的檢查設計了:清理與抽樣、兩種切法、兩家交叉、討論機制、三種來源判斷、停止條件。
這一整套目前還是「你每次帶著它跑一遍」。最後一步是把它交出去。
判斷時機很簡單:當你發現這套標準做過一兩次都沒問題了,就可以跟它說:
它做得到,這就叫迴圈工程。做不到的時候,多半是它不知道錯的時候該怎麼辦。那就回頭把「錯了怎麼發現、怎麼修、什麼時候停」補進規則裡。
那位學員在課堂最後說的話我印象很深:確定 OK 之後要做成技能包。這個順序是對的,先把流程跑順,再把跑順的流程存起來,而不是一開始就想做一個完美的技能包。
你可以怎麼開始
把你手上那份最常被 AI 讀錯的文件,隨機挑三個地方跟原檔核對一次。你會很快知道問題出在材料還是分析。
同一份文件按章節、按主題各跑一次,把兩邊的衝突列出來。不要叫它幫你選,衝突清單本身就是價值。
然後開一個新對話,只講你平常會講的那句話,測它會不會自己跑起來。
三步都不需要寫程式。你需要的是把自己每次都在檢查的東西講清楚,這件事只有你做得到。
相關的三篇
- 交代過的事 AI 為什麼老是忘記?:從『我記住了』到讓 AI 自己跑:怎麼確認這套檢查規則真的被記住、真的會啟動。
- 怎麼設計讓兩個 AI 互審?:三種不同程度的審查機制設計:第三層做起來之後,互審要做多深、指令怎麼下。
- 為什麼要把資料拆成卡片:從 PDF 難讀到 AI 檢索的卡片化教學:第一層的完整做法,材料怎麼清理。