AI 應用 / 文件審查

AI 改了十幾次還是有錯,怎麼辦?:資料清理只是第一關,長文件審不出錯的三層設計

同一份材料、同一個模型、同一種問法,跑第十次跟跑第二次通常不會有本質差別。要換的是層,不是次數。

這篇在講什麼

有位學員在講座上問了一個很好的問題。他做了一份 150 頁的教材簡報,先用一家模型反覆檢查內容、結構、章節順序,改了十幾次,覺得差不多了;換另一家模型審一遍,竟然找出內容裡的標準規範錯誤,而原本那家開了深度思考也沒抓到。他後來查出來,問題是兩套國際標準的差異。

「我用的兩家模型都是新的,也用了深度思考,反覆做了超過十次,結果還是有差異。所以應可證明不能只相信一家的 AI,或說,各家的功能與強調的方向可能不同。」2026-08-02 講座學員提問

他反覆做了超過十次,兩家都用最新模型、都開了深度思考,結果還是有落差。就這個案例看,問題比較像是材料、指令與機制的設計,不是靠換更強的模型能解決的;但也不能只憑一個案例就完全排除模型能力這一項。

我的判斷是:長文件出錯,通常是三層設計沒做,而多數人只做了第一層,甚至第一層也沒做。這篇把三層拆開來講,並且給你一段比「再跑一次」更有效的提示詞。

這篇分三段:

  1. 第一到第二節:為什麼反覆重跑沒有用,三層設計是哪三層
  2. 第三到第五節:每一層具體怎麼做,含可以直接複製的做法
  3. 第六到第八節:出錯之後怎麼判斷是哪一種問題、跑幾輪要停、怎麼把這套變成 AI 自己會跑的流程
適合誰
  • 要用 AI 檢查長文件的人:教材、報告、規範、合約、標書
  • 已經換過模型、開過深度思考,結果還是不放心的人
  • 想把一次性的檢查,變成下次可以重複用的流程的人
  • (第五節與第七節不限長文件,任何會跟 AI 反覆來回修改的人都用得上)
你可以帶走什麼
  • 三層檢查的順序與各層的判準
  • 兩種切法互相覆蓋的做法,以及為什麼一種切法不夠
  • 一段可直接複製的提示詞,用來跟 AI 討論它為什麼會出錯

一、為什麼反覆重跑十幾次沒有用

先講一個直覺上很難接受的事實:同一份材料、同一個模型、同一種問法,跑第十次跟跑第二次,通常不會有本質差別。每一次的字句會不一樣,偶爾也會多抓到一兩處,但同一層的盲點不會因為多跑幾次就自己消失。原因有三個,而且它們是不同層的問題。

第一層 材料

AI 讀到的東西跟你看到的不一樣。這是資料清理要解決的。

第二層 切法

一次讀太多,它會漏。這是分區塊要解決的。

第三層 視角

同一個模型會沿用同一套偏好,它覺得對的地方,回頭審還是覺得對。這是換一家模型要解決的。

反覆重跑,只是在同一層裡面繞。你重跑十次,材料還是那份難讀的材料、切法還是那個一次吞完的切法、視角還是同一個視角。

順序很重要先把材料變成它讀得懂的,再決定怎麼切,最後才找第二個視角。跳過前兩層直接找第二家模型,你只會得到兩份都建立在同一個誤讀上的檢查報告。

二、第一層:材料,先確認它讀到的跟你看到的一樣

這一層官網已經有兩篇寫得很完整,直接給你連結:

所以這裡不重複,只補三件跟「審查」直接相關的事。

嚴肅規範類的內容要優先清理

教材、法規、標準、合約這一類,錯一個版本號、錯一個標準代號,整段結論就跟著錯,而且錯得很像對的。這種內容我一律建議先轉成純文字的 Markdown 檔,把章節架構跟內容檢索一起整理出來,再交給 AI 分析。轉出來的是給 AI 讀的可檢索副本,原檔要留著:表格、圖片裡的字、頁尾註解這些東西轉檔時最容易掉,所以下一段的抽樣核對要回原檔比對。

「我目前遇到說文件容易有幻覺的,90% 的人做資料清理之後都會有極大幅度的改善。」2026-08-02 講座現場

清理完要做一次抽樣核對

不要清完就直接開始審。隨機挑三到五個地方,回頭跟原檔核對一次:表格有沒有跳列、頁尾註解有沒有被吃掉、圖片裡的文字有沒有完全消失。這一步花五分鐘,可以省掉後面十次白跑。

把「出處」變成規則的一部分

這是那位學員的案例給我的啟發:既然錯的是規範版本,那就在檢查規則裡要求它標出處。

凡是你提到規範、標準、法條、版本號的地方, 一律在句子後面標出:出自哪一份文件、第幾章節、哪一版。 你在原始材料裡找不到出處的,不要寫成肯定句, 改成「這一點材料裡沒有明確依據」並且列出來給我。

這段話的作用是把它「順口說出來」的東西,變成必須舉證的東西。沒有出處的說法會自己浮出來。

但這條擋不住開頭那個案例學員那份教材的錯,是兩套國際標準搞混。兩套標準都真實存在、都查得到出處,所以它引用錯的那一套時,照樣標得出出處給你看,而且看起來完全合理。要擋這種錯,規則要再加一層:先指定這份文件適用哪一套、哪一版,再要求它每次引用都跟這一行比對。
本文件適用的規範是:{填你的標準名稱與版本,例如 XXX 標準 2023 版}。 你每次引用規範時,先跟上面這一行比對: 1. 相符 → 照常寫,後面標出章節 2. 不相符(引到別套或別版)→ 標成【版本不符】並列出來 3. 材料裡沒有寫明是哪一套 → 標成【待確認適用版本】,不要自己挑一套 最後給我一份清單:哪些地方是【版本不符】、哪些是【待確認】。

這一層的關鍵在第三種情況。多數規範類的錯誤不是憑空捏造,是在兩套都成立的東西之間選錯了一套,而它選的時候不會告訴你它做過選擇。你要做的是把「選擇」這件事變成必須回報的動作。

三、第二層:切法,而且不要只用一種

第二層的問題是:一次讀太多,它會用跳的。

一份一百多頁的東西整份丟進去,前面讀得很清楚,讀到後面就開始略過。所以要分區塊。但真正的關鍵在下一句:區塊不要用同一種分法。

「你下次請他試試看分區塊去檢查,就是避免上下文爆炸。分區塊,然後區塊不要用同一種分法,用兩到三種不同的分法,那這樣子基本上會好很多。」2026-08-02 講座現場
切法一 按章節切

十個章節就分十次,一個章節分析一次,最後再把十個章節的結果做一次大統整。

死角:跨章節的矛盾看不到,例如第二章跟第八章講同一件事但說法不一樣。

切法二 按主題切

先請它把這十個章節拆成五個主題,再用五個主題各跑一次。

死角:章節內部的順序問題看不到,例如由淺入深的鋪陳斷掉了。

兩種切法蓋的區域不一樣,重疊起來才有覆蓋率。這是「用兩種以上不同分法」真正的意思,不是同一種切法跑兩次。

第一輪:這份文件有 {章節數} 個章節,請你一個章節分析一次, 每一章單獨回報問題,最後再做一次跨章節統整。 第二輪:請你先把這些章節重新歸成 {主題數} 個主題, 告訴我你怎麼歸的,然後用這些主題各分析一次。 兩輪的結果如果有衝突,把衝突列出來,不要自己選一個。
最後那一句最重要不叫它列衝突,它會自動幫你選一個,而你不會知道它選過。

四、第三層:視角,讓兩家各跑一輪再交叉

第三層才是換模型。

「你用章節幫我一個一個檢查,然後 Claude 交叉相乘、GPT 交叉相乘,再把 Claude 跟 GPT 的交叉相乘,那這樣子基本上很難會有問題。」2026-08-02 講座現場

做法是:兩種切法各讓兩家模型跑一輪,然後把兩邊的結果交叉一次。這樣你手上會有四份結果,交叉之後剩下的分歧,通常就是真正需要人判斷的地方。

那位學員的經驗剛好是這一層的證明:兩家模型都用最新版、都開深度思考、反覆做了超過十次,結果還是有差異。

我自己的補充是:不同模型的權重不一樣,盲點也不一樣。這不是誰比較強的問題,是他們在意的東西不同。

只能用一家模型怎麼辦很多環境有這個限制:公司只採購一家、資安規定只允許特定服務。這時候第三層拿不到,但不是完全沒有替代:同一家模型,開兩個乾淨的新對話,一個用「章節切」的角色設定跑、一個用「主題切+只挑矛盾」的角色設定跑,再把兩份結果交給第三個對話比對。要老實說的是,這比跨家交叉弱,因為兩邊的偏好還是同一套,抓得到疏漏,抓不到「它一貫的認知偏差」。把它當補強,不要當等價替代。
那三家會不會更保險我算過就放棄了。如果要每一家都審過每一家,A 要審 B 再審 C,B 要審 A 再審 C,C 要審 A 審 B,然後再重跑一遍,工作量會往上翻好幾倍,時間也耗不起。我的經驗是兩家交叉就能處理掉絕大多數問題,這是經驗判斷,不是統計數字。

五、比再跑一次更有效的一步:跟它討論為什麼會錯

這是我覺得最多人漏掉的一步。

發現錯誤之後,多數人的反應是「你再檢查一次」。但錯誤已經發生了,重跑只是換一次骰子。更有效的是直接跟它討論這件事本身。

我在課堂上念的是這一段:

為什麼你會出現規範錯誤的資訊?我們如何確保資訊是正確的? 假設我願意多花時間、多花費用,讓你第二次複查, 或是第二次用不同角度驗證,第三次再跟其他 AI 複查, 我也有兩套模型可以搭配。 你是否可以陪我一起設計出一套審查機制、除錯機制, 或是資訊追蹤機制,以確保所有的東西都是正確的?

這段話有兩個作用。

  • 把問題換一層:從「這一次錯了」變成「我們要設計一套不會再錯的流程」。你拿到的不是一次修正,是一份可以留下來的檢查設計。
  • 逼出它自己知道、但你沒問就不會講的限制:例如哪一段其實它沒有把握、哪一種比對它做不到、哪些內容需要外部資料才能驗證。

六、出錯的三種來源,先分清楚是哪一種

跟它討論完,你會需要判斷問題屬於哪一種,因為三種的處理方式完全不同。

「有些東西是我們指令沒有下好,有些東西是我們機制沒有設定好,有些東西是可能突破現在模型能力的上限。」2026-08-02 講座現場
來源 01 指令沒下好

特徵:它做的事情跟你要的不一樣,但它做得很認真。

處理:把判準、範圍、輸出格式寫清楚。

來源 02 機制沒設好

特徵:它做對了這次,但下次同樣情況又漏。

處理:把檢查點、順序、停止條件寫成規則。

來源 03 超出模型上限

特徵:換模型、換切法、換問法都一樣錯。

處理:這一段改用人審,或改用能查證的外部資料。

那位學員的 150 頁教材,看起來不像是超出模型的閱讀範圍,所以我判斷它落在前兩種,是指令跟機制的問題。要補一句:頁數不能直接換算成模型讀得下多少,真正影響的是清理之後的文字量與格式,所以這是就這個案例的判斷,不是通則。

判斷錯了會做白工機制問題你去換更強的模型,換到最貴的也還是會漏;能力問題你一直改指令,改到天亮也改不出來。

七、跑幾輪要停

還有一個問題比「怎麼審」更容易被漏掉:修正幾次要停。

如果你只跟它說「按照我的標準去修正」,沒有給次數上限,它會一直修到它覺得好為止。結果通常是兩種:費用一直往上,或是越修越歪。

我自己的工作以文件分析推理為主,經驗值是兩到三輪。這裡的一輪指的是:

  • 第一輪:A 審完 B,B 也審完 A
  • 第二輪:A 依照 B 的建議再跑一次,B 依照 A 的建議再跑一次,然後互相再審一遍
「兩到三輪沒問題的就沒問題的,有問題的他也不會比較好⋯⋯跑兩輪還無解的就不要在那,因為他跑十輪跑一百輪,基本上也不會有解。」2026-08-02 講座現場

判斷「該停了」有一個很簡單的方法:同一個問題連續兩到三次都卡在同一個地方,就停下來回報,不要再跑。

停下來之後要做的是回頭看規則少寫了什麼。通常是這三種:

  • 判準沒定義:什麼叫做「正確」,你沒說。
  • 例外沒規定:遇到規則沒寫到的情況怎麼辦,你沒說。
  • 出處沒要求:憑什麼說這是對的,你沒要求它舉證。

八、最後一步:把這套變成它自己會跑的流程

做到這裡,你手上已經有一套完整的檢查設計了:清理與抽樣、兩種切法、兩家交叉、討論機制、三種來源判斷、停止條件。

這一整套目前還是「你每次帶著它跑一遍」。最後一步是把它交出去。

判斷時機很簡單:當你發現這套標準做過一兩次都沒問題了,就可以跟它說:

「你知道我的標準,你應該要讓自己跑啊。我希望下次我不在你身邊,你也可以按照這個標準,自己審查、自己跑。這就叫迴圈工程了。」2026-08-02 講座現場

它做得到,這就叫迴圈工程。做不到的時候,多半是它不知道錯的時候該怎麼辦。那就回頭把「錯了怎麼發現、怎麼修、什麼時候停」補進規則裡。

那位學員在課堂最後說的話我印象很深:確定 OK 之後要做成技能包。這個順序是對的,先把流程跑順,再把跑順的流程存起來,而不是一開始就想做一個完美的技能包。

你可以怎麼開始

今天 抽樣核對清理結果

把你手上那份最常被 AI 讀錯的文件,隨機挑三個地方跟原檔核對一次。你會很快知道問題出在材料還是分析。

這週 用兩種切法各跑一次

同一份文件按章節、按主題各跑一次,把兩邊的衝突列出來。不要叫它幫你選,衝突清單本身就是價值。

做完前兩步 把出處與停止條件寫進規則

然後開一個新對話,只講你平常會講的那句話,測它會不會自己跑起來。

三步都不需要寫程式。你需要的是把自己每次都在檢查的東西講清楚,這件事只有你做得到。

相關的三篇

AI工作流跨家審稿資料整理知識管理基礎2026-08-05 發布