AI 應用 / 審查機制

交代過的事 AI 為什麼老是忘記?:從『我記住了』到讓 AI 自己跑

你交代過的事,AI 說記住了,下次還是照舊。問題出在「記住」這兩個字有三種意思,只有一種能撐到下一次。

這篇在講什麼

你交代 AI 一件事,改了三次,它終於說「我知道了,我記住了」。下一次同樣的任務,它又用回原本的做法。關鍵在「記住」這兩個字:它在 AI 那裡有三種意思,只有一種能撐到下一次對話。

這篇分三段,你可以只讀你需要的那一段:

  1. 第一到第二節:三種假記住怎麼分辨,加上七個追問句,今天就能用
  2. 第三節:把追問寫成 AI 自己會跑的檢查清單,含一份可以直接複製的範例
  3. 第四節之後:進階的部分。兩家 AI 怎麼共用一份資料、抄別人的技能包要先看什麼、驗收基準怎麼定、互審的三種難度、寫進迴圈的四條規則、跑幾輪要停,最後是一個現場學員的真實案例
適合誰
  • 只用 ChatGPT 或 Claude 網頁版,交代過的規則它老是忘記的人
  • 已經在用 AI 做正事,但每次都得盯著它,一離開就走鐘的人
  • 寫過技能包或規則檔,卻發現它常常沒被讀到、沒被觸發,又講不出原因的人
你可以帶走什麼
  • 七個追問句,AI 說「記住了」的時候直接貼上去用
  • 一份可以直接複製的檢查清單範例,含寫在哪、用什麼句型、怎麼確認它真的跑了
  • 一組判斷:什麼時候該找第二個 AI 來審、互審的三種難度、跑幾輪要停
名詞先講白話技能包是一個寫著「遇到某類任務就照這樣做」的檔案,AI 讀得到、你也改得動。觸發詞是這個檔案開頭寫的那幾句「什麼情況要用我」。上下文是這次對話 AI 能一起看進去的資料量,滿了就會開始漏東西。

一、「我記住了」有三種意思,只有一種撐得到下一次

「如果你要一直學怎麼操作工具,那你就必須得要一直操作工具。那就是叫 AI 去操作工具,我就不用操作工具了。」2026-08-02 講座現場

這句話是我在講座開場講的。學工具跟學怎麼指揮工具,是兩件事。而指揮的第一關,就是它到底有沒有真的把你的話收下來。

我用 AI 的第一天就滿滿的懷疑,可是懷疑的方向一開始是錯的。我以為要防的是它答錯,後來發現要防的是它答對了,但沒有做。

最早那次,我把一個規則講了很多遍,它說記住了。我問它:你記在哪?

它的回答很老實:抱歉,我的記住只在這個對話視窗裡面。

講白話就是:關掉這個對話,它就忘了。這是第一種假記住。

如果你只用網頁版這一關有現成的解法,不用寫任何檔案。兩個位置二選一:

一、自訂指令(設定裡的個人化那一區,ChatGPT 與 Claude 都有類似位置)。適合放你每一次對話都要遵守的事,例如品牌用語、稱呼、輸出格式。缺點是所有對話共用,規則多了會互相打架。

二、專案(ChatGPT 的 Projects、Claude 的 Projects)。開一個專案,把規則寫進那個專案的「指示」欄位,這個專案裡的每一個新對話就會先讀到它。要注意寫的位置:ChatGPT 是 project instructions,Claude 要放在專案指示或專案知識裡,它不會去讀專案的名稱與簡介。適合放某一類工作專屬的規則,例如月結檢查、客戶提案。各家的欄位名稱與位置會改,開設定看一眼最準。

判斷方式很簡單:每次都要用的放自訂指令,只有某類工作要用的放專案。各家介面偶爾會改位置,在設定裡搜尋「自訂」或「指令」通常就找得到;免費方案能不能用這兩項,各家不時在調整,開設定看一眼最快。你要做的只是把「記住」這件事,從對話裡搬到一個下次還打得開的地方。

我當時的做法是把要求講清楚:我要你的記住是,以後開新的任務、新的視窗,你都要記住。它才提出兩個做法,一個是寫一份工作日誌放在固定目錄,一個是寫成技能包。

檔案寫出來了,我以為這件事解決了。結果下一次它還是沒照做。因為檔案存在跟檔案被讀到是兩件事,沒有人叫它去讀,它就不會讀。這是第二種假記住。

最後一種最難發現。我把規則寫成技能包,這次總該會自動啟動了吧。直到有一次我發現它還是沒啟動,追問之後它說:我有記成技能包,但是那個觸發詞沒有設定好,我不認為這個工作流程跟這件事是同一件事。

它沒有騙我。技能包在、內容也對,只是它判斷「現在這個任務」跟「那個技能包負責的任務」不是同一件事,所以沒有把它叫出來。

假記住 01 記在視窗

關掉這個對話就忘了。

要問的那一句:你記在哪?換一個新對話還在嗎?

假記住 02 記成檔案沒啟動

檔案寫了,但沒有人叫它讀。

要問的那一句:下次遇到同樣任務,你會去讀哪一個檔案?

假記住 03 觸發詞沒設好

檔案會讀,但它認不出這次該讀。

要問的那一句:我要怎麼說,你才會想到要用這一份?

這三個坑我是一次一次踩過來的。

「我們永遠可以相信,AI 值得懷疑,需要懷疑。這件事情養成心法之後,再用 AI 就很容易,越用越順。」2026-08-02 講座現場
「AI 是絕對必須要懷疑的。他說的每一句你都要說,你要證明給我看是真的有意義的,並且確保下一次你真的可以照著做,做不好可以自己去修正。」2026-08-02 講座現場
懷疑就是原料這句話聽起來像在講 AI 不可靠,其實是在講一件更務實的事:你能懷疑到的每一個點,都是一個可以被寫下來的檢查點。

二、七個追問句,直接複製去用

AI 說「我終於懂了,我知道了,我記住了」的時候,我不會回「好」。我會一口氣問完下面這些。

第一組:你到底記了什麼

1. 你解釋一下,你到底記了什麼?你理解了什麼? 2. 你真的懂我想要怎麼做嗎?你知道我的目標,還有這些步驟的意義嗎?請你解釋給我聽。

這一組在測理解。很多時候它複述得出字面,卻講不出為什麼要這樣做,那就代表下次情況一變它就會走鐘。

第二組:你記在哪,找不找得到

3. 你到底記在哪?下一次真的找得到嗎? 4. 你找到了,真的會照著去啟動嗎?啟動之後會真的照這些步驟做嗎?

第三個問題會打掉「記在視窗」,第四個問題會打掉「檔案有了沒啟動」跟「觸發詞沒設好」。這兩句是我後來才加的,因為前面三個坑都是在這裡漏掉的。

第三組:做錯了怎麼辦

5. 如果你沒有照這些步驟做,你要如何自己發現? 6. 如果你做錯了,你要如何自己檢查? 7. 如果你找到新的、更好的方法,你會把它存回去嗎?

這一組最重要,也最少人問。前四個問題都還是在確認「它這次會不會照做」,第五到第七題問的是「我不在的時候,它有沒有辦法自己發現、自己修、自己累積」。這三題答得出來,你才有機會把工作交出去。

先說清楚這七句的極限它們只解決當下這一次。真正的價值在於,你會從它的回答裡看到你的規則到底缺了什麼。下一節就是把這些答案,變成一份它下次會自己讀、自己跑的東西。

三、把追問變成一份它自己會跑的檢查清單

「我之前其實對於自動化這件事情就很沒有自信,我就覺得我不是工程師,我不會寫自動化流程。直到做了迴圈工程之後。」2026-08-02 講座現場

我對這件事本來很沒有自信。我不是工程師,不會寫自動化流程,而且我的工作大多是抽象的分析與判斷,很難拆成步驟。那時候我的日常是:AI 跑一步,我校正一步,它再跑一步,我再校正一步。

後來寫成技能包,一次可以跑三到五步,但每三到五步還是要我停下來校正。真正的轉折是我發現一件事:這些校正點,其實每次都一樣。

同一個工作流程,我就是在那幾個地方停下來檢查,標準也一直沒變。既然標準這麼明確,那能不能讓它自己審?沒有到標準就自己修正,直到到標準為止?

迴圈工程它講的就是這件事:把你一直在做的那個檢查,寫成它照著跑的規則。

檢查清單長什麼樣子

很多人卡在這裡:知道自己每次都在檢查什麼,但不知道「寫成規則」到底要寫成什麼樣子。以下用一個辦公室的例子,從頭到尾走一次。

假設你每個月要核部門費用彙整表,你每次都在看這五項:日期有沒有跨月、發票號碼有沒有重複、部門代號對不對、金額加總跟收據張數對不對、有沒有漏簽核。

第一步,把五項寫成一段規則文字。就是這樣的白話,不用任何語法:

【月結費用表檢查】 什麼時候用我:我說「核費用表」「月結檢查」「這份報表幫我看一下」, 或是我丟給你一份含有日期、發票號碼、部門代號、金額的表格時。 你要做的事: 1. 逐列檢查日期是否落在本月,跨月的列出來 2. 檢查發票號碼有沒有重複,重複的列出來 3. 檢查部門代號是否在我給的代號清單內 4. 金額加總,跟我說的收據張數與總額核對 5. 檢查簽核欄有沒有空白 完成條件:五項全部檢查完,每一項回報「通過」或「有幾筆問題、是哪幾列」。 沒有把握的地方不要猜,列出來問我。 遇到這五項沒寫到的狀況,把其他四項做完,然後告訴我是哪一種狀況。 修正上限:同一個問題最多自己重做兩次,還沒解決就停下來回報。
按下去之前先確認兩件事第一,表格怎麼交給它。幾十列的直接複製貼上就好;幾百列的,網頁版可以上傳檔案(CSV 或 Excel),上傳前先確認你的方案支援檔案分析。第二,這份資料能不能貼進去。發票號碼、部門代號、金額是公司的資料,先確認公司對外部 AI 服務的規定。不確定的話有兩條路:把識別欄位遮掉再貼(發票號碼留後三碼、金額改成相對比例),或是改用公司採購的企業版帳號。這一步跟規則寫得好不好無關,但它決定你敢不敢真的按下去。

第二步,決定它住在哪裡。只用網頁版的話,貼進自訂指令,或開一個「月結」專案放在專案說明欄。有在用桌面版 Agent 的話,存成一個檔案放在固定資料夾,或做成技能包。位置不重要,重要的是下次打得開、而且它會自己去讀。

第三步,確認它真的跑了。這一步最常被跳過。開一個全新的對話,只講你平常會講的那句話(「這份報表幫我看一下」),然後看它有沒有自己按五項回報。有,代表觸發詞寫對了;沒有,代表它認不出這句話跟這份規則有關,回去把「什麼時候用我」那段補上你真正會講的說法。

三步的重點寫成規則文字、決定它住哪裡、開新對話測它會不會自己跑起來。第三步沒做,前面兩步都只是檔案。

觸發得動與觸發不動的差別

第三種假記住幾乎都出在「什麼時候用我」這一段寫得太抽象。對照一下:

觸發不動 抽象的分類語
  • 用於財務相關文件處理
  • 協助使用者進行資料驗證
  • 適用於各類報表
觸發得動 你真正會講的那幾句話
  • 我說「核費用表」「月結檢查」「這份報表幫我看一下」時
  • 我丟給你含日期、發票號碼、部門代號、金額的表格時
  • 我問「這張表有沒有問題」時

左邊那種寫法你自己讀得懂,但它要判斷「使用者現在這句話算不算財務相關文件處理」,就會猶豫。右邊直接寫出你真正會講的那幾句話,判斷就變成比對。

還有一個坑:兩份規則的觸發條件重疊時,它可能只叫出其中一份。所以規則不要越寫越多份,同一類工作盡量收在同一份裡面。

觸發不動還有另外兩個成因,比較少見但值得知道:一是這次對話塞了太多資料,規則被擠出它的閱讀範圍(就是前面講的上下文滿了);二是規則檔放的位置它根本沒去讀。所以第三步的測試要在全新的、乾淨的對話裡做,才分得出來是措辭問題還是位置問題。

一個我自己在跑的例子

我有一條發文流程:人在外面用手機丟一個 YouTube 連結加語音指令,桌機那邊分析內容、寫成我自己觀點的短文、做圖卡、然後發文。裡面關於圖片,我寫死了四項檢查:規格是不是 4 比 5、有沒有壓縮跟轉檔、圖上的文字有沒有跑掉、角色造型有沒有跑掉。

這四項就是我以前每次都要人工看一遍的東西。寫進流程之後,它自己檢查、自己修,我只在文案那一關把關。

「Threads 他有發成功,但是 IG、FB 沒有發。欸你看我就不爽了,之前明明就有發成功過,他應該要去把他找出來檢查回來。這次迴圈工程算是半成功。」2026-08-02 講座現場

要老實講的是,這條迴圈最近一次跑只算半成功。有一張圖沒被檢查到,因為我的規則只寫了「檢查兩次」,第三張之後就沒有覆蓋;短文平台發成功了,另外兩個社群平台沒發出去,而且它沒有自己把這件事找回來。我後來的處理很單純:回頭請它把沒發的補發,然後把「每一張都要檢查」跟「三個平台都要回報成功或失敗」補進規則裡。

迴圈掉了一段,通常就是那一段的檢查點還沒被寫進去。你發現一個漏檢,就補一個檢查點,這條流程就往前走一格。

這條流程的五個段落、四項圖片檢查的完整寫法、還有另一個安靜失敗的缺口,寫在人在外面,可以叫家裡的電腦先做嗎?:手機掃一次 QR code,桌機就開始跑

四、想讓兩個 AI 一起工作,先給它們同一份資料

做到這裡,你手上有一份會自己跑的檢查清單。下一步是找第二個 AI 來挑錯。在那之前有一個前提要先處理:兩邊要讀得到同一份東西。

「我有一份資料夾,就是主知識庫。我的文件、我的分析、我的策略、我的企劃,甚至我的技能包,我都存在這一份資料夾裡面,然後讓這一份資料夾可以讓各家 AI 去讀。」2026-08-02 講座現場

這樣做的好處很直接:兩邊互審的時候,彼此都找得到同一份材料,不用你在中間貼來貼去。

現場有人問我,全部堆在一個資料夾會不會亂。我的回答是會。

解法是這個資料夾裡面要有一套規矩,讓所有 AI 一讀就知道什麼東西放哪裡、怎麼找、怎麼用。這件事可以用分類與檢索機制處理,不在這篇的範圍,但你至少要知道:資料互通很快,代價是它會越堆越多,所以規矩要跟資料一起長。

工具怎麼選

我目前的主力是兩家桌面版 Agent:Claude 與 Codex。理由很務實,這兩家各訂閱一份月費,在桌面版就能互相呼叫,不需要另外接 API,對文書工作者來說門檻最低。

我的工作以文件分析推理、質化的報告研究、跨域統整為主,不是比誰操作快、也不是寫程式。以這條線來說,最強的模型當然好用,但價格也高;我現在重要的決策,就是讓這兩家跑。

如果你不是工程師這篇講的所有做法,我都是以文書工作者做得到為前提在設計的。你聽完覺得道理對、但不知道怎麼動手,可以直接把這篇丟給你的 AI,請它照著幫你轉成你手上工具的做法。

五、要不要抄別人的技能包:先看流程衝突,再看來源

現在網路上有很多現成的技能包,包含讓兩家 AI 互相呼叫的那種。抓來用是最快的路,但有兩件事要先看。

這一節講的是判斷順序。來源三層怎麼看、權限真正要看的四件事、已經裝了一堆該怎麼回頭查,在裝了別人的技能包,AI 會不會被搞亂?:抄之前我會先做三件事裡面有完整版。

比惡意程式更常發生的是流程衝突

對方通常沒有惡意,只是他的工作方式跟你的差很多。你把他的做法整包加進來,你的 AI 就會很困惑:你原本的流程想往東走,這個技能包說要往西走,那到底要往哪走?

所以我會先問一句:他的機制跟流程,跟我現在的有沒有衝突?如果有,我是直接不要、參考部分、整合部分,還是只抓他的概念,工作流程仍然用我的?

這一問通常比安全檢查更值得花時間,因為衝突不會報錯,只會讓你的流程慢慢走鐘,而你要很久以後才發現。

來源檢查能擋什麼,擋不掉什麼

我的習慣是把那篇文章或那個連結先丟給 AI,請它檢查有沒有惡意程式、順便查一下網路上的說法是不是真的,確認沒問題再請它安裝。這一段我在課堂上是直接念出來給大家看的,而且我會多加一句:

「你們不只要懷疑 AI,要懷疑我。這是一個好習慣。雖然我是真人在這裡,我不會騙大家,但網路上的東西,我建議大家至少還是要讓 AI 先檢查一下。」2026-08-02 講座現場
這一步的界線它能幫你看出明顯的可疑指令、對照網路上有沒有人回報過問題;它擋不掉刻意藏在內容裡、專門寫給 AI 看的誘導文字,因為那段文字在被檢查的當下,就已經進到 AI 的閱讀範圍裡了。用一個可能被影響的判官去審污染源,這件事本身有極限。

所以我的做法是三層:

  1. 先看來源是誰。有名有姓、有公開紀錄、有人用過,跟一個匿名連結,風險差很多
  2. 再叫 AI 檢查一遍,同時查網路上的說法
  3. 前兩層都過了,才給它動手的權限;來源不清楚的東西,寧可只抄概念自己重寫一份

安裝的時候會遇到三件事

  • 存取權:技能包檢查過沒問題,可以給它完整存取權,讓它自己去抓資料處理。前提是前面那兩層真的做過。
  • 帳號授權:它會要求另一家的授權。這裡要講清楚:我不是要用 API 額外付費,我要用訂閱帳號的額度。
  • 誰去裝:這種比較機械性的工作,交給執行力強的那一家去裝就好,不用動用你的主力模型。

順帶一提,沒有現成技能包也裝得起來。我在朋友的電腦上示範過一次,連技能包都沒給,只給了一段課程宣傳文案,AI 自己也裝好了。差別只是多跑幾次。流程真的很複雜的時候,我的建議是參考別人的,改成自己的形狀。

六、「安裝好了」不等於「跑通了」

裝完之後,AI 通常會說:我安裝好了。

這句話也要被審查。我幫人裝過一次,AI 說安裝好了,我照慣例追問:你確定嗎?你怎麼驗證?你有跑過嗎?沒有問題了嗎?

「當 AI 說安裝好了的時候,第一個問他:你確定你安裝好了嗎?你怎麼驗證你安裝好了?你有跑過嗎?沒有問題了嗎?」2026-08-02 講座現場

那次它才說:對,我只是安裝好了,但其實還沒有正式測試,還沒跑通。

所以驗收基準要你自己給,不能讓它自己定義什麼叫做好。基準分兩層:

第一層,這個東西的功能本身有沒有跑出結果。你裝的是做圖卡的技能包,就要看到一張真的圖;裝的是報表檢查,就要看到一份真的檢查回報。這一層不能省。

第二層,如果你裝的是「讓兩家 AI 互相呼叫」這種連線類的東西,還要驗連線本身。我當時的講法是這樣:

我所謂的跑通基準是,我要能夠做到兩家模型互相審查。 你可以隨便丟一個模擬的測試問題去問另外一家模型, 總之你要給我確定,你們兩個可以交叉推理。
回報與驗證的差別回報是它認為自己做完了,驗證是這件事真的存在、可以檢查,而且換一個人或另一個模型也接得下去。

七、為什麼一個模型審不出自己的問題

假設今天辦一場廚藝比賽,讓每個廚師自由發揮自己愛吃的東西。麻辣火鍋的廚師就是愛吃辣,所以他一定會做辣的料理。等到評審的時候,他會覺得哪一道好吃?辣的好吃。

他沒有要騙人,也沒有要包庇自己。他就是喜歡吃辣。

模型也是這樣。它在做決策的時候覺得這樣好,才會給出這個決策;那它回頭審這個決策的時候,當然還是覺得好,因為這就是它認為好的樣子。所以叫同一個模型自我審查三遍五遍,我個人覺得意義不大。

愛吃辣的廚師,需要的是一個不吃辣的試吃員。2026-08-02 講座現場

互審的三種難度

難度 01 只審最後結果

主力模型一路做到最後,另一家只看成品。日常工作大多用這種就夠。

難度 02 兩邊各跑一次再併回

兩家從同一份材料各自跑完,讓主力模型參考另一條線,把值得採用的併進來。

難度 03 完整雙軌互審

A 跑完審 B,B 跑完審 A,最後兩邊再互審一次。重大決策才這樣跑。

第一種是我最早的做法,用了一陣子之後我發現一個盲點:如果主力模型在最一開始就判斷錯了呢?或者有另外一條完全不同的路,效果也很好呢?只審結果,這兩種情況你永遠看不到。

跑雙軌有一個關鍵設定,講起來很簡單但很容易被忽略:兩邊要用同一份材料,各自從頭跑,而且不准偷看對方的答案。先看了對方的結果,第二軌就失去獨立性,你拿到的只是同一個答案的兩種說法。

成本大概怎麼算

先講固定成本:兩家各一份月費訂閱,桌面版工具就能互相呼叫,不需要另外接 API。這是我目前的用法。

再講變動成本。同一件事,只審結果大約是單跑一次的兩倍工作量,完整雙軌互審會再明顯多一截,因為兩邊都要從頭讀完整份材料。三家互審我算過就沒有做:如果要每一家都審過每一家,A 要審 B 再審 C,B 要審 A 再審 C,C 要審 A 審 B,然後再重跑一遍,工作量會往上翻好幾倍,時間也耗不起。這幾個數字是我自己抓的相對感覺,不是量測結果。

老實說我沒有精確計量過每一種的實際用量,只能給你相對關係。實用的判斷是:日常工作用第一種,重要決策才用第三種。

三種難度各自的可複製指令、怎麼選的三個判準、只能用一家模型時還剩什麼,在怎麼設計讓兩個 AI 互審?:三種不同程度的審查機制設計

八、我寫進迴圈的四條規則

兩家能互審之後,接下來要決定的是:它們遇到問題的時候該怎麼辦。我現在跑迴圈工程,一定會寫進去的有四條。

「遇事不決,找另外一家模型一起聊。你遇到問題,你就去找另外一家模型討論,不要先找我,你先去跟另外一個問。」2026-08-02 講座現場
01

遇事不決

先找另外一家模型討論,不要第一時間回來找人。

02

小矛盾

兩家聊一聊,有共識就繼續做。

03

大矛盾

能跳過就跳過,把不相關的後續做完,最後回報哪一步有問題。

04

修正上限

明確給次數。不給,它會一直修到自己覺得好為止。

這四條的前提是你的材料給得夠清楚。以我自己的經驗來說,只要過去的案例、我的標準、我的原則、相關的範例都寫在那份共用資料裡,兩家互相討論,絕大多數狀況不會出問題。這是經驗判斷,不是統計數字。

「假設第五個問題真的是大矛盾無解,如果他可以跳過,你就先跳過。接下來的六七八九十跟第五個沒有相關,那你就把這個做完,你最後回報我說第五步有問題就好了。」2026-08-02 講座現場

這條規則要解決的是一個很實際的問題:卡住不做,比做完九成再回報糟糕。你半小時後回來,看到一條做到一半的線,跟看到一份完成九成加一句「第五步卡住」,價值差很多。

第四條是我當天臨時補的講到一半我才想到這題沒講:你叫它按標準修正,那修幾次?兩次、五次、十次,還是一千次一萬次?不給上限,它會無限制修下去,費用一直往上,或者越修越歪。

九、跑幾輪要停

還有一個問題比「要不要互審」更容易被漏掉:修正幾次要停。

如果你只跟 AI 說「按照我的標準去修正」,沒有給次數上限,它會一直修到它覺得好為止。結果通常是兩種:費用一直往上,或是越修越歪。

我自己的工作以文件分析推理為主,經驗值是兩到三輪。這裡的一輪指的是:

  • 第一輪:A 審完 B,B 也審完 A
  • 第二輪:A 依照 B 的建議再跑一次,B 依照 A 的建議再跑一次,然後互相再審一遍

兩到三輪還沒解決的,通常跑十輪一百輪也不會有解。那通常是規則本身缺了東西,加再多次數也補不回來。

判斷「該停了」的方法:桌上多了一顆球

你給 AI 一張整潔桌面的標準圖,還有四個指標:文件疊齊、杯子回固定位置、小物集中收好、桌面空出七成。它整理一輪,拿結果對照標準,沒達標就再整理。

但如果桌上突然多了一顆球,而標準圖裡沒有球,也沒有寫球該放哪裡呢?它再跑一百次也不可能完全符合標準圖。這時候該做的是停下來回報:其他都擺好了,這顆球沒有規則,請你補。

停止條件要寫兩層第一層是次數上限,第二層是「遇到規則沒寫到的情況,做完其他的並且回報」。規則不可能窮盡所有狀況,但可以規定遇到沒寫到的狀況該怎麼辦。

對家聯絡不上的時候:交接要寫哪四欄

我有一台桌機兩台筆電,帳號會互相踢登出,互審常常斷線。以前規則寫死「一定要互審」,結果一斷線整條流程就卡住,我回來看到的是做到一半的東西。

現在我的規則改成:對家沒回應,主軌先做完,然後告訴我另一家沒有審,並且產出一份交接指令,讓我一鍵複製就能貼給另一家。那份交接要說清楚四件事:

  1. 這個任務在跑什麼
  2. 它要審什麼
  3. 它不能動什麼(重點:這份丟過去是要它審,不是要它接著做)
  4. 審完之後結果要貼回哪裡

主軌先跑完,多數時候拿到的東西大部分可以用,比整條線停在那裡好。這是我自己的體感,不是量過的比例。

十、現場的真實案例:150 頁教材,兩家模型審出不一樣的結果

講座當天有位學員提了一個很好的案例。他在公司做了一份 150 頁的教材簡報,先用一家模型反覆檢查內容、結構、章節順序,改了十幾次;換另一家模型審一遍,竟然找出內容裡的標準規範錯誤,而原本那家開了深度思考也沒抓到。他後來查出來,問題是兩套國際標準的差異。

他問我怎麼看。我的第一個判斷不是模型能力,是資料。

下面三件事是當天的回答。材料、切法、視角三層各自怎麼做,含指定規範版本的規則寫法,在AI 改了十幾次還是有錯,怎麼辦?:資料清理只是第一關,長文件審不出錯的三層設計

第一件事:PPT 與 PDF 一定要先做資料清理

「PPT 跟 PDF 它完全是為了人類視覺去做排版的。比如說 PDF 上面有一條橫線,我們看起來是一條橫線,但是它在檔案裡面是要寫起點、終點、線的顏色、大小、位置高低。它實際的邏輯跟我們肉眼看到的邏輯差異非常大,所以 AI 容易出很多問題。」2026-08-02 講座現場

嚴肅規範、嚴肅內容的東西,我一律建議先轉成純文字的 Markdown 檔,把章節架構跟內容檢索一起整理出來,再交給 AI 分析。我遇到說文件容易有幻覺的案例,絕大多數做完資料清理都有極大幅度的改善。這是我接觸過的案例,不是統計。

第二件事:分區塊,而且不要用同一種切法

  • 不要一口氣分析十章。一個章節分析一次,最後再大統整
  • 換一種切法再跑一次:先請它把十章拆成五個主題,再用五個主題跑一遍
  • 兩種切法互相覆蓋,才蓋得到單一切法的死角
  • 然後才交叉:用章節切法讓兩家各跑一輪,兩邊結果再交叉一次

資料沒清理很容易遇到上下文塞爆,分區塊也是在處理這件事。

第三件事:跟 AI 討論機制本身

這是我覺得最多人漏掉的一步。與其一直重跑,不如直接跟它討論為什麼會錯:

為什麼你會出現規範錯誤的資訊?我們如何確保資訊是正確的? 假設我願意多花時間、多花費用,讓你第二次複查, 或是第二次用不同角度驗證,第三次再跟其他 AI 複查, 我也有兩套模型可以搭配。 你是否可以陪我一起設計出一套審查機制、除錯機制, 或是資訊追蹤機制,以確保所有的東西都是正確的?

問題通常來自三個地方:指令沒下好、機制沒設定好、或者真的超出模型當下的能力上限。這三種的處理方式完全不同,所以要先分清楚是哪一種。

最後一步:從技能包升級成迴圈

「我們理論上剛剛這個技能包,就已經把所有的標準跟方法都講得超清楚了對不對?如果你做一兩次發現這樣做真的都沒有問題了,你下一句就是:你知道我的標準,你應該要讓自己跑。我希望下次我不在你身邊,你也可以按照這個標準自己審查自己跑。這就叫迴圈工程了。」2026-08-02 講座現場

那位學員接著說:現在缺的就是沒有辦法讓它自己跑。這句話很精準,而答案通常也很簡單:它不知道錯的時候該怎麼辦、不知道怎麼修正。把這兩件事寫進去,它就跑得動了。

十一、順序:先審查,再互審,最後才是迴圈

回頭把整件事排成順序,其實只有三段:

第一段 · 審查機制

你能問出什麼問題,就能寫下什麼檢查點。前面那七個追問句就是起點。

第二段 · 兩個模型互審

因為同一個模型審不出自己的偏好,找一個不吃辣的試吃員。

第三段 · 迴圈工程

把完成條件、檢查方法、失敗換路、停止條件寫清楚,讓它自己跑、自己審、自己修到達標。

這三段是有先後的。審查機制沒做好就直接想自動化,等於把一個你自己都說不清楚的標準交出去,跑再多輪也不會變好。

那什麼時候算是走到第三段?有一個很簡單的判斷方式。當你發現這套標準做過一兩次都沒問題了,你就可以跟它說:

你知道我的標準了。我希望下次我不在你身邊, 你也可以按照這個標準,自己審查、自己跑。

它做得到,這就叫迴圈工程。做不到的時候,多半是它不知道錯的時候該怎麼辦。那就回到第一段,把「錯了怎麼發現、怎麼修、什麼時候停」補進去。

你可以怎麼開始

今天 把七句貼過去

下次 AI 說「我記住了」,把第二節那七句貼過去。光是第三、四句就會讓你看到很多以為存在的規則其實沒有生效。

這週 寫成一份規則,然後測它

挑一個你每週要做兩三次的任務,把每次都在檢查的東西列出來,照第三節那份範例的格式寫成規則文字,決定它住哪裡,最後開一個新對話測它會不會自己跑起來。

做完前兩步 找另一家來審

先從只審結果開始。只用網頁版也做得到:開另一家的網頁版,把成品貼過去,請它挑毛病。等你發現「它一開始的方向就有問題」這種狀況,再升級成雙軌。

三步都不需要寫程式。你需要的是把自己每次都在做的那個檢查講清楚,這件事只有你做得到,AI 幫不了你。

接下來讀哪一篇

這篇是總覽,四個段落各有一篇完整版:

AI工作流AIAgent技能包設計跨家審稿基礎2026-08-06 發布