這篇在講什麼
你交代 AI 一件事,改了三次,它終於說「我知道了,我記住了」。下一次同樣的任務,它又用回原本的做法。關鍵在「記住」這兩個字:它在 AI 那裡有三種意思,只有一種能撐到下一次對話。
這篇分三段,你可以只讀你需要的那一段:
- 第一到第二節:三種假記住怎麼分辨,加上七個追問句,今天就能用
- 第三節:把追問寫成 AI 自己會跑的檢查清單,含一份可以直接複製的範例
- 第四節之後:進階的部分。兩家 AI 怎麼共用一份資料、抄別人的技能包要先看什麼、驗收基準怎麼定、互審的三種難度、寫進迴圈的四條規則、跑幾輪要停,最後是一個現場學員的真實案例
- 只用 ChatGPT 或 Claude 網頁版,交代過的規則它老是忘記的人
- 已經在用 AI 做正事,但每次都得盯著它,一離開就走鐘的人
- 寫過技能包或規則檔,卻發現它常常沒被讀到、沒被觸發,又講不出原因的人
- 七個追問句,AI 說「記住了」的時候直接貼上去用
- 一份可以直接複製的檢查清單範例,含寫在哪、用什麼句型、怎麼確認它真的跑了
- 一組判斷:什麼時候該找第二個 AI 來審、互審的三種難度、跑幾輪要停
一、「我記住了」有三種意思,只有一種撐得到下一次
這句話是我在講座開場講的。學工具跟學怎麼指揮工具,是兩件事。而指揮的第一關,就是它到底有沒有真的把你的話收下來。
我用 AI 的第一天就滿滿的懷疑,可是懷疑的方向一開始是錯的。我以為要防的是它答錯,後來發現要防的是它答對了,但沒有做。
最早那次,我把一個規則講了很多遍,它說記住了。我問它:你記在哪?
它的回答很老實:抱歉,我的記住只在這個對話視窗裡面。
講白話就是:關掉這個對話,它就忘了。這是第一種假記住。
一、自訂指令(設定裡的個人化那一區,ChatGPT 與 Claude 都有類似位置)。適合放你每一次對話都要遵守的事,例如品牌用語、稱呼、輸出格式。缺點是所有對話共用,規則多了會互相打架。
二、專案(ChatGPT 的 Projects、Claude 的 Projects)。開一個專案,把規則寫進那個專案的「指示」欄位,這個專案裡的每一個新對話就會先讀到它。要注意寫的位置:ChatGPT 是 project instructions,Claude 要放在專案指示或專案知識裡,它不會去讀專案的名稱與簡介。適合放某一類工作專屬的規則,例如月結檢查、客戶提案。各家的欄位名稱與位置會改,開設定看一眼最準。
判斷方式很簡單:每次都要用的放自訂指令,只有某類工作要用的放專案。各家介面偶爾會改位置,在設定裡搜尋「自訂」或「指令」通常就找得到;免費方案能不能用這兩項,各家不時在調整,開設定看一眼最快。你要做的只是把「記住」這件事,從對話裡搬到一個下次還打得開的地方。
我當時的做法是把要求講清楚:我要你的記住是,以後開新的任務、新的視窗,你都要記住。它才提出兩個做法,一個是寫一份工作日誌放在固定目錄,一個是寫成技能包。
檔案寫出來了,我以為這件事解決了。結果下一次它還是沒照做。因為檔案存在跟檔案被讀到是兩件事,沒有人叫它去讀,它就不會讀。這是第二種假記住。
最後一種最難發現。我把規則寫成技能包,這次總該會自動啟動了吧。直到有一次我發現它還是沒啟動,追問之後它說:我有記成技能包,但是那個觸發詞沒有設定好,我不認為這個工作流程跟這件事是同一件事。
它沒有騙我。技能包在、內容也對,只是它判斷「現在這個任務」跟「那個技能包負責的任務」不是同一件事,所以沒有把它叫出來。
關掉這個對話就忘了。
要問的那一句:你記在哪?換一個新對話還在嗎?
檔案寫了,但沒有人叫它讀。
要問的那一句:下次遇到同樣任務,你會去讀哪一個檔案?
檔案會讀,但它認不出這次該讀。
要問的那一句:我要怎麼說,你才會想到要用這一份?
這三個坑我是一次一次踩過來的。
二、七個追問句,直接複製去用
AI 說「我終於懂了,我知道了,我記住了」的時候,我不會回「好」。我會一口氣問完下面這些。
第一組:你到底記了什麼
這一組在測理解。很多時候它複述得出字面,卻講不出為什麼要這樣做,那就代表下次情況一變它就會走鐘。
第二組:你記在哪,找不找得到
第三個問題會打掉「記在視窗」,第四個問題會打掉「檔案有了沒啟動」跟「觸發詞沒設好」。這兩句是我後來才加的,因為前面三個坑都是在這裡漏掉的。
第三組:做錯了怎麼辦
這一組最重要,也最少人問。前四個問題都還是在確認「它這次會不會照做」,第五到第七題問的是「我不在的時候,它有沒有辦法自己發現、自己修、自己累積」。這三題答得出來,你才有機會把工作交出去。
三、把追問變成一份它自己會跑的檢查清單
我對這件事本來很沒有自信。我不是工程師,不會寫自動化流程,而且我的工作大多是抽象的分析與判斷,很難拆成步驟。那時候我的日常是:AI 跑一步,我校正一步,它再跑一步,我再校正一步。
後來寫成技能包,一次可以跑三到五步,但每三到五步還是要我停下來校正。真正的轉折是我發現一件事:這些校正點,其實每次都一樣。
同一個工作流程,我就是在那幾個地方停下來檢查,標準也一直沒變。既然標準這麼明確,那能不能讓它自己審?沒有到標準就自己修正,直到到標準為止?
檢查清單長什麼樣子
很多人卡在這裡:知道自己每次都在檢查什麼,但不知道「寫成規則」到底要寫成什麼樣子。以下用一個辦公室的例子,從頭到尾走一次。
假設你每個月要核部門費用彙整表,你每次都在看這五項:日期有沒有跨月、發票號碼有沒有重複、部門代號對不對、金額加總跟收據張數對不對、有沒有漏簽核。
第一步,把五項寫成一段規則文字。就是這樣的白話,不用任何語法:
第二步,決定它住在哪裡。只用網頁版的話,貼進自訂指令,或開一個「月結」專案放在專案說明欄。有在用桌面版 Agent 的話,存成一個檔案放在固定資料夾,或做成技能包。位置不重要,重要的是下次打得開、而且它會自己去讀。
第三步,確認它真的跑了。這一步最常被跳過。開一個全新的對話,只講你平常會講的那句話(「這份報表幫我看一下」),然後看它有沒有自己按五項回報。有,代表觸發詞寫對了;沒有,代表它認不出這句話跟這份規則有關,回去把「什麼時候用我」那段補上你真正會講的說法。
觸發得動與觸發不動的差別
第三種假記住幾乎都出在「什麼時候用我」這一段寫得太抽象。對照一下:
- 用於財務相關文件處理
- 協助使用者進行資料驗證
- 適用於各類報表
- 我說「核費用表」「月結檢查」「這份報表幫我看一下」時
- 我丟給你含日期、發票號碼、部門代號、金額的表格時
- 我問「這張表有沒有問題」時
左邊那種寫法你自己讀得懂,但它要判斷「使用者現在這句話算不算財務相關文件處理」,就會猶豫。右邊直接寫出你真正會講的那幾句話,判斷就變成比對。
還有一個坑:兩份規則的觸發條件重疊時,它可能只叫出其中一份。所以規則不要越寫越多份,同一類工作盡量收在同一份裡面。
觸發不動還有另外兩個成因,比較少見但值得知道:一是這次對話塞了太多資料,規則被擠出它的閱讀範圍(就是前面講的上下文滿了);二是規則檔放的位置它根本沒去讀。所以第三步的測試要在全新的、乾淨的對話裡做,才分得出來是措辭問題還是位置問題。
一個我自己在跑的例子
我有一條發文流程:人在外面用手機丟一個 YouTube 連結加語音指令,桌機那邊分析內容、寫成我自己觀點的短文、做圖卡、然後發文。裡面關於圖片,我寫死了四項檢查:規格是不是 4 比 5、有沒有壓縮跟轉檔、圖上的文字有沒有跑掉、角色造型有沒有跑掉。
這四項就是我以前每次都要人工看一遍的東西。寫進流程之後,它自己檢查、自己修,我只在文案那一關把關。
要老實講的是,這條迴圈最近一次跑只算半成功。有一張圖沒被檢查到,因為我的規則只寫了「檢查兩次」,第三張之後就沒有覆蓋;短文平台發成功了,另外兩個社群平台沒發出去,而且它沒有自己把這件事找回來。我後來的處理很單純:回頭請它把沒發的補發,然後把「每一張都要檢查」跟「三個平台都要回報成功或失敗」補進規則裡。
迴圈掉了一段,通常就是那一段的檢查點還沒被寫進去。你發現一個漏檢,就補一個檢查點,這條流程就往前走一格。
這條流程的五個段落、四項圖片檢查的完整寫法、還有另一個安靜失敗的缺口,寫在人在外面,可以叫家裡的電腦先做嗎?:手機掃一次 QR code,桌機就開始跑。
五、要不要抄別人的技能包:先看流程衝突,再看來源
現在網路上有很多現成的技能包,包含讓兩家 AI 互相呼叫的那種。抓來用是最快的路,但有兩件事要先看。
這一節講的是判斷順序。來源三層怎麼看、權限真正要看的四件事、已經裝了一堆該怎麼回頭查,在裝了別人的技能包,AI 會不會被搞亂?:抄之前我會先做三件事裡面有完整版。
比惡意程式更常發生的是流程衝突
對方通常沒有惡意,只是他的工作方式跟你的差很多。你把他的做法整包加進來,你的 AI 就會很困惑:你原本的流程想往東走,這個技能包說要往西走,那到底要往哪走?
所以我會先問一句:他的機制跟流程,跟我現在的有沒有衝突?如果有,我是直接不要、參考部分、整合部分,還是只抓他的概念,工作流程仍然用我的?
這一問通常比安全檢查更值得花時間,因為衝突不會報錯,只會讓你的流程慢慢走鐘,而你要很久以後才發現。
來源檢查能擋什麼,擋不掉什麼
我的習慣是把那篇文章或那個連結先丟給 AI,請它檢查有沒有惡意程式、順便查一下網路上的說法是不是真的,確認沒問題再請它安裝。這一段我在課堂上是直接念出來給大家看的,而且我會多加一句:
所以我的做法是三層:
- 先看來源是誰。有名有姓、有公開紀錄、有人用過,跟一個匿名連結,風險差很多
- 再叫 AI 檢查一遍,同時查網路上的說法
- 前兩層都過了,才給它動手的權限;來源不清楚的東西,寧可只抄概念自己重寫一份
安裝的時候會遇到三件事
- 存取權:技能包檢查過沒問題,可以給它完整存取權,讓它自己去抓資料處理。前提是前面那兩層真的做過。
- 帳號授權:它會要求另一家的授權。這裡要講清楚:我不是要用 API 額外付費,我要用訂閱帳號的額度。
- 誰去裝:這種比較機械性的工作,交給執行力強的那一家去裝就好,不用動用你的主力模型。
順帶一提,沒有現成技能包也裝得起來。我在朋友的電腦上示範過一次,連技能包都沒給,只給了一段課程宣傳文案,AI 自己也裝好了。差別只是多跑幾次。流程真的很複雜的時候,我的建議是參考別人的,改成自己的形狀。
六、「安裝好了」不等於「跑通了」
裝完之後,AI 通常會說:我安裝好了。
這句話也要被審查。我幫人裝過一次,AI 說安裝好了,我照慣例追問:你確定嗎?你怎麼驗證?你有跑過嗎?沒有問題了嗎?
那次它才說:對,我只是安裝好了,但其實還沒有正式測試,還沒跑通。
所以驗收基準要你自己給,不能讓它自己定義什麼叫做好。基準分兩層:
第一層,這個東西的功能本身有沒有跑出結果。你裝的是做圖卡的技能包,就要看到一張真的圖;裝的是報表檢查,就要看到一份真的檢查回報。這一層不能省。
第二層,如果你裝的是「讓兩家 AI 互相呼叫」這種連線類的東西,還要驗連線本身。我當時的講法是這樣:
七、為什麼一個模型審不出自己的問題
假設今天辦一場廚藝比賽,讓每個廚師自由發揮自己愛吃的東西。麻辣火鍋的廚師就是愛吃辣,所以他一定會做辣的料理。等到評審的時候,他會覺得哪一道好吃?辣的好吃。
他沒有要騙人,也沒有要包庇自己。他就是喜歡吃辣。
模型也是這樣。它在做決策的時候覺得這樣好,才會給出這個決策;那它回頭審這個決策的時候,當然還是覺得好,因為這就是它認為好的樣子。所以叫同一個模型自我審查三遍五遍,我個人覺得意義不大。
互審的三種難度
主力模型一路做到最後,另一家只看成品。日常工作大多用這種就夠。
兩家從同一份材料各自跑完,讓主力模型參考另一條線,把值得採用的併進來。
A 跑完審 B,B 跑完審 A,最後兩邊再互審一次。重大決策才這樣跑。
第一種是我最早的做法,用了一陣子之後我發現一個盲點:如果主力模型在最一開始就判斷錯了呢?或者有另外一條完全不同的路,效果也很好呢?只審結果,這兩種情況你永遠看不到。
跑雙軌有一個關鍵設定,講起來很簡單但很容易被忽略:兩邊要用同一份材料,各自從頭跑,而且不准偷看對方的答案。先看了對方的結果,第二軌就失去獨立性,你拿到的只是同一個答案的兩種說法。
成本大概怎麼算
先講固定成本:兩家各一份月費訂閱,桌面版工具就能互相呼叫,不需要另外接 API。這是我目前的用法。
再講變動成本。同一件事,只審結果大約是單跑一次的兩倍工作量,完整雙軌互審會再明顯多一截,因為兩邊都要從頭讀完整份材料。三家互審我算過就沒有做:如果要每一家都審過每一家,A 要審 B 再審 C,B 要審 A 再審 C,C 要審 A 審 B,然後再重跑一遍,工作量會往上翻好幾倍,時間也耗不起。這幾個數字是我自己抓的相對感覺,不是量測結果。
三種難度各自的可複製指令、怎麼選的三個判準、只能用一家模型時還剩什麼,在怎麼設計讓兩個 AI 互審?:三種不同程度的審查機制設計。
八、我寫進迴圈的四條規則
兩家能互審之後,接下來要決定的是:它們遇到問題的時候該怎麼辦。我現在跑迴圈工程,一定會寫進去的有四條。
遇事不決
先找另外一家模型討論,不要第一時間回來找人。
小矛盾
兩家聊一聊,有共識就繼續做。
大矛盾
能跳過就跳過,把不相關的後續做完,最後回報哪一步有問題。
修正上限
明確給次數。不給,它會一直修到自己覺得好為止。
這四條的前提是你的材料給得夠清楚。以我自己的經驗來說,只要過去的案例、我的標準、我的原則、相關的範例都寫在那份共用資料裡,兩家互相討論,絕大多數狀況不會出問題。這是經驗判斷,不是統計數字。
這條規則要解決的是一個很實際的問題:卡住不做,比做完九成再回報糟糕。你半小時後回來,看到一條做到一半的線,跟看到一份完成九成加一句「第五步卡住」,價值差很多。
九、跑幾輪要停
還有一個問題比「要不要互審」更容易被漏掉:修正幾次要停。
如果你只跟 AI 說「按照我的標準去修正」,沒有給次數上限,它會一直修到它覺得好為止。結果通常是兩種:費用一直往上,或是越修越歪。
我自己的工作以文件分析推理為主,經驗值是兩到三輪。這裡的一輪指的是:
- 第一輪:A 審完 B,B 也審完 A
- 第二輪:A 依照 B 的建議再跑一次,B 依照 A 的建議再跑一次,然後互相再審一遍
兩到三輪還沒解決的,通常跑十輪一百輪也不會有解。那通常是規則本身缺了東西,加再多次數也補不回來。
判斷「該停了」的方法:桌上多了一顆球
你給 AI 一張整潔桌面的標準圖,還有四個指標:文件疊齊、杯子回固定位置、小物集中收好、桌面空出七成。它整理一輪,拿結果對照標準,沒達標就再整理。
但如果桌上突然多了一顆球,而標準圖裡沒有球,也沒有寫球該放哪裡呢?它再跑一百次也不可能完全符合標準圖。這時候該做的是停下來回報:其他都擺好了,這顆球沒有規則,請你補。
對家聯絡不上的時候:交接要寫哪四欄
我有一台桌機兩台筆電,帳號會互相踢登出,互審常常斷線。以前規則寫死「一定要互審」,結果一斷線整條流程就卡住,我回來看到的是做到一半的東西。
現在我的規則改成:對家沒回應,主軌先做完,然後告訴我另一家沒有審,並且產出一份交接指令,讓我一鍵複製就能貼給另一家。那份交接要說清楚四件事:
- 這個任務在跑什麼
- 它要審什麼
- 它不能動什麼(重點:這份丟過去是要它審,不是要它接著做)
- 審完之後結果要貼回哪裡
主軌先跑完,多數時候拿到的東西大部分可以用,比整條線停在那裡好。這是我自己的體感,不是量過的比例。
十、現場的真實案例:150 頁教材,兩家模型審出不一樣的結果
講座當天有位學員提了一個很好的案例。他在公司做了一份 150 頁的教材簡報,先用一家模型反覆檢查內容、結構、章節順序,改了十幾次;換另一家模型審一遍,竟然找出內容裡的標準規範錯誤,而原本那家開了深度思考也沒抓到。他後來查出來,問題是兩套國際標準的差異。
他問我怎麼看。我的第一個判斷不是模型能力,是資料。
下面三件事是當天的回答。材料、切法、視角三層各自怎麼做,含指定規範版本的規則寫法,在AI 改了十幾次還是有錯,怎麼辦?:資料清理只是第一關,長文件審不出錯的三層設計。
第一件事:PPT 與 PDF 一定要先做資料清理
嚴肅規範、嚴肅內容的東西,我一律建議先轉成純文字的 Markdown 檔,把章節架構跟內容檢索一起整理出來,再交給 AI 分析。我遇到說文件容易有幻覺的案例,絕大多數做完資料清理都有極大幅度的改善。這是我接觸過的案例,不是統計。
第二件事:分區塊,而且不要用同一種切法
- 不要一口氣分析十章。一個章節分析一次,最後再大統整
- 換一種切法再跑一次:先請它把十章拆成五個主題,再用五個主題跑一遍
- 兩種切法互相覆蓋,才蓋得到單一切法的死角
- 然後才交叉:用章節切法讓兩家各跑一輪,兩邊結果再交叉一次
資料沒清理很容易遇到上下文塞爆,分區塊也是在處理這件事。
第三件事:跟 AI 討論機制本身
這是我覺得最多人漏掉的一步。與其一直重跑,不如直接跟它討論為什麼會錯:
問題通常來自三個地方:指令沒下好、機制沒設定好、或者真的超出模型當下的能力上限。這三種的處理方式完全不同,所以要先分清楚是哪一種。
最後一步:從技能包升級成迴圈
那位學員接著說:現在缺的就是沒有辦法讓它自己跑。這句話很精準,而答案通常也很簡單:它不知道錯的時候該怎麼辦、不知道怎麼修正。把這兩件事寫進去,它就跑得動了。
十一、順序:先審查,再互審,最後才是迴圈
回頭把整件事排成順序,其實只有三段:
你能問出什麼問題,就能寫下什麼檢查點。前面那七個追問句就是起點。
因為同一個模型審不出自己的偏好,找一個不吃辣的試吃員。
把完成條件、檢查方法、失敗換路、停止條件寫清楚,讓它自己跑、自己審、自己修到達標。
這三段是有先後的。審查機制沒做好就直接想自動化,等於把一個你自己都說不清楚的標準交出去,跑再多輪也不會變好。
那什麼時候算是走到第三段?有一個很簡單的判斷方式。當你發現這套標準做過一兩次都沒問題了,你就可以跟它說:
它做得到,這就叫迴圈工程。做不到的時候,多半是它不知道錯的時候該怎麼辦。那就回到第一段,把「錯了怎麼發現、怎麼修、什麼時候停」補進去。
你可以怎麼開始
下次 AI 說「我記住了」,把第二節那七句貼過去。光是第三、四句就會讓你看到很多以為存在的規則其實沒有生效。
挑一個你每週要做兩三次的任務,把每次都在檢查的東西列出來,照第三節那份範例的格式寫成規則文字,決定它住哪裡,最後開一個新對話測它會不會自己跑起來。
先從只審結果開始。只用網頁版也做得到:開另一家的網頁版,把成品貼過去,請它挑毛病。等你發現「它一開始的方向就有問題」這種狀況,再升級成雙軌。
三步都不需要寫程式。你需要的是把自己每次都在做的那個檢查講清楚,這件事只有你做得到,AI 幫不了你。
接下來讀哪一篇
這篇是總覽,四個段落各有一篇完整版:
- AI 改了十幾次還是有錯,怎麼辦?:資料清理只是第一關,長文件審不出錯的三層設計:第十節那個 150 頁教材的案例,材料、切法、視角三層的完整做法。
- 怎麼設計讓兩個 AI 互審?:三種不同程度的審查機制設計:第七節那三種難度的可複製指令、選擇判準、斷線備援。
- 裝了別人的技能包,AI 會不會被搞亂?:抄之前我會先做三件事:第五節的完整版,含權限四項與已經裝一堆怎麼回頭查。
- 人在外面,可以叫家裡的電腦先做嗎?:手機掃一次 QR code,桌機就開始跑:第三節那條發文迴圈實際長什麼樣子,包含它沒跑好的地方。