AI 工作流 / 成本控制

讓 AI 定時整理資料前,先決定它多久醒一次

網頁負責機械性收集,AI 負責定時統整。同樣每小時跑,從每月 400 美金降到 3.69 美金,差別只在呼叫 AI 之前先問一句。

第一版的想法很直覺:把 588 則訊息全部丟給 AI 讀。算完成本,每個月 400 美金。

我幫一個社團做了「LINE 群訊息自動整理成活動看板」。訊息堆在群裡沒人整理,想知道下週例會幾點,得一直往上滑。

這篇講我怎麼把每月 400 美金壓到 76 元台幣,以及過程中發現的一件事:省錢的關鍵不在挑哪個模型,是決定 AI 多久醒一次,挑模型反而是其次。文章裡的耗時與準確度是實測,用 138 則真實訊息、八天、一個 LINE 群跑出來的;月費是拿那八天的量推估的,不是真的跑滿一個月的帳單。

適合誰

· 手上有一堆 LINE 群訊息、表單、郵件想自動整理,但不知道會花多少錢的人
· 已經在用 AI 做自動化,帳單長出來嚇一跳的人
· 要幫客戶做自動化,需要先估價的專業工作者

你可以帶走什麼

· 一個判斷順序:哪些工作給程式做、哪些非得給 AI 做
· 一張頻率與成本對照表,四種頻率的月費與延遲,可以直接套到你的案子
· 一個先算再做的估算方法,四個數字乘一乘就知道大概多少錢,不用真的接 API
· 一條實測結論:規則寫清楚的效果,遠大於換一個更貴的模型

一個群,一天十七則訊息,堆到 588 則沒人整理

文中的群組、活動與課程名稱都已去識別,只留下判斷需要的結構。數字與訊息則數沒有動。

那是一個社團的 LINE 公佈欄群組。成員在裡面公告例會、貼報名接龍、傳活動照片、講參加心得。

問題是 LINE 沒有整理功能。想知道「下週例會幾點」,得往上滑。想找上個月參訪的照片,滑不到。

所以我做了一個看板:把群訊息整理成活動清單,每場活動有時間地點、報名名單、當天照片、社友心得。

做的時候第一個版本很簡單:把全部訊息丟給 AI,請它整理出活動清單。跑了一次,確實會動。然後我算了一下成本。

先把 LINE 群的東西收下來,我之前寫過怎麼做

全部丟給 AI 讀,一個月要 400 美金

先把三個數字分清楚,後面都會用到:九百多則是這個群的全部歷史訊息,588 則是目前累積還沒整理的,138 則是我拿來做測試的樣本(連續八天)。

全量重讀的意思是每次都把九百多則送進去,大約 145,000 個 token。

Token 是計費的單位,中文一個字大約算 1.3 個 token。如果每小時整理一次,一天 24 次,一個月 720 次:

145,000 token × 720 次 = 1.04 億 token

用當時的單價算,一個月 400 美金。台幣一萬兩千塊,整理一個社團的群組。

荒謬的地方在於 那 900 則訊息裡,899 則上一次已經讀過了。每小時重讀一次全部,只為了看有沒有多出一則新的。

把「有沒有新東西」這一步交給程式,同樣每小時跑,成本差一百倍

改法是把整件事拆成兩層。

機械層:查資料庫有沒有比上次更新的訊息。這是一句資料庫查詢,問的是「有沒有比上次新的」,不用 AI,不花錢。

AI 層:有新訊息才啟動,而且只送新的那幾則,不重讀全部。

沒有新訊息 → 結束,這次花 0 元 有 3 則新的 → 只送這 3 則 + 現有活動摘要給 AI
第一版 全部給 AI

每次重讀全部 900 則,沒有新訊息也照跑。
每月 400 美金

改完 分成兩層

機械層先查有沒有新的,有才叫 AI,而且只送新的。
每月 3.69 美金

這個拆法的判準

判準只有一句:這件事的答案唯一嗎。跟難易無關。

程式做

查有沒有新訊息
數報名幾個人
答案唯一,一句查詢的事

AI 做

這則在講哪一場活動
這是公告還是閒聊
要讀懂上下文才判得出來

這兩個數字要用同一個頻率比才公平 上面兩欄都是「每小時跑一次」,400 美金對 3.69 美金,差 108 倍。後面我實際採用的是每三小時,那個數字是每月 2.38 美金,但頻率不一樣,不能跟 400 放在同一句話裡比。
答案唯一的給程式,需要讀懂上下文的才給 AI 數人頭看起來是最簡單的工作,但 AI 在這件事上反而最不可靠。四個模型對同一份名單數出 8、9、9、12 四個答案,因為名單裡有「+1」、有空的編號、有人重複報名。這是規則題,寫成程式碼一次就對。
哪些該給 AI、哪些該給程式,我拆過一次完整的

決定多久醒一次,就決定了帳單長什麼樣

拆完兩層之後,成本剩下唯一一個旋鈕:多久檢查一次。

我用那個群八天的真實訊息(138 則)算了四種頻率。「平均等多久」是指一則訊息從貼出來到出現在看板上,中間隔多久。

一天兩次

早上九點、下午五點
平均等 6.7 小時
一個月 NT$48

每三小時

早上七點到晚上十點
平均等 1.9 小時
一個月 NT$76

每小時

早上七點到晚上十點
平均等 48 分鐘
一個月 NT$118

每十分鐘

早上七點到晚上十點
平均等 5 分鐘
一個月 NT$253

最慢跟最快差五倍價錢,體感差八十倍。

為什麼選每三小時

看起來每五小時更省(一個月省 16 元),但有個數字讓我放棄它:每三小時的話,只有 4% 的訊息要等超過三小時才進看板;改成每五小時,這個數字跳到 36%

省下 16 元,換來三分之一的訊息要等三小時以上。這不划算。

而且那個群的貼文集中在早上十點到晚上十點,深夜八天下來一則都沒有。每三小時剛好接得住整個活躍時段。

排程醒來 144 次,真的花錢的只有 4.5 次

這是整套機制裡我最喜歡的一段。

排程固定每十分鐘醒一次,一天醒 144 次。但醒來會做三件事,前兩件都不花錢:

1. 看現在該不該做

設定是每三小時,現在 11:20 不在名單上,睡回去。不花錢。

2. 查有沒有新訊息

在名單上才做這步。一句資料庫查詢。不花錢。

3. 真的有新的才叫 AI

這一步才花錢。八天實測平均一天 4.5 次。

為什麼不乾脆設成每三小時醒一次

因為這樣換頻率就要改程式、重新部署。

現在的做法是頻率寫在設定裡,不寫在程式裡。想從每三小時換成每小時,改一個字就好,不用動程式碼,也不用重新上線。新舊之間只有一個開關,退得回去。

四個模型全錯在同一個地方,問題出在規則

這一段是整件事裡最意外的發現。

我寫了一份規則給 AI:什麼算活動、什麼不算、同一場怎麼合併。然後拿四個模型跑同一批訊息測準確度。結果四個全部把一段課程介紹當成獨立活動建立了:

《用香氣打造你的影響力》 副標:從個人風格、社交記憶到共好的一場香氣體驗講座 這是一堂讓大家親身感受香氣怎麼成為人與人連結的課……

那是某場例會的講題。它沒有自己的日期、沒有自己的地點。

四個模型都錯,代表換模型救不回來。我回去在規則裡補了一段:「一段介紹要講什麼的文案,如果沒有自己的日期或地點,那是某場活動的講題,不要建立成活動。」

重跑,四個模型全部答對。

規則寫清楚的效果,遠大於換一個更貴的模型 我後來把這份規則從 6,900 字補到 14,500 字,每個月的費用只多了 4 元台幣。規則寫長幾乎不影響成本,因為同一段規則重複送可以走快取,只算十分之一的價錢。

最貴最慢的模型沒有比較準

同一批 138 則訊息,我跑了六個組合(三個模型 × 兩種推理強度)。這是其中三組:

便宜模型、低推理

滿分
289 秒
每月 NT$76

貴模型、高推理

滿分
694 秒
每月 NT$196

貴模型、低推理

輸出空的
完全失敗
沒有成績可以算

慢 2.4 倍、貴 2.6 倍,準確度一樣。還有一個意外:貴模型配低推理反而整個失敗,讀完六萬個 token 之後輸出一個空的結果。貴不等於穩。

真正影響帳單的是推理強度

推理強度(reasoning effort)是可以調的參數,決定 AI 在回答前「想多久」。想得越久越貴,因為那段思考本身就是要付錢的 token。

實測同一個模型:低推理每次用掉約 500 個推理 token,高推理用掉約 6,100 個。差 12 倍,而且這部分算貴的輸出價。 換模型省的錢,遠不如把推理強度調對。

模型有一次比我的標準答案還對

測到後面出現一件有趣的事。

我準備了一份人工標準答案當評分依據。某個模型拿了 29 分,滿分 38。它被扣最多的那一題(5 分)是把一場工作坊建立成獨立活動,而我的答案寫著「這是陷阱,不該建立」。

我回去看原文:

9/12例會後還有精彩的芳療工作坊,趕快報名喔! https://forms.gle/...

它有自己的報名連結。能單獨報名,就是單獨一場。

模型是對的,我的標準答案錯了 這已經是第二次。前一次我把別的單位辦的活動當成「多抓」扣分,但規則裡明明寫著那種活動也要收。兩次都是我自己的答案有問題。

這件事後來變成規則裡的一條判準:有自己的報名連結,通常就是單獨一場。它比「有沒有寫日期地點」好用,因為報名連結是個乾淨的訊號,不用猜。

寫完這條之後又被審稿的 AI 打回一次:它不是鐵證。一場活動的晚宴可能另外收費、另外報名,但仍然屬於同一場。所以規則裡它是強證據,要跟其他判準一起看,判不準就留空。

教訓是:模型跟你的答案不一致時,先回去看原文,不要直接判它錯。

順帶一提,我連分母都報錯過 這篇初稿寫的是「29 分,滿分 31」。後來回去重算計分規則,滿分其實是 38。評分腳本印的「滿分 31」是一行寫死的字串,加分項目後來改過,那行字沒跟著改。自己寫的工具印出來的數字,也要回去對一次。

上面哪些數字是實測,哪些是估的

寫這種文章最容易犯的錯是把結果講得太漂亮。幾個限制要先講清楚。

可以信的 實測

· 訊息量、耗時、準確度:138 則、八天、一個群
· 推理 token:直接從 API 回傳量到的
· 模型單價:官方價目表

要打折的 估的或沒測過

· 中文一個字算幾個 token:用 1.3 倍
· 換一個群會不會一樣:沒測過,要重測
· 標準答案:我一個人判的,已經自己錯過兩次

省下來的錢有限。 一個群一個月從 400 美金壓到 76 元台幣,聽起來很多,但絕對值本來就不大。這套方法真正的價值是讓成本可預測。案子放大十倍時,可預測比省錢重要。

判斷錯了還是要人工修。 機制能把錯誤壓到少數,壓不到零。所以看板上每一則訊息都留了「為什麼這樣判斷」的紀錄,讓人能回頭查。

今天就能開始:先算再做

如果你手上也有類似的事情要自動化,這三步可以直接套。

第一步:把工作分成兩堆

拿一張紙,把要做的事逐項列出來,每一項問一句:這件事的答案是唯一的嗎?

答案唯一的(查有沒有新資料、數數量、比對格式、算日期)→ 程式做。

需要讀懂上下文才能判斷的(這段在講什麼、屬於誰、是不是同一件事)→ AI 做。

大部分人的第一版都是全部丟給 AI。分完之後你會發現,真正需要 AI 的比想像中少很多。

第二步:先算成本,不要先跑

不用真的接 API 才知道要花多少。你需要四個數字:每次送進去多少字(數一下你的資料)、每天會觸發幾次(看你打算多久跑一次)、模型單價(查官方價目表)、中文字換 token(大約 1.3 倍)。

乘起來就是月費。算出來如果超過你的預算,那是設計有問題。 回第一步重分。

另一筆我也是先算再做的帳

第三步:頻率寫在設定裡,不要寫在程式裡

這是最容易忽略但最有用的一條。頻率是你之後最可能調整的東西。用起來覺得太慢想加快、帳單太高想放慢,都會改到它。把它寫在程式裡,每次調都要重新部署;寫在設定裡,改一個字就好。

順便留一個手動按鈕。 排程負責日常,按鈕負責「我現在就想看」。有了按鈕,頻率可以設得比你以為的慢很多。

自動化、效率、成本:真正要取捨的只有一組

回到最開始的問題:自動化、效率、成本,怎麼取捨。我的答案是它們不是三選二。

真正的取捨只有一組:延遲對成本。等得久一點就便宜,要快就貴。這條線畫在哪裡,看你的人多久會回頭看一次。

自動化程度不在這條線上。把「查有沒有新東西」交給程式,自動化程度提高了,同樣每小時跑的成本卻降到百分之一。因為那一步本來就不該給 AI 做。

所以順序是這樣 一、先把不該給 AI 的工作拿回來給程式。這一步同時提高自動化與降低成本,沒有取捨。
二、剩下的部分,才在延遲與成本之間選一個點。
三、那個點寫在設定裡,隨時可以改。
接下來可以看什麼

這篇提到過的

再往前後延伸