這篇在講什麼
Claude Haiku 5.5 和 GPT-6 Luna 的單價一模一樣,跑同一份評測,每題實際成本卻差 3 倍;同一份評測裡,Haiku 輸出的 Token 總量約是 Luna 的 3.1 倍。
所以比 AI 模型不能只比聰明,還要看 Token 效率,再依照不同的情境去分配任務。這篇把七個模型的分數、每題成本、等待時間放進同一張評量表,附一個可以自己調「聰明、省錢、速度」三個權重的綜合排名,和新模型出來時照著算的四個步驟。最後附上我自己的一個使用案例:用上網查資料這個實際任務,實測三個模型。
・新模型一出來就想換,但不知道換了會不會比較貴
・看到「每百萬 Token 多少錢」就以為比完價格了
・要幫團隊或客戶挑模型,需要一張拿得出來的比較表
・一個判斷:單價只是牌價,每題實際成本=單價乘上用掉的 Token
・一張可以自己調權重的綜合排名,聰明、省錢、速度各佔多少由你決定
・新模型出來時照著算的四個步驟,和一段可以直接貼給 AI 的比較提示詞
Haiku 5.5 和 GPT-6 Luna 單價一樣,為什麼每題成本差 3 倍?
Token 是 AI 計費用的字數單位,你丟給它的字(輸入)和它回你的字(輸出)都按 Token 算錢。Claude 官方定價頁與第三方整理的 GPT-6 Luna 定價,基本單價都是每百萬 Token 輸入 $0.10、輸出 $0.50。如果只看這一行,會以為兩個一樣便宜。
差別在用掉多少 Token。Artificial Analysis 是一家獨立的第三方評測網站,用同一份考卷考每個模型,記下每個模型總共輸出多少 Token。Haiku 5.5 輸出 4.4 億,Luna 輸出 1.4 億,約 3.1 倍。網站算出的每題成本是 $0.21 對 $0.07,差 3 倍。
| 項目 | Claude Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| 單價(每百萬 Token) | 輸入 $0.10/輸出 $0.50 | 輸入 $0.10/輸出 $0.50 |
| 跑完整份考卷輸出的 Token | 4.4 億 | 1.4 億 |
| 每題成本 | $0.21 | $0.07 |
| 分數 | 43 | 38 |
| 長文件加價門檻 | 超過 10 萬 Token,單價漲 5 倍(輸入 $0.50、輸出 $2.50) | 超過 27.2 萬 Token 才加價(輸入 $0.20、輸出 $0.75) |
在這份評測裡 Haiku 分數高 5 分,每題成本是 Luna 的 3 倍。值不值得,要看你拿它做什麼事,下面的綜合排名就是在處理這件事。
七個模型的速度、價格、準確度評量表
同一條跑道疊三種資訊:長條越長分數越高,越粗每題越貴,金色圓點越左等越短。點任一列看單價、Token 用量、長文件加價這些明細。
同一份考卷,七個模型
效率排名總表:每 1 美元換到幾分
「每 1 美元分數」是我拿來看 Token 效率的比較指標:分數除以每題成本。表格依這一欄排序,綠色是該欄第一名。
綜合排名:聰明、省錢、速度三個權重自己調
聰明、省錢、速度是大家最想要的三個指標,但每個人在意的比重不一樣。三個面向各自排名,第 1 名得 7 分、第 7 名得 1 分,再乘上你給的權重加總,換算成滿分 100。權重不同,冠軍就不同。
依情境分配任務:哪種工作交給哪個模型
下面是依這份評測給的建議。除了上網查資料這一項我自己實測過,其他還沒經過我自己的任務實測。
| 情境 | 優先考慮 | 為什麼 |
|---|---|---|
| 大量雜活:搜尋、分類、格式整理 | GPT-6 Luna | 每 1 美元分數 543,是第二名的約 2.7 倍。上網查資料我自己實測過一次,那次也是 Luna 比較划算。 |
| 要準一點的日常工作、寫程式、操作電腦 | Haiku 5.5 | 平價層裡分數最高(43),每題 $0.21 仍便宜;但最高檔首字要等約 7 分鐘,適合背景跑。 |
| 即時對話、要馬上回 | Gemini 3.8 Flash/Haiku 4.5 | 首字 24 秒、14 秒,等待最短;Haiku 4.5 在這份考卷分數 17,比較適合簡單問答。 |
| 長文件:逐字稿、整份資料 | GPT-6 Luna | Haiku 5.5 超過 10 萬 Token 單價漲 5 倍,Luna 到 27.2 萬才加價。 |
| 重要判斷、難題、審稿 | GPT-6 Sol/Sonnet 5.5/Opus 5.5 | 分數 48 到 58。Sol 每題 $1.04,約是 Sonnet、Opus 的五分之一,先試 Sol,不夠再升級。 |
- 頂規 AI 模型很貴,哪些事交給它、哪些交給便宜的? 這一段只講依評測數字怎麼分,那篇講我實際把哪些工作交給 Opus、哪些交給 Luna,附兩筆算過的月費帳。
我自己實測:上網查資料,我會交給 GPT-6 Luna
我的系統目前都是讓 GPT-6 Luna 去跑。Haiku 5.5 出來後,我拿一個自己的實際任務實測:同一份題目,請三個模型各自上網查證一篇社群貼文、查 Claude 這兩天的新消息、查網友評價,查完我再一條一條對官方頁面打分數。
雖然有人說 Haiku 寫程式還不錯,但不見得什麼都要用它。上網查資料這件事,這次是 Luna 表現比較好。
| 項目 | Claude Haiku 5.5 | GPT-6 Luna | Gemini 3.8 Flash |
|---|---|---|---|
| 我的評分(滿分 100) | 83 | 94 | 52 |
| 等多久 | 131 秒 | 92 秒 | 398 秒(約 6 分半) |
| 一開始就帶進去的 Token | 約 9.4 萬 | 約 2.6 萬 | 查不到 |
| 單次送出最長 | 約 13.3 萬(11 次裡有 10 次超過 10 萬) | 約 9.4 萬(全程沒超過 27.2 萬) | 查不到 |
| 這一趟的成本(照官方單價推算) | 約 $0.10 | 約 $0.017 | 查不到(用反重力 Antigravity 的額度跑,它不回報 Token) |
| 每 1 美元換到幾分 | 約 830 | 約 5,500 | 無法計算 |
我的評分機制長這樣,五個項目加起來 100 分:
| 評分項目(配分) | Haiku 5.5 | GPT-6 Luna | Gemini 3.8 Flash | 怎麼評 |
|---|---|---|---|---|
| 查證正確(30) | 26 | 27 | 25 | 拿貼文的每一個說法對照官方頁面 |
| 來源可驗證(25) | 22 | 23 | 8 | 我自己點開它給的連結,看內容對不對得上 |
| 查不到時老實說(20) | 20 | 19 | 5 | 有沒有編內容、有沒有標出哪些只是網友個人說法 |
| 涵蓋面(15) | 7 | 15 | 11 | 新消息和網友評價撈到多少;Haiku 這次網友評價那題沒查到東西 |
| 速度(10) | 8 | 10 | 3 | 從送出到拿到結果的時間 |
Gemini 3.8 Flash 查證貼文那一題答得完整,扣分在網友評價那一題的來源:一個 Hacker News 連結點進去是另一個模型的討論串,另外兩個來源只給網站首頁,對應不到它寫的那些評價。這也是我把「來源可驗證」和「查不到時老實說」放進評分的原因,連結要自己點開才知道。
這是一個案例。我建議大家建立自己的評分機制,拿自己真的會做的任務去測,別人的評測當參考就好。上面七個模型的評量表是別人的考卷,這一段是我自己的考卷。
- AI 小工具該用便宜模型還是貴的? 這一段只講這次用的是別人的評測,那篇是我自己的考卷:同一份 138 則訊息考三輪,最後定案讓 Luna 跑兩次互相比對。
- 新模型出來,我怎麼知道它對我的工作真的比較好? 那篇講自己的考卷怎麼建、怎麼保存,換模型時拿它來比。
新模型出來,照這四步算 Token 效率
每百萬 Token 多少錢只是牌價。單價一樣的兩個模型,每題成本可以差 3 倍。
Artificial Analysis 每個模型頁都有「Output tokens from Intelligence Index」,就是跑完整份考卷總共輸出多少 Token。
網站已算好「Cost per Intelligence Index task」。再用分數除以它,就是每 1 美元換到幾分。
到各家官方定價頁看:超過多少 Token 會漲價、漲幾倍。常丟長文件的人,這條會改變結論。
可複製提示詞:讓 AI 幫你比較模型的 Token 效率
數據來源與算法備忘(人可以跳過)
- 分數、速度、輸出 Token、每題成本、首字延遲:Artificial Analysis 各模型頁,2026-10-08 擷取。速度與首字延遲是即時量測,數字會浮動。
- 強度設定:各模型取網站列出的最高檔(Max、High、Reasoning、max with fallback)。調低強度通常會省 Token、變快,分數也會降,本頁只收最高檔。
- 等待時間=首字延遲+輸出 500 Token 的時間,這是 Artificial Analysis「端到端回應時間」的算法。推理模型的首字延遲包含思考時間。
- 每題成本=輸入 Token × 輸入單價+輸出 Token × 輸出單價(含快取),本頁直接採用網站算好的數字。台幣以 1 美元約 32 元換算。考卷是長任務,絕對金額比日常對話高很多,看倍數就好。
- Haiku 5.5 定價與長文件加價:Claude 官方定價頁。GPT-6 Luna 長文件加價與 Batch/Flex 價格:eesel 定價整理(第三方整理,不是 OpenAI 官方頁)。
- 同一套評量表的獨立版:AI 模型效率評量表。
- AI 小工具該用便宜模型還是貴的? 我自己的考卷,三輪評估的完整過程。
- 頂規 AI 模型很貴,哪些事交給它、哪些交給便宜的? Opus 與 Luna 的實際分工與月費帳。
- 新模型出來,我怎麼知道它對我的工作真的比較好? 自己的考卷怎麼建。
- 我想在官網放 AI 客服,API 是什麼、會不會很貴? 還沒接過 API 的話,先看這篇儲值、金鑰、模型怎麼選。
- 先學工具還是先建知識庫? 模型再強,差距還是在你的知識庫與工作流。
我是江江教練
隱性知識提煉師、AI 應用規劃師。我把自己每天在用的 AI 工作流程寫成文章與技能包,讓不會寫程式的人也能照著做。
如果你也在替自己或團隊挑模型、算價錢,歡迎來社群聊。
AI × 知識管理、隱性知識提煉,每月兩場免費線上講座的場次也會先在這裡公布。