AI 工作流 / 模型選擇

新的 AI 模型 Token 效率要怎麼比較?|效率評量表與綜合排名,聰明、省錢、速度三個權重自己調

單價一樣的兩個模型,跑同一份考卷,每題實際成本可以差 3 倍。我把 Artificial Analysis 公開的評測中文化,用我自己看 Token 效率的方式整理成一張評量表,聰明、省錢、速度三個權重你可以自己調。也附上我自己的一個使用案例,用實際的任務實測 Haiku 5.5、GPT-6 Luna、Gemini 3.8 Flash。

咪卡踮腳拿捲尺量一根很高的長條,旁邊矮長條和高長條都掛著單價一樣的吊牌,高的標著乘以 3;下方三根推桿標著聰明、省錢、速度
單價一樣,用掉的 Token 可以差好幾倍。

這篇在講什麼

Claude Haiku 5.5 和 GPT-6 Luna 的單價一模一樣,跑同一份評測,每題實際成本卻差 3 倍;同一份評測裡,Haiku 輸出的 Token 總量約是 Luna 的 3.1 倍。

所以比 AI 模型不能只比聰明,還要看 Token 效率,再依照不同的情境去分配任務。這篇把七個模型的分數、每題成本、等待時間放進同一張評量表,附一個可以自己調「聰明、省錢、速度」三個權重的綜合排名,和新模型出來時照著算的四個步驟。最後附上我自己的一個使用案例:用上網查資料這個實際任務,實測三個模型。

先說清楚:七個模型的評量表不是我自己實測 七個模型的評量表,是我把 Artificial Analysis 已經做好、公開的評測中文化,再用我自己看 Token 效率的方式去算。他們的數據都有公開,來源附在文末。2026-10-08 我另外用自己的一個任務(上網查資料)實測了 Haiku 5.5 和 GPT-6 Luna,結果放在我的實測那一段。
適合誰

・新模型一出來就想換,但不知道換了會不會比較貴
・看到「每百萬 Token 多少錢」就以為比完價格了
・要幫團隊或客戶挑模型,需要一張拿得出來的比較表

你可以帶走什麼

・一個判斷:單價只是牌價,每題實際成本=單價乘上用掉的 Token
・一張可以自己調權重的綜合排名,聰明、省錢、速度各佔多少由你決定
・新模型出來時照著算的四個步驟,和一段可以直接貼給 AI 的比較提示詞

Haiku 5.5 和 GPT-6 Luna 單價一樣,為什麼每題成本差 3 倍?

Token 是 AI 計費用的字數單位,你丟給它的字(輸入)和它回你的字(輸出)都按 Token 算錢。Claude 官方定價頁與第三方整理的 GPT-6 Luna 定價,基本單價都是每百萬 Token 輸入 $0.10、輸出 $0.50。如果只看這一行,會以為兩個一樣便宜。

差別在用掉多少 Token。Artificial Analysis 是一家獨立的第三方評測網站,用同一份考卷考每個模型,記下每個模型總共輸出多少 Token。Haiku 5.5 輸出 4.4 億,Luna 輸出 1.4 億,約 3.1 倍。網站算出的每題成本是 $0.21 對 $0.07,差 3 倍。

項目Claude Haiku 5.5GPT-6 Luna
單價(每百萬 Token)輸入 $0.10/輸出 $0.50輸入 $0.10/輸出 $0.50
跑完整份考卷輸出的 Token4.4 億1.4 億
每題成本$0.21$0.07
分數4338
長文件加價門檻超過 10 萬 Token,單價漲 5 倍(輸入 $0.50、輸出 $2.50)超過 27.2 萬 Token 才加價(輸入 $0.20、輸出 $0.75)

在這份評測裡 Haiku 分數高 5 分,每題成本是 Luna 的 3 倍。值不值得,要看你拿它做什麼事,下面的綜合排名就是在處理這件事。

長文件的價差更大例如一次輸入 20 萬 Token、輸出 5 千 Token(不算快取),Haiku 5.5 約 $0.113,Luna 約 $0.023,差約 5 倍。常丟逐字稿、整份資料給 AI 的人,這條會改變結論。

七個模型的速度、價格、準確度評量表

同一條跑道疊三種資訊:長條越長分數越高,越粗每題越貴,金色圓點越左等越短。點任一列看單價、Token 用量、長文件加價這些明細。

同一份考卷,七個模型

Artificial Analysis Intelligence Index,2026-10-08 擷取
模型長度=分數 粗細=每題成本 圓點=等待時間分數每題成本適合
長條刻度(分)
圓點刻度(秒)

效率排名總表:每 1 美元換到幾分

「每 1 美元分數」是我拿來看 Token 效率的比較指標:分數除以每題成本。表格依這一欄排序,綠色是該欄第一名。

名次只在這七個模型之間比Artificial Analysis 各模型頁上的名次母數不同(有的寫 /182、有的寫 /225),不能跨頁直接比名次。所以這張表只拿原始數字,在這七個模型之間重排。

綜合排名:聰明、省錢、速度三個權重自己調

聰明、省錢、速度是大家最想要的三個指標,但每個人在意的比重不一樣。三個面向各自排名,第 1 名得 7 分、第 7 名得 1 分,再乘上你給的權重加總,換算成滿分 100。權重不同,冠軍就不同。

依情境分配任務:哪種工作交給哪個模型

下面是依這份評測給的建議。除了上網查資料這一項我自己實測過,其他還沒經過我自己的任務實測。

情境優先考慮為什麼
大量雜活:搜尋、分類、格式整理GPT-6 Luna每 1 美元分數 543,是第二名的約 2.7 倍。上網查資料我自己實測過一次,那次也是 Luna 比較划算。
要準一點的日常工作、寫程式、操作電腦Haiku 5.5平價層裡分數最高(43),每題 $0.21 仍便宜;但最高檔首字要等約 7 分鐘,適合背景跑。
即時對話、要馬上回Gemini 3.8 Flash/Haiku 4.5首字 24 秒、14 秒,等待最短;Haiku 4.5 在這份考卷分數 17,比較適合簡單問答。
長文件:逐字稿、整份資料GPT-6 LunaHaiku 5.5 超過 10 萬 Token 單價漲 5 倍,Luna 到 27.2 萬才加價。
重要判斷、難題、審稿GPT-6 Sol/Sonnet 5.5/Opus 5.5分數 48 到 58。Sol 每題 $1.04,約是 Sonnet、Opus 的五分之一,先試 Sol,不夠再升級。
貴的模型和便宜的模型怎麼分工,我之前寫過實際做法

我自己實測:上網查資料,我會交給 GPT-6 Luna

我的系統目前都是讓 GPT-6 Luna 去跑。Haiku 5.5 出來後,我拿一個自己的實際任務實測:同一份題目,請三個模型各自上網查證一篇社群貼文、查 Claude 這兩天的新消息、查網友評價,查完我再一條一條對官方頁面打分數。

雖然有人說 Haiku 寫程式還不錯,但不見得什麼都要用它。上網查資料這件事,這次是 Luna 表現比較好。

項目Claude Haiku 5.5GPT-6 LunaGemini 3.8 Flash
我的評分(滿分 100)839452
等多久131 秒92 秒398 秒(約 6 分半)
一開始就帶進去的 Token約 9.4 萬約 2.6 萬查不到
單次送出最長約 13.3 萬(11 次裡有 10 次超過 10 萬)約 9.4 萬(全程沒超過 27.2 萬)查不到
這一趟的成本(照官方單價推算)約 $0.10約 $0.017查不到(用反重力 Antigravity 的額度跑,它不回報 Token)
每 1 美元換到幾分約 830約 5,500無法計算
成本差約 6 倍,主要是超過 10 萬那條線Haiku 5.5 這次是在 Claude Code 裡當子代理跑,一開始就帶著約 9.4 萬 Token 的系統說明和我的工作規則,第一次送出約 9.4 萬還在便宜那一級,第二次就超過 10 萬,之後每次都用漲 5 倍的單價算(我逐次拆開算過)。如果全程都在 10 萬以下,同一趟大約 $0.03。所以這個差距大部分來自用法和起跑時帶了多少東西,Haiku 5.5 本身的單價跟 Luna 一樣。

我的評分機制長這樣,五個項目加起來 100 分:

評分項目(配分)Haiku 5.5GPT-6 LunaGemini 3.8 Flash怎麼評
查證正確(30)262725拿貼文的每一個說法對照官方頁面
來源可驗證(25)22238我自己點開它給的連結,看內容對不對得上
查不到時老實說(20)20195有沒有編內容、有沒有標出哪些只是網友個人說法
涵蓋面(15)71511新消息和網友評價撈到多少;Haiku 這次網友評價那題沒查到東西
速度(10)8103從送出到拿到結果的時間

Gemini 3.8 Flash 查證貼文那一題答得完整,扣分在網友評價那一題的來源:一個 Hacker News 連結點進去是另一個模型的討論串,另外兩個來源只給網站首頁,對應不到它寫的那些評價。這也是我把「來源可驗證」和「查不到時老實說」放進評分的原因,連結要自己點開才知道。

這是一個案例。我建議大家建立自己的評分機制,拿自己真的會做的任務去測,別人的評測當參考就好。上面七個模型的評量表是別人的考卷,這一段是我自己的考卷。

這次實測的限制只跑一次,題目只有一份。Haiku 5.5 和 GPT-6 Luna 都是用訂閱方案跑的,沒有真的扣 API 費用,成本是照官方單價推算(Claude 官方定價頁、OpenAI GPT-6 Luna 模型頁),搜尋工具本身的費用沒有算進去;Haiku 的輸出 Token 是用報告長度估的;Gemini 3.8 Flash 是用反重力 Antigravity 的指令列工具跑,拿不到 Token 數,所以沒有成本數字。
我自己怎麼用同一份考卷重新評估模型,另外寫過

新模型出來,照這四步算 Token 效率

STEP 1不要只看單價

每百萬 Token 多少錢只是牌價。單價一樣的兩個模型,每題成本可以差 3 倍。

STEP 2看它用掉多少 Token

Artificial Analysis 每個模型頁都有「Output tokens from Intelligence Index」,就是跑完整份考卷總共輸出多少 Token。

STEP 3算每題成本與每 1 美元分數

網站已算好「Cost per Intelligence Index task」。再用分數除以它,就是每 1 美元換到幾分。

STEP 4查長文件加價門檻

到各家官方定價頁看:超過多少 Token 會漲價、漲幾倍。常丟長文件的人,這條會改變結論。

可複製提示詞:讓 AI 幫你比較模型的 Token 效率

幫我比較這幾個 AI 模型的 Token 效率:(填模型名稱)。 請到 Artificial Analysis 各模型頁,抓這幾個數字: 分數、每題成本(Cost per Intelligence Index task)、跑完考卷輸出的 Token、每秒輸出速度、首字延遲。 再到各家官方定價頁,查超過多少 Token 會加價。 算出: 1. 每 1 美元分數=分數 ÷ 每題成本 2. 等待時間=首字延遲 + 500 ÷ 每秒輸出速度 用表格列出來,並告訴我: 我的工作主要是(填你的工作,例:大量整理逐字稿), 聰明、省錢、速度三個我比較在意(填比重),該優先試哪一個。 只比同一版本評測、同一強度設定、同一天擷取的數字,條件對不上就不要排名,直接告訴我缺什麼。 每個數字都附來源網址與擷取日期,查不到的寫查不到,不要自己估。

數據來源與算法備忘(人可以跳過)

  • 分數、速度、輸出 Token、每題成本、首字延遲:Artificial Analysis 各模型頁,2026-10-08 擷取。速度與首字延遲是即時量測,數字會浮動。
  • 強度設定:各模型取網站列出的最高檔(Max、High、Reasoning、max with fallback)。調低強度通常會省 Token、變快,分數也會降,本頁只收最高檔。
  • 等待時間=首字延遲+輸出 500 Token 的時間,這是 Artificial Analysis「端到端回應時間」的算法。推理模型的首字延遲包含思考時間。
  • 每題成本=輸入 Token × 輸入單價+輸出 Token × 輸出單價(含快取),本頁直接採用網站算好的數字。台幣以 1 美元約 32 元換算。考卷是長任務,絕對金額比日常對話高很多,看倍數就好。
  • Haiku 5.5 定價與長文件加價:Claude 官方定價頁。GPT-6 Luna 長文件加價與 Batch/Flex 價格:eesel 定價整理(第三方整理,不是 OpenAI 官方頁)。
  • 同一套評量表的獨立版:AI 模型效率評量表。
這篇提到過的 再往前後延伸

我是江江教練

隱性知識提煉師、AI 應用規劃師。我把自己每天在用的 AI 工作流程寫成文章與技能包,讓不會寫程式的人也能照著做。

如果你也在替自己或團隊挑模型、算價錢,歡迎來社群聊。

LINE 社群

AI × 知識管理、隱性知識提煉,每月兩場免費線上講座的場次也會先在這裡公布。

加入社群 ↗