AI 工作流 · 語音派工 · 生圖實測

讓網頁版 ChatGPT 當 Codex 總控台|有官方 MCP,但限制還很多

語音派工回家裡電腦、反過來叫 Chat 生圖,兩個方向我都試了。能用的、卡住的都攤開,給你參考。

咪卡操作桌機、筆電與手機總控台的文章封面
咪卡總機的概念插畫。

我想要的很簡單:開口講,工作就交給電腦裡的 AI 去做,做完把結果拿回來。我想讓網頁版 ChatGPT 當這個總控台。目前限制還很多,問題也還不少,這篇把我的走法攤開,給你參考。

適合誰

已經在好幾個 AI 之間交辦工作、想少切幾個視窗的人。想用手機叫家裡電腦做事的人。用語音工作、覺得額度掉很快的人。常要生圖、希望角色每張都長一樣的人。

你可以帶走什麼

兩個方向的實際走法、每一步走 MCP 還是靠網頁、咪卡跑掉的錯誤示範、一次事後撈出來的用量,還有三個檢查點和一段可以直接丟給 AI 的提示詞。

截至 2026 年 10 月 10 日,我接到哪
這一段現況
用語音叫 Coco 派工每天在用
方向一:網頁語音派回家裡電腦的 Codex通了,我已經在用
再往下叫 Claude Code、成果送回網頁還沒接好
方向二:Codex 叫網頁 Chat 生圖能叫,但只有送指令走 MCP
連續五張、咪卡造型一致五張都生出來,原圖只拿回三張
哪條路比較省還比不出來

兩個方向,一張圖看懂

兩個方向,分開看

咪卡比較兩個選項
  • 暖橘實線:本次實測完成
  • 灰藍實線:使用者回報可用
  • 灰藍虛線:文件接法示意或未驗

上條|網頁語音派回本機

下條|Codex 叫網頁 Chat 生圖

網頁語音:在 ChatGPT 網頁用說的交代工作。使用者回報,這裡已能把任務派回本機。

概念示意,實測截至2026年10月9日。上條依使用者回報與官方文件畫出,完整回收未驗;下條為單張實測。

我試了兩個方向。方向一:在網頁版用語音,把工作派回家裡電腦的 Codex。方向二:反過來,讓 Codex 叫網頁版 Chat 生圖。下面先把方向一講完,再講方向二。

方向一:在網頁版用語音,派工回家裡的 Codex

這條是我最早想要的:開口講,工作就交給家裡電腦的 AI 去做。先從我原本的語音總機講起。

1-1 我有一個總機叫 Coco

以前我在 Codex 開十幾二十個任務,開到最後會忘記哪個是做什麼的、進度在哪。

現在我有個總機叫 Coco。開新任務、追進度、收成果給我驗收,都先找它。我只要跟 Coco 聊。

Coco 跑在 Codex 上。我用說的交代工作,它再分派給其他 Codex Agent、Claude Code,或交給 Antigravity 裡的 Gemini 和 Claude。

10 月 7 日脆文配圖,中間是 Coco 擔任 Codex 總機的實際工作畫面
10 月 7 日脆文配圖。中間是 Coco 擔任 Codex 總機的實際工作畫面。

我還把即時語音接上一個 3D 角色。示範時我發現,只把 ChatGPT 打開,大家還是習慣用工具的方式操作;桌面上一出現角色,大家就很自然把它當員工交代事情。

人類的習慣很難改變,所以我們先改變工具的操作介面,讓工具更符合人性。

用說的派工真的很方便。但我還想更進一步:桌機、筆電、手機都能叫同一個總控台,接到我自己的電腦和各種 Agent,像 Grok Agent、ChatGPT、Claude Code。現在很多地方還沒互通,卡在跨機連線、權限,還有結果怎麼拿回來。

延伸閱讀

1-2 語音很爽,額度掉超快

就我用過的,ChatGPT 的即時語音最順,開口就能交代事情。

問題是額度。我每月付 100 美元,用 Codex 語音工作,額度掉得很快。我自己估,一天工作八小時,就算大部分只是在派工,也可能一天就吃掉一週 50% 的額度。這是我的體感,沒做過控制條件的實驗。

我原本懷疑是語音一直開著在聽。去翻了官方價格文件,白話講就三件事:

  1. 語音按分鐘扣:電腦版 Codex 的語音,用的是 Codex 的額度,一分鐘 0.05 美元。
  2. 做事另外扣:語音交代出去的工作,接手的模型照工作量另外算。
  3. 兩邊扣同一包:語音和工作,共用同一個方案的額度上限。

所以開著語音、派工出去,兩邊都在扣。哪邊扣得比較多,我還沒量。靜音的時候算不算分鐘,文件也沒寫。

1-3 想把語音搬去網頁,結果網頁也分兩種

我聽說網頁版 ChatGPT 聊天的額度,跟桌面 Codex 是分開的。那把語音前台搬到網頁,讓 Codex 專心做事,不就省了?

查了才發現,網頁也分 Chat 和 Work。依官方使用說明,Chat 是聊天問答,Work 是把一件事做到有成果。重點來了:Work 跟 Codex 吃同一包額度。

還有,網頁派回家裡電腦的工作,如果電腦上的 Codex 是用 ChatGPT 帳號登入,那份工作一樣照 Codex 額度算。

所以只是把入口換到網頁,不保證省。網頁語音本身扣多少、派出去的工作扣多少,要分開看。

官方語音文件也提到,ChatGPT Voice 可以開長任務、查進度、把結果帶回對話。這是官方自己的路。我要的跨工具、跨機器,還是得自己接。

1-4 派得出去,成果還沒回來

現在的進度:我在 ChatGPT 網頁用語音交代,家裡電腦的 Codex 會接單。這條我已經在用。

再往下叫 Claude Code,最後把成果送回網頁,這段還沒接好。

Coco 讀取工作 31633028136a 的結果:Codex 正常退出,但成果資料夾是空的
10 月 9 日下午,我請 Coco 讀一筆網頁派工的結果。

上面這張是 10 月 9 日下午,我請 Coco 去讀一筆網頁派工。它回報:Codex 正常結束,可是成果資料夾是空的,也沒留下測試報告。

程式跑完,不等於事情做完。這就是我後面要一件一件驗的原因。

1-5 網頁怎麼接回家裡電腦?想自己接的人看

咪卡示意 ChatGPT 網頁、官方 Tunnel、本機轉接與 Codex 執行的請求及回傳方向
概念示意圖,完整回收還沒驗。

官方文件列的接法,拆成四步:

1. 讓網頁認得你電腦的工具

做一個 MCP server,列出幾個範圍有限的工具,像派工、查進度、讀成果,再照官方自訂 MCP 接入說明接到 ChatGPT。

2. 用官方 Tunnel 打通道

Secure MCP Tunnel 讓你的電腦主動往外連,網頁的請求就能進來。工作區權限要先確認。

3. 自己寫一段轉接程式去叫 Codex

能讀哪個資料夾、能不能上網、能不能再叫 Claude Code,都由這段程式決定。通道通了,不代表每個能力都接上了。另外,舊的 codex mcp-server 已經拿掉,CLI 文件要新整合改接 Codex app-server,中間一樣要轉接。

4. 回傳看得到的成果

長工作先回工作編號,再查進度、讀成果。如果只回一個「結束了」的代碼,網頁什麼也拿不到。

我最新那次派工實際走哪條通道,沒有重驗。10 月 9 日下午還發現,轉接程式要求的 Codex 版本是 0.162.0-alpha.2,電腦上已經是 0.162.0-alpha.17.2,對不上。之後每筆工作都要記下實際版本、哪台機器跑的、成果放哪。

方向二:讓 Codex 幫你叫網頁版 ChatGPT 生圖

咪卡按下派工按鈕,讓 Codex 幫你叫網頁版 ChatGPT 生圖

先講答案:可以。Codex 能透過 MCP,叫網頁版 ChatGPT 的普通 Chat 模式生圖,我實測過。

但 MCP 只管「送指令」這一步。角色圖要上傳、圖生好要下載,這兩步現在都還是 AI 去點網頁完成的。

傳文字走 MCP,傳圖片走網頁操作

咪卡站在岔路口

區塊一|傳文字:走 MCP

Codex你的電腦
普通 ChatChatGPT 網頁

只送文字,Codex 用 MCP 就叫得動 Chat 生圖。可是 Chat 不知道咪卡長怎樣,咪卡容易跑掉。

區塊二|傳圖片:走網頁操作

Codex你的電腦
普通 ChatChatGPT 網頁
你的電腦存原圖
普通 ChatChatGPT 網頁

這次用的 MCP 工具 send_message_to_thread 只能送文字,沒有附件欄位。所以在普通 Chat 這條路上,圖片一進一出,都要 Codex 開瀏覽器,像人一樣按上傳、按下載。這次是 Codex 主代理和 Luna 輪流做的。

要咪卡長得對,就得附角色設定圖,兩個區塊都要走:文字走 MCP,圖片走網頁操作。

不傳角色圖,Codex 用 MCP 就叫得動 Chat,但咪卡會跑掉。要傳角色設定圖,Codex 就得改成操作網頁。下載原圖在普通 Chat 這條路上也要操作網頁。(Work 模式那次是靠私人 Pages 中轉讀回來的,但 Work 跟 Codex 吃同一包額度,不是我這次要測的路。)這次操作網頁的是 Codex 主代理和 Luna 輪流。

我寫深度文章常需要封面和示意圖,每張都要有咪卡。我想讓 Codex 把生圖交給網頁的普通 Chat,用 Chat 的圖片額度,生完直接拿回本機。

Work 模式測試圖,指令要求不加字,圖上卻寫了圖片回本機
Work 測試(10/9 23:00):要求不加字,還是寫了字。只留作案例。

我特別指定普通 Chat,不要 Work。因為 Work 跟 Codex 吃同一包額度,我想測的是能不能改用 Chat 的圖片額度,所以拿 Work 測成功不算數。

2026 年 10 月 9 日,協助我的 AI 找到入口:官方 Codex App MCP 的 send_message_to_thread。它可以把指令送進既有的 ChatGPT 對話。

這次的生圖指令,就從這裡送進一個普通 Chat 對話,網頁也真的生出一張圖。協助的 AI 在瀏覽器確認過,送出前後都是 Chat 模式。

問題在後面。這個工具只能送文字,沒有附件欄位。所以角色圖傳不上去,生好的圖也拿不回來。

下載繞了一點路。協助的 AI 按下圖片檢視器的下載鈕,再處理 macOS 的儲存視窗,把 PNG 存回本機。

10 月 10 日,我先把咪卡參考圖上傳到同一個普通 Chat,再由 Codex 經 MCP 逐張送出五張指令。五張都在 Chat 畫面上生出來了,可是截至 10 月 10 日早上 8 點,原圖只拿回前三張:第 1 張是 Codex 主代理下載的,第 2、3 張是 Luna 下載的;Luna 送第 4 張指令時卡住,主代理接手。第 4、5 張的原圖到現在還沒拿回來,所以這批不能算成功,只能算測到一半。前三張也只有 Codex 自己看過,還沒找另一家 AI 審圖。

延伸閱讀

2-1 咪卡造型跑掉,我想到先給參考圖

我看了先前試生的圖,發現咪卡造型跑掉,就想到直接把角色圖給它。補上參考圖和文字規格後,前三張都看得見兩隻耳朵、低頂扁帽和側扣,也沒有再穿人類衣服。每張還是要分開查:指令送到、圖片生成、造型正確、原檔拿回。

參考圖和角色文字規格已放進同一個對話。這次沒有確認 Chat 自動啟動了咪卡技能。

這張是普通 Chat 還沒給參考圖時生的。指令寫了不要頂鈕,帽子還是有頂鈕;咪卡穿上外套和襯衫,書本和花瓶也多了英文字:

普通 Chat 單張測試,咪卡穿外套襯衫、帽子有頂鈕、多了英文字
錯誤示範:沒給參考圖的普通 Chat(10/9 23:17)
同一張圖在 Chat 畫面裡的樣子
同一張在 Chat 畫面裡,它還回報「已成功」

補上參考圖之後,拿回來的三張。第 4、5 張在 Chat 畫面上有,原圖還沒下載回來:

普通 Chat 輪播第 1 張
第 1 張
普通 Chat 輪播第 2 張
第 2 張
普通 Chat 輪播第 3 張
第 3 張
延伸閱讀

2-2 叫網頁生圖,會比較省嗎?Codex 沒記帳

我也懷疑過,操作網頁會不會比直接生圖更耗。協助我的 AI 這次真的派 GPT-6 Luna 去操作,再請 Claude Code 核算。Luna 這段約七分鐘,換算成 API 價格約 0.15 美元,期間存回第 2、3 張;第 1 張由主要協助的 AI 完成。這筆只涵蓋 Luna 操作的那一段,目前還不能判定哪種做法比較省。

問題是,Codex 沒有邊做邊記用量,事後只交出 Luna 這一段,漏掉了主代理。這算一個 bug。我叫 Claude Code 去翻 Codex 的對話紀錄(每次請求都有 token 計數),把同一時段主代理的用量撈出來,算法放在文末技術細節:

10 月 10 日 07:37 到 08:00,輪播測試這段的用量
誰用量換算 API 價
Codex 主代理(gpt-6.1-sol)90 次請求,輸入約 2,220 萬 token(大多是快取),輸出約 3.6 萬約 5.10 美元
Luna(gpt-6-luna)約七分鐘的網頁操作約 0.15 美元
Chat 生圖本身吃訂閱的圖片額度拿不到數字

加起來約 5.25 美元,換到三張原圖。主代理那段同時也在處理文章標題,拆不開,所以這個數字會偏高一點。

錢主要燒在主代理身上:它一直盯著網頁,每次都讀很長的對話,90 次請求裡有 46 次長到觸發長文加價。Luna 那段只佔零頭。直接打 API 生五張,Claude Code 估過約 0.2 到 1.1 美元,看畫質和單價而定,這是估價,沒實跑,也還沒算重試。

下一步,我會把上傳、生圖、檢查、下載和重試分開記錄,再把整條流程的用量和時間,除以真正合格、存回本機的張數。Codex 內建生圖的單張用量,我還沒辦法拿到同樣的數字,所以兩邊目前沒辦法公平比較。

現成的總控台,我還在看

研究時也看到幾個現成工具。HAPI 和 Happy 可以拿來比跨裝置的 Agent 工作;Superset 的 MCP server 能叫主機、工作區和終端機。另外也有 Agent of Empires 整理終端機工作,或用 n8n SSH 觸發電腦上的工作。

這些我都還沒裝、沒登入、沒實機跑過。有手機畫面,不代表接得住我原本的 Agent 工作,所以先放候選清單。

這篇怎麼來的:問題是我自己抓出來的

10 月 10 日早上,我自己檢查後,把問題一件件指出來:文章太長、太專業,看了很久還是看不出到底能不能叫 Chat 生圖;試生的咪卡也沒有照角色設定。

  • 我請 Codex 把原本那篇改簡單、口語,它卻把生圖測試改成原篇主題。我問是不是第二篇,它說是原篇更新版。我再講一次原本要寫什麼,它才把原篇恢復,生圖另存成第二篇。後來我決定把兩篇合併,就是現在這篇。
  • 內容太長、太專業,改了很多次還是一堆術語,語音用量那段尤其複雜。我最後直接說:「拜託說人話好不好,你這個改幾百遍了啊。」
  • 我問能不能透過 MCP 叫 Chat 生圖,看了老半天找不到答案。哪一步走 MCP、哪一步靠網頁,一開始就沒講清楚。
  • 咪卡畫錯沒當一回事,是我看到才提出先傳角色圖。
  • 我手上明明有 Coco 總機的截圖和脆文,原篇沒放,還要我提醒。
  • 成本要實測數字,它只交出 Luna 一小段。

問題的源頭在 Codex。它先前只回報單張生圖和下載成功,沒有講清楚離完整目標還差多遠:固定角色、五張回收和成本比較都還沒做好。咪卡造型不一致,也沒有當下修好。

我請 Claude Code 介入。它把主文改短,畫了兩張可以點的圖解,再由 Codex 放進網頁、在本機檢查。標題由 OpenAI 代理模擬三位讀者測試,Claude Code 另外交叉檢查,沒有找真人讀者測過。成本部分,Claude Code 先用假設試算,拿到 Luna 的實際數據後再重算,也指出兩張半程和五張整程不能直接比,API 換算金額不能當成訂閱實付。

上傳參考圖、送出生圖指令和下載原圖,都由 Codex 和 Luna 操作,Claude Code 沒有生圖,也沒有下載原圖。現在拿得出哪些圖,我就寫到哪一步;還沒拿回來的,也一起留在案例裡。

誰做了什麼
誰做了什麼
Codex 主代理找到 MCP 入口、送生圖指令、下載第 1 張、網頁排版和本機檢查
Luna操作網頁,下載第 2、3 張
Codex、Luna上傳咪卡角色圖
ChatGPT 普通 Chat實際生圖
Claude Code改稿、畫圖解、交叉檢查標題、核算成本、事後從紀錄撈出主代理用量、順稿

還沒做完的:第 4、5 張原圖、五張的跨家審圖、完整的成本比較。

你也在接的話,先跑一件小工作

接到了,還要看做完與拿回來

咪卡檢查 AI 的成果

一件小工作,從起點走一圈

起點你下指令的地方

三個點各自核對。前一點過了,下一點還是要另外看。

接單:起點送出後,看有沒有工作編號、執行器和開始時間。

概念示意,實測截至2026年10月9日。方框留白,表示這是檢查方式,還沒有替任何一點打勾。

如果你也在接這類系統,先挑一件很小、好核對的工作。例如在指定資料夾建一份幾行字的測試檔。

然後照上面的圖,分開看三個點:

  1. 有沒有接到:起點送出後,有沒有工作編號、執行器和開始時間。
  2. 有沒有做完:成果檔案在不在,內容對不對。只有退出碼零,只能算程式結束。
  3. 有沒有拿回來:起點拿不拿得到成果位置和摘要。

有好幾台機器,就每台各跑一次,記下實際是哪台在做。額度也順手記:前台用什麼模式、語音開多久、派出去的工作吃了多少。

可以把這段交給幫你接線的 AI:

拿這段請 AI 幫你檢查
請核對目前的接單入口、實際執行器、成果位置與答案回收方式。
只讀現有證據,先不要改系統或擴權。
逐項列出已驗證、待驗證、無法取得的部分。
程序退出碼零,另查成果是否存在、內容是否符合任務。
區分語音用量、任務模型用量、委派接收端用量。
最後提出一件可逆的小工作,讓我確認後再從起點測到成果回收。

上面講的接單、執行、回收,Codex 另外幫我畫成一張圖解。這張改了好幾版:第一版「回收」那格沒有咪卡,22:38 那版咪卡少一隻耳朵,我指出後才重生成兩隻耳朵的定稿。

接單、執行、回收分開驗證圖解定稿
定稿(10/9 22:40)
圖解第一版,回收那格沒有咪卡
錯誤:回收那格沒有咪卡(22:20)
圖解另一版,咪卡少一隻耳朵
錯誤:咪卡少一隻耳朵(22:38)
圖解 22:24 中間版
中間版(22:24)

我的總控台還沒接完。接下來,我會把接單、執行、回收一件件驗過,再決定下一步補哪裡。

這篇提到過的再往前後延伸
想自己接線?展開看技術細節

技術摘要:兩個方向的接法

以下是截至 2026-10-10 的實測範圍。

方向一:網頁接回本機

依官方自訂 MCP 接入說明,把自己的 MCP server 接到 ChatGPT,列出有限工具,例如派工、查狀態、讀成果。

Secure MCP Tunnel 讓本機 tunnel-client 向外建立 HTTPS 連線,把私有 MCP server 接到支援的產品。Platform 和 ChatGPT 工作區各有權限條件,要逐項確認。

三者分工不同:

  • Secure MCP Tunnel:只負責通道。
  • 自訂 adapter:決定能讀寫哪裡、能不能連網、能不能再叫 Claude Code,再去呼叫 Codex。
  • Codex app-server:Codex 自己的整合介面。CLI 文件列出舊的 codex mcp-server 已移除,新整合參考 app-server。它和 MCP 介面不同,中間要靠 adapter 轉接。

這是官方列出的途徑。最新的完整工作是否經這條通道跑通,還沒有證據。

方向二:Codex 叫網頁 Chat

send_message_to_thread 目前只有文字 prompt,沒有附件欄位。這次角色參考圖由網頁上傳;原圖由網頁圖片檢視器和系統儲存視窗下載。downloadMedia 曾回覆不支援 blob,不能把「已生成」直接當成「原圖已回收」。

用官方 Codex App MCP 工具 send_message_to_thread,把普通 Chat 指令送進既有對話,生成單張圖。下載由協助的 AI 在網頁圖片檢視器和 macOS 儲存視窗操作完成。

另一次 Work 測試,經私人 Pages 中轉加 MCP 讀回 PNG 成功。Work 和 Codex 共用工作用量,這條另外留作案例。

MCP Events 可讓 server 通知 ChatGPT,入口是網頁 Work、桌面 Work Cloud 和 dots,要求 MCP 2.0。這次沒有啟用。

一次性用量記錄

Luna 第一段截至 07:56:42:輸入 10,475,363,其中快取 10,162,944,輸出 16,102。API 等值 0.140922 美元。包含恢復分頁的後續嘗試,截至 07:58:53:輸入 11,030,900,快取 10,670,720,輸出 16,719;API 等值 0.151085 美元。推理 token 已包含在輸出,沒有重複加。這是 Luna 的部分操作記錄,主代理、Chat 圖片額度和封面另計。

Codex 主代理(gpt-6.1-sol)當時沒記錄,事後由 Claude Code 讀 Codex 對話紀錄的 token_count 事件,取 2026-10-09T23:37:38Z(江江要求連續三到五張)到 2026-10-10T00:00:06Z。累計差:輸入 22,198,963,其中快取 21,932,928,輸出 35,907。逐筆以每次請求的 last_token_usage 計價(輸入 2、快取 0.1、輸出 10 美元/百萬 token;單次輸入超過 272K 時整筆輸入 2 倍、輸出 1.5 倍),90 筆中 46 筆超過 272K,合計約 5.10 美元;不加長文倍率約 3.15 美元。此時段也包含文章標題的派工,未拆分。

用同一組五張、同一角色參考與驗收標準,記錄上傳、送指令、生成、檢查、下載、重試和接手。以整條流程總用量除以合格且回收張數。這次是混合執行的部分實測,不能直接和五張 API 估價排名。

Luna 官方 API 費率用於等值計算;訂閱用量與 API 計費須分開看。

還沒驗的部分

  • 已取得 Luna 這段與主代理同時段的 token 記錄;各階段(上傳、送指令、下載、重試)用量沒有分開記。Chat 圖片額度、Codex 內建生圖單張用量讀不到。
  • 五張已生成,原 PNG 回收目前完成三張;跨機器未測。
  • 網頁「Threads 圖文」技能裡的咪卡角色參考,和本機最新封面規格是否一致,仍待比對。


依官方 Build skills 文件,插件內的技能也可在 Chat 與 Work 使用。這次單張測試沒有確認 Chat 是否載入咪卡技能。

我是江江教練

隱性知識提煉師、AI 應用規劃師

對 AI × 知識管理、隱性知識提煉有興趣?歡迎加入我的 LINE 社群。

我每月固定舉辦兩場免費線上講座,分享實戰經驗與方法論。如果你對這些主題感興趣,想持續學習,或是有顧問需求,都歡迎先從社群開始。

主要討論:善用 AI 作為思考夥伴,提升決策品質與思考深度;把知識、經驗整理成提示詞、技能包、知識庫,讓 AI 能靈活運用。