Skip to content

同樣用 AI 做任務,為什麼我可以只花一半的 Token 成本?給新手的 Model Routing 模型分工教學

Gary Chen 教你如何透過 Model Routing 模型分工,節省超過一半的 Token 成本,提升 AI 任務效率。

Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.

Generated from the transcript and can be wrong — check the timestamp.

Key Takeaways

  • Model Routing 是依任務步驟分配最適合的模型與推理強度,而非單純選最強模型。
  • 合理分工可在不降低品質下,節省超過一半的 Token 成本。
  • 任務不同階段對模型的需求不同,規劃與高風險決策用強模型,高量重複執行用便宜模型。
  • 良好的任務交接與 Spec 文件是成功 Model Routing 的關鍵。
  • 選擇模型前必須考慮公司政策與資料安全,確保合規使用。

What the video covers

  • 介紹新模型如 Fable 5、GPT 5.6 上線後,Token 使用量激增的問題。
  • 說明 Model Routing 不只是選模型,更是依任務步驟分配不同模型與推理強度。
  • 透過規劃、執行、Review 三階段分工,成功降低超過 50% 的 Token 成本。
  • 強調不同任務步驟智力需求不同,適合用不同成本與能力的模型處理。
  • 介紹四種模型與推理強度組合,對應不同工作類型與風險。
  • 以網站製作為例,拆解任務步驟並說明各階段適合的模型分配。
  • 強調 Spec 文件的重要性,確保任務交接清楚且可驗證。
  • 提醒模型選擇前需考慮公司允許使用的工具及資料安全限制。
  • 說明成本結構與 Token 使用量,解析哪個階段最值得進行 Model Routing。
  • 提供實用的 Model Routing Prompt Set 及各家模型定位參考。

Answers

Questions about this video

什麼是 Model Routing?

Model Routing 是根據任務不同階段的需求,分配最合適的 AI 模型和推理強度,以達到成本效益最大化,而非單純選擇最強模型。

如何透過 Model Routing 節省 Token 成本?

將任務拆分成規劃、執行、Review 等步驟,並根據每步驟的複雜度與風險,分配不同成本與能力的模型,避免全程使用高價模型,從而節省超過一半的 Token 成本。

選擇模型時需要注意什麼?

除了模型本身的能力與價格外,還需考慮公司允許使用的工具、資料安全限制,以及任務是否需要連接特定資料源,確保合規且有效率地使用 AI。

Full Transcript — Download SRT & Markdown

00:00
Speaker A
最近 Fable 5、GPT 5.6 這些新模型接連上線,模型越來越強,但很多人第一個感受到的不是生產力爆炸,而是 Token 額度爆炸。你一定遇過這種情況,明明只是叫 AI 幫你研究一個題目,做一份簡報,改幾頁網站,結果來回幾輪下來,工作還沒做完,Token 就快見底了。
00:46
Speaker A
整天在複製貼上,整理表格,改檔名 不是他做不到,是太浪費 最強模型也是一樣 最貴的判斷力 應該留給最容易影響結果 走錯代價最高的地方 今天這支影片 我會帶你拆一個完整任務 看規劃,執行,Review 分別該用什麼模型 以及為什麼只是換一種分工方式 就能省下真金白銀的 Token 成本 看完今天的影片 你就能拿自己的工作流 直接標出哪一步該花錢,哪一步可以省 那我們直接開始 先來說什麼是 Model Routing 很多人會把 Model Routing 直白理解成選模型 也就是這個任務到底要用最強的模型 還是便宜的模型 但這只回答了一半 因為同一個模型 你也可以讓它用不同的推理強度來工作 模型的意思是你派誰上場 是最強,最貴,判斷力最好的模型 還是便宜,快速 適合大量執行的模型? 推理強度的意思則是你叫它用多少腦力 是快速回答就好 還是要它多想幾步,反覆檢查 花更多 Token 去推理?
01:43
Speaker A
這時候問題不一定是你用太多 AI,而是你可能每一步都用了太貴的模型。我拿同一份任務測了一次,不是降低品質,也不是偷工減料,只是把規劃、執行、Review 分給不同模型,成本就下降了 54%。這就是 Model Routing 模型分工。說白了,就是讓每一步任務用剛剛好的模型。
02:59
Speaker A
不能因為某個模型看起來很划算 就直接丟到外部 API 那不是 Model Routing 那比較像是把公司資安部門的血壓 拿來做壓力測試 公司如果批准的是 ChatGPT Enterprise Claude Team,Microsoft Copilot 你就先從這些工具裡面選 第二道限制是 這個任務有沒有需要特殊能力模型 也就是有沒有特殊能力要求 有些工作需要特定資料源 比如 Live Web,X,公司內部資料庫 逐字稿資料庫,CRM 或是一套可以搜尋歷史資料的系統 如果任務取決於最新資訊 能不能連上 Live Web 就很重要 如果任務取決於 X 上現在大家怎麼討論 Grok 這類接近資料源的工具就會有意義 重點不是它是不是宇宙最強模型 而是它有沒有接到你需要的那條資料流 過完這兩道限制,才輪到模型本身 方向還沒定,任務很混亂 需要判斷力,Taste 或策略時
03:51
Speaker A
在改格式、整理資料、跑重複步驟的時候,不用一律派出最強的 AI。很多人用 AI 的方式,就像請公司裡薪水最高、能力最好的人,整天在複製貼上、整理表格、改檔名。不是他做不到,是太浪費。
04:40
Speaker A
稍早我提到 我拿同一份任務測試 只是做了 Model Routing 在不降低品質,不偷工減料的情況下 成本就下降了超過一半 省下了真金白銀,卻不用犧牲品質 這聽起來太香了對吧? Model Routing 能維持產出品質的原因 其實不複雜 一份工作裡 不同步驟需要的智力本來就不一樣 拿做網站來說 一開始要理解客戶是誰 網站要解決什麼問題,競品怎麼做 頁面架構怎麼排 這一段是在處理未知的方向 定下來後,網站架構,頁面清單 文案原則,資料格式和驗收條件都寫清楚了 後面的工作就變成純執行 而在這個網站案例裡 最花 Token 的剛好就是後面的執行 模型要讀 Code,寫 Code,改頁面 跑測試,修 Bug 如果你全程都用最貴的模型 等於是把最高單價套在輸出量最大的地方 以前我會直覺認為 既然任務很重要 規劃和執行都交給最強模型應該最穩 但我最近比較了三種做法 第一種是 Fable 負責規劃
05:37
Speaker A
最強模型也是一樣,最貴的判斷力應該留給最容易影響結果、走錯代價最高的地方。今天這支影片,我會帶你拆一個完整任務,看規劃、執行、Review 分別該用什麼模型,以及為什麼只是換一種分工方式,就能省下真金白銀的 Token 成本。
06:25
Speaker A
你會發現這是一條流程 例如我需要 AI 幫我做一個網站 至少要拆成五步 Research,Design 和 Spec Execute,Review 最後是 Fix 和 Deploy 不過 只是把任務切成五塊還不叫 Routing 真正的關鍵是把交接設計好 Research 要交出研究資料包 讓 Design 和 Spec 有證據可以做決定 Spec 要交出清楚的工作規格 讓 Execute 不用猜 Execute 要交出可以檢查的成品 Review 再交出問題清單和證據 Fix 按照問題清單修完,最後才 Deploy 讓每一步的 Output 變成下一步的 Input
06:59
Speaker A
看完今天的影片,你就能拿自己的工作流,直接標出哪一步該花錢,哪一步可以省。那我們直接開始,先來說什麼是 Model Routing。很多人會把 Model Routing 直白理解成選模型,也就是這個任務到底要用最強的模型,還是便宜的模型。
07:49
Speaker A
只把來源,重點和可疑點整理回來 資料回到 Research Manager 手上 再由強模型去重,找矛盾,補缺口 最後整理成能拿去決策的報告 以做一個網站為例 強模型先決定要研究品牌,受眾 競品和 Accessibility Scout 分頭找資料 最後強模型再收斂成網站需求 頁面優先順序和設計原則 這樣分工 把開頭和結尾留給高品質高單價的模型 中間大量,可拆分的資料搜集就可以做替換 第二步是 Design 和 Spec Spec 白話講就是交接文件 而且要清楚到 換一個模型,換一個人 甚至隔兩個禮拜後的你自己回來看 都知道要交什麼 怎麼判斷有沒有做完 一份好的 Spec 至少要講清楚 網站有哪些頁面?每一頁服務誰? 資料從哪裡來?設計原則是什麼? Success Criteria 是什麼? 還有,什麼事情不能做 這一段我會用強模型 通常也會開比較高的推理強度
08:44
Speaker A
但這只回答了一半,因為同一個模型,你也可以讓它用不同的推理強度來工作。模型的意思是你派誰上場,是最強、最貴、判斷力最好的模型,還是便宜、快速、適合大量執行的模型?推理強度的意思則是你叫它用多少腦力,是快速回答就好,還是要它多想幾步,反覆檢查,花更多 Token 去推理?
09:37
Speaker A
才適合交給比較便宜的模型大量做 如果成果好壞很容易檢查 例如格式有沒有對,連結能不能打開 測試有沒有過 欄位有沒有符合規格,那就很適合 Routing 反過來 如果你自己都不知道什麼叫做好 那便宜模型做得再快 也只是快速產生一堆你不敢用的東西 第四步是 Review 這裡很多人最容易做錯 因為大家把 Review 想成檢查錯字 我會把 Review 當成 Investigation 像辦案一樣先決定要查什麼 需要什麼證據 什麼條件才算過關 網站要查的可能包括速度,SEO Accessibility,Broken Links 事實和引用有沒有亂寫 還有表單到底能不能送出 接著讓多個 Checker 分頭調查 Agent A 測速度,Agent B 找 Broken Links Agent C 檢查引用和事實
10:20
Speaker A
模型選擇乘上推理強度,會出現四種組合。第一,強模型加高推理,留給方向不明、走錯代價高的工作,像是產品策略、系統架構、重要 Spec 或最後的高風險 Review。這種地方一旦判斷錯,後面做再快都只是往錯的方向跑。
11:09
Speaker A
那就不要叫便宜模型硬修 直接升級回強模型,重新處理方向 這五步串起來 Model Routing 管的就不再是模型名稱 而是每一步的不確定性 輸出量,風險和可驗證程度 如果你好奇 Model Routing 到底能在每一步省下多少錢 我接下來用同一個任務算一筆帳給你看 先說清楚 下面這組數字不是要你背價格 因為模型價格一定會變 重點是讓你看懂成本結構 哪一段 Token 量最大 哪一段 Output 最多 哪一段最值得 Routing 假設今天要做一個中型行銷網站 Research 加 Planning 預計用掉三十萬 Input Token 四萬 Output Token Execute 用掉三十萬 Input Token 十五萬 Output Token
11:48
Speaker A
第二,強模型加低推理,適合需要好判斷,但不用想很久的工作,比如你手上有三個產品方向,要先快速判斷哪一個值得研究。這時候可以派強模型先做初篩,不用一開始就把 Reasoning 開到最高。
12:10
Speaker A
按照每百萬 Token 十美元算 大約八點二美元 二十七萬 Output 按照每百萬 Token 五十美元算 大約十三點五美元 這樣加起來 我做一個網站的總成本是二十一點七美元 換成方法 B 的 Model Routing Research 和 Planning 我還是用 Fable 5 因為這裡方向最重要 三十萬 Input 加四萬 Output 大約五美元 到了 Execute,交給 Claude Sonnet 5 按照它目前的優惠價計算 三十萬 Input 加十五萬 Output 大約二點一美元
12:38
Speaker A
第三,便宜模型加高推理,適合方向已經定了、Spec 也寫清楚,但執行本身還是有難度的工作,像是依照既有規格補一段複雜邏輯。模型不需要重新決定產品方向,但可以多花一點思考預算,把技術細節做好。
13:11
Speaker A
這組算式也解釋了 為什麼執行階段最值得 Routing 因為 Output Token 通常比 Input Token 貴 模型寫得越多,價差就越明顯 所以不要只看 Input 單價便宜多少 要看這一步最後會輸出多少東西 當然 Routing 不保證每一個任務 都能省下一半的成本 如果 Spec 寫得很爛 或便宜模型根本做不了這份任務 只要重跑一次 就可能把省下來的錢和時間全部填回去 所以再重複一次 你的每個任務成本其實分成 4 個部分 總 Token 成本 最後成品能不能用,重跑了幾次 還有你自己花了多少時間 Review 聽到這裡 如果你沒有每一家最高階模型的訂閱 也不代表這套方法不能用 Model Routing 不要求你把所有模型湊齊
13:50
Speaker A
第四,便宜模型加低推理,就拿來處理機械、重複、易檢查對錯的事情。整理資料、分類、摘要、改格式、跑固定檢查,都適合放在這個象限。
14:44
Speaker A
放了一套 Model Routing Prompt Set 裡面不只有可以直接拿去用的提示詞 我也整理了各家開源和閉源模型的定位 包含 Anthropic,OpenAI,Gemini DeepSeek,Kimi 再加上社群使用者的實戰評價整理 有興趣的話可以點擊了解 那我們幫今天的影片做個收尾 很多人把 Model Routing 當成 Model Selection 也就是單純在挑模型 但我認為更準確的說法是 Compute Allocation 算力分配 就像你不會拿一張 RTX 5090 只用來玩小畫家,AI 也是一樣 OCR,摘要,分類和固定格式整理 不需要每次都叫最強模型上場 然後再抱怨 Token 太貴 這不是模型定價的問題 是你把算力放錯位置 所以真正成熟的做法 不是今天 Fable 強就全部換 Fable
15:26
Speaker A
不過真正開始選模型以前,要先過兩道限制。第一道是公司准用的工具,也就是公司允許你使用哪些工具。你在公司裡用 AI,第一個問題通常不是哪個模型最強,而是這份資料能不能丟進去。客戶資料、財務資料、法務草稿、還沒發布的產品計畫。
Topics:Model RoutingAI 模型分工Token 成本AI 工作流優化GPT 5.6Fable 5AI 推理強度成本節省AI 任務管理模型選擇

Get More with the SozAI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries, speaker detection, and unlimited transcriptions.

Or transcribe another YouTube video here →