Claude Fable 5.1 enterprise agent two-tier model architecture

2026 年 9 月 1 日,Anthropic 發布 Claude Fable 5.1 與 Claude Mythos 5.1。兩者使用相同的底層模型,卻採用不同的存取方式與安全防護:Fable 5.1 面向一般企業與開發者,Mythos 5.1 則只提供給通過審查的資安與生命科學機構。

這次更新值得企業注意的,不只是模型分數變高,而是供應商開始把「能力相同、權限不同」做成正式產品架構。當 AI 代理可以連續工作數小時、讀取多個系統並採取動作,模型選型已不能只比較一次回答的品質。企業還要決定哪些工作可以直接交給一般模型、哪些工作必須經過額外審查,以及資料與安全事件由誰保管。

本文從企業採購與部署角度拆解三個變化:長時間代理開始成為主要工作單位、快取與重複上下文影響實際成本,以及模型防護會直接改變工作流程。若要先理解大型模型如何從文字生成走向工具操作,可搭配閱讀 🔗 大型語言模型的運作方式

一、同一個模型,為什麼分成 Fable 與 Mythos

Anthropic 的說法很明確:Fable 5.1 與 Mythos 5.1 是相同底層模型,差異在安全防護與使用資格。Fable 5.1 已提供 Pro、Max、Team、Enterprise 與 API 使用,也可經由 AWS、Google Cloud 與 Microsoft Foundry 取得;Mythos 5.1 則限於受審查的組織,重點是資安與生命科學研究。

這種分層表示模型能力不再等於使用者可以取得的全部能力。一般企業即使採用 Fable 5.1,涉及滲透測試、漏洞利用程式或二進位掃描的請求,仍可能被阻擋或轉交其他模型。API 團隊也不能假設切換模型名稱後,舊流程會原封不動運作。

層級 主要對象 使用方式 企業必查項目
Fable 5.1 一般企業、團隊與開發者 Claude 產品、API 與雲端市集 防護介入、Fallback 設定、資料保留
Mythos 5.1 通過審查的資安與生命科學組織 Trusted access 計畫 資格、地域、監控與 30 天保留政策
Opus fallback 被防護機制重新分流的工作 由產品自動或 API 設定路由 能力差異、價格、延遲與稽核紀錄

對採購團隊而言,合約裡要寫清楚的是「我們實際會得到哪一條路徑」。同一個使用者問題,可能由 Fable、Opus 或拒答流程處理。若只在測試環境記錄最終答案,卻沒有保存實際模型、分流原因與回應時間,正式上線後就難以解釋成本與品質差異。

二、官方基準很亮眼,但不能直接當成公司成效

Anthropic 公布的測試中,Fable 5.1 在 AutomationBench 為 31.4%,高於 Fable 5 的 17.1% 與 Opus 5 的 26.9%;在 CursorBench 3.2.0 為 73.4%。這些數字來自供應商自己的發布資料,適合用來建立候選名單,不等於每家公司都會得到相同比例的提升。

發布頁也揭露幾個重要限制。Fable 5.1 是在正式防護機制開啟的情況下評估;部分任務若觸發安全防護,會計為零分或改由其他模型完成。OSWorld 2.0 使用 2026 年 8 月更新過的任務,官方特別提醒不能與舊版測試直接比較。這些註解比排行榜順位更接近企業真正會遇到的問題:模型是否完成工作,會受到安全政策、工具權限與測試版本影響。

發布資料中的早期客戶案例,補上了 Benchmark 看不到的長任務情境。Millennium 表示,一個多年無法解釋、約百萬次執行才出現一次的罕見當機,Fable 5.1 透過反組譯外部函式庫、比對 core dump 找到根因;MongoDB 表示模型用約三天研究服務程式碼與文件、建立原型,並能連續數小時自行執行與驗證;Ramp 則描述一次長達 38 小時的機器學習任務,模型辨識出標籤資料造成的假象,修正後啟動六組平行實驗。

這些都是 Anthropic 在發布頁整理的合作夥伴回饋,不是獨立、可普遍套用的產能證明。它們真正提供的訊號是:企業測試不能只出一道題看答案,而要觀察模型是否會留下可讀紀錄、在長時間工作中維持方向、驗證自己的結果,以及在證據不足時停下來。

企業的驗收集應該用自己的文件、程式庫與例外情境建立。財務研究要測來源是否可追溯;客服代理要測是否越過退款權限;程式代理不只要能產生程式碼,還要跑測試、保存變更範圍並在不確定時停止。若工作高度依賴內部資料,🔗 RAG 2.0 的架構整理有助於把「模型能力」和「資料找得對不對」分開測試。

三、成本關鍵從單次 Token 轉向整段代理工作

Fable 5.1 的公開 API 價格為每百萬輸入 Token 10 美元、每百萬輸出 Token 50 美元。快取讀取降到每百萬 Token 0.25 美元,比 Fable 5 低 75%。Anthropic 估算,典型工作可降低約 25% 成本,高度代理化工作最多約 45%;這些都是供應商估算,仍需以企業自己的請求長度、快取命中率與重試次數驗證。

快取變便宜之所以重要,是因為長時間代理會反覆讀取相同內容:程式庫說明、專案規則、公司政策與前一步產生的紀錄。若每一步都重新傳送完整背景,成本與等待時間會快速累積。反過來,快取命中率低、上下文持續變動,宣稱的節省幅度就不一定出現。

努力等級也會影響比較。Fable 5.1 在 Claude Code 預設為 High effort,在 Claude Cowork 與 claude.ai 則預設為 Medium;官方表示 Low 或 Medium effort 也可能以更低成本取得接近或超過 Fable 5 的結果。因此 PoC 必須固定 effort、工具與停止條件,否則同名模型的兩次測試仍可能不是同一種成本配置。

可以用一個簡化情境理解快取的槓桿:若代理在 20 個步驟中都要讀取 10 萬 Token 的穩定背景,總讀取量是 200 萬 Token。若全部按一般輸入單價計算,僅這部分是 20 美元;若都符合快取讀取條件,對應讀取費是 0.5 美元。這不是完整帳單,尚未包含第一次寫入快取、動態輸入、輸出、工具與重試,但它說明了為什麼工作流程的上下文設計會直接影響成本。

評估時應以「一件完成且可接受的工作」為單位,記錄:

  • Fable、Fallback 與人工各處理多少步驟。
  • 每一步的輸入、輸出與快取讀取量。
  • 因工具失敗、權限不足或答案不合格而重跑的次數。
  • 從接收任務到交付可用結果的總時間。
  • 人工審查與修正花費,而不是只看 API 帳單。

若企業計畫自架輔助模型或共享 GPU,還要把利用率與排隊延遲算進去。🔗 有效管理 GPU 的方法與 🔗 GPU 分割及資源配置可作為容量規劃的延伸參考。

四、長時間代理需要的不是更長提示詞,而是可恢復的流程

Fable 5.1 主打數小時、跨多個應用的工作,例如整理工作待辦、操作瀏覽器、處理程式庫或執行非同步研究。這類工作與一般聊天最大的差別,是錯誤可能在很後面才被發現。代理如果在第二步讀錯檔案,卻到第二十步才產生交付物,修正成本會遠高於一次問答。

企業應把長任務拆成可驗證的檢查點。每個階段都要保存輸入來源、工具結果、決策理由與下一步限制。代理失敗後應能從最近一次通過驗證的狀態恢復,而不是從頭重跑,也不能讓模型自行宣稱「已完成」就進入下一階段。

實務上可以設計四道控制:

  1. 開始前:確認資料範圍、允許工具與禁止動作。
  2. 執行中:對外寄信、付款、刪除、權限變更等動作設人工核准。
  3. 交付前:用程式檢查格式、引用、測試結果與必要欄位。
  4. 失敗後:保留完整狀態與錯誤類型,讓人或另一個模型接手。

這也說明為什麼模型升級不能取代流程設計。好的代理不是一路自動執行,而是在關鍵點能停、能解釋、能回復。

五、防護與 Fallback 會改變產品體驗

Fable 5.1 的資安防護比 Fable 5 更精準。Anthropic 表示,Claude Code 每個工作階段平均可少約 60% 的資安防護介入;生命科學的無害請求誤攔截也較最初版本減少 85%。但滲透測試、漏洞利用程式、二進位漏洞掃描及部分雙重用途生命科學問題仍會被限制或分流。

這些數字同樣是供應商報告,企業需要在合法、授權的內部測試中確認。更重要的是,Fallback 不是幕後小細節。若請求被送到 Opus 4.8 或 Opus 5,回應能力、價格、延遲與版本生命週期都可能不同。對外服務應避免讓使用者在沒有提示的情況下收到風格或能力突然改變的答案。

API 團隊可在日誌中加入實際模型、路由原因、安全政策版本與批准人。安全團隊則要定義哪些請求應直接拒絕,哪些可以交由經過審查的專門環境處理。將所有攔截都視為「模型失敗」,或把所有分流都視為「成功完成」,都會扭曲成效報告。

六、資料保留與 EFS 是採購問題,不只是設定選項

Fable 5.1 與 Mythos 5.1 預設需要 30 天資料保留,用於安全監控。Anthropic 同日公布的 Enterprise Frontier Safeguards計畫,主張把活動資料存放在客戶控制的雲端環境,以兼顧接近零資料保留的隱私需求與跨時間的濫用偵測。EFS 預計在 2026 年秋季分階段推出;在正式可用前,符合資格的企業可暫時使用零資料保留。

EFS 的責任切分比「資料放在客戶端」更具體。活動紀錄可存入客戶自己的 Amazon S3、Azure Blob Storage 或 Google Cloud Storage,沿用客戶管理的加密金鑰、存取政策與稽核日誌;自動化系統分析跨工作階段與帳號的滾動資料視窗,若發現嚴重濫用或憑證外洩訊號,警示直接交給客戶團隊。依官方設計,預設不需要 Anthropic 員工進行人工審查。客戶自有儲存、客戶管理金鑰與自動審查可分別選用,而且不改變模型行為、API 價格或速率限制。

官方表示 EFS 本身不另收費,但客戶仍需支付雲端儲存、讀寫與資料傳輸費用。客戶自管金鑰、儲存位置與人工審查,也代表責任不會因為資料留在自己的帳號裡就消失。企業要先確認:

  • 哪些內容會保存、保存多久、誰能存取。
  • 事件告警由供應商還是客戶調查。
  • 使用 AWS、Google Cloud 或 Microsoft Azure 時,控制是否一致。
  • 法遵刪除、訴訟保全與跨境資料規則如何處理。
  • 安全監控資料是否會被納入既有 SIEM 與稽核流程。

對臺灣企業而言,個資、客戶合約與產業規範應在 PoC 前就納入資料流圖。只看「不拿資料訓練」並不足以回答保留、人工檢視與跨境處理問題。

七、企業導入建議:先選工作,再決定模型層級

Fable 5.1 適合先測試長時間、可分段驗證的高價值工作,例如跨文件研究、複雜程式除錯與多階段資料整理。Mythos 5.1 不應被當成一般升級選項;它是受限制的專門存取層,需要資格、監控與更嚴格的使用理由。

一個可執行的四週試點可以這樣安排:第一週建立真實任務與禁止動作;第二週比較 Fable 5.1、現有模型與人工基準;第三週加入工具、Fallback 與核准點;第四週計算每件合格結果的成本、錯誤類型與恢復時間。若資料問題比推理問題更常見,再評估 🔗 RAG 與微調的差異,避免把資料治理缺口誤判為模型不夠大。

這次發布真正改變的,是企業模型清單開始包含「同一能力、不同存取與防護」的正式分層。採購決策也必須從單一模型名稱,升級成模型、路由、防護、資料保留與人工責任的整體設計。

如果你想持續追蹤企業大模型、代理治理與 GPU 基礎設施,歡迎訂閱 AI-Stack 的後續分析。