文章上線

Claude Opus 5 在大多數基準測試中表現優於 Fable 5,且成本僅為一半

Claude Opus 5 在大多數基準測試中表現優於 Fable 5,且成本僅為一半

序言

本文摘要說明 Anthropic 新款 Claude Opus 5 與其前代 Claude Fable 5 之間的主要差異,重點在於效能、定價及對使用者與企業的實際影響。

於 7 月 24 日發布的 Claude Opus 5 定價為 每百萬輸入代幣 5 美元,與其 Opus 系列前代相同,同時價格正好為 Claude Fable 5 的一半。除了更具成本效益外,Opus 5 在大多數常用基準測試上也超越了 Fable 5,這使其成為許多訂閱者和商業使用者的有力選擇。本文說明 Opus 5 在 Anthropic 產品分層中的定位、總結基準比較,並概述企業和研究人員應該了解的新模型事項。

Lazy bag

Opus 5 是 Anthropic 系列中的新主力:定價為 每百萬輸入代幣 5 美元,在實務基準測試中常常 表現優於 Fable 5,同時成為 Claude Max 的預設模型以及 Claude Pro 上最強的選項。對於許多使用情境,Opus 5 已取代 Fable 5,成為訂閱者和企業最具吸引力的選擇。

主體

Anthropic 最新發布的 Claude Opus 5 有兩個立即顯著的特點:相較於公司 Mythos 階層的公開模型 Claude Fable 5 更低的價格,與在若干主要基準測試上更佳的測得效能。每百萬輸入代幣 5 美元的定價延續 Opus 系列以中階商業價格提供強大模型的傳統,與 Fable 5 的較高成本形成對比。對於評估成本效益與能力的組織而言,這樣的組合很重要。

Anthropic 將其產品劃分為適合不同需求的層級:Haiku 適合對成本敏感且需要快速處理的任務;Sonnet 適合中階使用;Opus 作為高負載、通用的主力模型;Mythos 則為較高端且具有更多專門變體的類別。Fable 5 在對外定位上屬於 Mythos 類,作為付費使用者的旗艦,但其推出過程並不順利:在六月初上線後因安全疑慮短暫下架,回歸時改為僅以點數形式提供,而非保留在標準方案中。Opus 5 現在填補了大多數訂閱者在標準方案下需要可靠且強大的模型的空缺。

基準測試提供了一種超越行銷宣稱的客觀比較方式。在測量代理式編碼能力、以成功完成端到端軟體工程任務百分比為評分的 Frontier-Bench v0.1 上,Opus 5 達到 43.3%。Fable 5 得分為 33.7%,OpenAI 的 GPT-5.6 Sol 為 34.4%。這顯示 Opus 5 在代理式編碼任務上具有顯著優勢——這類任務要求模型規劃、生成並驗證程式碼以完成實務工程目標。

最大的效能差距出現在 ARC-AGI-3,這是一個著重於新穎問題解決的基準,在該情況下單靠訓練資料的記憶不太可能有幫助。Opus 5 解出 30.2% 的測試謎題,而 GPT-5.6 Sol 則為 7.8%。報告的比較中未對 Fable 5 在該基準進行評估。如此幅度的差距顯示 Opus 5 在推理陌生、多步驟謎題方面具有實質優勢——這對於高階研究、創意問題解決與代理式工作流程來說是重要特性。

在以 Elo 風格評級衡量專業任務相對表現的知識工作基準 GDPval-AA v2 上,Opus 5 得分為 1,861,Fable 5 為 1,747,GPT-5.6 Sol 為 1,736。這些分數強化了 Opus 5 在反映真實世界知識工作之多樣測試套件中持續帶來改進的趨勢。

除了純數字之外,第三方的實際測試也顯示出實務上的提升。某開發者平台報告指出,與 Opus 4.7 相比,Opus 5 在困難的代理式編碼任務上的效能提升了 22%,且跨次執行的變異更小。Zapier 在 AutomationBench(端到端業務工作流程自動化評估)上評估 Opus 5,報告稱 Opus 5 成功執行了完整的用戶流失預防工作流程,從標記高風險帳戶到通知正確的負責人並為挽留團隊彙整行動摘要,這是早期模型無法完整完成的任務。

對於研究應用,Anthropic 與外部合作夥伴強調 Opus 5 在多步驟分析工作流程中表現出更有紀律、系統化的行為。一家 DNA 定序公司指出該模型傾向於選擇適當的統計檢定、交叉檢查結果並遵循一致的分析順序——這些特性使其在程序與可重現性重要的延伸技術分析中變得有用。

仍有一些狹隘領域 Fable 5 保有小幅優勢:早期報告指出在某些法律與健康領域任務上有些領先。這些專長反映了 Fable 5 在 Mythos 的定位,並暗示在特定受管制或領域專用的工作流程中,Fable 5 可能仍然更為合適。然而,對於大多數使用者優先考量的工程、問題解決與業務自動化任務,Opus 5 展現出更強且更具成本效益的表現。

此次新發布也發生在更廣泛產業發展的背景下。一款來自北京初創公司的開放權重模型因其規模與可取得性獲得關注;獨立比較顯示該模型整體上落後於 Fable 5 與 GPT-5.6 Sol,儘管在某些特定基準上超越它們。在這樣的格局中,Opus 5 的價格與測得能力組合使其成為許多團隊務實的預設選擇。

Anthropic 透過 API 提供 Opus 5,價格為 每百萬輸入代幣 5 美元每百萬輸出代幣 25 美元。提供一種約為預設速度 2.5 倍的快速模式,該模式的輸入/輸出基礎費率為兩倍。隨著 Opus 5 成為 Claude Max 的預設模型並在 Claude Pro 上為最強選項,它有效地取代了原本預期由 Fable 5 承擔的一般訂閱者角色。

總而言之,Claude Opus 5 是一項商業上合理的升級:它降低了運行高需求模型的成本,同時在多項反映實務工程與業務任務的基準上提升效能。對於大多數組織和開發者而言,除非有特定利基需求使得 Fable 5 的少數領域優勢更為重要,否則 Opus 5 將成為偏好的選擇。

重點一覽表

面向 說明
定價 Opus 5:每百萬輸入代幣 5 美元(與 Opus 前代相同),為 Fable 5 價格的一半。
Frontier-Bench v0.1 在代理式編碼任務上,Opus 5 得分為 43.3%,相較於 Fable 5 的 33.7% 與 GPT-5.6 Sol 的 34.4%。
ARC-AGI-3 Opus 5 在新穎問題解決謎題上得分為 30.2%;GPT-5.6 Sol 為 7.8%;未報告 Fable 5。
GDPval-AA v2 Opus 5 的 Elo 類分數為 1,861;Fable 5 為 1,747;GPT-5.6 Sol 為 1,736。
實務自動化 Zapier 報告 Opus 5 完成了先前模型未能完成的整套用戶流失預防工作流程。
研究行為 合作夥伴指出 Opus 5 在多步驟科學與統計分析中表現得更有條理。
領域例外 Fable 5 在某些法律與健康任務上保有小幅優勢;但整體而言 Opus 5 較為強大。
最後編輯時間:2026/7/25
#SOL

Mr. W

Z新聞專職作家