← 全部模型

Claude Opus 4.8:歷史模型參考資料

1M tokens · Text / Vision / Code · Prompt cache

Okou已不再執行Claude Opus 4.8。本頁作為它的規格、價格和基準測試參考保留。要做同類工作,請用Claude Opus 5.5。

檢視Claude Opus 5.5

Claude Opus 4.8是Anthropic在2026年5月28日發布的旗艦,以同樣的$5/$25廠商標價直接升級Opus 4.7。它拿下了Anthropic迄今最高的SWE-bench Pro(69.2%)、OSWorld-Verified(83.4%)、MCP-Atlas(82.2%)和Humanity's Last Exam(帶工具57.9%)成績,也是第一個在法律智能體全透過標準上突破10%的模型。

值得了解的結構性變化有兩處:一是動態工作流(先規劃任務,再在同一個會話裡並行鋪開數百個子智能體),二是快速模式降價,2.5倍速度下每100萬token $10/$50——比之前Claude模型的快速模式便宜三倍。effort等級擴充為high(預設)、extra和max。Anthropic自己把這次發布定性為「溫和但實在的改進」,而不是一次飛躍。

Claude Opus 4.8是什麼?

2026年5月28日

第三方解讀(LLM Stats、VentureBeat、Vellum)印證了它相對4.7和競品的排序:在Anthropic公佈的對比表裡,除Terminal-Bench 2.1之外每一格都是4.8勝出,那一格仍由GPT-5.5領先(78.2%對4.8的74.6%)。從4.7到4.8,SWE-bench Pro提升4.9個百分點,USAMO 2026提升27.4,新增的100萬token GraphWalks長上下文F1提升27.8。絕對分數只作方向性參考——SWE-bench Verified在所有前沿模型上都已接近飽和。

Claude Opus 4.8有什麼特別之處

架構與能力上的主要亮點。

Opus 4.8沿用Opus 4.7的100萬token上下文視窗和128K最大輸出,整個視窗都按標準輸入價計費。effort控制擴充為三檔:high(新的預設值)、extra(在Claude Code裡叫xhigh)和max。Messages API現在允許在對話中間插入system條目而不破壞提示詞快取。動態工作流讓Claude可以在同一個會話裡規劃並派發數百個並行子智能體。快速模式以約2.5倍的標準速度執行,每100萬token $10 / $50。文字、視覺、程式碼的多模態輸入保持不變。

規格速覽

系列Claude 4代
模態文字、視覺、程式碼
語言以英語為主,支援多語言
提示詞快取支援(Anthropic)
上下文視窗100萬token
最大輸出最多128K token
effort等級High(預設)/ Extra / Max
廠商標價每100萬token輸入$5 / 輸出$25(快速模式$10/$50,2.5倍速度)

Claude Opus 4.8基準測試

以下為Anthropic的Opus 4.8系統卡公佈的廠商成績,對比物件是Opus 4.7、GPT-5.5和Gemini 3.1 Pro,均在max檔effort下取5次試驗的平均值。Anthropic公佈的七格里4.8贏下六格;Terminal-Bench 2.1仍由GPT-5.5保持領先。SWE-bench Verified在所有前沿模型上都已接近飽和——更難的SWE-bench Pro題集才是更經得起時間檢驗的訊號。

SWE-bench Verified廠商公佈;高於Opus 4.7的87.6%
88.6%
SWE-bench Pro領先全場(4.7:64.3%,GPT-5.5:58.6%,Gemini 3.1 Pro:54.2%)
69.2%
Terminal-Bench 2.1高於4.7在2.0上的66.1%;這一項由GPT-5.5以78.2%領先
74.6%
OSWorld-Verified(電腦操作)領先全場(4.7:82.8%,GPT-5.5:78.7%)
83.4%
Online-Mind2Web(瀏覽器智能體)廠商公佈
84%
MCP-Atlas高於Opus 4.7的77.3%
82.2%
BrowseComp(單智能體)高於Opus 4.7的79.3%
84.3%
GraphWalks長上下文F1(100萬token)高於Opus 4.7的40.3%
68.1%
Humanity's Last Exam(帶工具)不帶工具為49.8%;領先全場
57.9%
GPQA Diamond與4.7持平——在前沿模型上已飽和
~93%
USAMO 2026(數學)高於Opus 4.7的69.3%
96.7%
GDPval-AA(知識工作)領先(4.7:1753,GPT-5.5:1769)
1890 Elo
Finance Agent v2領先全場
53.9%
法律智能體全透過第一個突破該標準的模型
>10%

Claude Opus 4.8價格

服務商歷史公開價格,按每百萬 token 計。這些數字僅供參考,並非 Okou 目前收費。

輸入$5.00
輸出$25.00
快取讀取$0.50
快取寫入$6.25

Claude Opus 4.8實際用起來怎麼樣

來自生產環境智能體執行的實際觀察。

一次就改對的程式碼

Anthropic稱,Opus 4.8在評審程式碼時漏看缺陷的機率大約只有4.7的四分之一,而SWE-bench Pro上4.9個百分點的提升(69.2%對64.3%)在更難、更不飽和的程式設計題集上印證了這一點。需要一次補丁乾淨地落在很多檔案上時,選4.8。

長上下文召回

100萬token下的GraphWalks F1從40.3%跳到68.1%——這是本次發布中單項提升最大的一個。100萬token的視窗在高位區間現在是真能用了,而不只是紙面上有。

誠實度與過度自信

Anthropic稱,相比4.7,過度自信減少了十倍以上;不加甄別地報告有問題的結果的比例為0%(Claude家族首次做到);未把重要事件上報給使用者的比例為3.7%。失準發生率約為1.9,基本與Anthropic對齊得最好的Mythos Preview持平。

速度與快速模式

標準速度與Opus 4.7相當。真正的變化在價格:2.5倍速度的快速模式每100萬token收費$10 / $50,比之前Claude模型的快速模式便宜三倍。在掛鐘延遲要緊的編排環節值得一用。

提示詞注入的注意事項

Anthropic的系統卡指出,4.8對智能體提示詞注入的抵抗力略弱於4.7——Gray Swan紅隊測試顯示攻擊成功率約9.6%,4.7為6.0%。在會接觸不可信輸入的流水線裡跑4.8的團隊,應該重新檢查自己的沙箱方案。

Claude Opus 4.8最適合的智能體任務

過去要花一個迭代週期的程式碼庫級遷移

把一次牽涉幾百個檔案的遷移交給Opus 4.8——換ORM、升框架大版本、在monorepo裡全量修安全問題——讓動態工作流在一個會話內把活鋪給並行子智能體。SWE-bench Pro上4.9個百分點的提升,加上程式碼評審漏看缺陷減少到四分之一,正是在這類執行裡兌現價值的地方。

真正扛得住的100萬token調研

把一份200頁的合同草案、三家競爭對手的方案和上個季度的法律意見一起放進視窗,再讓Opus 4.8標出每一條比市場慣例更苛刻的條款。100萬token下GraphWalks從40.3%跳到68.1%,正是這類跨文件綜合分析開始變得可靠的原因。

不會謊報工作的智能體編排者

把4.8當成規劃者:它把一個請求拆成十步,分派給更便宜的子智能體,再彙報結果。不加甄別地報告有問題的結果比例為0%,加上過度自信下降十倍,正是生產團隊在智能體的自述必須可信時選擇4.8的原因。

終於能靠快速模式算得過賬的低延遲流程

2.5倍速度的快速模式,過去的價格是現在的三倍(每100萬token $10/$50,對比之前的檔位)。對互動式副駕、值班摘要,或者任何掛鐘延遲主導體驗的環節來說,快速模式下的4.8現在是Claude家族裡的預設選擇。

什麼時候不該用Claude Opus 4.8

大批次的常規工作別用Opus 4.8,Sonnet 4.6用零頭的成本就能達到同樣的質量水準;對延遲要求極高的聊天回覆也別用,Kimi K2.7 Code快得多;終端裡的智能體程式設計同樣繞開它,GPT-5.5在Terminal-Bench 2.1上仍然領先(78.2%對4.8的74.6%);沒有沙箱卻要攝入不可信輸入的流水線也不適合——4.8對提示詞注入的抵抗力略弱於4.7。

Claude Opus 4.8與其他模型對比

Claude Opus 4.8對比GPT-5.5

在Anthropic的對比表裡,Opus 4.8贏下七格中的六格,差距最大的是SWE-bench Pro(69.2%對58.6%)和OSWorld-Verified(83.4%對78.7%)。Terminal-Bench 2.1仍由GPT-5.5領先(78.2%對74.6%)。跨檔案程式設計和電腦操作類智能體選4.8;工作以終端驅動為主時,專門選GPT-5.5。

Claude Opus 4.8對比Gemini 3.1 Pro

Opus 4.8在SWE-bench Pro(+15.0)和OSWorld-Verified(+7.2)上大幅領先。在GPQA Diamond這類已經飽和的科學類基準上,兩個模型的差距還在誤差範圍內。做智能體類工作預設選4.8;只有當你需要Google那套工具整合方案時,才考慮Gemini。

常見問題

Opus 4.8的價格和4.7比怎麼樣?

常規價格完全一樣:輸入5美元/100萬token,輸出25美元/100萬token,快取輸入0.50美元/100萬token。變化在快速模式:現在是輸入10美元、輸出50美元每100萬token,速度提升到2.5倍——只有此前Claude模型快速模式價格的三分之一。

什麼是動態工作流?

這是一項新能力:Opus 4.8可以先規劃一個任務,再在同一個會話裡並行跑幾百個子智能體。Anthropic把它定位為通往「一次智能體執行完成數十萬行程式碼庫級遷移」的路徑。

Opus 4.8支援哪些思考強度檔位?

三檔:high(新的預設值)、extra(在Claude Code裡叫xhigh)和max。檔位越高,模型在給出回答前花在推理上的token越多;檔位越低,越偏向速度和速率限制下的效率。

Opus 4.8支援提示詞快取嗎?

支援。快取輸入按0.50美元/100萬token計費,快取部分相當於打了一折。Messages API現在還允許在對話中途插入system條目,而不會讓快取失效。

替代選擇

Claude Opus 4.8在Okou上的可用情況

Okou 已不再提供 Claude Opus 4.8。目前支援的替代模型請參閱 Claude Opus 5.5。本頁保留模型的歷史資料,不代表 Okou 目前定價。