← Tất cả các mô hình

Claude Opus 4.8: thông tin tham khảo lịch sử

1M tokens · Text / Vision / Code · Prompt cache

Okou không còn chạy Claude Opus 4.8. Trang này được giữ lại làm tài liệu tham khảo cho các thông số kỹ thuật, giá cả và điểm chuẩn của nó. Đối với cùng loại công việc, hãy sử dụng Claude Opus 5.5.

Xem Claude Opus 5.5

Claude Opus 4.8 là bản phát hành chủ lực của Anthropic vào ngày 28 tháng 5 năm 2026, một bản nâng cấp trực tiếp lên Opus 4.7 với cùng mức giá niêm yết của nhà cung cấp là 5 đô la/25 đô la. Nó đạt điểm SWE-bench Pro cao nhất (69,2%), OSWorld-Verified (83,4%), MCP-Atlas (82,2%) và Humanity's Last Exam (57,9% với các công cụ) mà Anthropic từng phát hành, và là mô hình đầu tiên vượt qua 10% theo tiêu chuẩn vượt qua tất cả các tác nhân pháp lý.

Hai thay đổi cấu trúc đáng chú ý là quy trình làm việc động (lập kế hoạch một công việc, phân tán nó trên hàng trăm tác nhân phụ song song trong một phiên duy nhất) và giảm giá chế độ nhanh xuống tốc độ 2,5 lần với giá 10 đô la/50 đô la cho mỗi 1 triệu token — rẻ hơn ba lần so với chế độ nhanh trên các mô hình Claude trước đây. Mức độ nỗ lực mở rộng thành cao (mặc định), thêm và tối đa. Bản thân Anthropic coi bản phát hành này là một "cải tiến khiêm tốn nhưng hữu hình" chứ không phải là một bước nhảy vọt.

Claude Opus 4.8 là gì?

Ngày 28 tháng 5 năm 2026

Các bài đọc độc lập (LLM Stats, VentureBeat, Vellum) xác nhận thứ tự tương đối so với 4.7 và các đối thủ cạnh tranh: 4.8 thắng trên mọi ô của bộ so sánh được công bố của Anthropic ngoại trừ Terminal-Bench 2.1, nơi GPT-5.5 vẫn dẫn đầu (78.2% so với 74.6% của 4.8). Bước nhảy từ 4.7 lên 4.8 trên SWE-bench Pro là +4.9 điểm; trên USAMO 2026 là +27.4; trên F1 ngữ cảnh dài GraphWalks 1M-token mới là +27.8. Coi các điểm tuyệt đối là định hướng — SWE-bench Verified đang tiến gần đến điểm bão hòa trên tất cả các mô hình tiên tiến.

Điều gì đáng chú ý về Claude Opus 4.8

Kiến trúc tiêu đề và các tính năng khả năng.

Opus 4.8 giữ cửa sổ ngữ cảnh 1M token và đầu ra tối đa 128K từ Opus 4.7, được tính phí theo giá đầu vào tiêu chuẩn trên toàn bộ cửa sổ. Kiểm soát nỗ lực mở rộng thành ba cấp độ: cao (mặc định mới), thêm (xhigh bên trong Claude Code) và tối đa. Messages API hiện chấp nhận các mục hệ thống giữa cuộc trò chuyện mà không làm hỏng bộ nhớ đệm lời nhắc. Quy trình làm việc động cho phép Claude lập kế hoạch và điều phối hàng trăm tác nhân phụ song song trong một phiên duy nhất. Chế độ nhanh chạy ở tốc độ ~2,5 lần tốc độ tiêu chuẩn với giá 10 đô la / 50 đô la cho mỗi 1M token. Đầu vào đa phương thức trên văn bản, thị giác và mã không thay đổi.

Thông số kỹ thuật nhanh

Gia đìnhThế hệ Claude 4
Phương thứcVăn bản, thị giác, mã
Ngôn ngữƯu tiên tiếng Anh, đa ngôn ngữ
Bộ nhớ đệm lời nhắcĐược hỗ trợ (Anthropic)
Cửa sổ ngữ cảnh1M token
Đầu ra tối đaLên đến 128K token
Mức độ nỗ lựcCao (mặc định) / Thêm / Tối đa
Giá niêm yết của nhà cung cấp5 đô la đầu vào / 25 đô la đầu ra cho mỗi 1 triệu (chế độ nhanh 10 đô la/50 đô la, tốc độ 2,5 lần)

Điểm chuẩn Claude Opus 4.8

Điểm số được nhà cung cấp báo cáo từ thẻ hệ thống Opus 4.8 của Anthropic, với so sánh với Opus 4.7, GPT-5.5 và Gemini 3.1 Pro ở mức nỗ lực tối đa và trung bình 5 lần thử. 4.8 dẫn đầu ở sáu trong bảy ô mà Anthropic công bố; GPT-5.5 vẫn dẫn đầu trên Terminal-Bench 2.1. SWE-bench Verified đang đạt đến mức bão hòa trên tất cả các mô hình tiên tiến — bộ SWE-bench Pro khó hơn là tín hiệu bền vững hơn.

Đã xác minh SWE-benchdo nhà cung cấp báo cáo; tăng từ 87,6% của Opus 4.7
88.6%
SWE-bench Prodẫn đầu lĩnh vực (4.7: 64,3%, GPT-5.5: 58,6%, Gemini 3.1 Pro: 54,2%)
69.2%
Terminal-Bench 2.1tăng từ 66,1% của 4.7 trên 2.0; GPT-5.5 dẫn đầu ở mức 78,2%
74.6%
Đã xác minh OSWorld (sử dụng máy tính)dẫn đầu lĩnh vực (4.7: 82.8%, GPT-5.5: 78.7%)
83.4%
Online-Mind2Web (tác nhân trình duyệt)do nhà cung cấp báo cáo
84%
MCP-Atlastăng từ 77,3% của Opus 4.7
82.2%
BrowseComp (tác nhân đơn)tăng từ 79,3% của Opus 4.7
84.3%
F1 ngữ cảnh dài của GraphWalks (1M token)tăng từ 40,3% của Opus 4.7
68.1%
Kỳ thi cuối cùng của nhân loại (có công cụ)49,8% không có công cụ; dẫn đầu lĩnh vực
57.9%
GPQA Diamondphẳng so với 4.7 — bão hòa trên các mô hình tiên phong
~93%
USAMO 2026 (toán)tăng từ 69,3% của Opus 4.7
96.7%
GDPval-AA (công việc tri thức)dẫn đầu (4.7: 1753, GPT-5.5: 1769)
1890 Elo
Đại lý tài chính v2dẫn đầu lĩnh vực
53.9%
Đại lý pháp lý toàn diệnmô hình đầu tiên phá vỡ tiêu chuẩn này
>10%

Giá Claude Opus 4.8

Giá niêm yết trước đây của nhà cung cấp cho mỗi một triệu token. Các số liệu tham khảo này không phải phí Okou hiện tại.

Đầu vào$5.00
Đầu ra$25.00
Đọc bộ nhớ cache$0.50
Ghi bộ nhớ cache$6.25

Cách Claude Opus 4.8 hoạt động trong thực tế

Hành vi được quan sát từ các lần chạy tác nhân sản xuất.

Chỉnh sửa mã lần đầu

Anthropic báo cáo Opus 4.8 ít có khả năng bỏ qua các lỗi khi xem xét mã hơn 4.7 khoảng bốn lần, và mức tăng +4.9 điểm SWE-bench Pro (69.2% so với 64.3%) ủng hộ điều đó trên bộ mã hóa khó hơn, ít bão hòa hơn. Chọn 4.8 cho các bản vá phải được áp dụng sạch sẽ trên nhiều tệp.

Khả năng nhớ ngữ cảnh dài

GraphWalks F1 ở 1M token tăng từ 40,3% lên 68,1% — mức tăng điểm chuẩn lớn nhất trong bản phát hành. Cửa sổ 1M token hiện thực sự có thể sử dụng được ở mức cao nhất trong phạm vi của nó, không chỉ là danh nghĩa.

Trung thực và tự tin thái quá

Anthropic báo cáo giảm hơn mười lần sự tự tin quá mức so với 4.7, 0% về việc báo cáo không phê phán các kết quả sai sót (lần đầu tiên đối với dòng Claude), và tỷ lệ 3.7% không nâng cao các sự kiện quan trọng cho người dùng. Tỷ lệ sai lệch là ~1.9, gần như ngang bằng với Mythos Preview được căn chỉnh tốt nhất của Anthropic.

Tốc độ và chế độ nhanh

Tốc độ tiêu chuẩn tương đương với Opus 4.7. Thay đổi giá là tiêu đề chính: chế độ nhanh với tốc độ 2,5 lần có giá 10 đô la / 50 đô la cho mỗi 1 triệu token, rẻ hơn ba lần so với chế độ nhanh trên các mô hình Claude trước đó. Đáng để sử dụng cho các bước điều phối nơi độ trễ đồng hồ treo tường quan trọng.

Cảnh báo tiêm lời nhắc

Thẻ hệ thống của Anthropic lưu ý rằng 4.8 kém mạnh mẽ hơn một chút đối với việc chèn lời nhắc tác nhân so với 4.7 — thử nghiệm Gray Swan cho thấy tỷ lệ thành công tấn công khoảng 9,6% so với 6,0% trên 4.7. Các nhóm chạy 4.8 trong các đường ống xử lý đầu vào không đáng tin cậy nên xem xét lại phương pháp hộp cát của họ.

Các tác vụ tác nhân tốt nhất cho Claude Opus 4.8

Việc di chuyển quy mô cơ sở mã mà trước đây cần một sprint

Giao cho Opus 4.8 một quá trình di chuyển liên quan đến vài trăm tệp — hoán đổi ORM, tăng phiên bản framework, sửa lỗi bảo mật trên một monorepo — và để các quy trình làm việc động phân tán công việc cho các tác nhân phụ song song trong một phiên. Bước nhảy +4.9 điểm SWE-bench Pro và việc giảm bốn lần các lỗi bị bỏ sót trong đánh giá mã là những gì mang lại lợi ích từ loại chạy này.

Chạy nghiên cứu 1 triệu token thực sự gắn kết

Thả một bản nháp hợp đồng dài 200 trang, ba đề xuất của đối thủ cạnh tranh và các ý kiến pháp lý của quý trước vào cửa sổ, sau đó yêu cầu Opus 4.8 gắn cờ mọi điều khoản chặt chẽ hơn thị trường. GraphWalks ở 1M nhảy từ 40,3% lên 68,1% là điều làm cho loại tổng hợp đa tài liệu này trở nên đáng tin cậy hơn bao giờ hết.

Bộ điều phối tác nhân không nói dối về công việc của mình

Sử dụng 4.8 làm công cụ lập kế hoạch chia một yêu cầu thành mười bước, gửi từng bước cho các tác nhân phụ rẻ hơn và báo cáo kết quả. Tỷ lệ 0% trong việc báo cáo kết quả sai sót một cách không phê phán, kết hợp với việc giảm mười lần sự tự tin thái quá, là lý do các nhóm sản xuất tìm đến 4.8 khi báo cáo tự đánh giá của tác nhân phải đáng tin cậy.

Luồng nhạy cảm với độ trễ cuối cùng cũng được tính toán ở chế độ nhanh

Chế độ nhanh ở tốc độ 2,5 lần từng có giá gấp ba lần so với hiện tại (10 đô la/50 đô la cho mỗi 1M so với cấp trước). Đối với các copilots tương tác, tóm tắt theo yêu cầu hoặc bất kỳ bước nào mà độ trễ đồng hồ tường chiếm ưu thế trải nghiệm, chế độ nhanh 4.8 hiện là lựa chọn mặc định trong dòng Claude.

Khi nào nên bỏ qua Claude Opus 4.8

Bỏ qua Opus 4.8 đối với các công việc thường xuyên khối lượng lớn mà Sonnet 4.6 đạt được cùng chất lượng với chi phí thấp hơn nhiều, đối với các phản hồi trò chuyện quan trọng về độ trễ mà Kimi K2.7 Code nhanh hơn nhiều, đối với mã hóa terminal tác nhân mà GPT-5.5 vẫn dẫn đầu Terminal-Bench 2.1 (78.2% so với 74.6% của 4.8), và đối với các quy trình xử lý đầu vào không đáng tin cậy mà không có hộp cát — khả năng chống chèn lời nhắc của 4.8 hơi yếu hơn 4.7.

Claude Opus 4.8 so với các mô hình khác

Claude Opus 4.8 so với GPT-5.5

Opus 4.8 dẫn đầu trên sáu trong bảy ô trong bộ so sánh của Anthropic, với khoảng cách lớn nhất trên SWE-bench Pro (69.2% so với 58.6%) và OSWorld-Verified (83.4% so với 78.7%). GPT-5.5 vẫn dẫn đầu trên Terminal-Bench 2.1 (78.2% so với 74.6%). Chọn 4.8 cho mã hóa đa tệp và các tác nhân sử dụng máy tính; chọn GPT-5.5 đặc biệt khi công việc điều khiển bằng terminal chiếm ưu thế.

Claude Opus 4.8 so với Gemini 3.1 Pro

Opus 4.8 dẫn đầu với biên độ lớn trên SWE-bench Pro (+15.0) và OSWorld-Verified (+7.2). Hai mô hình này vẫn nằm trong giới hạn nhiễu trên các điểm chuẩn khoa học bão hòa như GPQA Diamond. Mặc định sử dụng 4.8 cho công việc tác nhân; hãy cân nhắc Gemini cụ thể khi bạn cần tích hợp công cụ của Google.

Các câu hỏi thường gặp

Giá của Opus 4.8 so với 4.7 như thế nào?

Giá thông thường giống hệt nhau: 5 đô la cho 1 triệu token đầu vào, 25 đô la cho 1 triệu token đầu ra, 0,50 đô la cho 1 triệu token đầu vào được lưu trong bộ nhớ cache. Thay đổi là chế độ nhanh, hiện là 10 đô la / 50 đô la cho 1 triệu token với tốc độ 2,5 lần — rẻ hơn ba lần so với chế độ nhanh trên các mô hình Claude trước đây.

Quy trình làm việc động là gì?

Một khả năng mới cho phép Opus 4.8 lập kế hoạch một tác vụ và sau đó chạy hàng trăm tác nhân phụ song song trong một phiên duy nhất. Anthropic định vị đây là con đường để di chuyển quy mô cơ sở mã trên hàng trăm nghìn dòng mã trong một lần chạy tác nhân.

Opus 4.8 hỗ trợ mức độ nỗ lực nào?

Ba cấp độ: cao (mặc định mới), thêm (xhigh trong Claude Code) và tối đa. Các cài đặt cao hơn tiêu tốn nhiều token hơn cho việc suy luận trước khi tạo ra phản hồi; các cài đặt thấp hơn ưu tiên tốc độ và hiệu quả giới hạn tỷ lệ.

Opus 4.8 có hỗ trợ bộ nhớ đệm nhắc nhở không?

Có. Đầu vào được lưu trong bộ nhớ cache có giá 0,50 đô la cho mỗi 1 triệu token, giảm giá 10 lần cho phần được lưu trong bộ nhớ cache. API Tin nhắn hiện cũng chấp nhận các mục nhập hệ thống giữa cuộc trò chuyện mà không làm hỏng bộ nhớ cache.

Các lựa chọn thay thế

Khả dụng của Claude Opus 4.8 trên Okou

Okou không còn cung cấp Claude Opus 4.8. Xem Claude Opus 5.5 để biết lựa chọn thay thế hiện được hỗ trợ. Trang này lưu thông tin lịch sử của mô hình, không phải giá Okou hiện tại.