DeepSeek V4 Flash: thông tin tham khảo lịch sử
1M tokens · Text / Code · Prompt cache
Okou không còn cung cấp DeepSeek V4 Flash. Xem GPT 6 Luna để biết lựa chọn thay thế hiện được hỗ trợ. Trang này lưu thông tin lịch sử của mô hình, không phải giá Okou hiện tại.
Xem GPT 6 LunaDeepSeek V4 Flash là gì?
Ngày 31 tháng 7 năm 2026 (DeepSeek-V4-Flash-0731, bản beta công khai)
Điều gì đáng chú ý về DeepSeek V4 Flash
Kiến trúc tiêu đề và các tính năng khả năng.
V4 Flash là một mô hình Mixture-of-Experts thưa thớt: tổng cộng 284B tham số với 13B được kích hoạt trên mỗi token, trong đó mỗi lớp MoE chứa 1 chuyên gia được chia sẻ và 256 chuyên gia được định tuyến ở kích thước trung gian 2048, và 6 chuyên gia được định tuyến kích hoạt trên mỗi token. Ba lớp MoE đầu tiên sử dụng định tuyến băm, và độ sâu dự đoán đa token là 1. Điểm kiểm tra 0731 được xuất bản có 304B tham số vì nó vận chuyển một mô-đun dự thảo giải mã suy đoán trên nền tảng 284B cơ sở. Nó hỗ trợ cửa sổ ngữ cảnh 1M token với tối đa 384K đầu ra, chế độ suy nghĩ và không suy nghĩ, và một tham số reasoning_effort với các cấp độ low, high và max. Trọng số được cấp phép MIT và không bị giới hạn.
Thông số kỹ thuật nhanh
Điểm chuẩn DeepSeek V4 Flash
Các số liệu do DeepSeek báo cáo từ thẻ mô hình DeepSeek-V4-Flash-0731, được chạy với DeepSeek Harness ở chế độ tối thiểu với nỗ lực suy luận tối đa (nhiệt độ 1.0, top_p 0.95). Harness chưa được phát hành, vì vậy không có số liệu nào trong số này được tái tạo độc lập, và DSBench-FullStack và DSBench-Hard là các bộ kiểm tra nội bộ của DeepSeek.
Các tác vụ tác nhân tốt nhất cho DeepSeek V4 Flash
Các tác nhân mã hóa khối lượng lớn
Đánh giá PR hàng loạt, viết kiểm thử, chạy lint-and-fix và tái cấu trúc theo lịch trình, nơi cùng một tác nhân chạy hàng trăm lần mỗi ngày. Với chi phí 0,28 đô la cho mỗi 1 triệu token đầu ra, chi phí mỗi lần chạy vẫn đủ thấp để khối lượng không còn là hạn chế.
Tự động hóa dựa trên thiết bị đầu cuối và công cụ
Kết quả được công bố mạnh nhất của bản dựng 0731 là về công việc đầu cuối và sử dụng công cụ, đó chính xác là những gì một tác nhân sửa lỗi bản dựng, kiểm tra triển khai hoặc phân loại nhật ký thực hiện cả ngày.
Đọc toàn bộ kho lưu trữ
Một cửa sổ 1M-token có thể chứa toàn bộ kho lưu trữ cỡ trung bình, một dòng thời gian sự cố dài hoặc một bộ tài liệu thiết kế đầy đủ trong một lần, vì vậy một tác nhân di chuyển hoặc kiểm toán có thể suy luận về toàn bộ thay vì từng phần.
Lớp rẻ tiền bên dưới một bộ điều phối tiên phong
Hãy để Claude Opus 5 hoặc GPT 5.6 Sol lập kế hoạch và xem xét, và giao nhiều bước cơ học — đọc tệp, chạy lệnh, soạn thảo bản vá — cho V4 Flash. Bạn chỉ trả phí biên giới cho các bước quyết định lần chạy.
Các câu hỏi thường gặp
Cửa sổ ngữ cảnh của DeepSeek V4 Flash là gì?
1M token đầu vào và lên đến 384K token đầu ra mỗi phản hồi. DeepSeek khuyến nghị giới hạn đầu ra 384K đầy đủ ở các cấp độ nỗ lực suy luận high và max.
DeepSeek V4 Flash có hỗ trợ tầm nhìn không?
Không. Nó chỉ chấp nhận văn bản và mã. Định tuyến các bước dựa trên ảnh chụp màn hình, biểu đồ hoặc PDF đến một mô hình đa phương thức như Claude Sonnet 4.6 hoặc GPT 5.6 Luna.
Các lựa chọn thay thế
Khả dụng của DeepSeek V4 Flash trên Okou
Okou không còn cung cấp DeepSeek V4 Flash. Xem GPT 6 Luna để biết lựa chọn thay thế hiện được hỗ trợ. Trang này lưu thông tin lịch sử của mô hình, không phải giá Okou hiện tại.

