Bỏ qua, tới nội dung chính

Model & giá

Chín model production, giá USD trên 1 triệu token. ID nguồn công khai.

ModelKhả năngContextInputInput (cache)Output
glm-5.2Giảm 40%@cf/zai-org/glm-5.2toolsreasoningjson262K$1,40$0,84$0,26$0,156$4,40$2,64
kimi-k2.7-codeGiảm 40%@cf/moonshotai/kimi-k2.7-codetoolsvisionreasoning262K$0,95$0,57$0,19$0,114$4,00$2,40
kimi-k2.6Giảm 40%@cf/moonshotai/kimi-k2.6toolsvisionreasoning262K$0,95$0,57$0,16$0,096$4,00$2,40
glm-4.7-flashGiảm 40%@cf/zai-org/glm-4.7-flashtoolsreasoningfast131K$0,06$0,036—$0,40$0,24
deepseek-v4-flashGiảm 40%@cf/deepseek-ai/deepseek-v4-flash-0731toolsreasoningfast1M$0,44$0,264$0,014$0,008$1,32$0,792
deepseek-v4-proGiảm 40%@cf/deepseek-ai/deepseek-v4-pro-0813toolsreasoningjson1M$1,32$0,792$0,044$0,026$3,96$2,376
qwen3.8-27bGiảm 40%@cf/qwen/qwen3.8-27btoolsreasoningvision262K$0,45$0,27$0,05$0,03$3,20$1,92
glm-5.3-flashGiảm 40%@cf/zai-org/glm-5.3-flashtoolsvisionreasoningjson1M$0,15$0,09$0,03$0,018$0,50$0,30
glm-5.3Giảm 40%@cf/zai-org/glm-5.3toolsreasoningjson1M$1,40$0,84$0,26$0,156$4,40$2,64

Trúng cache toàn phần chỉ tính 10% giá thường. Giá tại ngày 2026-09-25 — dashboard luôn hiện giá live.

glm-5.2

Giảm 40%@cf/zai-org/glm-5.2

Model suy luận chủ lực lâu năm của Z.ai. Mạnh ở suy luận nhiều bước, toán và phân tích ngữ cảnh dài; hỗ trợ tool call và JSON output chặt.

Cửa sổ context262K
Khả năngtoolsreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$1,40$0,84
Input (cache)$0,26$0,156
Output$4,40$2,64

kimi-k2.7-code

Giảm 40%@cf/moonshotai/kimi-k2.7-code

Chuyên gia code của Moonshot AI. Tinh chỉnh cho việc code quy mô cả repo và agentic tool use, kèm vision đọc screenshot và sơ đồ.

Cửa sổ context262K
Khả năngtoolsvisionreasoning

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,95$0,57
Input (cache)$0,19$0,114
Output$4,00$2,40

kimi-k2.6

Giảm 40%@cf/moonshotai/kimi-k2.6

Model Kimi đa dụng cân bằng chất lượng và chi phí. Tool call và vision tốt — lựa chọn mặc định vững cho assistant và agent.

Cửa sổ context262K
Khả năngtoolsvisionreasoning

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,95$0,57
Input (cache)$0,16$0,096
Output$4,00$2,40

glm-4.7-flash

Giảm 40%@cf/zai-org/glm-4.7-flash

Con ngựa thồ nhanh, giá rẻ. Trung vị thời gian ra token đầu khoảng 0,65 giây theo bài đo của chúng tôi — hợp phân loại, trích xuất và chat khối lượng lớn.

Cửa sổ context131K
Khả năngtoolsreasoningfast

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,06$0,036
Input (cache)—
Output$0,40$0,24

deepseek-v4-flash

Giảm 40%@cf/deepseek-ai/deepseek-v4-flash-0731

Bản V4 Flash chính thức của DeepSeek với cửa sổ context 1 triệu token. Nhanh trong bài đo của chúng tôi (~1 giây ra token đầu, ~100 tok/s), tool calling agentic tốt — lựa chọn hời cho việc ngữ cảnh dài.

Cửa sổ context1M
Khả năngtoolsreasoningfast

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,44$0,264
Input (cache)$0,014$0,008
Output$1,32$0,792

deepseek-v4-pro

Giảm 40%@cf/deepseek-ai/deepseek-v4-pro-0813

Model V4 đầu bảng của DeepSeek: context 1 triệu token, suy luận sâu và function calling ổn định. Sinh ra cho phân tích cỡ cả repo và tài liệu dài.

Cửa sổ context1M
Khả năngtoolsreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$1,32$0,792
Input (cache)$0,044$0,026
Output$3,96$2,376

qwen3.8-27b

Giảm 40%@cf/qwen/qwen3.8-27b

Qwen 3.8 27B của Alibaba — khả năng đọc ảnh do chính chúng tôi probe xác nhận, không chép từ bảng thông số. Gửi ảnh kèm văn bản trong cùng một request; context 262K token, có tool calling và reasoning.

Cửa sổ context262K
Khả năngtoolsreasoningvision

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,45$0,27
Input (cache)$0,05$0,03
Output$3,20$1,92

glm-5.3-flash

Giảm 40%@cf/zai-org/glm-5.3-flash

GLM 5.3 Flash của Z.ai: cửa sổ context 1 triệu token và đọc được ảnh (probe của chính chúng tôi xác nhận) trong cùng một model — giá input rẻ nhất trong các model vision của catalog. Có tool calls, reasoning và JSON nghiêm ngặt.

Cửa sổ context1M
Khả năngtoolsvisionreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$0,15$0,09
Input (cache)$0,03$0,018
Output$0,50$0,30

glm-5.3

Giảm 40%@cf/zai-org/glm-5.3

Model coding chủ lực (flagship) của Z.ai cho agentic work: cửa sổ context 1 triệu token với giá niêm yết đúng bằng GLM-5.2, có tool calls, năm mức reasoning effort và JSON nghiêm ngặt. Chỉ nhận chữ — request kèm ảnh bị từ chối ngay từ đầu, không tốn của bạn đồng nào.

Cửa sổ context1M
Khả năngtoolsreasoningjson

Token suy luận tính theo giá output — không bao giờ tính hai lần.

Input$1,40$0,84
Input (cache)$0,26$0,156
Output$4,40$2,64

Về token suy luận: model suy luận trả phần "suy nghĩ" như một phần của output. Số token đó là tập con của token output, chỉ bị tính tiền MỘT lần theo giá output, và được tách riêng trong usage log — không bao giờ bị cộng thêm.