Ngày 21 tháng 8 năm 2026, OpenAI chính thức cắt giảm giá API của GPT-5.6 Sol thêm một lần nữa: giá đầu vào giảm từ 5 xuống 4 USD mỗi triệu token, giá đầu ra giảm từ 30 xuống 20 USD, mức giảm hơn 20%, khuyến mãi kéo dài ít nhất đến ngày 21 tháng 11. Đây là bước tiếp theo sau lần giảm giá Terra (giảm 20%) và Luna (giảm 80%) vào ngày 30 tháng 7 — vòng giảm giá chính thức thứ hai của GPT-5.6 trong vòng hai tháng. Sau lần giảm giá này, giá niêm yết của Sol đã thấp hơn Claude Opus 5 (5 USD đầu vào / 25 USD đầu ra), nhưng điều đó không có nghĩa Sol tự động trở thành "lựa chọn rẻ hơn" — bạn vẫn cần xem xét Fast Mode, cache, giá ngữ cảnh dài và xử lý theo lô (Batch) mới tính được số tiền thực tế phải trả.
Bảng giá đầy đủ hiện tại của GPT-5.6: Sol, Terra và Luna
Dưới đây là giá chính thức mới nhất tính đến tháng 8 năm 2026 (mỗi triệu token, đơn vị USD, chế độ Standard):
Ngữ cảnh ngắn (Short context):
GPT-5.6 Sol: đầu vào $4.00, đầu vào cache $0.40, ghi cache $5.00, đầu ra $20.00
GPT-5.6 Terra: đầu vào $2.00, đầu vào cache $0.20, ghi cache $2.50, đầu ra $12.00
GPT-5.6 Luna: đầu vào $0.20, đầu vào cache $0.02, ghi cache $0.25, đầu ra $1.20
Ngữ cảnh dài (Long context, thường là các yêu cầu vượt một ngưỡng token nhất định):
GPT-5.6 Sol: đầu vào $8.00, đầu vào cache $0.80, ghi cache $10.00, đầu ra $30.00
GPT-5.6 Terra: đầu vào $4.00, đầu vào cache $0.40, ghi cache $5.00, đầu ra $18.00
GPT-5.6 Luna: đầu vào $0.40, đầu vào cache $0.04, ghi cache $0.50, đầu ra $1.80
Bạn sẽ thấy giá đầu vào ở ngữ cảnh dài đúng bằng gấp đôi ngữ cảnh ngắn, nhưng đầu ra thì không tăng theo tỷ lệ tương ứng (ví dụ đầu ra của Sol chỉ tăng từ 20 lên 30, không phải 40). Điều này cho thấy OpenAI áp dụng logic tăng giá khác nhau giữa "đầu ra dài hơn" và "đầu vào dài hơn", vì vậy khi ước tính chi phí cho tài liệu dài hoặc cuộc hội thoại dài, bạn không thể chỉ đơn giản nhân hai.
Không phải lần giảm giá đầu tiên: Trong hai tháng, OpenAI đã hạ giá GPT-5.6 theo hai giai đoạn
Lần giảm giá này thực chất là hành động tiếp nối, không phải diễn ra một cách đơn lẻ:
Ngày 30 tháng 7, OpenAI thông báo trên cộng đồng nhà phát triển rằng nhóm phát triển GPT-5.6 đã giao cho chính mô hình này tự tối ưu hiệu suất vận hành của mình, và đạt được hai kết quả: giảm 20% chi phí vận hành nhờ cải tiến GPU kernel trong môi trường sản xuất, và tăng hiệu suất sinh token hơn 15% nhờ cải tiến kỹ thuật giải mã dự đoán (speculative decoding). OpenAI đã trực tiếp chuyển những cải tiến hiệu suất này vào giá: Luna giảm 80%, Terra giảm 20%, đồng thời Sol có thêm Fast Mode (tốc độ tối đa gấp 2,5 lần Standard, với giá gấp đôi).
Ngày 21 tháng 8, OpenAI tiếp tục thông báo rằng chính Sol sẽ giảm hơn 20% (đầu vào giảm 20%, đầu ra giảm 33%), và nêu rõ mức giảm này "áp dụng cho Fast Mode, các yêu cầu ngữ cảnh dài, cũng như xử lý Batch và Flex" — nghĩa là lần giảm giá này không chỉ cắt một mức giá đầu vào, mà là điều chỉnh toàn bộ đường cong giá cùng lúc. OpenAI cũng giải thích rằng việc điều chỉnh giá lần này "bao gồm API, tín dụng Codex, và đang được mở rộng dần sang các gói ChatGPT Work đủ điều kiện", nhưng giá của các gói đăng ký Pro, Plus và Business không thay đổi — điều này nhắc bạn rằng tính phí API và tính phí đăng ký tiêu dùng là hai hệ thống giá hoàn toàn độc lập; việc giảm giá ở một bên không tự động phản ánh sang bên còn lại.
Fast Mode (trước đây gọi là Priority): Đắt hơn Standard bao nhiêu, khi nào nên dùng
Fast Mode là tên gọi chính thức mới của "xử lý Priority" từ ngày 30 tháng 7 năm 2026. Trong các yêu cầu API, bạn vẫn có thể dùng `service_tier: "priority"`, hoặc đổi sang tên mới `service_tier: "fast"` — cả hai đều tương đương. Giá Fast Mode sau khi giảm (ngữ cảnh ngắn):
GPT-5.6 Sol: đầu vào $8.00, đầu vào cache $0.80, ghi cache $10.00, đầu ra $40.00
GPT-5.6 Terra: đầu vào $4.00, đầu vào cache $0.40, ghi cache $5.00, đầu ra $24.00
GPT-5.6 Luna: đầu vào $0.40, đầu vào cache $0.04, ghi cache $0.50, đầu ra $2.40
Nói ngắn gọn: Fast Mode có giá gấp đôi Standard một cách đồng nhất, đổi lại bạn có tốc độ xử lý tối đa gấp 2,5 lần, mức độ thông minh của mô hình không thay đổi. Nếu ứng dụng của bạn là chăm sóc khách hàng theo thời gian thực hoặc tương tác giọng nói — nơi người dùng đang chờ đợi — thì trả thêm gấp đôi tiền để có độ trễ thấp hơn thường là đáng giá. Nếu là nhiệm vụ xử lý theo lô ở hậu trường, hoặc chạy báo cáo vào giờ thấp điểm, thì việc trả tiền để mua tốc độ sẽ không có ý nghĩa gì, lúc này nên chuyển sang Batch/Flex ở phần tiếp theo.
Batch và Flex: Giảm nửa giá, đổi lại phải chờ
Hai chế độ xử lý Batch và Flex có mức giá hoàn toàn giống nhau, đều giảm 50% so với Standard (ngữ cảnh ngắn):
GPT-5.6 Sol: đầu vào $2.00, đầu vào cache $0.20, ghi cache $2.50, đầu ra $10.00
GPT-5.6 Terra: đầu vào $1.00, đầu vào cache $0.10, ghi cache $1.25, đầu ra $6.00
GPT-5.6 Luna: đầu vào $0.10, đầu vào cache $0.01, ghi cache $0.125, đầu ra $0.60
Sự khác biệt là Batch gửi một loạt yêu cầu không đồng bộ và chờ hoàn thành, phù hợp với các công việc như tổng hợp báo cáo, tóm tắt số lượng lớn tài liệu — những việc không cần thấy kết quả ngay lập tức. Flex là một chế độ xử lý linh hoạt chính thức khác của OpenAI, có giá giống Batch nhưng cách sử dụng khác. Cả hai đều không phù hợp với các tình huống cần phản hồi ngay lập tức cho người dùng.
Mô hình Cyber (Daybreak): Một bảng giá riêng, không phải ai cũng cần dùng đến
Họ mô hình GPT-5.6 còn có một nhánh độc lập gọi là mô hình Cyber, tương ứng với chương trình Daybreak của OpenAI, hiện chỉ có giá cho ngữ cảnh ngắn: GPT-5.6 Sol vẫn giữ ở mức $4.00 / $0.40 / $5.00 / $20.00 (giống Sol thông thường), còn GPT-5.6 Cyber có giá $12.50 đầu vào / $1.25 đầu vào cache / $15.625 ghi cache / $75.00 đầu ra — cao hơn rõ rệt, gấp nhiều lần. Tài liệu chính thức cũng chỉ ra rằng hai tên gọi thay thế (alias) `daybreak-blue-latest` và `daybreak-red-latest` hiện đang trỏ tới `gpt-5.6-sol` và `gpt-5.6-cyber` tương ứng, và sẽ được cập nhật — kèm theo giá được điều chỉnh — khi chương trình Daybreak cho ra mắt các mô hình mới. Nếu ứng dụng của bạn không liên quan đến đánh giá an ninh mạng, diễn tập red team hoặc các trường hợp sử dụng mục tiêu tương tự của chương trình Daybreak, thông thường bạn sẽ không cần đụng đến bảng giá của mô hình Cyber.
Khuyến mãi kéo dài đến ngày 21 tháng 11 năm 2026: Sau đó giá có tăng lại không
Tài liệu chính thức ghi rõ "giá khuyến mãi của GPT-5.6 Sol sẽ được duy trì ít nhất đến ngày 21 tháng 11 năm 2026" — chú ý cách dùng từ "ít nhất" ở đây, nghĩa là OpenAI không cam kết giá sẽ chắc chắn trở lại mức $5/$30 ban đầu sau khi khuyến mãi kết thúc, cũng không cam kết sẽ tiếp tục duy trì ở mức $4/$20. Trong các chuỗi thảo luận của cộng đồng nhà phát triển chính thức của OpenAI, các kỹ sư và nhà phát triển cũng có hai luồng ý kiến khác nhau: có người cho rằng áp lực cạnh tranh — đặc biệt từ các mô hình mã nguồn mở và cuộc chiến giá giữa các nhà cung cấp — sẽ khiến mức giảm giá này tiếp tục kéo dài; cũng có người cho rằng rất có thể trong 3 tháng nữa sẽ có một thế hệ mô hình mới ra mắt, và khi đó chiến lược giá của mô hình cũ tự nó cũng sẽ bị thay thế. Hiện tại chưa có thông báo chính thức nào để xác minh điều này, đây chỉ là suy đoán của cộng đồng, chứ không phải sự thật đã được xác nhận. Khi lập kế hoạch ngân sách cho giai đoạn sau tháng 11, bạn nên tính đến cả hai tình huống — "giảm giá tiếp tục duy trì" và "giá trở lại như cũ" — không nên chỉ đặt cược vào một khả năng duy nhất.
GPT-5.6 Sol hiện tại có thực sự rẻ hơn Claude Opus 5 không
Đặt hai bảng giá chính thức cạnh nhau để so sánh: GPT-5.6 Sol (Standard, ngữ cảnh ngắn) có giá $4.00 đầu vào / $20.00 đầu ra; Claude Opus 5 (Standard) có giá $5 đầu vào / $25 đầu ra. Nếu chỉ nhìn vào giá niêm yết, Sol thực sự thấp hơn Opus 5 ở cả hai chiều đầu vào và đầu ra. Nhưng sự so sánh này có hai giới hạn bạn cần lưu ý: thứ nhất, hai bên sử dụng tokenizer khác nhau, cùng một đoạn văn bản sẽ không tạo ra số lượng token giống nhau trên Sol và Opus 5, giá niêm yết rẻ hơn không đảm bảo hóa đơn thực tế cho cùng một công việc sẽ thấp hơn. Thứ hai, Claude Opus 5 cung cấp mức giảm giá Batch 50% ($2.50 / $12.50) và giảm giá cache prompt lên đến 90%, trong khi mức giảm giá Batch của GPT-5.6 Sol cũng là 50% ($2.00 / $10.00), nhưng cấu trúc cache lại khác nhau (đầu vào cache của Sol bằng một phần mười giá chuẩn, còn việc đọc cache của Opus 5 bằng 0,1 lần giá đầu vào, và việc ghi cache thì bằng 1,25 lần hoặc 2 lần tùy theo là ghi trong 5 phút hay 1 giờ). Điều thực sự nên so sánh không phải là con số nổi bật trong thông báo chính thức, mà là hóa đơn thực tế phát sinh từ khối lượng công việc cụ thể của bạn.
Quyết định mua sắm doanh nghiệp: Tin giảm giá không có nghĩa bạn nên đổi mô hình ngay
Thấy tin giảm giá là muốn ngay lập tức đổi toàn bộ pipeline sang mô hình mới — đây là phản ứng dễ khiến bạn tốn nhiều tiền hơn nhất. Trước khi chuyển đổi, hãy xác nhận ba điều sau: khối lượng sử dụng hiện tại của bạn đang phân bố ở chế độ nào (Standard / Fast Mode / Batch), và liệu lần giảm giá này có thực sự bao gồm chế độ bạn đang dùng hay không; mức độ nhạy cảm của công việc bạn đối với độ trễ — nếu vốn là công việc chạy ở hậu trường, thì việc giảm giá Fast Mode thực ra không liên quan đến bạn; và liệu bạn có đang sử dụng tùy chọn Data Residency (lưu trữ dữ liệu theo khu vực) hay không. Tài liệu chính thức ghi rõ rằng các điểm cuối (endpoint) xử lý theo khu vực sẽ bị tính phụ phí 10% đối với các mô hình đủ điều kiện được phát hành từ ngày 5 tháng 3 năm 2026 trở đi, và họ mô hình GPT-5.6 nằm trong phạm vi này — vì vậy giá sau khi giảm cần nhân thêm 1,1 mới ra chi phí xử lý theo khu vực thực tế của bạn. Hãy tính rõ ba điều này trước khi quyết định có nên chuyển đổi pipeline hay không.
Câu hỏi thường gặp
Câu 1: Sau lần giảm giá này, tín dụng ChatGPT Work hoặc Codex mà tôi đã mua trước đó có tự động rẻ hơn không? Thông báo chính thức ghi rằng lần giảm giá này "bao gồm API, tín dụng Codex, và đang được mở rộng dần sang các gói ChatGPT Work đủ điều kiện", nhưng giá của các gói đăng ký Pro, Plus và Business không thay đổi. Nghĩa là, nếu bạn dùng API hoặc tín dụng Codex, mức giảm giá thường sẽ tự động được áp dụng; nhưng nếu bạn là người dùng đăng ký, lần giảm giá này không ảnh hưởng đến chi phí đăng ký của bạn.
Câu 2: Sau khi khuyến mãi kết thúc (ngày 21 tháng 11 năm 2026), giá có chắc chắn tăng lại lên $5/$30 không? Hiện tại OpenAI chưa công bố cách xử lý sau khi khuyến mãi kết thúc, chỉ nói rằng khuyến mãi sẽ duy trì "ít nhất" đến ngày đó. Đây là một sự kiện trong tương lai chưa được xác nhận, bạn có thể tham khảo nhưng không nên coi đó là sự thật chắc chắn để lập kế hoạch ngân sách dài hạn.
Câu 3: Fast Mode có phải là cùng một thứ với xử lý Priority trước đây không? Đúng vậy. Tài liệu chính thức ghi rõ "Priority processing was renamed Fast mode on July 30, 2026" (xử lý Priority được đổi tên chính thức thành Fast Mode vào ngày 30 tháng 7 năm 2026). Tham số API `service_tier` vẫn có thể dùng `"priority"`, hoặc đổi sang tên mới `"fast"` — hiệu quả giống nhau.
Câu 4: Lần giảm giá này có áp dụng cho Batch và ngữ cảnh dài không? Có áp dụng. Thông báo chính thức ngày 21 tháng 8 nêu rõ "việc giảm giá cũng áp dụng cho Fast Mode, các yêu cầu ngữ cảnh dài, cũng như xử lý Batch và Flex". Các mức giá của từng chế độ được liệt kê trong bài viết này đều đã là số liệu chính thức mới nhất sau khi giảm giá.
Câu 5: GPT-5.6 Sol hiện tại có thực sự rẻ hơn Claude Opus 5 không? So sánh theo giá niêm yết chính thức, giá đầu vào và đầu ra của Sol đều thấp hơn Opus 5. Nhưng vì tokenizer của hai bên khác nhau, cấu trúc giảm giá cache và Batch cũng khác nhau, nên tổng chi phí thực tế cần dựa trên việc chạy thử với khối lượng công việc của riêng bạn, không thể chỉ nhìn vào đơn giá nổi bật trong tiêu đề.
Câu 6: GPT-5.6 Cyber khác gì so với Sol thông thường, tôi có cần lưu ý không? Cyber là một nhánh mô hình độc lập tương ứng với chương trình Daybreak (liên quan đến đánh giá an ninh mạng), có giá cao hơn rõ rệt so với Sol thông thường (đầu ra lên đến $75), và hiện chỉ có giá cho ngữ cảnh ngắn. Nếu ứng dụng của bạn không liên quan đến đánh giá an ninh hoặc diễn tập red team, thông thường bạn sẽ không dùng đến và cũng không cần đặc biệt lưu ý đến mức giá này.
Công bố nguồn dữ liệu
Các số liệu trong bài viết này được xác minh tính đến ngày 25 tháng 8 năm 2026, dựa trên các nguồn chính thức sau:
Trang giá chính thức của OpenAI, Pricing | OpenAI API (xác minh ngày 2026-08-25)
Thông báo chính thức từ cộng đồng nhà phát triển OpenAI, "20% price reduction for GPT 5.6 Sol: API, Codex credits and ChatGPT Work", công bố ngày 21 tháng 8 năm 2026 (xác minh ngày 2026-08-25)
Thông báo chính thức từ cộng đồng nhà phát triển OpenAI, "Announcing a major Price drop for 5.6 Terra and Luna and Fast mode for 5.6-Sol", công bố ngày 30 tháng 7 năm 2026 (xác minh ngày 2026-08-25)
Trang giá chính thức của Anthropic, Pricing - Claude Platform Docs (xác minh ngày 2026-08-25), được dùng làm cơ sở cho các số liệu so sánh với Claude Opus 5
Nếu bạn đang đánh giá xem lần giảm giá này có đủ để điều chỉnh tổ hợp mô hình của mình hay không, hoặc muốn hiểu rõ chính xác lượng token bạn đang dùng đã đi vào đâu, hãy truy cập Ai Token để dùng thử miễn phí — hiểu rõ hóa đơn của bạn trước, rồi mới quyết định có nên chuyển đổi hay không.