← Trang chủ
What Changed

GPT-6 Sol hay Luna: giá token giảm 50% nhưng nên chọn theo loại việc, không chỉ theo giá

GPT-6 Sol và Luna có giá API thấp hơn thế hệ trước, nhưng headline giảm 50% chưa cho biết workload của bạn sẽ tốn bao nhiêu. Đây là cách đọc bảng giá bằng một phép tính nhỏ trước khi đổi model.

OpenAI vừa công bố GPT-6 Sol và GPT-6 Luna với mức giá API thấp hơn 50% so với giá quảng bá của GPT-5.6 Sol và Luna. AI Pulse của newsroom đã ghi nhận sự kiện này. Nhưng nếu bạn đang trả tiền API, câu hỏi tiếp theo hữu ích hơn là: giảm 50% ở bảng giá có làm workload của mình rẻ đi đúng 50% không?

Câu trả lời là chưa chắc. Đơn giá là một phần của hóa đơn; lượng token đầu vào, đầu ra, số lần gọi lại và cách ứng dụng dùng cache cũng ảnh hưởng chi phí thực tế. Vì vậy, thay vì bắt đầu bằng câu hỏi ‘model nào rẻ nhất?’, hãy lấy một workload nhỏ mà bạn hiểu rõ rồi tính trước.

Bốn con số cần đọc trước

Theo bảng giá OpenAI công bố ngày 22/9/2026, GPT-6 Sol có giá 2 USD cho một triệu token đầu vào và 10 USD cho một triệu token đầu ra. GPT-6 Luna có giá 0,10 USD cho một triệu token đầu vào và 0,50 USD cho một triệu token đầu ra. Reuters cũng xác nhận các mức giá này và việc chúng thấp hơn 50% so với giá quảng bá của GPT-5.6 Sol và Luna.

Điểm dễ bỏ qua là input và output không cùng giá. Một ứng dụng đọc nhiều tài liệu nhưng trả lời ngắn có cấu trúc chi phí khác một agent tạo ra rất nhiều nội dung hoặc code. Chỉ nhìn giá input có thể làm phép so sánh sai ngay từ đầu.

Một phép tính nhỏ trước khi bàn về production

Giả sử một workload trong một chu kỳ dùng đúng 1.000.000 token đầu vào và 200.000 token đầu ra. Đây là ví dụ giả lập để minh họa cách tính, không phải số liệu sử dụng thực tế của một sản phẩm.

Với Sol, phần input là 2 USD. Phần output là 0,2 triệu nhân 10 USD, tức 2 USD. Tổng minh họa là khoảng 4 USD.

Với Luna, input là 0,10 USD. Output là 0,2 triệu nhân 0,50 USD, tức 0,10 USD. Tổng minh họa là khoảng 0,20 USD.

Khoảng cách này rất lớn, nhưng nó chưa nói Luna là lựa chọn tốt hơn cho workload đó. Bạn vẫn chưa đo chất lượng đầu ra, số lần phải retry, thời gian xử lý hay việc task có cần mức năng lực của Sol hay không.

Vì sao đơn giá giảm 50% không bảo đảm hóa đơn giảm 50%

Nếu chuyển model khiến mỗi tác vụ cần nhiều vòng hơn, output dài hơn hoặc phải chạy lại vì kết quả không đạt, lượng token có thể tăng. Ngược lại, nếu model hoàn thành việc với ít vòng hơn hoặc ứng dụng tận dụng cache tốt hơn, chi phí trên một tác vụ có thể giảm nhiều hơn mức nhìn thấy từ bảng giá.

OpenAI nói các cải tiến về caching và inference là một phần lý do hãng có thể hạ giá. Nhưng đó không phải lời hứa rằng mọi ứng dụng sẽ tự động đạt cùng mức tiết kiệm. Hóa đơn của bạn phụ thuộc vào cách workload thực sự chạy.

Benchmark là tín hiệu, không phải hóa đơn của bạn

Trong công bố, OpenAI đưa ra nhiều kết quả cho công việc chuyên môn, coding, computer use và agent, đồng thời so sánh chi phí trên tác vụ với các model khác. Đây là benchmark do chính OpenAI công bố. Chúng hữu ích để biết hãng đang định vị Sol và Luna ở đâu, nhưng không thay thế phép thử trên dữ liệu và tiêu chí chất lượng của ứng dụng của bạn.

Reuters xác nhận định vị chung: Astra vẫn là model mạnh nhất của dòng GPT-6, còn Sol và Luna nhắm tới các lựa chọn chi phí thấp hơn cho công việc chuyên môn, coding, automation và computer use. Reuters không biến các benchmark riêng của OpenAI thành một bảo đảm độc lập cho workload cụ thể.

Cách chọn mà không cần đoán

Lấy 20–50 tác vụ đại diện mà bạn đã biết đầu ra chấp nhận được là gì. Chạy cùng một bộ trên model hiện tại và model bạn định thử. Ghi ba thứ: chất lượng đạt hay không, tổng input/output token và số lần phải chạy lại.

Nếu Luna đạt yêu cầu cho một tác vụ lặp lại đơn giản, chênh lệch đơn giá có thể đáng để khai thác. Nếu task cần suy luận hoặc coding khó hơn và Luna làm tăng retry hoặc rework, Sol có thể hợp lý hơn dù đơn giá cao hơn. Với những việc khó nhất, chính OpenAI vẫn định vị Astra là lựa chọn mạnh nhất.

Điểm cần giữ lại từ lần ra mắt này không phải ‘mọi thứ rẻ hơn 50%’. Thay đổi đáng chú ý là bạn có thêm các điểm giá rất khác nhau trong cùng dòng model. Quyết định tốt hơn là gắn mỗi model với một workload có thể đo, tính cả input lẫn output, rồi đổi production sau khi phép thử nhỏ cho thấy chất lượng và chi phí cùng đạt yêu cầu.

Nguồn tham khảo

  1. OpenAI
  2. reuters.com