Claude Opus 5.5 rẻ hơn Opus 5: đừng chỉ nhìn giá token trước khi đổi model
Opus 5.5 giảm giá token và Anthropic nói chi phí workload điển hình thấp hơn khoảng 40%, nhưng migration còn phụ thuộc lượng token, cache, chất lượng và thay đổi thinking.
Nếu bạn đang chạy một tác vụ bằng Claude Opus 5 và thấy Opus 5.5 có giá đầu vào 4 USD và đầu ra 20 USD cho mỗi triệu token, phản xạ dễ hiểu là: đổi model thì hóa đơn giảm 20%. Nhưng đó mới là giá trên từng token. Chi phí của một tác vụ còn phụ thuộc model dùng bao nhiêu token, có đọc cache hay không, mất bao nhiêu lượt để hoàn thành và kết quả có đạt tiêu chí của bạn ngay lần đầu không.
Anthropic ra mắt Claude Opus 5.5 ngày 22/9/2026. Hãng công bố giá API chuẩn là 4 USD cho một triệu token đầu vào và 20 USD cho một triệu token đầu ra, thấp hơn 20% so với Opus 5. Anthropic đồng thời nói một workload điển hình tính theo token có thể tốn khoảng 40% ít hơn Opus 5 vì Opus 5.5 vừa rẻ hơn trên mỗi token vừa dùng ít token hơn cho một tác vụ. Cache read được niêm yết ở mức 0,20 USD cho một triệu token, thấp hơn 60% so với Opus 5.
Con số 40% là tuyên bố của Anthropic về workload điển hình, không phải cam kết rằng hóa đơn của mọi ứng dụng sẽ giảm đúng 40%. Nếu ứng dụng của bạn có prompt, tool call, cache pattern và tiêu chí chất lượng khác với các phép thử của hãng, mức tiết kiệm thực tế có thể khác.
Hai con số 20% và 40% đang nói về hai thứ khác nhau
Mức 20% là thay đổi giá niêm yết cho input và output token so với Opus 5. Mức khoảng 40% mà Anthropic nêu cho workload điển hình bao gồm thêm hiệu quả sử dụng token. Đây là lý do không nên lấy một tỷ lệ rồi áp thẳng lên hóa đơn tháng trước.
Ví dụ giả lập: bạn có 20 task nội bộ cố định, mỗi task có tiêu chí pass/fail rõ ràng. Hãy chạy một mẫu nhỏ bằng cấu hình Opus 5 hiện tại và Opus 5.5 mới, giữ nguyên prompt và tool set. Với mỗi task, ghi input token, output token, cache read nếu có, số lượt cần sửa lại và kết quả có vượt tiêu chí hay không. Ví dụ này là cách đo do biên tập viên đề xuất; đây không phải benchmark đã chạy và không phải số liệu hiệu năng thực tế của hai model.
Nếu Opus 5.5 tạo ít token hơn nhưng bạn phải sửa lại nhiều hơn, chi phí token thấp chưa chắc là lợi ích tổng thể. Ngược lại, nếu cùng tiêu chí chất lượng được đạt với ít lượt và ít token hơn, mức tiết kiệm trên mỗi task có thể lớn hơn chênh lệch giá niêm yết.
Cache rẻ hơn có thể quan trọng với agent chạy dài
Anthropic nhấn mạnh cache read vì đây có thể là phần lớn chi phí trong các agent làm việc lâu và liên tục đọc lại ngữ cảnh. Với Opus 5.5, hãng niêm yết cache read 0,20 USD cho một triệu token, giảm 60% so với Opus 5.
Điều đó đáng chú ý nếu workload của bạn thực sự dùng prompt caching nhiều. Nếu ứng dụng hầu như không có cache hit, mức giảm này không tạo ra cùng tác động. Cách kiểm tra đơn giản là nhìn usage thực tế của workload hiện tại thay vì giả định mọi agent đều hưởng lợi giống nhau.
Migration không chỉ là đổi tên model
Release này còn có thay đổi về thinking và safeguard. Anthropic cho biết Opus 5.5 sử dụng preserved thinking cho các tài khoản API tạo từ ngày 31/8/2026 trở đi. Cơ chế này hạn chế việc ứng dụng chỉnh sửa phần thinking trước đó trong context. Anthropic cũng nói Opus 5.5 không còn tùy chọn tắt thinking.
Nếu ứng dụng của bạn chỉ gửi prompt và nhận câu trả lời thông thường, thay đổi này có thể ít đáng kể. Nhưng nếu code đang lưu, sửa hoặc phát lại thinking blocks giữa các lượt, bạn cần đọc tài liệu migration của Anthropic và thử integration trước. Đừng đổi model production chỉ vì model ID mới chạy được ở một request đơn lẻ.
Opus 5.5 cũng đi kèm lớp safeguard tương tự Fable 5.1 cho một số lĩnh vực như an ninh mạng, sinh học và chống distillation. Vì vậy một workload chuyên biệt có thể gặp hành vi khác với model cũ. Đây là thay đổi cần được kiểm tra bằng task hợp lệ của chính bạn, không nên suy ra chỉ từ benchmark tổng hợp.
Một phép thử migration nhỏ trước khi đổi production
Bạn có thể bắt đầu với bốn bước:
- Chọn 10–20 task đại diện nhưng không chứa secrets hoặc dữ liệu khách hàng nhạy cảm.
- Viết tiêu chí đạt trước khi chạy: đúng dữ kiện nào, file nào được phép sửa, test nào phải pass hoặc cấu trúc đầu ra nào phải giữ.
- Chạy cùng task trên cấu hình hiện tại và Opus 5.5; ghi token, cache, số lượt, lỗi integration và pass/fail.
- Chỉ chuyển rộng hơn nếu chi phí trên task và chất lượng đều đạt ngưỡng của bạn. Nếu thinking/context bị lỗi, safeguard chặn task hợp lệ hoặc kết quả cần sửa nhiều hơn, giữ cấu hình cũ trong khi điều tra.
Đừng dùng các con số giả lập trong bài làm baseline. Hãy lấy usage từ chính ứng dụng của bạn và bảng giá hiện hành của Anthropic tại thời điểm đo.
Benchmark của hãng giúp đặt câu hỏi, không thay phép thử của bạn
Anthropic công bố nhiều benchmark và lời chứng thực cho thấy Opus 5.5 dùng ít token hoặc ít bước hơn trong một số workload. Những số liệu này hữu ích để biết model đáng thử ở đâu, nhưng phần lớn vẫn là đánh giá do Anthropic hoặc đối tác được hãng trích dẫn. Chúng không chứng minh ứng dụng của bạn sẽ đạt cùng tỷ lệ.
Điểm thực dụng của release không phải là ‘model mới rẻ hơn nên hãy đổi ngay’. Nó là: giá token đã giảm đủ để đáng chạy lại phép tính cho những workload Opus 5 hiện có. Nếu phép thử nhỏ cho thấy cùng chất lượng với chi phí mỗi task thấp hơn và integration không vỡ, bạn có bằng chứng để migration. Nếu không, bảng giá mới vẫn chưa phải lý do để thay một hệ thống đang ổn định.