Nếu ứng dụng AI của bạn chạy trên GPT-5.1, GPT-5.3-Codex hoặc GPT-5.4-Nano, OpenAI sẽ tắt các model đó trên API vào ngày 01/04/2027. Các snapshot GPT-5 và o3 cũ hơn bị tắt sớm hơn, ngày 11/12/2026. Claude Sonnet 4.5 bị khai tử ngày 30/11/2026. Để chuyển đổi mà không bị thụt lùi chất lượng, đừng chỉ đổi model ID. Hãy chốt một bộ test chuẩn (golden set) từ traffic thật, sửa các thay đổi phá vỡ API, tinh chỉnh lại prompt và mức suy luận trên bộ test đó, chạy song song (shadow) model mới trên traffic thật, rồi mới chuyển dần kèm phương án dự phòng. Với phần lớn ứng dụng production, việc này mất hai tới sáu tuần, và phần eval thường lâu hơn phần sửa code.
Bài này tập trung vào quy trình. Hạn chót, tham số và giá lấy từ các trang deprecation, model và bảng giá của OpenAI, Anthropic và Google, kiểm tra ngày 07/10/2026. Giá token cho từng kiến trúc có trong bài chi phí phát triển ứng dụng AI. Kế hoạch eval đủ để qua auditor có trong bài kiểm thử LLM cho ngành tuân thủ.
Đây là các hạn chót trên API dễ ảnh hưởng tới ứng dụng production nhất trong sáu tháng tới:
| Ngày ngừng | Hãng | Cái gì bị ngừng | Thay thế được khuyến nghị | Ngày thông báo |
|---|---|---|---|---|
| 31/10/2026 (chỉ đọc), 30/11/2026 (ngừng hẳn) | OpenAI | Nền tảng Evals (dashboard và API) | OpenAI khuyến nghị Promptfoo | 03/06/2026 |
| 30/11/2026 | OpenAI | Reusable prompts (v1/prompts) và Agent Builder | Đưa prompt vào code của bạn; Agents SDK hoặc workspace agents của ChatGPT | 03/06/2026 |
| 30/11/2026 | Anthropic | claude-sonnet-4-5-20250929 | claude-sonnet-5-5 | 30/09/2026 |
| 11/12/2026 | OpenAI | Các snapshot GPT-5 gốc (gpt-5, -mini, -nano, -pro) và o3 / o3-pro | GPT-5.6 Sol, Terra hoặc Luna | 11/06/2026 |
| 06/01/2027 | OpenAI | tts-1, tts-1-hd, các snapshot gpt-4o-mini-tts | gpt-realtime-2.1-mini | 01/10/2026 |
| 01/04/2027 | OpenAI | gpt-5.1, gpt-5.3-codex, gpt-5.4-nano | gpt-6-sol (Nano → gpt-6-luna) | 01/10/2026 |
| 07/05/2027 | gemini-3.1-flash-lite | gemini-3.5-flash-lite | Xem trang deprecation của Gemini |
Hãy theo dõi thêm ba mốc. Claude Haiku 4.5 vẫn đang hoạt động, nhưng Anthropic chỉ cam kết giữ nó "không sớm hơn" ngày 15/10/2026, nên thông báo khai tử có thể tới bất cứ lúc nào. Anthropic cam kết báo trước ít nhất 60 ngày trước khi khai tử một model đã phát hành công khai. Gemini 3.8 Flash không bị khai tử, nhưng giá tăng gấp đôi từ 01/01/2027. Còn nếu bộ test hồi quy của bạn nằm trên nền tảng Evals của OpenAI, hãy xuất ra ngay trong tháng này. Nó chuyển sang chỉ đọc từ ngày 31/10.

Cả hai hãng đều biến những thiết lập request trước đây vô hại thành lỗi cứng. Chỉ đổi tên model sẽ gây lỗi trên production. Đây là các thay đổi mà hướng dẫn chuyển đổi của họ liệt kê:
| Hạng mục | GPT-6 Sol / GPT-6.1 Sol / GPT-6 Luna | Claude Opus 5.5 |
|---|---|---|
| Tham số lấy mẫu | Bỏ temperature, top_p và top_logprobs khi mức suy luận khác none (và bỏ logprobs trên Chat Completions) | Bất kỳ giá trị khác mặc định nào của temperature, top_p hoặc top_k đều trả lỗi 400 |
| Suy luận / thinking | Các mức effort từ none tới max, mặc định medium. GPT-6.1 Sol không có none; dùng low. Đổi minimal sang low rồi so sánh | Adaptive thinking luôn bật. thinking: disabled và ngân sách thinking thủ công bị từ chối. Effort là cách điều khiển duy nhất, mặc định medium (Opus 5 mặc định high) |
| Gọi công cụ | Dùng Responses API để gọi công cụ trên GPT-6.1 Sol. Trên Chat Completions, GPT-6 Sol và Luna chỉ gọi function khi effort là none | Ép gọi công cụ (any hoặc chỉ định tên) bị từ chối. Dùng auto kèm strict tools hoặc structured outputs |
| Cấu trúc phản hồi | Thiết lập suy luận làm thay đổi độ dài đầu ra và độ trễ | Phản hồi có thể bắt đầu bằng khối thinking, nên code đọc content[0].text sẽ hỏng. Khối thinking phải được gửi lại nguyên vẹn trong vòng lặp công cụ |
| Prefill và cache | Thay prompt_cache_retention bằng prompt_cache_options.ttl đặt là "30m" | Prefill lượt assistant bị từ chối; dùng structured outputs hoặc chỉ dẫn trong system prompt |
| An toàn và từ chối | Kiểm tra từ chối trên các ca biên của bạn | Có thêm loại stop_reason: "refusal", kèm tùy chọn tự chuyển sang model khác phía máy chủ |
| Xử lý theo khu vực | Fast mode không dùng được với lưu trữ dữ liệu tại EU | Suy luận chỉ tại Mỹ tốn 1,1 lần |
Hai trong số này gây thụt lùi âm thầm thay vì báo lỗi. Trên Opus 5.5, đoạn văn model viết giữa các lần gọi công cụ giờ nằm trong khối thinking, mà mặc định là rỗng. Ứng dụng nào từng stream các cập nhật tiến độ đó cho người dùng sẽ im lặng, và không có ngoại lệ nào được ném ra. Trên GPT-6 Sol và Opus 5.5, khi không đặt effort thì mặc định là medium, có thể làm thay đổi độ sâu câu trả lời và độ trễ mà không cần sửa dòng code nào.

Giá niêm yết mỗi triệu token (đầu vào / đầu ra) lấy từ trang giá của các hãng ngày 07/10/2026. Các cột "mỗi 1.000" dùng lại giả định trong bài chi phí: 6.000 token đầu vào và 500 token đầu ra cho một câu trả lời RAG, 60.000 đầu vào và 3.000 đầu ra cho một tác vụ agent. Không dùng cache, chưa tính token suy luận.
| Chuyển đổi | Giá trước → sau | Mỗi 1.000 câu trả lời RAG | Mỗi 1.000 tác vụ agent | Cần lưu ý |
|---|---|---|---|---|
| GPT-5.1 → GPT-6 Sol | $1,25 / $10 → $2 / $10 | $12,50 → $17,00 | $105 → $150 | Đầu vào đắt hơn 60%. Đầu vào có cache giá $0,20 (Sol) hoặc $0,10 (6.1 Sol) |
| GPT-5.3-Codex → GPT-6 Sol | $1,75 / $14 → $2 / $10 | $17,50 → $17,00 | $147 → $150 | Gần như không đổi. Việc sinh nhiều đầu ra sẽ rẻ hơn |
| GPT-5.4-Nano → GPT-6 Luna | $0,20 / $1,25 → $0,10 / $0,50 | $1,83 → $0,85 | $15,75 → $7,50 | Khoảng một nửa giá. Kiểm tra chất lượng trên các ca khó nhất |
| Claude Sonnet 4.5 → Sonnet 5.5 | $3 / $15 → $2 / $10 | $25,50 → ~$22,10 | $225 → ~$195 | Tokenizer mới sinh ra nhiều hơn ~30% token cho cùng văn bản, nên chỉ tiết kiệm ~13%, không phải 33% |
| Claude Opus 5 → Opus 5.5 | $5 / $25 → $4 / $20 | $42,50 → $34,00 | $375 → $300 | Anthropic cho biết chi phí giảm 40% trên khối lượng điển hình ở thiết lập mặc định, một phần nhờ effort mặc định thấp hơn |
Có ba cái bẫy chi phí nằm ngoài giá niêm yết. Thứ nhất, Anthropic tính token thinking như token đầu ra, và trên Opus 5.5 mọi request đều có thinking vì không tắt được. Hãy kiểm tra cả lượng token suy luận ở phía OpenAI. Một tác vụ trước đây chạy không có thinking có thể sinh nhiều token đầu ra hơn dù đơn giá thấp hơn. Thứ hai, GPT-6 Sol và GPT-6.1 Sol tính $4 đầu vào và $15 đầu ra khi ngữ cảnh vượt 272K token. Các model Claude từ 4.6 trở đi tính giá chuẩn trên toàn bộ cửa sổ 1M. Thứ ba, xử lý batch giảm một nửa ở cả hai hãng, nên hãy chuyển eval và các tác vụ hậu trường sang batch.
Không hãng nào công bố cam kết độ trễ cho các model này. Anthropic nói Opus 5.5 sinh đầu ra nhanh hơn Opus 5 trên 30%, và có fast mode giá $8 / $40. GPT-6.1 Sol của OpenAI không có mức effort none, nên thời gian phản hồi có một mức sàn. Hãy đo độ trễ p50 và p95 trên chính prompt của bạn, ở mức effort bạn định dùng. Đừng tin biểu đồ trong buổi ra mắt.
Model mới tốt hơn ở mức trung bình nhưng có thể kém hơn ở một số ca của riêng bạn. Nguyên nhân thường gặp:
Không có bộ eval, bạn chỉ phát hiện những điều này qua phàn nàn của khách hàng. Tránh được điều đó là toàn bộ mục đích của phần tiếp theo.
Sáu bước, theo đúng thứ tự này. Hai tới sáu tuần là thực tế cho một tính năng production, chủ yếu tùy vào việc bạn đã có eval hay chưa.

Mỗi rủi ro một dòng, và đặt ngưỡng trước khi xem kết quả. Các ngưỡng dưới đây chỉ là ví dụ. Hãy đặt ngưỡng của bạn dựa trên mốc hiện tại.
| Bài test | Đo cái gì | Ví dụ quy tắc đạt |
|---|---|---|
| Độ chính xác tác vụ | Câu trả lời hoặc hành động đúng trên golden set, chấm bằng quy tắc, nhãn của người hoặc LLM chấm điểm đã hiệu chỉnh | Không kém hơn mốc quá 1 điểm tổng thể, và không giảm ở ý định quan trọng nào |
| Định dạng hợp lệ | JSON hoặc schema parse được, đủ trường bắt buộc | 100% với đầu ra có cấu trúc |
| Gọi công cụ đúng | Đúng công cụ, tham số hợp lệ, không gọi công cụ bị cấm, số lần gọi mỗi tác vụ | Không có lần gọi bị cấm nào; trung vị số lần gọi lệch không quá 20% so với mốc |
| Từ chối | Từ chối thừa với request hợp lệ, từ chối thiếu với prompt red-team | Không có từ chối mới trên golden set; chặn hết các ca red-team |
| Bám nguồn | Câu trả lời có nguồn truy xuất hỗ trợ, trích dẫn mở được | Không có khẳng định thiếu căn cứ trong tập nội dung thuộc diện quản lý |
| Độ trễ | p50 và p95 đầu-cuối, tính cả công cụ | p95 dưới timeout của sản phẩm, có biên an toàn |
| Chi phí | Token và tiền cho mỗi tác vụ, tính cả token suy luận | Nằm trong ngân sách đã dự báo lại |
Nếu bạn ở ngành có quản lý, hãy lưu kết quả chạy, phiên bản model và ngưỡng làm bằng chứng. Thay đổi model chính là loại sự kiện auditor sẽ hỏi. Kế hoạch eval cho ngành tuân thủ của chúng tôi ánh xạ các bài test này với HIPAA, PCI DSS và EU AI Act, còn bài đánh giá và quan sát AI agent nói về công cụ.
max_tokens cho cả thinking và câu trả lời.Chuyển đổi model là một phần việc có ranh giới rõ: kiểm kê, eval, sửa code và triển khai. Vì vậy nó phù hợp để làm với giá cố định. Các dự án phát triển AI agent của chúng tôi tính giá theo giai đoạn từ $10K, và các gói đã công bố đi từ Pitch Demo $4K tới Flagship Sprint $38K, gồm bộ test đầy đủ, deploy và rollback tự động, và quan sát hệ thống đầy đủ. Framework agent mã nguồn mở của chúng tôi, Kite, có sẵn A/B test prompt với khoảng tin cậy thống kê trên traffic thật. Nó tồn tại vì "prompt mới có vẻ tốt hơn" không phải là tiêu chí phát hành. Nếu bạn không chắc nên chuyển đổi hay xây lại agent, bài framework AI agent và bài chi phí AI agent là điểm khởi đầu tốt.
Ngày 01/04/2027. Ngày 01/10/2026, OpenAI thông báo gpt-5.1, gpt-5.3-codex và gpt-5.4-nano sẽ bị tắt vào ngày đó, với gpt-6-sol thay cho hai model đầu và gpt-6-luna thay cho Nano. Request tới model đã tắt sẽ thất bại.
Chưa, tính tới ngày 07/10/2026. Trang deprecation của OpenAI không ghi ngày ngừng nào cho gpt-5.5, model có giá $5 đầu vào và $30 đầu ra mỗi triệu token. Việc model nào xuất hiện trong ChatGPT là chuyện riêng, không phải deprecation trên API.
Chạy cả hai trên golden set của bạn và quyết định dựa trên bằng chứng. GPT-6.1 Sol giá $2 / $10 với ngữ cảnh 1,05M. Opus 5.5 giá $4 / $20 với ngữ cảnh 1M và thinking luôn bật. Giá mỗi token ít quan trọng hơn chi phí cho mỗi tác vụ thành công, và con số đó phụ thuộc vào prompt, công cụ và mức effort của bạn.
Benchmark lấy trung bình trên những tác vụ không phải của bạn. Chính Anthropic nhận xét rằng chênh lệch benchmark đã trở thành thước đo kém tin cậy hơn cho khác biệt trong thực tế. Một golden set 200 ca mất vài ngày để xây và là cách duy nhất để biết ứng dụng của bạn tốt lên hay kém đi.
Đổi model ID mất vài phút. Chuyển đổi an toàn cho một tính năng production thường mất hai tới sáu tuần. Phần lớn thời gian dành cho xây bộ eval, tinh chỉnh prompt và effort, và chạy shadow traffic đủ lâu để tin được số liệu.
BeevR là studio AI do founder dẫn dắt với đội ngũ senior tại Hà Nội, Việt Nam. Chúng tôi làm việc với giá cố định theo giai đoạn, bạn sở hữu code và IP từ ngày đầu, và chúng tôi xây AI cho các ngành có yêu cầu tuân thủ. Nếu bạn sắp tới hạn chót của một model, hãy cho chúng tôi biết bạn đang chạy những model nào. Chúng tôi sẽ vạch ra các thay đổi phá vỡ và phần việc eval trước khi bạn cam kết bất cứ điều gì.