← Blog
Field note

Chuyển Đổi Model LLM: Lên GPT-6 Sol, Claude Opus 5.5 Không Thụt Lùi

Thien Nguyen · Oct 6, 2026

Nếu ứng dụng AI của bạn chạy trên GPT-5.1, GPT-5.3-Codex hoặc GPT-5.4-Nano, OpenAI sẽ tắt các model đó trên API vào ngày 01/04/2027. Các snapshot GPT-5 và o3 cũ hơn bị tắt sớm hơn, ngày 11/12/2026. Claude Sonnet 4.5 bị khai tử ngày 30/11/2026. Để chuyển đổi mà không bị thụt lùi chất lượng, đừng chỉ đổi model ID. Hãy chốt một bộ test chuẩn (golden set) từ traffic thật, sửa các thay đổi phá vỡ API, tinh chỉnh lại prompt và mức suy luận trên bộ test đó, chạy song song (shadow) model mới trên traffic thật, rồi mới chuyển dần kèm phương án dự phòng. Với phần lớn ứng dụng production, việc này mất hai tới sáu tuần, và phần eval thường lâu hơn phần sửa code.

Bài này tập trung vào quy trình. Hạn chót, tham số và giá lấy từ các trang deprecation, model và bảng giá của OpenAI, Anthropic và Google, kiểm tra ngày 07/10/2026. Giá token cho từng kiến trúc có trong bài chi phí phát triển ứng dụng AI. Kế hoạch eval đủ để qua auditor có trong bài kiểm thử LLM cho ngành tuân thủ.

Model nào sắp bị khai tử, và khi nào?

Đây là các hạn chót trên API dễ ảnh hưởng tới ứng dụng production nhất trong sáu tháng tới:

Ngày ngừngHãngCái gì bị ngừngThay thế được khuyến nghịNgày thông báo
31/10/2026 (chỉ đọc), 30/11/2026 (ngừng hẳn)OpenAINền tảng Evals (dashboard và API)OpenAI khuyến nghị Promptfoo03/06/2026
30/11/2026OpenAIReusable prompts (v1/prompts) và Agent BuilderĐưa prompt vào code của bạn; Agents SDK hoặc workspace agents của ChatGPT03/06/2026
30/11/2026Anthropicclaude-sonnet-4-5-20250929claude-sonnet-5-530/09/2026
11/12/2026OpenAICác snapshot GPT-5 gốc (gpt-5, -mini, -nano, -pro) và o3 / o3-proGPT-5.6 Sol, Terra hoặc Luna11/06/2026
06/01/2027OpenAItts-1, tts-1-hd, các snapshot gpt-4o-mini-ttsgpt-realtime-2.1-mini01/10/2026
01/04/2027OpenAIgpt-5.1, gpt-5.3-codex, gpt-5.4-nanogpt-6-sol (Nano → gpt-6-luna)01/10/2026
07/05/2027Googlegemini-3.1-flash-litegemini-3.5-flash-liteXem trang deprecation của Gemini

Hãy theo dõi thêm ba mốc. Claude Haiku 4.5 vẫn đang hoạt động, nhưng Anthropic chỉ cam kết giữ nó "không sớm hơn" ngày 15/10/2026, nên thông báo khai tử có thể tới bất cứ lúc nào. Anthropic cam kết báo trước ít nhất 60 ngày trước khi khai tử một model đã phát hành công khai. Gemini 3.8 Flash không bị khai tử, nhưng giá tăng gấp đôi từ 01/01/2027. Còn nếu bộ test hồi quy của bạn nằm trên nền tảng Evals của OpenAI, hãy xuất ra ngay trong tháng này. Nó chuyển sang chỉ đọc từ ngày 31/10.

Dòng thời gian khai tử model trên API từ tháng 10/2026 đến tháng 5/2027: OpenAI Evals chỉ đọc 31/10, Claude Sonnet 4.5 và Agent Builder 30/11, snapshot GPT-5 và o3 11/12, TTS 06/01, GPT-5.1, GPT-5.3-Codex và GPT-5.4-Nano 01/04/2027, gemini-3.1-flash-lite 07/05/2027, kèm model thay thế
Hình 1: Dòng thời gian khai tử model trên API từ tháng 10/2026 đến tháng 5/2027: OpenAI Evals chỉ đọc 31/10, Claude Sonnet 4.5 và Agent Builder 30/11, snapshot GPT-5 và o3 11/12, TTS 06/01, GPT-5.1, GPT-5.3-Codex và GPT-5.4-Nano 01/04/2027, gemini-3.1-flash-lite 07/05/2027, kèm model thay thế

Điều gì sẽ hỏng khi chuyển sang GPT-6 Sol hoặc Claude Opus 5.5?

Cả hai hãng đều biến những thiết lập request trước đây vô hại thành lỗi cứng. Chỉ đổi tên model sẽ gây lỗi trên production. Đây là các thay đổi mà hướng dẫn chuyển đổi của họ liệt kê:

Hạng mụcGPT-6 Sol / GPT-6.1 Sol / GPT-6 LunaClaude Opus 5.5
Tham số lấy mẫuBỏ temperature, top_p và top_logprobs khi mức suy luận khác none (và bỏ logprobs trên Chat Completions)Bất kỳ giá trị khác mặc định nào của temperature, top_p hoặc top_k đều trả lỗi 400
Suy luận / thinkingCác mức effort từ none tới max, mặc định medium. GPT-6.1 Sol không có none; dùng low. Đổi minimal sang low rồi so sánhAdaptive thinking luôn bật. thinking: disabled và ngân sách thinking thủ công bị từ chối. Effort là cách điều khiển duy nhất, mặc định medium (Opus 5 mặc định high)
Gọi công cụDùng Responses API để gọi công cụ trên GPT-6.1 Sol. Trên Chat Completions, GPT-6 Sol và Luna chỉ gọi function khi effort là noneÉp gọi công cụ (any hoặc chỉ định tên) bị từ chối. Dùng auto kèm strict tools hoặc structured outputs
Cấu trúc phản hồiThiết lập suy luận làm thay đổi độ dài đầu ra và độ trễPhản hồi có thể bắt đầu bằng khối thinking, nên code đọc content[0].text sẽ hỏng. Khối thinking phải được gửi lại nguyên vẹn trong vòng lặp công cụ
Prefill và cacheThay prompt_cache_retention bằng prompt_cache_options.ttl đặt là "30m"Prefill lượt assistant bị từ chối; dùng structured outputs hoặc chỉ dẫn trong system prompt
An toàn và từ chốiKiểm tra từ chối trên các ca biên của bạnCó thêm loại stop_reason: "refusal", kèm tùy chọn tự chuyển sang model khác phía máy chủ
Xử lý theo khu vựcFast mode không dùng được với lưu trữ dữ liệu tại EUSuy luận chỉ tại Mỹ tốn 1,1 lần

Hai trong số này gây thụt lùi âm thầm thay vì báo lỗi. Trên Opus 5.5, đoạn văn model viết giữa các lần gọi công cụ giờ nằm trong khối thinking, mà mặc định là rỗng. Ứng dụng nào từng stream các cập nhật tiến độ đó cho người dùng sẽ im lặng, và không có ngoại lệ nào được ném ra. Trên GPT-6 Sol và Opus 5.5, khi không đặt effort thì mặc định là medium, có thể làm thay đổi độ sâu câu trả lời và độ trễ mà không cần sửa dòng code nào.

Dashboard giám sát một ứng dụng AI
Dashboard giám sát một ứng dụng AI

Model mới so với model cũ thế nào về chi phí và độ trễ?

Giá niêm yết mỗi triệu token (đầu vào / đầu ra) lấy từ trang giá của các hãng ngày 07/10/2026. Các cột "mỗi 1.000" dùng lại giả định trong bài chi phí: 6.000 token đầu vào và 500 token đầu ra cho một câu trả lời RAG, 60.000 đầu vào và 3.000 đầu ra cho một tác vụ agent. Không dùng cache, chưa tính token suy luận.

Chuyển đổiGiá trước → sauMỗi 1.000 câu trả lời RAGMỗi 1.000 tác vụ agentCần lưu ý
GPT-5.1 → GPT-6 Sol$1,25 / $10 → $2 / $10$12,50 → $17,00$105 → $150Đầu vào đắt hơn 60%. Đầu vào có cache giá $0,20 (Sol) hoặc $0,10 (6.1 Sol)
GPT-5.3-Codex → GPT-6 Sol$1,75 / $14 → $2 / $10$17,50 → $17,00$147 → $150Gần như không đổi. Việc sinh nhiều đầu ra sẽ rẻ hơn
GPT-5.4-Nano → GPT-6 Luna$0,20 / $1,25 → $0,10 / $0,50$1,83 → $0,85$15,75 → $7,50Khoảng một nửa giá. Kiểm tra chất lượng trên các ca khó nhất
Claude Sonnet 4.5 → Sonnet 5.5$3 / $15 → $2 / $10$25,50 → ~$22,10$225 → ~$195Tokenizer mới sinh ra nhiều hơn ~30% token cho cùng văn bản, nên chỉ tiết kiệm ~13%, không phải 33%
Claude Opus 5 → Opus 5.5$5 / $25 → $4 / $20$42,50 → $34,00$375 → $300Anthropic cho biết chi phí giảm 40% trên khối lượng điển hình ở thiết lập mặc định, một phần nhờ effort mặc định thấp hơn

Có ba cái bẫy chi phí nằm ngoài giá niêm yết. Thứ nhất, Anthropic tính token thinking như token đầu ra, và trên Opus 5.5 mọi request đều có thinking vì không tắt được. Hãy kiểm tra cả lượng token suy luận ở phía OpenAI. Một tác vụ trước đây chạy không có thinking có thể sinh nhiều token đầu ra hơn dù đơn giá thấp hơn. Thứ hai, GPT-6 Sol và GPT-6.1 Sol tính $4 đầu vào và $15 đầu ra khi ngữ cảnh vượt 272K token. Các model Claude từ 4.6 trở đi tính giá chuẩn trên toàn bộ cửa sổ 1M. Thứ ba, xử lý batch giảm một nửa ở cả hai hãng, nên hãy chuyển eval và các tác vụ hậu trường sang batch.

Không hãng nào công bố cam kết độ trễ cho các model này. Anthropic nói Opus 5.5 sinh đầu ra nhanh hơn Opus 5 trên 30%, và có fast mode giá $8 / $40. GPT-6.1 Sol của OpenAI không có mức effort none, nên thời gian phản hồi có một mức sàn. Hãy đo độ trễ p50 và p95 trên chính prompt của bạn, ở mức effort bạn định dùng. Đừng tin biểu đồ trong buổi ra mắt.

Vì sao nâng cấp model lại gây thụt lùi chất lượng?

Model mới tốt hơn ở mức trung bình nhưng có thể kém hơn ở một số ca của riêng bạn. Nguyên nhân thường gặp:

  • Prompt được chỉnh cho model cũ. Các mẹo bù cho điểm yếu cũ, như "luôn trả lời bằng JSON" hay "suy nghĩ từng bước", có thể làm rối một model vốn đã làm tốt những việc đó.
  • Giá trị mặc định thay đổi. Effort, độ dài và hành vi từ chối thay đổi giữa các phiên bản. Một request không đặt gì giờ sẽ hành xử khác.
  • Định dạng đầu ra bị lệch. Thay đổi nhỏ về markdown, thứ tự trường hay cách trích dẫn làm hỏng parser và giao diện.
  • Hành vi gọi công cụ. Mỗi model khác nhau về mức sẵn sàng gọi công cụ, số lần gọi và cách xử lý lỗi công cụ. Agent bị ảnh hưởng nhiều nhất.
  • Số token. Tokenizer mới làm thay đổi khoảng trống trong cửa sổ ngữ cảnh, điểm cắt bớt và chi phí.
  • Ngân sách độ trễ. Suy luận nhiều hơn có thể đẩy độ trễ p95 vượt một ngưỡng timeout chưa từng bị chạm tới.

Không có bộ eval, bạn chỉ phát hiện những điều này qua phàn nàn của khách hàng. Tránh được điều đó là toàn bộ mục đích của phần tiếp theo.

Kế hoạch chuyển đổi dựa trên eval trông như thế nào?

Sáu bước, theo đúng thứ tự này. Hai tới sáu tuần là thực tế cho một tính năng production, chủ yếu tùy vào việc bạn đã có eval hay chưa.

  1. Kiểm kê. Liệt kê mọi model ID, endpoint, phiên bản SDK và tham số đang dùng, kể cả job chạy nền và script. Console của Anthropic xuất được mức sử dụng theo API key và model, và dashboard sử dụng của OpenAI cho biết bạn đang gọi những model nào.
  2. Xây golden set. Lấy mẫu 200–500 request thật trải đều các ý định chính, cộng mọi sự cố cũ và ca biên đã biết. Lưu đầu ra của model hiện tại làm mốc, và gắn nhãn thế nào là "đúng" cho từng ca.
  3. Sửa các thay đổi phá vỡ. Đi hết bảng ở trên. Đọc khối nội dung theo loại, bỏ tham số lấy mẫu, chọn rõ mức effort và chuyển việc gọi công cụ sang API được hỗ trợ.
  4. Tinh chỉnh trên bộ test. Chạy golden set trên model ứng viên ở hai hoặc ba mức effort. Gỡ từng mẹo prompt cũ một và chỉ giữ thay đổi nào cải thiện điểm số.
  5. Shadow traffic thật. Gửi bản sao request production tới model mới mà không hiển thị kết quả cho người dùng. So sánh điểm chất lượng, tỷ lệ từ chối, số lần gọi công cụ, chi phí và độ trễ trong ít nhất một tuần.
  6. Canary rồi chuyển hẳn. Chuyển 5%, rồi 25%, rồi 100% traffic. Giữ model cũ làm dự phòng tới ngày nó bị tắt, và giữ bộ eval trong CI cho lần chuyển đổi tiếp theo.
Kế hoạch chuyển đổi LLM sáu bước dựa trên eval: kiểm kê, golden set 200–500 ca thật, sửa thay đổi phá vỡ, tinh chỉnh, shadow traffic một tuần, canary 5%, 25%, 100%, kèm ví dụ quy tắc đạt cho test hồi quy
Hình 2: Kế hoạch chuyển đổi LLM sáu bước dựa trên eval: kiểm kê, golden set 200–500 ca thật, sửa thay đổi phá vỡ, tinh chỉnh, shadow traffic một tuần, canary 5%, 25%, 100%, kèm ví dụ quy tắc đạt cho test hồi quy

Bài test hồi quy cần bao phủ những gì?

Mỗi rủi ro một dòng, và đặt ngưỡng trước khi xem kết quả. Các ngưỡng dưới đây chỉ là ví dụ. Hãy đặt ngưỡng của bạn dựa trên mốc hiện tại.

Bài testĐo cái gìVí dụ quy tắc đạt
Độ chính xác tác vụCâu trả lời hoặc hành động đúng trên golden set, chấm bằng quy tắc, nhãn của người hoặc LLM chấm điểm đã hiệu chỉnhKhông kém hơn mốc quá 1 điểm tổng thể, và không giảm ở ý định quan trọng nào
Định dạng hợp lệJSON hoặc schema parse được, đủ trường bắt buộc100% với đầu ra có cấu trúc
Gọi công cụ đúngĐúng công cụ, tham số hợp lệ, không gọi công cụ bị cấm, số lần gọi mỗi tác vụKhông có lần gọi bị cấm nào; trung vị số lần gọi lệch không quá 20% so với mốc
Từ chốiTừ chối thừa với request hợp lệ, từ chối thiếu với prompt red-teamKhông có từ chối mới trên golden set; chặn hết các ca red-team
Bám nguồnCâu trả lời có nguồn truy xuất hỗ trợ, trích dẫn mở đượcKhông có khẳng định thiếu căn cứ trong tập nội dung thuộc diện quản lý
Độ trễp50 và p95 đầu-cuối, tính cả công cụp95 dưới timeout của sản phẩm, có biên an toàn
Chi phíToken và tiền cho mỗi tác vụ, tính cả token suy luậnNằm trong ngân sách đã dự báo lại

Nếu bạn ở ngành có quản lý, hãy lưu kết quả chạy, phiên bản model và ngưỡng làm bằng chứng. Thay đổi model chính là loại sự kiện auditor sẽ hỏi. Kế hoạch eval cho ngành tuân thủ của chúng tôi ánh xạ các bài test này với HIPAA, PCI DSS và EU AI Act, còn bài đánh giá và quan sát AI agent nói về công cụ.

Làm sao đưa model mới lên production an toàn?

  • Đặt model sau một công tắc cấu hình, không phải một thay đổi code, để rollback chỉ mất vài giây.
  • Định tuyến theo tác vụ, không theo hãng. Tác vụ dễ có thể chuyển sang model rẻ hơn như GPT-6 Luna hay Claude Haiku 4.5. Giữ model đắt cho những bước mà eval cho thấy thật sự cần.
  • Cấu hình dự phòng có chủ đích. Nếu một lần từ chối hay sự cố chuyển hội thoại sang model khác, hãy test cả đường đó. Hướng dẫn của Anthropic cảnh báo model dự phòng thường sẽ chạy mà không có các khối thinking của Opus 5.5.
  • Theo dõi chỉ số online trong hai tuần sau khi chuyển: người dùng sửa câu trả lời, lượt đánh giá xấu, chuyển lên người xử lý, lỗi công cụ, chi phí mỗi tác vụ và độ trễ p95.
  • A/B test thay đổi prompt bằng thống kê, không bằng cảm giác. Chênh hai điểm trên 50 mẫu thường chỉ là nhiễu.

Checklist chuyển đổi model gồm những gì?

  • Đã liệt kê mọi model ID, phiên bản SDK và tham số đang dùng, kể cả batch job.
  • Mỗi model có ngày ngừng và một người phụ trách trong tracker.
  • Đã xuất eval khỏi mọi nền tảng sắp ngừng, ví dụ OpenAI Evals trước 31/10/2026.
  • Có golden set 200–500 ca thật, gồm ca biên và sự cố cũ, kèm mốc đã ghi lại.
  • Đã gỡ tham số lấy mẫu, prefill, ép gọi công cụ và tắt thinking ở những nơi chúng bị từ chối.
  • Code parse phản hồi đọc khối theo loại, và khối thinking được gửi lại nguyên vẹn.
  • Mức effort hoặc suy luận được đặt rõ ràng, chọn từ một lượt quét eval.
  • Đã tính lại max_tokens cho cả thinking và câu trả lời.
  • Ngưỡng đạt được ghi ra trước khi chạy model ứng viên.
  • Shadow traffic đã chạy ít nhất một tuần, có so sánh chất lượng, chi phí và độ trễ.
  • Đã test các bước canary và rollback bằng một công tắc.
  • Đã dự báo lại chi phí token, tính cả thay đổi tokenizer, bậc giá ngữ cảnh dài và thay đổi giá năm 2027.
  • Bộ eval được giữ trong CI cho lần chuyển đổi tiếp theo.

BeevR có thể giúp gì khi chuyển đổi model?

Chuyển đổi model là một phần việc có ranh giới rõ: kiểm kê, eval, sửa code và triển khai. Vì vậy nó phù hợp để làm với giá cố định. Các dự án phát triển AI agent của chúng tôi tính giá theo giai đoạn từ $10K, và các gói đã công bố đi từ Pitch Demo $4K tới Flagship Sprint $38K, gồm bộ test đầy đủ, deploy và rollback tự động, và quan sát hệ thống đầy đủ. Framework agent mã nguồn mở của chúng tôi, Kite, có sẵn A/B test prompt với khoảng tin cậy thống kê trên traffic thật. Nó tồn tại vì "prompt mới có vẻ tốt hơn" không phải là tiêu chí phát hành. Nếu bạn không chắc nên chuyển đổi hay xây lại agent, bài framework AI agent và bài chi phí AI agent là điểm khởi đầu tốt.

FAQ

Khi nào GPT-5.1 ngừng hoạt động trên API?

Ngày 01/04/2027. Ngày 01/10/2026, OpenAI thông báo gpt-5.1, gpt-5.3-codex và gpt-5.4-nano sẽ bị tắt vào ngày đó, với gpt-6-sol thay cho hai model đầu và gpt-6-luna thay cho Nano. Request tới model đã tắt sẽ thất bại.

GPT-5.5 có bị khai tử trên API không?

Chưa, tính tới ngày 07/10/2026. Trang deprecation của OpenAI không ghi ngày ngừng nào cho gpt-5.5, model có giá $5 đầu vào và $30 đầu ra mỗi triệu token. Việc model nào xuất hiện trong ChatGPT là chuyện riêng, không phải deprecation trên API.

Nên chuyển sang GPT-6.1 Sol hay Claude Opus 5.5?

Chạy cả hai trên golden set của bạn và quyết định dựa trên bằng chứng. GPT-6.1 Sol giá $2 / $10 với ngữ cảnh 1,05M. Opus 5.5 giá $4 / $20 với ngữ cảnh 1M và thinking luôn bật. Giá mỗi token ít quan trọng hơn chi phí cho mỗi tác vụ thành công, và con số đó phụ thuộc vào prompt, công cụ và mức effort của bạn.

Có thể bỏ qua eval nếu model mới "tốt hơn" không?

Benchmark lấy trung bình trên những tác vụ không phải của bạn. Chính Anthropic nhận xét rằng chênh lệch benchmark đã trở thành thước đo kém tin cậy hơn cho khác biệt trong thực tế. Một golden set 200 ca mất vài ngày để xây và là cách duy nhất để biết ứng dụng của bạn tốt lên hay kém đi.

Chuyển đổi LLM mất bao lâu?

Đổi model ID mất vài phút. Chuyển đổi an toàn cho một tính năng production thường mất hai tới sáu tuần. Phần lớn thời gian dành cho xây bộ eval, tinh chỉnh prompt và effort, và chạy shadow traffic đủ lâu để tin được số liệu.

BeevR là studio AI do founder dẫn dắt với đội ngũ senior tại Hà Nội, Việt Nam. Chúng tôi làm việc với giá cố định theo giai đoạn, bạn sở hữu code và IP từ ngày đầu, và chúng tôi xây AI cho các ngành có yêu cầu tuân thủ. Nếu bạn sắp tới hạn chót của một model, hãy cho chúng tôi biết bạn đang chạy những model nào. Chúng tôi sẽ vạch ra các thay đổi phá vỡ và phần việc eval trước khi bạn cam kết bất cứ điều gì.