Nền tảng AI dev agent là công cụ nhận một tác vụ phần mềm — sửa bug, làm tính năng, chuyển đổi hệ thống — rồi tự lập kế hoạch, sửa code, chạy lệnh và test, và trả lại một diff hoặc pull request với rất ít can thiệp của con người. Tính đến tháng 10/2026, các lựa chọn đáng cân nhắc chia thành bốn nhóm: agent nằm trong IDE (Cursor, Devin Desktop, Kiro), agent chạy trên terminal (Claude Code, Codex CLI), agent đám mây nhận issue và trả về PR (GitHub Copilot cloud agent, Jules, Devin, Codex Cloud), và agent mã nguồn mở tự host (OpenHands, Cline, Aider). Chọn cái nào phụ thuộc ít vào model, mà nhiều vào việc code của bạn được phép chạy ở đâu, ai review đầu ra, và bạn chặn hóa đơn bằng cách nào.
Chúng tôi viết bài này với tư cách một studio xây AI agent production cho các ngành chịu quản lý — và đã mở mã nguồn Kite, framework agent dựa trên nguyên tắc coi LLM là thành phần không đáng tin. Chúng tôi đánh giá coding agent theo đúng nguyên tắc đó: nó chạm được tới đâu, chứng minh được gì, và ai là người ký duyệt. Đây không phải bài về framework — nếu bạn đang xây agent vào sản phẩm của mình, hãy đọc chọn framework AI agent năm 2026. Bài này nói về những agent viết phần mềm cho bạn.
Trợ lý code thì gợi ý; dev agent thì hành động. Autocomplete và chat trả lời từng câu một, mọi chỉnh sửa vẫn do bạn làm. Agent chạy theo vòng lặp: đọc repository, lập kế hoạch, sửa nhiều file, chạy build và test, đọc lỗi, thử lại, và dừng khi xong việc hoặc bị kẹt. Magic Quadrant 2026 của Gartner cho mảng Enterprise AI Coding Agents (công bố 20/5/2026) định nghĩa đúng như vậy — công cụ bán tự hành biến ý định của con người thành kế hoạch nhiều bước rồi thực thi và kiểm chứng trên code và test — và xếp Anthropic, Cursor, GitHub, OpenAI vào nhóm Leaders.
Với một đội ngũ, agent thay đổi ai là người viết bản nháp đầu tiên của cả một tác vụ — và vì thế điểm nghẽn dời sang review, test và bảo mật.
Agent tích hợp trong IDE sống trong editor và giữ lập trình viên trong vòng lặp ở từng bước: Cursor, Devin Desktop (Cognition đổi tên Windsurf thành Devin Desktop vào tháng 6/2026) và Kiro của AWS, vốn đi theo hướng spec trước — requirements, thiết kế và danh sách task rồi mới tới code.
Agent terminal (CLI) chạy trong shell trên bản checkout local, dùng chính công cụ, script và bộ test của bạn. Claude Code và Codex CLI của OpenAI là hai cái tên chính; cả hai cũng chạy trong IDE, ứng dụng desktop, trình duyệt, và chạy headless được trong CI.
Agent đám mây tự hành nhận ticket, làm việc trong một môi trường từ xa dùng xong bỏ, rồi mở pull request. GitHub Copilot cloud agent chạy trong môi trường tạm thời trên nền GitHub Actions; Google Jules clone repo vào một VM đám mây; Devin, Codex Cloud và cloud agents của Cursor (trước đây gọi là "background agents") cũng làm tương tự. Factory chạy các "Droid" trên CLI, desktop, công cụ chat và CI.
Agent mã nguồn mở, tự host cho bạn tự chọn model và giữ việc thực thi trên hạ tầng của mình: OpenHands (MIT, sandbox Docker, dùng LLM nào cũng được), Cline (Apache 2.0, VS Code/JetBrains/CLI, mặc định duyệt từng bước) và Aider (Apache 2.0, chạy trên terminal, commit từng thay đổi vào git).
Các công cụ dựng app như Replit Agent nhắm tới người không phải lập trình viên muốn tạo app bằng chat — một bài toán khác với làm việc trong codebase có sẵn.
Định vị tính đến tháng 10/2026, lấy từ tài liệu chính thức của từng nhà cung cấp. Chúng tôi cố ý không chấm điểm hay xếp hạng, và chỉ ghi mô hình tính giá — bảng giá thay đổi hàng tháng.
| Nền tảng | Loại | Code chạy ở đâu | Mức tự hành | MCP / công cụ | Mô hình tính giá |
|---|---|---|---|---|---|
| Claude Code (Anthropic) | Terminal + IDE + desktop + web | Máy của bạn (sandbox cấp hệ điều hành cho lệnh shell) hoặc phiên cloud của Anthropic | Từ tương tác đến giao việc hoàn toàn; subagent, routine theo lịch | Có, kèm hooks và skills | Gói Claude hoặc tính theo API |
| OpenAI Codex | CLI (mã nguồn mở) + IDE + cloud | Sandbox local (chế độ read-only / workspace-write) hoặc Codex Cloud | Từ tương tác đến tác vụ nền | Có | Gói ChatGPT |
| GitHub Copilot cloud agent | Agent đám mây | Môi trường GitHub Actions tạm thời; một repo, một branch, một PR mỗi task; phiên tối đa 59 phút | Issue vào, pull request ra | Có, mặc định giới hạn trong repo | Các gói Copilot trả phí |
| Cursor | IDE + cloud agents | Local, hoặc VM đám mây cô lập | Từ trong editor đến chạy nền | Có | Thuê bao; cloud agents tính theo giá API của model, có hạn mức chi |
| Devin / Devin Desktop (Cognition) | Agent đám mây + IDE (trước là Windsurf) | VM đám mây, desktop, CLI | Giao việc nhiều nhất; điều phối cả đội agent | Tích hợp + Agent Client Protocol | Thuê bao theo bậc |
| Google Jules | Agent đám mây | VM đám mây clone repo của bạn | Bất đồng bộ: kế hoạch, duyệt diff, PR | — | Bậc theo số task mỗi ngày |
| Kiro (AWS) | IDE + CLI, đi từ spec | IDE và CLI local; có cả bản web | Spec → task → code | Có | Credit |
| Factory | "Droid" đa nền tảng | CLI, desktop, web, CI | Có điểm duyệt của con người | Nhiều nhà cung cấp model; REST API | Xem trang nhà cung cấp (team / enterprise) |
| OpenHands | Mã nguồn mở, tự host | Hạ tầng của bạn, sandbox Docker; có bản cloud | Tùy cấu hình | LLM bất kỳ; chạy agent khác qua ACP | Miễn phí (MIT) + tiền model |
| Cline / Aider | Mã nguồn mở, IDE / terminal | Máy của bạn | Duyệt từng bước (Cline); commit git từng thay đổi (Aider) | Cline: có | Miễn phí (Apache 2.0) + tiền model |
Hai chuyển động đáng chú ý. AWS sẽ ngừng hỗ trợ plugin IDE của Amazon Q Developer vào 30/4/2027 và hướng người dùng sang Kiro. Còn việc kết nối công cụ đã chuẩn hóa quanh Model Context Protocol: khi Anthropic trao MCP cho Agentic AI Foundation thuộc Linux Foundation vào tháng 12/2025, đã có hơn 10.000 MCP server công khai đang hoạt động. Rất tiện — nhưng cũng là bề mặt tấn công: mỗi MCP server bạn kết nối là một đoạn code có quyền với mọi thứ agent chạm tới được.
Có ba chuyển động quan trọng hơn bất kỳ đợt ra mắt model nào: công cụ giờ kết nối qua MCP, công việc đang dời từ editor sang các agent chạy nền trên đám mây trả về pull request, và người mua ngày càng coi governance của agent — phân quyền, audit và chi tiêu — là yêu cầu bắt buộc. Hãy chọn nền tảng đáp ứng cả ba, không phải nền tảng có demo đẹp nhất.
Benchmark đo các tác vụ được chọn lọc sẵn. Trong một codebase thật, những yếu tố sau mới quyết định kết quả:
Đội startup làm MVP (2–6 kỹ sư). Dùng một agent terminal hoặc IDE mà cả đội thành thạo, cộng một agent đám mây cho các việc vặt được mô tả rõ (nâng dependency, tăng test coverage, bug nhỏ). Chuẩn hóa file hướng dẫn và checklist review ngay từ ngày đầu. Đừng chạy ba agent chồng chéo nhau; quy ước sẽ vỡ rất nhanh.
Doanh nghiệp có quy trình duyệt bảo mật và tuân thủ. Bắt đầu từ Git host và hệ thống định danh đang dùng: một agent nằm gọn trong luồng PR, branch protection và audit hiện có (Copilot cloud agent nếu bạn dùng GitHub, hoặc gói enterprise có SSO và chính sách admin) dễ được duyệt hơn nhiều so với công cụ "xịn nhất" nhưng đi vòng qua các kiểm soát đó.
Dữ liệu chịu quản lý (HIPAA, PCI, hồ sơ tài chính). Câu hỏi không phải agent nào thông minh nhất, mà là dữ liệu chịu quản lý có bao giờ chạm tới agent hay không. Giữ dữ liệu production hoàn toàn ngoài môi trường dev, dùng dữ liệu giả lập, và ưu tiên cách bố trí mà bạn kiểm soát cả nơi thực thi lẫn endpoint model — agent mã nguồn mở tự host, hoặc agent thương mại đi qua tài khoản cloud của chính bạn theo các thỏa thuận sẵn có. Lấy xác nhận bằng văn bản của người phụ trách tuân thủ về luồng dữ liệu trước khi chạy thử.
Gánh nặng review không biến mất, chỉ dời chỗ. Trong khảo sát Stack Overflow Developer Survey 2025, 84% lập trình viên đang dùng hoặc định dùng công cụ AI, nhưng chỉ khoảng 31% từng dùng AI agent; số người không tin độ chính xác của AI (46%) nhiều hơn số người tin (33%), và 66% nói nỗi bực mình lớn nhất là kết quả "gần đúng nhưng chưa đúng hẳn". Agent mở mười PR mỗi ngày nghĩa là mười lượt review mỗi ngày.
Cảm giác nhanh không phải là nhanh thật. Thử nghiệm ngẫu nhiên có đối chứng của METR với các lập trình viên open-source giàu kinh nghiệm (dùng công cụ đầu 2025) cho thấy họ mất thêm 19% thời gian khi dùng AI, trong khi vẫn tin mình nhanh hơn khoảng 20%. Công cụ đã tiến bộ từ đó, nhưng bài học vẫn đúng — hãy đo cycle time và lỗi, đừng đo cảm giác.
Nợ bảo mật. Bản cập nhật mùa xuân 2026 của Veracode, kiểm tra hơn 150 model, cho thấy chỉ khoảng 55% code sinh ra vượt qua bài kiểm tra bảo mật — gần như đứng yên suốt hai năm trong khi độ đúng cú pháp tăng đều. Code do agent viết cần đúng quy trình SAST, quét dependency và đánh giá mối đe dọa như code người viết.
Chi phí vượt kiểm soát. Tháng 6/2026, Gartner cảnh báo đến 2028 chi phí AI coding có thể vượt lương trung bình của một lập trình viên khi lượng token và mô hình tính phí theo mức dùng tăng lên; các bài đưa tin về dự báo này nêu hóa đơn hàng tháng từ $20–$100 tới $2.000–$5.000 cho mỗi lập trình viên. Đặt hạn mức chi theo người và để ý những agent chạy vòng lặp mãi trên test hỏng. Logic tương tự áp dụng cho agent trong sản phẩm của bạn: xem chi phí xây và vận hành AI agent.
Để agent chạy với giám sát nhẹ khi tác vụ được mô tả rõ, phạm vi ảnh hưởng nhỏ và bộ test tốt: việc vặt, coverage, refactor, công cụ nội bộ. Đưa kỹ sư senior vào cầm lái khi công việc liên quan quyết định kiến trúc, ranh giới bảo mật, dữ liệu chịu quản lý, thanh toán, migration dữ liệu, hoặc codebase có test yếu — nơi "gần đúng" biến thành sự cố. Đó cũng là lý do các dự án AI agent thất bại: trao quyền tự hành trước khi có cơ chế kiểm chứng. Cách làm đứng vững được: kỹ sư senior viết spec và test, agent viết bản nháp đầu, con người chịu trách nhiệm review, merge và deploy — kèm đánh giá và quan sát cho mọi thứ agent chạm vào trong production. Đó cũng là nguyên tắc đứng sau Kite, framework agent mã nguồn mở của chúng tôi: coi LLM là thành phần không đáng tin và thiết kế kiểm soát xung quanh nó.
Bằng đúng những nguyên tắc giúp AI production an toàn — những nguyên tắc BeevR công bố cho các agent mình xây: model là thành phần không đáng tin, ngữ cảnh phải được thiết kế, đầu ra phải qua test trước khi được tin, và một kỹ sư senior có tên cụ thể chịu trách nhiệm cho mỗi lần merge. Không nguyên tắc nào phụ thuộc vào việc agent của hãng nào đang chạy, điều quan trọng vì bảng so sánh ở trên sẽ khác đi chỉ sau sáu tháng. Hãy hỏi bất kỳ studio nào bạn thuê xem họ đáp ứng từng điểm ra sao.
Bằng chứng chúng tôi đưa ra được đều công khai: hai dự án mã nguồn mở bạn có thể đọc từng dòng, và các case study về hệ thống AI chúng tôi đưa từ prototype lên production. Hãy đọc code hoặc case study thay vì tin lời nhà cung cấp — kể cả lời của chúng tôi.
Với các dự án chịu quản lý, cùng bộ kiểm soát đó được đóng gói thành dịch vụ phát triển AI agent tuân thủ HIPAA.
Không có cái tốt nhất cho mọi đội. Magic Quadrant 2026 của Gartner xếp Anthropic, Cursor, GitHub và OpenAI vào nhóm Leaders, nhưng lựa chọn đúng phụ thuộc vào nơi code được phép chạy, Git host và hệ thống định danh, và việc bạn có cần tự host hay không. Hãy chạy thử hai công cụ trên chính repo của bạn rồi đo.
Có thể, nếu dữ liệu chịu quản lý không bao giờ chạm tới agent: dữ liệu test giả lập, không có credential production trong môi trường dev, thực thi có kiểm soát, endpoint model nằm trong thỏa thuận của bạn, và con người review mọi lần merge. Lấy xác nhận tuân thủ cho luồng dữ liệu trước.
Với phần mềm production thì chưa, tính đến tháng 10/2026. Agent mạnh ở tác vụ được mô tả rõ và có test tốt; yếu ở yêu cầu mơ hồ, kiến trúc và cân nhắc đánh đổi bảo mật. Nó thay đổi cấu trúc đội — ít người gõ code hơn, nhiều người đặc tả và review hơn.
Dao động rất rộng. Vẫn có gói thuê bao cố định, nhưng dùng agent nhiều thì ngày càng tính theo token; hóa đơn được ghi nhận từ vài chục đô tới vài nghìn đô mỗi tháng cho một lập trình viên. Đặt hạn mức chi ngay từ ngày đầu.
Mã nguồn mở (OpenHands, Cline, Aider) cho bạn kiểm soát nơi thực thi và chọn model — quan trọng với dữ liệu chịu quản lý — đổi lại phải tự cài đặt và bảo trì. Nền tảng thương mại cho trải nghiệm hoàn thiện, tính năng quản trị và hỗ trợ.
Chúng tôi là studio AI và phần mềm senior, do founder trực tiếp dẫn dắt, đặt tại Hà Nội — giá cố định theo từng giai đoạn, bạn sở hữu toàn bộ IP và repository từ ngày đầu, và một kỹ sư senior có tên cụ thể chịu trách nhiệm cho mỗi lần merge. Nếu bạn muốn tốc độ của agent mà không gánh rủi ro của agent, xem cách chúng tôi xây AI agent và phần mềm sẵn sàng cho production, hoặc kể cho chúng tôi bạn đang xây gì — chúng tôi sẽ nói thẳng phần nào nên để agent làm và phần nào cần con người.