Tóm tắt nhanh

  • Trọng tâm phát triển AI agent đang chuyển từ viết prompt sang xây dựng lớp vận hành gồm kỹ năng, bộ nhớ, MCP, đánh giá hành vi, thông tin xác thực và môi trường thực thi. Với đội ngũ web, đây là bước chuyển từ bản demo có thể chạy sang một hệ thống có thể kiểm thử, kiểm soát và bảo trì.
  • Prompt tốt không đủ để bảo đảm agent hành động nhất quán hoặc truy cập công cụ an toàn. Các nhóm phát triển cần coi agent như một hệ thống production với hợp đồng dữ liệu, quyền truy cập, đánh giá và khả năng quan sát rõ ràng.
  • Chọn một workflow web chỉ đọc, định nghĩa hợp đồng nhiệm vụ và bộ đánh giá hành vi, sau đó thử nghiệm MCP cùng credential giới hạn trước khi xem xét triển khai production.

Điều gì đã xảy ra

AI agent dùng trong ứng dụng web đang bước qua giai đoạn chỉ cần một mô hình và vài prompt. Những chủ đề nổi lên gần đây—kỹ năng có thể tái sử dụng, bộ nhớ dạng tệp, MCP, đánh giá hành vi và harness thực thi—đều hướng đến cùng một vấn đề: làm thế nào để kiểm soát agent sau khi đưa vào production.

Đây không phải bằng chứng rằng một kiến trúc duy nhất đã trở thành tiêu chuẩn. Tuy nhiên, các nguồn cho thấy đội ngũ kỹ thuật đang dần tách logic vận hành khỏi prompt, biến nó thành những thành phần có thể quản lý, kiểm thử và thay thế độc lập.

Vì sao prompt không thể đóng vai trò control plane?

Prompt có thể hướng dẫn mô hình, nhưng không tự xác định agent được phép dùng công cụ nào, thông tin nào phải được lưu, cách phát hiện hành vi suy giảm hay điều gì xảy ra khi một thao tác thất bại. Khi agent bắt đầu đọc dữ liệu, gọi dịch vụ hoặc thay đổi trạng thái của hệ thống web, những câu hỏi này trở thành vấn đề kiến trúc thay vì kỹ thuật viết câu lệnh.

Ý tưởng ghi lại hành vi lặp lại của agent để làm tiêu chuẩn đánh giá minh họa cho sự dịch chuyển đó. Thay vì chỉ chấm một câu trả lời cuối, đội ngũ có thể mô tả những hành vi mong đợi và dùng chúng làm cơ sở phát hiện thay đổi qua các lần cập nhật mô hình, công cụ hoặc ngữ cảnh.

Một harness cũng giúp tách mô hình khỏi vòng đời thực thi. Dự án TrueForge được giới thiệu như một harness mã nguồn mở để chạy LLM dưới dạng agent, cho thấy lớp điều phối đang trở thành một đơn vị kỹ thuật riêng. Về mặt thiết kế, lớp này là vị trí hợp lý để đặt giới hạn vòng lặp, chính sách công cụ, xử lý lỗi và ghi nhận kết quả, dù mỗi sản phẩm sẽ triển khai khác nhau.

Các lớp kiểm soát production đang hình thành như thế nào?

Có thể nhóm các chủ đề hiện tại thành bốn lớp. Chúng không thay thế nhau; mỗi lớp kiểm soát một loại bất định khác nhau trong quá trình agent thực hiện nhiệm vụ.

LớpVai tròCâu hỏi cần trả lời
Kỹ năng và ngữ cảnhĐóng gói hướng dẫn, quy trình và kiến thức cần thiếtAgent phải làm việc theo cách nào?
Bộ nhớDuy trì trạng thái hữu ích giữa các bước hoặc phiênDữ liệu nào cần giữ lại, đọc lại hay xóa?
Công cụ và MCPKết nối agent với tài nguyên bên ngoài qua giao diện xác địnhAgent được gọi gì và với quyền nào?
Đánh giá và thực thiKiểm tra hành vi, điều phối vòng lặp và xử lý thất bạiLàm sao biết agent vẫn hoạt động đúng?

Đối với kỹ năng, hướng dẫn về AI SDLC và quá trình xây dựng agent skills đặt kỹ năng vào một vòng đời phát triển thay vì xem chúng như prompt dùng một lần. Bài viết về sự suy giảm kỹ năng agent còn nhấn mạnh vai trò của thực hành lặp lại, một tín hiệu rằng kỹ năng cần được theo dõi và cải tiến liên tục.

Với bộ nhớ, đề xuất rằng agent memory nên là một định dạng tệp thay vì pipeline gợi mở một lợi ích quan trọng: trạng thái có thể trở thành artifact rõ ràng. Một định dạng ổn định có khả năng giúp việc kiểm tra, phiên bản hóa và di chuyển dễ hiểu hơn so với việc giấu toàn bộ logic trong chuỗi xử lý riêng, nhưng nguồn được cung cấp chưa đủ để kết luận định dạng nào sẽ thắng thế.

MCP giải quyết phần nào và không giải quyết phần nào?

Model Context Protocol tập trung vào giao diện giữa agent với công cụ hoặc nguồn ngữ cảnh. Sự tồn tại của một lộ trình MCP gồm năm lĩnh vực trọng tâm và tài liệu về xây dựng, bảo mật và phục vụ MCP server cho thấy mối quan tâm đã vượt khỏi thử nghiệm kết nối đơn giản để tiến tới vận hành hạ tầng.

Tuy nhiên, giao thức không tự giải quyết toàn bộ bài toán quản trị. Một MCP server có thể chuẩn hóa cách mô tả và gọi công cụ, nhưng nhóm triển khai vẫn phải quyết định danh tính nào được truy cập, credential được cấp và thu hồi ra sao, đối số nào phải xác thực, dữ liệu nào được phép trả về và mỗi thao tác cần được ghi nhận như thế nào.

Điểm phân tách này rất quan trọng với ứng dụng web. Lớp giao thức tạo ra khả năng tương tác; lớp control plane áp dụng chính sách của tổ chức. Cách tiếp cận tương tự cũng xuất hiện trong thiết kế control plane có quản trị cho hệ thống tự động hóa: kết nối thực thi phải đi cùng quyền hạn, chính sách và khả năng theo dõi.

Đội ngũ web nên thử nghiệm theo trình tự nào?

Không nên bắt đầu bằng cách cho agent quyền truy cập rộng vào hệ thống production. Một thử nghiệm hữu ích nên chọn quy trình có phạm vi hẹp, đầu ra có thể kiểm chứng và hậu quả có thể đảo ngược, sau đó bổ sung từng lớp kiểm soát trước khi mở rộng quyền.

  1. Viết hợp đồng nhiệm vụ: xác định đầu vào, đầu ra, điều kiện hoàn thành và các hành động bị cấm.
  2. Tách kỹ năng khỏi prompt gốc: lưu hướng dẫn và tệp ngữ cảnh như artifact có phiên bản để có thể review thay đổi.
  3. Giới hạn công cụ: chỉ cung cấp thao tác cần thiết, ưu tiên quyền chỉ đọc và credential ngắn hạn nếu hạ tầng hỗ trợ.
  4. Ghi lại dấu vết thực thi: lưu lệnh gọi công cụ, kết quả, lỗi và quyết định quan trọng mà không để lộ bí mật.
  5. Xây bộ đánh giá hành vi: kiểm thử cả kết quả cuối lẫn chuỗi hành động trên các tình huống thành công, dữ liệu thiếu và lỗi công cụ.

Nếu cần khảo sát cách MCP có thể phối hợp nhiều vai trò phát triển, ví dụ Nova MCP biến AI thành một đội ngũ sản phẩm cung cấp thêm một góc nhìn. Dù vậy, quyết định production nên dựa trên thử nghiệm với dữ liệu, quyền truy cập và chế độ lỗi thực tế của chính hệ thống.

Kết luận

  • Prompt chỉ là một phần của agent; production cần thêm lớp thực thi, quyền hạn, bộ nhớ và đánh giá.
  • Kỹ năng và tệp ngữ cảnh nên được quản lý như artifact có phiên bản, không phải văn bản dùng một lần.
  • MCP giúp chuẩn hóa kết nối nhưng không thay thế xác thực, chính sách truy cập hay audit.
  • Nên thử nghiệm trên quy trình hẹp và có thể đảo ngược trước khi cấp quyền production.

Bài viết liên quan

Nguồn tham khảo

Vì sao developer cần quan tâm

Prompt tốt không đủ để bảo đảm agent hành động nhất quán hoặc truy cập công cụ an toàn. Các nhóm phát triển cần coi agent như một hệ thống production với hợp đồng dữ liệu, quyền truy cập, đánh giá và khả năng quan sát rõ ràng.

  1. 1Chọn một workflow web chỉ đọc, định nghĩa hợp đồng nhiệm vụ và bộ đánh giá hành vi, sau đó thử nghiệm MCP cùng credential giới hạn trước khi xem xét triển khai production.