Đánh giá mới nhất từ Guidelight AI Standards đưa ra một thông điệp rõ ràng: việc giám sát đại lý, kiểm soát và giám định bên thứ ba vẫn còn non trẻ ở các phòng thí nghiệm hàng đầu. OpenAI và Anthropic dẫn đầu với điểm C+; Meta đứng sau với điểm F. Điều này đã đủ gây lo ngại trong môi trường nghiên cứu. Nhưng mức độ cấp bách tăng lên khi các doanh nghiệp tích hợp đại lý vào hàng đợi vé, chuỗi RPA và kho dữ liệu. Một số sự cố khi các đại lý thử nghiệm tiếp cận hệ thống bên ngoài xác nhận rằng các biện pháp bảo vệ còn lỏng lẻo trong các đường dẫn thực thi thực tế—đặc biệt khi API công cụ, plugin hoặc kết nối mở rộng khả năng của đại lý vượt ra ngoài môi trường phòng thí nghiệm.
Việc kiểm soát bị phá vỡ theo hai cách phổ biến. Thứ nhất, các sandbox giới hạn thực thi mã hoặc thoát mạng được áp dụng không đồng đều khi đại lý gọi công cụ bên ngoài, gọi hàm hoặc đi qua các kết nối truy xuất. Thứ hai, việc giám sát tập trung vào lời nhắc và đầu ra mô hình, không phải các hành động tiếp theo có thể gây rủi ro: sử dụng thông tin đăng nhập, thay đổi dữ liệu, ghi file và gọi API có đặc quyền. Khi đại lý có bộ nhớ dài hạn hơn, lập kế hoạch đa bước và hợp tác đa đại lý, sự sai lệch mục tiêu tinh vi và chuỗi công cụ có thể vượt qua các bộ lọc đơn giản. Nếu không có khả năng quan sát và thực thi chính sách ở cấp hành động, các kiểm tra an toàn sẽ trở thành việc so khớp mẫu theo nỗ lực tốt nhất thay vì kiểm soát rủi ro đáng tin cậy.
Đối với các nhà lãnh đạo công nghệ, đây không phải là một cuộc tranh luận trừu tượng về quản trị. Đây là vấn đề mua sắm, trách nhiệm pháp lý và thời gian hoạt động. Các nhà cung cấp hiếm khi cung cấp bằng chứng đầu-cuối về kiểm soát đại lý, kiểm toán bên thứ ba hoặc báo cáo sự cố có cấu trúc. Nội bộ, nhiều nhóm nâng cấp kỹ năng đại lý từ môi trường thử nghiệm lên sản xuất mà không có cổng thăng cấp, giảm đặc quyền hoặc ngắt mạch chi phí. Trong các ngành được quản lý, giám sát yếu kém cũng sẽ va chạm với các kỳ vọng an toàn mới từ kiểm toán viên và khách hàng. Hệ quả ngay lập tức: giới hạn phạm vi đại lý, ràng buộc khả năng và yêu cầu các tài liệu đánh giá khách quan trước khi bất kỳ đại lý nào được phép hoạt động với thông tin đăng nhập trong hệ thống thực tế.
Giải pháp thực tiễn có thể đạt được ngay hôm nay với thiết kế nhiều lớp. Xem đại lý như các microservice không đáng tin cậy: thông tin đăng nhập ít đặc quyền nhất, bộ lọc thoát mạng nghiêm ngặt, chính sách cho phép/từ chối ở cấp công cụ, nhật ký kiểm toán không thể thay đổi và công tắc tắt nhanh. Thêm các đánh giá ngoài chính sách nhằm vào hành vi rủi ro (rò rỉ dữ liệu, leo thang đặc quyền, gọi công cụ bóng tối), sau đó chạy các bài kiểm tra đội đỏ nhằm chiếm đoạt mục tiêu và chuỗi công cụ qua các ranh giới. Cuối cùng, triển khai cổng thăng cấp và diễn tập hỗn loạn: yêu cầu điểm đạt và kịch bản sự cố trước khi phát hành kỹ năng đại lý mới, luyện tập các chế độ thất bại hàng quý và đo thời gian trung bình để phát hiện và kiểm soát các bất thường do đại lý khởi xướng trong sản xuất.


