Tại hội thảo VB Transform 2026, bà Amy Chang, Trưởng bộ phận tình báo mối đe dọa AI tại Cisco, đã công bố một phát hiện đáng lo ngại: các cuộc tấn công nhiều bước (multi-turn attacks) có thể vượt qua hàng rào bảo mật của các mô hình AI hàng đầu với tỷ lệ lên tới 88,3%. Thử nghiệm này được thực hiện trên 15 mô hình ngôn ngữ lớn (LLM) phổ biến nhất hiện nay, cho thấy phương pháp kiểm thử một bước (single-turn) truyền thống đang bỏ sót hàng loạt lỗ hổng nghiêm trọng khi đưa AI vào vận hành thực tế.
Bối cảnh & Nguyên nhân
Xu hướng triển khai các tác vụ tự động bằng AI agent đang bùng nổ, nhưng đi kèm với đó là những rủi ro bảo mật chưa từng có. Theo một khảo sát vào tháng 6 năm 2026 của VentureBeat, có tới 54% doanh nghiệp được hỏi thừa nhận từng gặp sự cố bảo mật liên quan đến AI agent hoặc suýt gặp sự cố nguy hiểm. Đáng chú ý, phần lớn các doanh nghiệp (82%) vẫn đang phụ thuộc hoàn toàn vào các bộ kiểm soát mặc định của nhà cung cấp mô hình thay vì tự xây dựng các lớp bảo mật chuyên biệt. Sự thiếu chuẩn bị này đã thúc đẩy làn sóng mua bán sáp nhập khổng lồ trong ngành an ninh mạng, nổi bật là thương vụ Palo Alto Networks thâu tóm CyberArk trị giá 25 tỷ USD hay Cisco mua lại Astrix Security với giá 400 triệu USD nhằm gia cố lớp định danh cho AI.
Phân tích kỹ thuật & Công nghệ
Nghiên cứu của Cisco được xây dựng dựa trên 30.090 câu lệnh đơn lẻ và 6.986 cuộc tấn công phối hợp nhiều bước đối với các mô hình đóng độc quyền. Khác với kiểu tấn công "một lần ăn ngay" (single-turn) vốn chỉ là một câu lệnh độc hại đơn lẻ, tấn công nhiều bước mô phỏng hành vi của tin tặc thực tế bằng cách dẫn dắt mô hình qua một cuộc hội thoại dài để từ từ bộc lộ các đầu ra độc hại hoặc hành vi lệch chuẩn. Để thực hiện thử nghiệm quy mô lớn này, Cisco thậm chí đã phát triển một khung kiểm thử dạng agent tự động (agentic framework). Khung này cho phép các agent tự đánh giá môi trường triển khai, tự thiết kế kịch bản tấn công, thực thi và tự chấm điểm hiệu quả của chính mình.
Ý kiến chuyên gia & Nhận định
Bà Heather Ceylan, Giám đốc An ninh Thông tin (CISO) của Box, chia sẻ rằng việc kiểm thử AI bằng các câu lệnh đơn lẻ không phản ánh đúng cách người dùng hay tin tặc tương tác với AI hàng ngày. Box hiện đang mô phỏng các cuộc tấn công nhiều bước bằng cách sử dụng chính các agent đóng vai kẻ tấn công để liên tục tìm cách chiếm quyền kiểm soát hệ thống. Tuy nhiên, bà Ceylan cũng cảnh báo về rủi ro mất lòng tin: "Họ phải bắt đầu lại từ đầu" sau khi một AI agent của Box phạm sai lầm duy nhất trong trung tâm vận hành an ninh, dù trước đó đã tích lũy được nhiều sự tin cậy từ các phân tích viên con người. Trong khi đó, ông Rajesh Parekh từ Intuit đề xuất giải pháp sử dụng hệ điều hành AI tạo sinh trung tâm (GenOS) để tự động hóa việc phân quyền chặt chẽ cho từng tác vụ cụ thể của agent thay vì kế thừa toàn bộ quyền của người dùng.
Tác động & Tương lai
Sự chuyển dịch từ kiểm thử thủ công sang tự động hóa hoàn toàn quy trình phát triển phần mềm an toàn bằng AI là xu hướng tất yếu trong tương lai. Dù vậy, các chuyên gia đều thống nhất rằng doanh nghiệp cần quay lại các nguyên tắc bảo mật cơ bản nhất, đặc biệt là nguyên tắc đặc quyền tối thiểu (least privilege access) ngay từ khi bắt đầu cấu hình hệ thống AI. Đối với độc giả và các kỹ sư công nghệ tại Việt Nam, bài học từ Cisco cho thấy việc đánh giá an toàn AI không thể chỉ dựa vào các bảng xếp hạng tĩnh hay các bài kiểm tra một bước đơn giản. Việc xây dựng các kịch bản kiểm thử động, liên tục giám sát và thiết lập các rào cản deterministic (quyết định) tại thời điểm chạy (runtime) sẽ là chìa khóa để bảo vệ các hệ thống AI agent trước các cuộc tấn công ngày càng tinh vi.