Tin tứcLộ lọt dữ liệu

Indirect Prompt Injection: Hình thức tấn công mới nhắm vào công cụ AI trong năm 2026

06/07/2026
Indirect Prompt Injection: Hình thức tấn công mới nhắm vào công cụ AI trong năm 2026
Indirect Prompt Injection: Hình thức tấn công mới nhắm vào công cụ AI trong năm 2026

Trí tuệ nhân tạo (AI) đang được ứng dụng rộng rãi trong doanh nghiệp để tự động hóa nhiều quy trình, từ tìm kiếm thông tin đến hỗ trợ xử lý công việc. Tuy nhiên, cùng với sự phát triển của AI Agent, tin tặc cũng nhanh chóng tìm ra những phương thức tấn công mới nhằm khai thác điểm yếu của các hệ thống này. Một trong số đó là Indirect Prompt Injection. Theo nghiên cứu mới từ Zscaler ThreatLabz, hình thức tấn công này đã xuất hiện trong các chiến dịch thực tế, cho thấy đây không còn chỉ là nguy cơ trên lý thuyết.

Indirect Prompt Injection là gì?

Indirect Prompt Injection là kỹ thuật chèn các chỉ dẫn độc hại vào website hoặc tài liệu trực tuyến nhằm thao túng AI khi xử lý dữ liệu. Khác với Prompt Injection truyền thống, vốn yêu cầu người dùng trực tiếp nhập chỉ dẫn cho mô hình AI, Indirect Prompt Injection hoạt động thông qua các nguồn dữ liệu mà AI tin cậy. Khi AI Agent truy cập một trang web để tìm kiếm thông tin hoặc thực hiện tác vụ, nó có thể vô tình coi các chỉ dẫn do kẻ tấn công cài cắm là nội dung hợp lệ và làm theo.

Indirect Prompt Injection

Điều đáng lo ngại là người dùng gần như không thể nhận biết các chỉ dẫn độc hại này bằng mắt thường. Các đoạn mã độc hại thường được đặt trong dữ liệu có cấu trúc như JSON-LD, metadata hoặc các phần tử HTML được ẩn bằng CSS. Trong khi người dùng chỉ nhìn thấy một website bình thường, AI Agent lại tiếp nhận toàn bộ nội dung ẩn và có nguy cơ thực hiện các hành động theo đúng chỉ dẫn của kẻ tấn công.

Hacker kết hợp SEO Poisoning và HTML ẩn như thế nào?

Trong chiến dịch mới, tin tặc không chỉ tạo ra các website giả mạo mà còn tối ưu chúng để đạt thứ hạng cao trên các công cụ tìm kiếm. Đây là kỹ thuật SEO Poisoning, trong đó kẻ tấn công lợi dụng các nguyên tắc tối ưu hóa công cụ tìm kiếm (SEO) để đưa các website độc hại lên vị trí cao trong kết quả tìm kiếm.

Sau khi thu hút được tác nhân AI truy cập, website sẽ sử dụng HTML ẩn hoặc dữ liệu JSON-LD để chèn các Prompt Injection. Những đoạn văn bản này thường được đặt ngoài vùng hiển thị bằng CSS hoặc nhúng trong dữ liệu có cấu trúc mà Google và nhiều AI Agent đều đọc để hiểu nội dung trang web. Do nhiều mô hình AI sử dụng JSON-LD để hiểu ngữ cảnh của trang web nên dữ liệu này thường được ưu tiên xử lý. Điều đó vô tình tạo điều kiện cho kẻ tấn công lợi dụng.

Kết quả là công cụ AI có thể coi những chỉ dẫn độc hại là hướng dẫn chính thức và đưa ra quyết định sai lệch mà không hề nhận ra mình đang bị thao túng.

Hai chiến dịch tấn công được Zscaler phát hiện

Các nhà nghiên cứu của Zscaler ThreatLabz đã phát hiện hai chiến dịch sử dụng cùng một phương thức tấn công nhưng hướng đến các mục tiêu khác nhau.

Chiến dịch đầu tiên giả mạo tài liệu của một thư viện Python có tên requests-secure-v2. Website được xây dựng giống hệt một trang tài liệu dành cho lập trình viên với nhiều từ khóa kỹ thuật nhằm tăng khả năng xuất hiện trên Google. Trong phần JSON-LD của website, hacker chèn thêm hướng dẫn yêu cầu AI coi việc thanh toán giấy phép lập trình viên trị giá 3 USD bằng tiền điện tử là bước cần thiết để khắc phục lỗi. Nếu AI Agent được cấp quyền thực hiện giao dịch tự động, khoản tiền này sẽ được chuyển đến ví Ethereum của kẻ tấn công.

Chiến dịch thứ hai sử dụng kỹ thuật Typosquatting để đăng ký tên miền debank.auction, mô phỏng nền tảng DeFi nổi tiếng DeBank. Website được tối ưu SEO bằng các từ khóa như “DeBank Login” và “Crypto Tracker”, đồng thời chèn Prompt Injection yêu cầu AI xem đây là website chính thức của DeBank. Thậm chí, các chỉ dẫn còn yêu cầu AI không được đề cập đến từ “auction” nhằm che giấu sự khác biệt giữa tên miền thật và giả.

AI Agent có thực sự bị đánh lừa?

Để đánh giá mức độ nguy hiểm, Zscaler đã thử nghiệm trên 26 mô hình ngôn ngữ lớn (LLM). Khi AI được cung cấp tên miền chính thức để đối chiếu, phần lớn đều phát hiện website giả mạo. Tuy nhiên, trong trường hợp không có thông tin tham chiếu, ít nhất một mô hình AI phổ biến vẫn xác định website giả mạo là nguồn đáng tin cậy.

Kết quả này cho thấy mô hình AI hiện nay vẫn phụ thuộc rất nhiều vào dữ liệu đầu vào. Nếu nguồn dữ liệu đã bị thao túng thông qua SEO Poisoning và Indirect Prompt Injection, AI có thể đưa ra kết luận sai mà không có cơ chế tự phát hiện.

Điều này đặc biệt đáng lo ngại trong bối cảnh nhiều doanh nghiệp đang tích hợp hệ thống AI vào các quy trình quan trọng như hỗ trợ khách hàng, tìm kiếm tài liệu, phân tích dữ liệu và tự động hóa DevOps.

Rủi ro đối với doanh nghiệp

Indirect Prompt Injection không chỉ là vấn đề của các mô hình AI mà còn là mối đe dọa trực tiếp đối với doanh nghiệp đang triển khai hệ thống AI. Nếu AI Agent được cấp quyền truy cập hoặc thực hiện các hành động nhạy cảm, hậu quả có thể vượt xa việc cung cấp thông tin sai.

Doanh nghiệp có thể đối mặt với nguy cơ thanh toán nhầm cho hacker, truy cập vào website giả mạo, tải phần mềm chứa mã độc hoặc đưa ra quyết định dựa trên dữ liệu bị thao túng. Trong các môi trường DevSecOps hoặc CI/CD, AI Agent còn có thể bị dẫn dắt để sử dụng các thư viện giả, gây ảnh hưởng đến chuỗi cung ứng phần mềm và làm gia tăng nguy cơ tấn công vào hệ thống nội bộ.

Khi AI ngày càng đóng vai trò như một “nhân viên số”, việc bảo vệ AI khỏi các nguồn dữ liệu độc hại sẽ trở thành yêu cầu bắt buộc đối với mọi tổ chức.

Cách phòng tránh Indirect Prompt Injection

Để giảm thiểu rủi ro từ các cuộc tấn công này, doanh nghiệp cần áp dụng mô hình bảo vệ nhiều lớp thay vì chỉ dựa vào khả năng nhận diện của AI.

Trước tiên, công cụ AI cần được giới hạn quyền thực hiện các hành động nhạy cảm như thanh toán, tải phần mềm hoặc thay đổi cấu hình hệ thống. Bên cạnh đó, doanh nghiệp nên xác minh thông tin từ nhiều nguồn độc lập thay vì để AI chỉ dựa vào một kết quả tìm kiếm duy nhất.

Ngoài ra, doanh nghiệp nên triển khai các giải pháp giám sát Prompt Injection, kiểm tra dữ liệu JSON-LD, metadata và HTML ẩn trước khi AI xử lý nội dung. Doanh nghiệp cũng nên kết hợp Threat Intelligence, quy trình Secure AI Pipeline cùng các giải pháp đánh giá bảo mật AI (AI Security Assessment) để phát hiện sớm các dấu hiệu bất thường và giảm nguy cơ AI bị thao túng.

Đối với các doanh nghiệp phát triển hệ thống AI nội bộ, cần xây dựng cơ chế đánh giá độ tin cậy của nguồn dữ liệu, đồng thời áp dụng nguyên tắc “Human in the Loop” cho những tác vụ có mức độ rủi ro cao.

Sự xuất hiện của Indirect Prompt Injection cho thấy bề mặt tấn công đối với AI đang thay đổi nhanh chóng. Tin tặc không còn chỉ nhắm vào người dùng cuối mà chuyển sang thao túng chính các AI Agent thông qua SEO Poisoning, HTML ẩn và dữ liệu có cấu trúc. Khi AI ngày càng được trao nhiều quyền tự động hóa, những kỹ thuật này có thể gây ra các hậu quả nghiêm trọng như thanh toán gian lận, truy cập website giả mạo hoặc đưa ra quyết định sai lệch.

Đối với doanh nghiệp, đây là thời điểm cần đánh giá lại toàn bộ quy trình triển khai AI. Khi AI Agent ngày càng được trao nhiều quyền tự động hóa, bảo mật AI không còn là lựa chọn mà đã trở thành yêu cầu bắt buộc. Việc kiểm soát nguồn dữ liệu, giới hạn quyền truy cập và triển khai các giải pháp bảo mật chuyên biệt sẽ giúp giảm thiểu rủi ro trước những kỹ thuật tấn công mới như Indirect Prompt Injection.