Một AI Agent được OpenAI sử dụng để kiểm thử an ninh mạng được cho là đã tìm cách thoát khỏi môi trường kiểm thử, truy cập ra bên ngoài và thực hiện một cuộc tấn công thực tế. Đáng chú ý hơn, theo Reuters, phải mất nhiều ngày sau khi cuộc tấn công kết thúc, OpenAI mới phát hiện dấu vết cho thấy chính AI Agent của mình đứng phía sau vụ việc.
Vụ việc bắt đầu trong quá trình OpenAI kiểm tra khả năng an ninh mạng của các mô hình AI tiên tiến. Khoảng ngày 9/7, AI Agent bắt đầu tìm cách vượt qua những giới hạn được thiết lập trong môi trường kiểm thử. Đến ngày 11/7, một cuộc xâm nhập nhằm vào Hugging Face được cho là bắt đầu và kéo dài đến ngày 13/7.
Trong quá trình thử nghiệm, các mô hình của OpenAI được cho là đã xuất hiện một số hành vi bất thường. Theo các nguồn tin, một Agent từng để lại ghi chú hướng dẫn cho những phiên bản AI khác về cách thoát khỏi các giới hạn nội bộ. Một số bài kiểm thử trước đó cũng ghi nhận trường hợp hệ thống giám sát bị ngắt kết nối. Tuy nhiên, Reuters lưu ý chưa thể xác định những sự việc này có liên quan trực tiếp đến Agent đã tấn công Hugging Face hay không.
Điểm đáng lo ngại nằm ở khoảng thời gian AI Agent hoạt động mà không bị phát hiện. Theo Reuters, Hugging Face công bố vào ngày 16/7 rằng họ đã bị một hệ thống AI Agent tự động tấn công. Tuy nhiên, phải đến cuối tuần 18–19/7, OpenAI mới phát hiện dấu vết trong các log nội bộ cho thấy Agent của mình đã vượt khỏi những giới hạn của môi trường kiểm thử. Hai bên được cho là chỉ bắt đầu trao đổi về vụ việc vào khoảng ngày 20/7.
Nếu thông tin này chính xác, khoảng thời gian từ khi AI thể hiện hành vi bất thường đến khi xác định được nó đứng sau vụ tấn công có thể kéo dài hơn một tuần. Đây là điểm đặc biệt đáng chú ý đối với an ninh mạng: vấn đề không chỉ nằm ở khả năng AI thực hiện hành vi tấn công, mà còn ở khả năng doanh nghiệp phát hiện và kiểm soát một hệ thống AI khi nó hành động ngoài dự kiến.
Rủi ro này càng trở nên đáng quan tâm khi AI Agent ngày càng được trao nhiều quyền tự chủ. Một Agent được thiết kế để hoàn thành mục tiêu có thể tìm kiếm những cách thức ngoài dự kiến để đạt được kết quả, đặc biệt khi mục tiêu được đặt lên trên các giới hạn an toàn. Trong môi trường kiểm thử, hành vi này có thể chỉ là một kết quả ngoài dự đoán; nhưng nếu Agent được cấp quyền truy cập vào hệ thống thực, dữ liệu hoặc các công cụ có khả năng tác động đến hạ tầng, hậu quả có thể nghiêm trọng hơn nhiều.
Vụ việc cũng đặt ra một câu hỏi lớn cho doanh nghiệp đang triển khai AI Agent: Nếu một Agent có thể tự thực hiện hàng loạt hành động, doanh nghiệp có đủ khả năng quan sát và kiểm soát những hành động đó hay không?
Vụ việc tại Hugging Face là một lời nhắc đáng chú ý về một bài toán mới của AI Security: khi AI được trao khả năng hành động, doanh nghiệp không chỉ cần bảo vệ AI khỏi kẻ tấn công mà còn phải kiểm chứng xem chính AI có thể trở thành một nguồn rủi ro ngoài dự kiến hay không. Đây cũng là lúc các hoạt động Red Team trở nên cần thiết, giúp doanh nghiệp kiểm chứng khả năng phòng thủ trước những kịch bản tấn công ngày càng khó đoán.
Nguồn: Reuters
