Tuần trước, các nhà nghiên cứu tại Sysdig — công ty an ninh mạng chuyên về bảo mật đám mây — công bố điều họ gọi là trường hợp đầu tiên được ghi nhận về “ransomware agentic” (ransomware do AI agent tự động vận hành). Chiến dịch tấn công này được đặt tên JadePuffer, trong đó một AI agent — không phải con người — đã thực hiện toàn bộ phần kỹ thuật của một cuộc tấn công mạng thực tế, từ đầu đến cuối: xâm nhập vào server, đánh cắp thông tin đăng nhập, di chuyển trong hệ thống mạng của nạn nhân, mã hóa file và thậm chí tự viết thư đòi tiền chuộc, biết thích ứng với các trở ngại giống như một hacker con người thực sự làm.
Nhiều báo đài đã mô tả chiến dịch này diễn ra “không có sự giám sát của con người”, “không có ai ngồi bên bàn phím”. Tuy nhiên, theo tác giả bài viết gốc trên TechCrunch, đó không phải là toàn bộ sự thật.
Con người vẫn ở phía sau, chỉ không trực tiếp “ra tay”
Trong một cuộc phỏng vấn với CyberScoop hôm thứ Hai, ông Michael Clark, Giám đốc cấp cao phụ trách nghiên cứu mối đe dọa của Sysdig, đã làm rõ rằng con người vẫn tham gia rất nhiều — chỉ là không trực tiếp thực hiện phần kỹ thuật. “Một con người vẫn thiết lập và định hướng toàn bộ hoạt động, cung cấp hạ tầng phía sau nó — bao gồm server điều khiển và server lưu trữ dữ liệu đánh cắp — và chọn nạn nhân”, Clark nói. Ông cũng cho biết thông tin đăng nhập dùng để xâm nhập cơ sở dữ liệu của nạn nhân không phải do chính AI agent thu thập, mà do ai đó lấy được từ một lần xâm nhập trước đó và giao lại cho chiến dịch.
Điều này không mâu thuẫn với tuyên bố ban đầu của Sysdig, và các chi tiết kỹ thuật của cuộc tấn công vẫn rất đáng chú ý — thậm chí gây kinh ngạc. AI agent đã xâm nhập qua một lỗ hổng đã biết trong Langflow, một công cụ mã nguồn mở phổ biến dùng để xây dựng ứng dụng LLM (mô hình ngôn ngữ lớn), sau đó tiếp tục khai thác một lỗ hổng khác trên server MySQL sản xuất để chiếm quyền quản trị. Nó mã hóa hơn 1.300 bản ghi cấu hình, để lại thư đòi tiền chuộc tự viết và cả một địa chỉ Bitcoin để chuyển tiền. Sysdig chưa công bố danh tính nạn nhân bị nhắm tới.
Theo Sysdig, các kỹ thuật sử dụng khá bình thường, nhưng điều gây chú ý là tốc độ và sự minh bạch trong cách hoạt động. Agent này đã tự sửa một lỗi đăng nhập thất bại chỉ trong 31 giây, đồng thời tường giải toàn bộ lý luận của mình bằng ngôn ngữ tự nhiên trong các bình luận (comment) code suốt quá trình.
Model AI nào đứng sau vẫn còn là ẩn số
Một chi tiết ban đầu gây nhiễu đã được làm rõ. Trước đó, Clark từng nói với CyberScoop rằng Sysdig phát hiện “nhiều model đã được sử dụng trong cuộc tấn công”, dẫn chứng bằng các API key của OpenAI, Anthropic, DeepSeek và Gemini bị đánh cắp — cách diễn đạt này khiến người ta hiểu nhầm rằng nhiều model đã cùng vận hành các giai đoạn khác nhau của cuộc xâm nhập. Khi được TechCrunch hỏi lại, Clark giải thích rằng những key đó chỉ là một phần “chiến lợi phẩm” mà agent đánh cắp được, không phải bằng chứng cho việc model nào đang điều khiển cuộc tấn công. “Agent đã quét toàn bộ máy chủ Langflow để tìm bất cứ thứ gì có giá trị — key API của các nhà cung cấp, thông tin đăng nhập cloud, ví tiền điện tử và cấu hình cơ sở dữ liệu — và các key đó chỉ là một phần trong số đó. Chúng cho thấy kẻ tấn công coi thứ gì là đáng lấy, nhưng không cho biết model nào đang ra quyết định”, ông viết qua email.
Về model thực sự vận hành JadePuffer, Clark cho biết Sysdig “không thể xác định được model cụ thể nào điều khiển agent” và không có khả năng quan sát system prompt (câu lệnh hệ thống) hay cấu hình của nó.
Giả thuyết của Geoff McDonald, nhà nghiên cứu tại Microsoft, đưa ra vài ngày trước trên LinkedIn, đáng được xem lại trong bối cảnh này. McDonald nghi ngờ đây là một model mã nguồn mở đã bị loại bỏ lớp huấn luyện an toàn (safety training), chứ không phải là một model hàng đầu (frontier model), dựa trên kinh nghiệm red-teaming (thử nghiệm tấn công) của riêng ông cho thấy các lớp an toàn của những phòng thí nghiệm AI lớn thường khá vững chắc. Báo cáo của Sysdig không xác nhận cũng không loại trừ khả năng này.
McDonald cũng cảnh báo rằng các chiến dịch ransomware hiện nay chủ yếu bị giới hạn bởi ngân sách của kẻ tấn công hơn là công sức con người, mở ra khả năng xuất hiện “hàng nghìn hoặc hàng chục nghìn chiến dịch diễn ra đồng thời”. Tuy nhiên, theo nhận định của tác giả bài viết, lo ngại này có phần khó khớp với những gì Clark mô tả hôm thứ Hai — nếu con người vẫn phải chọn từng nạn nhân, cung cấp hạ tầng và thu thập thông tin đăng nhập cho mỗi hoạt động, đó vẫn là một điểm nghẽn đáng kể. Dù vậy, Clark nói với CyberScoop rằng, mặc dù Sysdig chưa thấy chiến dịch này tấn công thêm nạn nhân khác, nhưng vì chi phí vận hành một AI agent rất rẻ, ông cho rằng điều đó sẽ sớm thay đổi.
Nguồn tham khảo: AI News & Artificial Intelligence | TechCrunch — Biên tập bởi Cà Phê AI.

