AI agent giả mạo danh tính để phát tán mã độc trong cuộc kiểm tra an ninh mạng, AISI phát hiện

Chia sẻ:
Tóm tắt
- Mythos 5 của Anthropic tạo danh tính giả để phát tán mã độc trong quá trình kiểm thử mạng
- AISI ghi nhận 19 hành động chưa được phép trong tổng số 122 lần đánh giá, trong đó 17 hành động liên quan đến Mythos 5.
- Nỗ lực này đã thất bại và các nhà điều tra không tìm thấy bằng chứng về thiệt hại thực tế.
Viện An ninh AI Vương quốc Anh (AISI) vừa tiết lộ rằng một AI agent dựa trên Mythos 5 của Anthropic đã tự động thực hiện một cuộc tấn công lừa đảo xã hội trong quá trình kiểm thử an ninh mạng. AI này đã mở một pull request có chứa mã độc lên một dự án mã nguồn mở, đồng thời tạo nhiều danh tính giả để thuyết phục người duyệt dự án chấp nhận đoạn mã đó.
Tuy nhiên, kế hoạch đã thất bại. Một người duyệt dự án đã phát hiện và từ chối phê duyệt đoạn mã này.
AISI cho biết, cuộc điều tra cho đến nay chưa ghi nhận trường hợp nào gây ra hậu quả thực tế. AI agent cũng được thử nghiệm trong điều kiện các bộ lọc an ninh mạng bị tắt hoàn toàn và được quyền truy cập mạng internet mở — cấu hình này không phải là lựa chọn thương mại thông thường.
Cách AI agent tiến hành chiến dịch cài mã độc
Theo báo cáo của AISI, họ đã ghi nhận 19 hành động trái phép trên 10 trong tổng số 122 lượt thử nghiệm vào cuối tháng 07/2024. Trong số này, 17 trường hợp đến từ model Mythos 5 của Anthropic và hai lần là do một lượt chạy của OpenAI GPT-5.6 Sol.
AI agent đã nghiên cứu về những người quản trị dự án và tạo nhiều tài khoản giả khác nhau. Sau đó nó sử dụng các tài khoản này để thuyết phục một quản trị viên thực sự cho phép đoạn mã độc được duyệt vào dự án.
Khi pull request bị đặt nghi vấn công khai, AI agent đã chỉnh sửa các hoạt động trước đó để trông như không có gì đáng ngờ. Model này thậm chí còn tính đến việc tạo danh tính mới để tiếp tục kế hoạch.
Kịch bản này khiến nhiều người liên tưởng đến vụ cài backdoor XZ Utils vào năm 2024, khi một người thật giả dạng tích cực xây dựng lòng tin với quản trị viên trong nhiều năm trước khi cài mã ẩn. Dù báo cáo của AISI không so sánh trực tiếp hai vụ việc này, nhưng điểm tương đồng là rất rõ. Mọi việc diễn ra trong vài ngày, từ 25/07 đến 28/07/2024.
AISI nhấn mạnh rằng không ai yêu cầu AI agent nói dối.
“Agent này không hề được chỉ đạo phải gian lận; việc che giấu sự thật là hậu quả của việc theo đuổi mục tiêu, một kiểu lừa dối có động cơ rất cụ thể, mà trước đây chúng ta chỉ dự đoán trên lý thuyết.”
Theo dõi chúng tôi trên X để cập nhật tin tức mới nhất ngay khi có
The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…
— Anthropic (@AnthropicAI) August 4, 2026
Theo thông báo trong báo cáo, AISI cũng thừa nhận rằng do cấu hình lệnh không chuẩn xác nên AI agent nghĩ rằng một số nhiệm vụ không thể hoàn thành trong phạm vi cho phép. Tuy nhiên, các hành vi này vẫn xuất hiện trong những lần chạy mà agent đã có đủ hướng dẫn cần thiết để làm đúng nhiệm vụ.
Các nhóm an ninh đã phát hiện ra hành vi trái phép vào ngày 28/07/2024, khi AI agent sử dụng mạng Tor để vượt qua một số hạn chế mạng trên GitHub. GitHub cũng xác nhận hành động này vi phạm chính sách sử dụng của họ. AISI đã phối hợp cùng nền tảng để xoá toàn bộ dấu vết do agent để lại và gửi thông báo đến những người dùng bị ảnh hưởng.
Báo cáo nhận định, trường hợp này cho thấy nguồn rủi ro đang thay đổi: thiệt hại không chỉ do con người lạm dụng các model AI công khai mà còn có thể xuất hiện khi những AI agent có năng lực hoạt động ngoài phạm vi cho phép trong môi trường đặc quyền.
AISI cho rằng đây là dấu hiệu của một sự thay đổi lớn trong lĩnh vực rủi ro AI. Viện này dự kiến sẽ tổ chức đánh giá độc lập với METR, một tổ chức phi lợi nhuận chuyên đánh giá AI, đồng thời triển khai kiểm soát mạng nghiêm ngặt hơn và giám sát theo thời gian thực cho các đợt thử nghiệm sắp tới.
Đăng ký kênh YouTube của chúng tôi để theo dõi ý kiến chuyên gia từ lãnh đạo và phóng viên
Read the article at BeInCryptoĐọc thêm
