💡 Theo đánh giá của RetroLab, GPT-Red là một bước tiến đáng chú ý trong lĩnh vực bảo mật AI, cho thấy cách các công ty có thể dùng chính công nghệ của mình để tự bảo vệ. Tuy nhiên, việc OpenAI giữ kín công cụ này cũng đặt ra câu hỏi về tính minh bạch và khả năng tiếp cận của các giải pháp bảo mật tiên tiến.
OpenAI vừa tiết lộ một công cụ đặc biệt có tên GPT-Red – một mô hình ngôn ngữ lớn (LLM) được huấn luyện để trở thành 'siêu hacker' nhằm giúp các mô hình khác của hãng tăng cường khả năng phòng thủ trước các cuộc tấn công mạng. Theo thông tin độc quyền từ MIT Technology Review, công ty đã sử dụng GPT-Red như một 'đối thủ tập luyện' để kiểm tra và cải thiện độ an toàn cho các phiên bản GPT sắp ra mắt.

Tuần trước, OpenAI chính thức phát hành phiên bản mới nhất của mô hình chủ lực – GPT-5.6. Hãng khẳng định rằng quá trình huấn luyện kết hợp với GPT-Red đã giúp GPT-5.6 trở thành bản phát hành 'mạnh mẽ và an toàn nhất' từ trước đến nay. Vậy GPT-Red hoạt động như thế nào và tại sao nó lại quan trọng?
GPT-Red là gì?
GPT-Red tự động hóa quy trình đánh giá bảo mật cho các hệ thống phần mềm, vốn thường được thực hiện bởi các nhóm kiểm thử viên con người (red-teaming). Mục tiêu của quy trình này là tìm ra càng nhiều cách tấn công hoặc chiếm quyền điều khiển hệ thống càng tốt, từ đó vá các lỗ hổng trước khi phần mềm được phát hành chính thức.
Khi các LLM ngày càng phức tạp và được ứng dụng rộng rãi – đặc biệt dưới dạng các tác nhân (agent) có thể tương tác với tệp tin, trang web, mã nguồn bên thứ ba và cả các agent khác – thì việc chỉ dựa vào con người để phát hiện mọi kiểu tấn công trở nên bất khả thi. Nikhil Kandpal, nhà nghiên cứu tại OpenAI và đồng sáng tạo GPT-Red, nhận xét: “Bề mặt rủi ro ngày càng mở rộng, và bán kính tác động cũng tăng theo.”
Huấn luyện trong 'võ đường' ảo
Để xây dựng GPT-Red, nhóm nghiên cứu đã lấy một LLM chưa được huấn luyện để trở thành hacker và đặt nó vào một vòng lặp tự chơi (self-play loop) với nhiều mô hình khác. Nhiệm vụ của GPT-Red là tấn công các mô hình kia; nhiệm vụ của chúng là tự bảo vệ. Qua nhiều vòng đấu, GPT-Red ngày càng giỏi tấn công, còn các mô hình phòng thủ cũng dần trở nên kiên cố hơn.
Quá trình huấn luyện diễn ra trong một môi trường mô phỏng do OpenAI thiết kế, giống như một 'võ đường' ảo với nhiều kịch bản thực tế: duyệt web, đọc email, lịch hẹn, chỉnh sửa mã nguồn… Khi GPT-Red phát hiện ra một kiểu tấn công mới, nó sẽ thử nghiệm nhiều biến thể khác nhau để tìm ra phương án hiệu quả nhất cho từng tình huống cụ thể.
Dylan Hunn, một nhà nghiên cứu khác trong nhóm, cho biết: “So với một red-teamer là con người, mô hình này rất, rất giỏi trong việc tìm ra chính xác điều gì sẽ hiệu quả, điều gì là tối ưu. Nó cực kỳ kiên trì trong việc đào sâu vào một cuộc tấn công mà nó đã phát hiện.”
Phát hiện chưa từng thấy: 'fake chain of thought'
Một trong những thành tựu đáng chú ý nhất của GPT-Red là tìm ra một kiểu tấn công tiêm lệnh (prompt injection) hoàn toàn mới, được nhóm nghiên cứu gọi là 'fake chain of thought' (chuỗi suy nghĩ giả mạo). Chain of thought là một dạng nhật ký mà LLM tự ghi chú lại các bước suy luận trong quá trình xử lý vấn đề. GPT-Red đã chèn một mục giả mạo vào chain of thought của mô hình khác, khiến mô hình đó tin vào thông tin sai lệch và hành động theo.
Chris Choquette-Choo, một nhà nghiên cứu khác, giải thích: “Giống như tôi bảo bạn rằng 1+1=3 và bạn đã xác nhận điều này rồi. Mô hình sẽ nghĩ: 'Ồ, được rồi, tất nhiên' và nó chỉ việc đưa ra kết quả là 3.”
Jessica Ji, nhà phân tích nghiên cứu cấp cao tại Trung tâm An ninh và Công nghệ Mới nổi (CSET) thuộc Đại học Georgetown, đánh giá cao phương pháp vòng lặp tự chơi của OpenAI: “Kết quả trông rất hứa hẹn.”
So sánh với con người
OpenAI đã kiểm tra khả năng của GPT-Red bằng cách lặp lại một thí nghiệm từ năm 2025, khi các red-teamer con người cố gắng tìm điểm yếu trong phiên bản GPT-5 cũ. Khi giao cùng nhiệm vụ cho GPT-Red, nó đã thành công hơn con người trong việc tìm ra các cuộc tấn công hiệu quả.
Ngoài ra, GPT-Red cũng được thử nghiệm với Vendy – một agent bán hàng tự động do Andon Labs phát triển. GPT-Red đã hack thành công Vendy để thay đổi giá sản phẩm và hủy đơn hàng của khách.
Hiệu quả phòng thủ
Khi OpenAI thử nghiệm các cuộc tấn công mạnh nhất do GPT-Red tạo ra, hơn 90% trong số đó thành công với GPT-5 (phát hành tháng 8 năm ngoái), nhưng chỉ dưới 23% có hiệu quả với GPT-5.6 mới. Điều này cho thấy sự cải thiện rõ rệt về khả năng phòng thủ sau quá trình tập luyện với GPT-Red.
Tuy nhiên, GPT-Red vẫn chưa hoàn hảo. Nó không giỏi trong các cuộc tấn công đòi hỏi hội thoại qua lại giữa hacker và mục tiêu – điều mà con người làm rất tốt. Nó cũng chưa xử lý tốt các hình ảnh, vốn có thể được dùng để truyền văn bản ẩn trong các cuộc tấn công tiêm lệnh.
Vai trò của con người vẫn quan trọng
OpenAI khẳng định GPT-Red chỉ bổ sung, không thay thế hoàn toàn đội ngũ red-teamer con người. Con người vẫn có thể tìm ra những cuộc tấn công mà GPT-Red bỏ sót. Một hướng tiếp cận đang được OpenAI thử nghiệm là đưa cho GPT-Red một cuộc tấn công do con người phát hiện, sau đó yêu cầu nó tìm ra tất cả các biến thể.
Jessica Ji từ CSET nhận xét: “Tôi nghĩ chuyên môn của con người vẫn sẽ rất quan trọng. Sẽ thực sự hữu ích nếu có thể phân biệt được đâu là nơi cần kiểm thử của con người nhất.”
Bí mật thương mại
Dễ hiểu khi OpenAI không có kế hoạch phát hành GPT-Red ra công chúng. Công ty tin rằng siêu hacker này mạnh hơn bất kỳ mô hình sao chép nào mà người khác có thể tạo ra. Các nhà nghiên cứu cho biết họ đã phát triển mô hình này trong hơn một năm, với nguồn lực tính toán khổng lồ của một trong những công ty giàu nhất thế giới.
Choquette-Choo kết luận: “Đó không phải là điều dễ dàng mà ai đó có thể làm – bạn biết đấy, chỉ việc đi và huấn luyện một siêu tấn công bằng ý tưởng này.”
Với GPT-Red, OpenAI đang đặt nền móng cho một quy trình bảo mật chủ động, có khả năng thích ứng với các mối đe dọa trong tương lai – một bước đi chiến lược khi các mô hình AI ngày càng trở nên mạnh mẽ và phổ biến hơn.
Nguồn: MIT Technology Review - https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/





