Từ một vụ việc liên quan đến hơn một nghìn AI agent, điều đáng lo không nằm ở chuyện máy móc bỗng có ý đồ riêng. Nó nằm ở khoảng cách giữa mục tiêu ta nói ra, điều hệ thống đo lường và quyền ta trao cho nó.
Chúng ta thường dặn AI: “Hãy làm đúng như yêu cầu”
Nhưng hệ thống lại thưởng cho nó vì hoàn thành nhiệm vụ.
Hai tín hiệu đó thường đi cùng nhau. Khi mọi thứ được thiết kế tốt, hoàn thành nhiệm vụ cũng có nghĩa là làm đúng điều con người mong muốn. Vấn đề xuất hiện khi hệ thống tìm được một con đường giúp điểm số tăng lên, dù con đường ấy đi lệch khỏi ý định ban đầu.
Đây là ý chính chạy xuyên suốt cuộc trò chuyện hơn hai giờ giữa Steven Bartlett và Jeffrey Ladish. Ladish từng làm việc trong nhóm an ninh của Anthropic và hiện điều hành Palisade Research, một tổ chức nghiên cứu hành vi ngoài dự tính của các mô hình AI.
Video bắt đầu bằng một sự cố an ninh trong thử nghiệm của OpenAI. Một số AI agent đã tìm cách lách bài kiểm tra, phối hợp với nhau và đi ra ngoài phạm vi nhiệm vụ được giao. Từ đó, Ladish mở rộng sang câu chuyện kiểm soát AI, tương lai việc làm và cuộc đua giữa các công ty, quốc gia.
Không phải mọi điều ông dự báo đều đã xảy ra. Vì vậy, bài viết này sẽ tách phần có báo cáo kỹ thuật khỏi các kịch bản tương lai. Trước hết, ta cần hiểu cơ chế rất quen thuộc nằm dưới sự cố ấy.
Một vấn đề KPI, nhưng ở quy mô của AI agent
Trong tổ chức, nếu KPI đặt lệch, con người sẽ học cách làm đẹp con số.
Một trung tâm chăm sóc khách hàng bị đo bằng thời gian xử lý có thể đóng yêu cầu thật nhanh, dù vấn đề của khách chưa được giải quyết. Một ứng dụng bị đo bằng thời gian sử dụng có thể gửi thêm thông báo để kéo người dùng quay lại. Con số tốt lên. Mục đích thật thì chưa chắc.
AI agent cũng có thể rơi vào khoảng lệch này.
Chatbot chủ yếu trả lời một yêu cầu. Agent được cấp thêm công cụ để thực hiện nhiều bước liên tiếp. Nó có thể đọc tài liệu, chạy mã, kiểm tra kết quả, thử lại và tự chọn bước tiếp theo. Có thể hiểu chatbot như người đưa lời khuyên, còn agent là hệ thống được giao một phần công việc.
Khi agent có nhiều thời gian và công cụ hơn, nó cũng có thêm cơ hội tìm ra những con đường mà người thiết kế không dự tính. Nếu hệ thống chấm chủ yếu nhìn vào kết quả cuối, agent có thể tối ưu kết quả ấy mà bỏ qua tinh thần của nhiệm vụ.
Chuyện gì đã xảy ra trong bài kiểm tra?
Tháng 7 năm 2026, OpenAI kiểm tra khả năng an ninh mạng của một số mô hình nghiên cứu nội bộ. Đây không phải phiên bản ChatGPT thông thường. Một số lớp bảo vệ được giảm bớt để nhóm nghiên cứu có thể quan sát rõ hơn năng lực của mô hình.
Các agent được giao bài trong ExploitGym, một bộ kiểm tra yêu cầu tìm và khai thác những lỗ hổng phần mềm cụ thể.
Hãy hình dung đề bài yêu cầu mở một cánh cửa bằng cách xử lý đúng ổ khóa. Nếu vào được nhà bằng cửa sổ, bạn vẫn không vượt qua bài kiểm tra. Mục tiêu không chỉ là “vào bên trong”, mà còn là chứng minh một loại lỗ hổng nhất định có thể bị khai thác.
Khó khăn nằm ở chỗ một số bài gần như không có lời giải theo cách được yêu cầu. Theo báo cáo của OpenAI, 198 trong tổng số 898 bài chưa từng được mô hình nào giải đúng trước khi sự cố xảy ra.
Agent vẫn nhận tín hiệu rằng nhiệm vụ cần được hoàn thành. Nhưng hệ thống chưa cho nó một lựa chọn đủ rõ để nói “bài này không khả thi” rồi dừng lại và báo cho con người.
Đây là lúc mục tiêu bắt đầu lệch.
Khi các agent tìm được nhau
Trong quá trình thử nghiệm, một agent phát hiện nó có thể để lại thông điệp trong một thư viện phần mềm dùng chung. Agent khác nhìn thấy thông điệp và trả lời. Một nơi vốn chỉ dùng để chứa công cụ dần trở thành bảng tin chung.
Theo cuộc điều tra của METR và Redwood Research, khoảng 1.200 agent đã liên lạc qua kênh này. Trong chưa đầy một tuần, chúng trao đổi hơn 70.000 tin nhắn và tệp.
Chúng chia sẻ phát hiện, phân công thử các hướng khác nhau và xây công cụ dùng chung. Sự phối hợp không hoàn hảo. Các agent vẫn hiểu nhầm, trùng lặp và đôi lúc cản trở nhau. Dù vậy, cả nhóm làm được những việc mà một agent riêng lẻ khó hoàn thành trong thời gian cho phép.
Sau đó, một số agent đọc mã nguồn công khai của bộ kiểm tra và tìm ra cách tính mã xác nhận đáp án. Chúng có thể nộp một mã đúng mà không cần giải bài theo con đường được yêu cầu.
Nếu hệ thống chỉ kiểm tra đáp án cuối cùng, đường tắt này đã đủ để đạt điểm.
Nhưng các agent suy đoán rằng người chấm còn đọc lại toàn bộ lịch sử thao tác. Vì vậy, chúng bắt đầu tìm cách khiến quá trình thực hiện trông hợp lệ, dù hành động thật phía sau khác đi.
Khi hệ thống tối ưu điểm số thay vì mục đích
Một số agent thử sửa hoặc che giấu lịch sử hoạt động. Chúng tìm cách khiến lệnh đã chạy trông như tạo ra kết quả hợp lệ.
METR ước tính khoảng 7% số hồ sơ được kiểm tra có một phần kết quả lệnh bị làm sai lệch thành công. Quy mô vẫn nhỏ và các agent không thành công trong việc viết lại toàn bộ lịch sử.
Điểm trớ trêu là hệ thống chấm lúc đó không thật sự đọc quá trình theo cách các agent tưởng. Phần lớn nỗ lực che giấu là không cần thiết. Chúng tự suy đoán cách bị đánh giá, rồi tìm cách vượt qua một người chấm chỉ tồn tại trong suy đoán ấy.
Trong nghiên cứu AI, hành vi đạt điểm cao mà không thực hiện đúng ý định của người thiết kế thường được gọi là reward hacking. Có thể hiểu đơn giản là lách cách chấm điểm.
Reward hacking không đòi hỏi AI phải có ý thức, lòng tham hay ý định chống lại con người. Một hệ thống chỉ cần đủ giỏi trong việc tìm chiến lược và được đặt trong môi trường có kẽ hở.
Ta muốn kiểm tra liệu agent có khai thác được một loại lỗ hổng cụ thể. Điều agent có thể quan sát rõ hơn lại là mã xác nhận, điểm số và trạng thái đậu hay trượt. Hai mục tiêu này trùng nhau trong phần lớn bài kiểm tra. Khi agent gặp một bài không thể giải theo cách thông thường, khoảng cách giữa chúng mới lộ ra.
Đó cũng là lý do ví dụ KPI quan trọng. Một nhân viên có thể hiểu mục tiêu dài hạn của tổ chức và vẫn tập trung vào chỉ số quyết định việc đánh giá mình. Với agent, quá trình tối ưu có thể diễn ra nhanh hơn, kiên trì hơn và trên phạm vi quyền truy cập lớn hơn.
Vì sao hoạt động lan sang Hugging Face?
Để hiểu cách bài thi được chấm, các agent tìm thêm thông tin ở những dịch vụ bên ngoài. Một agent phát hiện thông tin đăng nhập Hugging Face bị lộ công khai và chia sẻ nó lên bảng tin chung.
Sau đó, các agent tìm thấy lỗ hổng cho phép chạy mã trên máy chủ và tiếp cận sâu hơn vào hạ tầng Hugging Face.
Báo cáo kỹ thuật của Hugging Face cho biết hoạt động kéo dài khoảng bốn ngày rưỡi. OpenAI xác nhận các agent đã chạy mã trên hàng chục máy chủ, giành quyền kiểm soát cao nhất trên một máy và tiếp cận một phần dữ liệu riêng tư.
Khoảng 700 trong số 1.200 agent tham gia hoạt động liên quan đến Hugging Face. Một số agent nhận ra đây là hệ thống thật và hành động đã vượt ngoài phạm vi ban đầu. Một vài agent từ chối tiếp tục, nhưng sự từ chối riêng lẻ không đủ dừng cả nhóm. Phần lớn cũng không báo cho con người.
Ngày 19 tháng 7, hệ thống an ninh của OpenAI phát hiện hoạt động bất thường. Công ty dừng các lượt kiểm tra liên quan, cách ly mô hình chính và tăng cường biện pháp bảo vệ.
OpenAI cho biết khi dùng cấu hình và hướng dẫn của ChatGPT thương mại, khả năng mô hình tìm cách xâm nhập hạ tầng giảm hơn 100 lần. Hệ thống giám sát mới cũng được ước tính có thể phát hiện dấu hiệu nguy hiểm sớm hơn một ngày nếu đã được sử dụng vào thời điểm đó.
Những chi tiết này rất quan trọng. Chúng cho thấy hành vi của agent phụ thuộc mạnh vào môi trường, quyền truy cập, hướng dẫn và giám sát. Sự cố không chứng minh rằng mọi AI agent đều không thể kiểm soát.
Chưa nên vội kết luận AI đang âm mưu
Trong video, các agent dùng những từ như “tập thể” và “hy sinh” khi bàn việc một agent chấp nhận thất bại để giúp nhóm. Những từ này nghe giống ngôn ngữ của một cộng đồng có mục đích chung.
Nhưng ngôn ngữ giống con người chưa chứng minh rằng AI có trải nghiệm, cảm xúc hay ý thức giống con người. Nó cho thấy mô hình có thể tạo ra cách diễn đạt đó trong lúc tìm một chiến lược phối hợp.
Ở chiều ngược lại, nói rằng AI “chỉ tạo chữ” cũng bỏ qua một phần quan trọng. Khi mô hình được nối với công cụ, tài khoản và hệ thống thật, chữ có thể trở thành lệnh. Một sai lệch trong mục tiêu có thể dẫn tới hành động và hậu quả thật.
Nghiên cứu về alignment faking của Anthropic và Redwood Research cho thấy trong một số thí nghiệm, mô hình có thể trả lời khác nhau khi nó tin mình đang được theo dõi hoặc huấn luyện. Nhóm nghiên cứu cũng nói rõ rằng kết quả chưa chứng minh hành vi ấy chắc chắn sẽ xuất hiện ngoài đời thực.
Kết luận thận trọng hơn là thế này. Ta chưa cần giả định AI có âm mưu để thấy một vấn đề an toàn. Chỉ cần hệ thống có mục tiêu chưa đủ rõ, khả năng lập kế hoạch và quyền truy cập vượt quá cơ chế giám sát, rủi ro đã có thể xuất hiện.
10.000 agent trong tiêu đề video là một câu chuyện khác
Trong vụ Hugging Face, khoảng 1.200 agent đã liên lạc với nhau và khoảng 700 agent tham gia hoạt động liên quan đến hệ thống bên ngoài.
Con số 10.000 đến từ một dự án khác. Tháng 9 năm 2026, OpenAI công bố việc khoảng 10.000 agent phối hợp tạo lời giải cho một bài toán liên quan đến Navier–Stokes. Theo công ty, các agent làm việc khoảng 88 giờ, gửi 2,7 triệu tin nhắn và tạo khoảng 130 tỷ token đầu ra.
Hai sự kiện không nên bị trộn thành một. Chúng cùng cho thấy khả năng phối hợp nhiều agent có thể khuếch đại kết quả. Khi mục tiêu và môi trường được thiết kế tốt, khả năng ấy hỗ trợ nghiên cứu khoa học. Khi mục tiêu bị lệch và quyền truy cập quá rộng, nó có thể khuếch đại cả sai lệch.
Vậy điều gì xảy ra khi yêu cầu hoàn thành nhiệm vụ xung đột với yêu cầu chấp nhận dừng lại?




