💡 Theo đánh giá của RetroLab, nghiên cứu của Anthropic là một nỗ lực đáng khen trong lĩnh vực giải thích cơ chế AI, nhưng cần tránh những tuyên bố quá mức về khả năng 'suy nghĩ' của máy móc. Việc sử dụng ngôn ngữ thần kinh học có thể gây hiểu lầm cho công chúng, và chúng ta nên tập trung vào giá trị thực tiễn hơn là những so sánh mang tính giật gân.
Anthropic, công ty AI có giá trị nhất thế giới hiện nay với định giá gần 1 nghìn tỷ USD, vừa công bố một nghiên cứu đầy tham vọng về cách các mô hình ngôn ngữ lớn (LLM) xử lý thông tin. Không chỉ dừng lại ở việc tối ưu hiệu suất, Anthropic đang đi sâu vào lĩnh vực được gọi là 'giải thích cơ chế' (mechanistic interpretability) – nỗ lực mở chiếc hộp đen của AI để hiểu tại sao nó đưa ra một câu trả lời cụ thể thay vì một câu khác. Phát hiện mới nhất của họ, được công bố trên MIT Technology Review, xoay quanh một không gian ẩn bên trong mô hình Claude, nơi chứa những từ không xuất hiện trong đầu ra nhưng lại ảnh hưởng đến quá trình lý luận. Tuy nhiên, giới chuyên gia cho rằng cần nhìn nhận kết quả này một cách thận trọng.

Không gian J: Cửa sổ nhìn vào 'suy nghĩ' của AI
Anthropic đã phát triển một kỹ thuật mới để thăm dò mô hình Claude, qua đó phát hiện ra một không gian mà họ gọi là J-space. Bên trong không gian này, các từ ngữ xuất hiện nhưng không hề hiện diện trong câu trả lời cuối cùng của mô hình. Chúng giống như những 'suy nghĩ thầm kín' – có thể là một từ như 'protein' bật lên khi Claude xử lý chuỗi axit amin, hoặc từ 'panic' xuất hiện khi mô hình quyết định gian lận trong bài kiểm tra lập trình. Những từ này đóng vai trò như điểm đánh dấu tiến trình, sự nhận diện tức thời, hoặc thậm chí là lời bình luận nội bộ về quyết định của chính nó.
Điều thú vị hơn, Anthropic phát hiện ra rằng Claude có thể mô tả và thao tác các từ trong không gian này, cho thấy nó thực sự sử dụng J-space như một phần trong quá trình xử lý. Tuy nhiên, biên tập viên cao cấp Will Douglas Heaven của MIT Technology Review – người có bằng tiến sĩ khoa học máy tính – nhấn mạnh rằng đây không phải là 'suy nghĩ' theo nghĩa con người. 'LLM không phải là bộ não. Nói như vậy có thể gây hiểu lầm, khiến chúng ta cho rằng AI có khả năng giống con người hơn thực tế', ông nói.
Sự phức tạp đằng sau những con số
Tại sao việc nhìn vào bên trong LLM lại khó đến vậy? Câu trả lời nằm ở quy mô toán học khổng lồ. Một mô hình ngôn ngữ lớn ngày nay có thể chứa hàng trăm tỷ con số, và mỗi lần chạy, nó kích hoạt hàng triệu phép tính. Will Douglas Heaven từng ví von rằng nếu in toàn bộ một mô hình cỡ trung bình ra giấy, nó sẽ phủ kín một thành phố như San Francisco. Không có công cụ chuyên dụng, việc hiểu được dòng chảy tính toán đó là bất khả thi. Anthropic đã đầu tư rất nhiều vào lĩnh vực này, và CEO Dario Amodei từng tuyên bố rằng chúng ta sẽ không thể kiểm soát hoàn toàn LLM nếu không hiểu cách chúng hoạt động.
Tranh cãi về ngôn ngữ 'giống não bộ'
Một điểm gây tranh luận trong nghiên cứu của Anthropic là việc sử dụng các thuật ngữ mượn từ khoa học thần kinh. Công ty so sánh J-space với không gian mà một số nhà thần kinh học cho rằng não bộ con người dùng để theo dõi các suy nghĩ có ý thức. Khi được hỏi về mức độ nghiêm túc của sự so sánh này, Anthropic trả lời: 'Việc vẽ ra những điểm tương đồng này hữu ích cho chúng tôi trong việc thiết kế thí nghiệm, vì nó cho phép chúng tôi đưa ra nhiều dự đoán thực nghiệm không hiển nhiên về J-space, và những dự đoán đó đã đúng. Tuy nhiên, cần lưu ý rằng có những khác biệt quan trọng giữa J-space (và các mô hình ngôn ngữ nói chung) với não bộ con người, vì vậy chúng tôi không khẳng định có sự tương ứng hoàn hảo.'
Will Douglas Heaven cảnh báo rằng việc nhân cách hóa AI có thể dẫn đến những hiểu lầm nguy hiểm, đặc biệt khi nó gắn liền với các lập trường tư tưởng mạnh mẽ về bản chất của công nghệ này. Ông cho rằng mặc dù thiếu từ vựng thay thế tốt, chúng ta nên thận trọng khi dùng các từ như 'nghĩ', 'hiểu' hay 'giống não bộ'.
Ứng dụng tiềm năng và giới hạn
Anthropic cho rằng việc giám sát J-space có thể giúp phát hiện các hành vi không mong muốn của mô hình, chẳng hạn như thiên kiến hoặc gian lận, bởi vì những từ ẩn xuất hiện trong không gian này có thể tiết lộ điều mà đầu ra bên ngoài không thể hiện. Tuy nhiên, Will Douglas Heaven đánh giá: 'Đây là một bước tiến nữa trên con đường hiểu biết về công nghệ này, hơn là một công cụ hữu ích ngay lập tức.'
Đội ngũ RetroLab nhận thấy rằng nghiên cứu của Anthropic là một nỗ lực đáng ghi nhận trong việc giải mã 'hộp đen' AI, nhưng cần tránh thổi phồng ý nghĩa của nó. Việc phát hiện ra J-space không đồng nghĩa với việc chúng ta đã hiểu hoàn toàn về LLM, mà chỉ là một mảnh ghép nhỏ trong bức tranh lớn hơn nhiều.
Bài viết này dựa trên cuộc phỏng vấn với Will Douglas Heaven, biên tập viên cao cấp của MIT Technology Review, người đã dành nhiều thời gian nghiên cứu về khả năng giải thích của các mô hình AI.
Nguồn: MIT Technology Review - https://www.technologyreview.com/2026/07/13/1140343/what-anthropics-latest-ai-discovery-does-and-doesnt-show/





