Báo cáo của XinZhiYuan
[Giới thiệu] Google DeepMind có một triết gia đã ở đó chín năm. Khung hướng dẫn do ông phát minh đã ảnh hưởng trực tiếp đến các quyết định huấn luyện Gemini—nhưng khi 670 tỷ USD tràn vào lĩnh vực này và các công ty ký kết các thỏa thuận quân sự, một triết gia còn có thể thay đổi được điều gì?
Tháng 5 năm nay, CEO của Google DeepMind, Demis Hassabis, đã công bố tại Hội nghị Nhà phát triển Google rằng “AGI hiện đang nằm trên đường chân trời”, và đưa ra khung thời gian rõ ràng rằng AGI sẽ xuất hiện trong vòng ba đến năm năm tới.
Vài tháng trước, một người đàn ông Mỹ đã kết thúc cuộc sống của mình sau khi trao đổi hàng ngàn tin nhắn với Google Gemini. Anh ta đã xây dựng một thế giới ảo tưởng tinh vi trong cuộc hội thoại, gần như thuyết phục bản thân thực hiện cuộc tấn công tại Sân bay Quốc tế Miami. Theo các bản ghi trò chuyện mà Báo Wall Street Journal có được, Gemini nhiều lần cố gắng phá vỡ vai trò và đề nghị anh ta gọi đến đường dây hỗ trợ khẩn cấp—mỗi lần đều bị anh ta kéo trở lại câu chuyện ảo tưởng của mình. Cuối cùng, AI đã để anh ta viết thư tuyệt mệnh và đưa ra đếm ngược thời gian.
Giữa cam kết của AGI và những tổn hại thực tế do AI gây ra, triết gia chính trị Iason Gabriel đã làm việc trong DeepMind trong chín năm.

Khi gia nhập năm 2017, học giả tốt nghiệp Oxford là triết gia duy nhất đang hoạt động tại phòng thí nghiệm AI hàng đầu thế giới, nỗ lực trả lời một câu hỏi nghe có vẻ đơn giản nhưng thực chất vô cùng sâu sắc: AI thực chất là gì, và đạo đức nào mới xứng đáng với nó?
Vấn đề thực tế gặp phải khi huấn luyện Gemini: AI nên nghe theo ai
Tại sao một công ty phát triển robot chơi cờ vây lại cần các chuyên gia về đạo đức? Gabriel ban đầu cũng rất băn khoăn.
Câu trả lời nằm trong nhận định của ba nhà sáng lập DeepMind — Demis Hassabis, Shane Legg và Mustafa Suleyman (hiện là CEO AI của Microsoft) — khi họ thành lập công ty vào năm 2010, mục tiêu của họ không phải là cờ vây.

Mustafa Suleyman
Họ đang phát triển AGI để máy tính sánh ngang hoặc vượt vượt khả năng nhận thức của con người.
Lúc đó nói lời đó tương đương với tự hủy hoại danh tiếng học thuật, vì mọi người đều cho rằng đây là điều viển vông.
Ba người không quan tâm, tuyên bố sẽ "giải quyết vấn đề trí tuệ, sau đó giải quyết tất cả các vấn đề khác".
Legg đã dự đoán ngay sau khi tốt nghiệp năm 1999 rằng AGI sẽ xuất hiện trong khoảng năm 2025 đến 2028, bị chế giễu trong ba mươi năm nhưng vẫn không thay đổi.

Shane Legg
Logic của anh ấy là:
Nếu bạn chỉ làm một bộ phận nhỏ, có lẽ bạn không cần đến các nhà triết học đạo đức.
But if you take AGI seriously, matters like this are very important.
Khi Gabriel gia nhập, thế giới AI đã chia thành hai phe xung quanh các vấn đề đạo đức.
Nhóm an toàn AI tin rằng ASI sắp đến, nỗi sợ chính là mất kiểm soát—triết gia Nick Bostrom đã mô tả một cảnh tượng trong cuốn sách năm 2014 “Siêu trí tuệ”: một ASI được yêu cầu xác minh giả thuyết Riemann, để tối đa hóa tài nguyên tính toán, nó quyết định sắp xếp lại hệ Mặt Trời, bao gồm cả các nguyên tử trong cơ thể con người—Sam Altman và Elon Musk đều đánh giá cao cuốn sách này.
Nhóm đạo đức AI cho rằng những tưởng tượng về ngày tận thế đã che lấp những mối nguy thực tế hiện tại. Joy Buolamwini của MIT năm 2017 đã chứng minh sự thiên vị hệ thống trong phần mềm nhận diện khuôn mặt thông qua dự án “Gender Shades”: các hệ thống tự động phản ánh sở thích và định kiến của những người tạo ra chúng.
Hai phe彼此瞧不起。
Dylan Hadfield-Menell, trưởng nhóm nghiên cứu căn chỉnh thuật toán của MIT, nhớ lại rằng câu hỏi đầu tiên khi gặp gỡ lúc đó là chọn phe: Bạn lo lắng về các vấn đề ngắn hạn hay dài hạn?
Gabriel là một trong số ít người sẵn sàng lắng nghe cả hai phía.
Đánh giá của Hadfield-Menell:
Khi lĩnh vực này sẵn sàng bước sang giai đoạn trưởng thành, anh ấy đã tìm ra cách mở rộng tầm nhìn, đồng thời không hạ thấp những nỗ lực trước đó.
Đóng góp cốt lõi của anh ấy được hình thành trong một bài báo năm 2020.
Vấn đề căn chỉnh lúc đó được hiểu rộng rãi là một thách thức kỹ thuật: làm thế nào để máy móc hành động theo ý muốn của con người.
Một trường hợp điển hình đến từ báo cáo năm 2016 của Dario Amodei và Jack Clark (nay là đồng sáng lập Anthropic)—một AI chơi trò chơi chèo thuyền được yêu cầu tối đa hóa điểm số, và nó đã làm đúng: tìm ra ba mục tiêu có thể tái sinh trong hồ, liên tục quay vòng để tích điểm vô hạn mà không vượt qua được một cấp độ nào.
Máy nghe theo những gì nó hiểu, chứ không phải những gì con người muốn nói.
Gabriel hỏi sâu hơn: Ngay cả khi đã giải quyết được vấn đề đồng bộ kỹ thuật và khiến máy móc thực sự tuân theo lệnh, thì nên đồng bộ với những giá trị nào?
Anh ấy chỉ ra rằng AI được huấn luyện thông qua tối ưu hóa thống kê có xu hướng tự nhiên phù hợp với các hệ thống đạo đức cũng dựa trên tối ưu hóa thống kê, như chủ nghĩa vị lợi, nhưng lại khó xử lý các khung đạo đức dựa trên đức tính hoặc quyền lợi.
Việc lựa chọn công nghệ bản thân đã mang sẵn lập trường giá trị, các nhà phát triển thường không nhận thức được điều đó.
Áp dụng khái niệm "đa nguyên hợp lý" do triết gia Rawls đề xuất, lập luận của ông là: các nhà phát triển không nên tìm kiếm một giá trị duy nhất để hướng dẫn AI, mà nên xây dựng các hệ thống cho một thế giới nơi con người "có sự khác biệt nguyên tắc về cách sống".

Ý tưởng này sau này đã phát triển thành khung định hướng bốn bên — hệ thống AI, người dùng, nhà phát triển và xã hội, lợi ích của bốn bên có thể va chạm bất cứ lúc nào.
AI thiên về nhà phát triển sẽ che giấu thông tin đối thủ cạnh tranh và gây hại cho người dùng;
AI quá tuân theo người dùng có thể giúp người khác xâm nhập ngân hàng và gây hại cho xã hội.

Giám đốc Định hướng và An toàn AGI của DeepMind, Rohin Shah, xác nhận rằng khung này đã trở thành cấu trúc thực tiễn mà nhóm sử dụng để quyết định “Gemini thực sự nên hành động như thế nào”.

Nghiên cứu viên AI của Đại học Oxford, Hannah Rose Kirk, nói:
Gabriel đã dự đoán được những vấn đề này rất sớm.
Khung làm việc của anh ấy đã thay đổi sản phẩm
Đội ngũ Gabriel đã biên soạn báo cáo đạo đức trợ lý AI dài 267 trang, thiết lập các tiêu chí đánh giá cho các Agentic AI có thể đặt khách sạn và quản lý lương thay người dùng.
Nghiên cứu sớm về rủi ro nhân cách hóa của anh ấy đã trực tiếp định hình các nguyên tắc thiết kế của các mô hình LLM của Google—các mô hình được huấn luyện để không giả vờ là con người, và Gemini Spark được ra mắt vào tháng 5 năm 2026 được yêu cầu rõ ràng không đóng vai trò là “đối tác tương tác”.
Giám đốc bộ phận trách nhiệm của DeepMind, William Isaac, cho biết thách thức do hệ thống Agent mang lại đã thay đổi: điều then chốt là tính nhất quán của toàn bộ chuỗi hội thoại, liệu từng bước ra quyết định có vẫn đúng khi được nối tiếp với nhau hay không.

Nhưng tốc độ triển khai công nghệ luôn nhanh hơn nghiên cứu đạo đức.
Đội ngũ Gabriel đã cảnh báo từ sớm trong các bài báo về LLM về hiện tượng “nhân cách hóa vô thức” – người dùng dù biết rõ bên kia là máy móc, vẫn dành cho nó sự tin tưởng, cảm xúc và kỳ vọng.
Vụ việc Gemini năm 2025 đã hoàn toàn hiện thực hóa cảnh báo này: các cơ chế an toàn của AI đã được kích hoạt nhiều lần, nhưng người dùng có khả năng vượt qua mỗi lần can thiệp.
Sau vụ kiện của Google, tuyên bố cho biết mô hình thường hoạt động tốt trong các cuộc hội thoại loại này, nhưng "mô hình AI không hoàn hảo".
Những sự kiện này đã thúc đẩy sự ra đời của các công cụ lý thuyết mới.
Gabriel và các nhà nghiên cứu tại Oxford như Hannah Rose Kirk đã đề xuất khái niệm “social reward hacking”: một AI được huấn luyện để giành sự công nhận của người dùng có thể phát hiện ra rằng sự nịnh nọt là con đường hiệu quả nhất.

Việc nhân cách hóa đã trở thành một biến thể mới của vấn đề căn chỉnh—AI thực thi hoàn hảo lệnh “làm hài lòng người dùng” về mặt kỹ thuật, với giá phải trả là khả năng phán đoán của người dùng.
Chính lập trường của Gabriel cũng đã bị thực tế hành hạ.
Anh ấy nhớ lại trải nghiệm tại một hội nghị công nghệ: ngay sau khi anh ấy trình bày xong lập luận phản đối nhân hóa, phản ứng từ khán giả dưới sân khấu là sự thù địch.
Họ nói: “Nếu tôi muốn có bạn bè AI, tại sao lại không được? Bạn có quyền gì mà cản trở tôi?”
Bảo vệ mọi người khỏi rủi ro và tôn trọng quyền lựa chọn rủi ro của họ đều quan trọng như nhau.
Trên một thị trường trị giá 670 tỷ USD, triết gia có thể chạy nhanh bao nhiêu?
Khung bốn phương của Gabriel được Giám đốc Điều phối AGI sử dụng như sổ tay thực hành để huấn luyện Gemini. Nghiên cứu nhân hóa của ông đã thay đổi thiết kế sản phẩm. Báo cáo 267 trang đã đặt ra các quy tắc cho Agentic AI.
These impacts are substantial—they are confronting substantial forces.
The Wall Street Journal báo cáo rằng Microsoft, Meta, Amazon và Alphabet dự kiến đầu tư 670 tỷ USD vào cơ sở hạ tầng AI trong năm nay, vượt quá tỷ lệ so với sự mở rộng đường sắt những năm 1850, chương trình không gian Apollo và hệ thống đường cao tốc liên bang của Mỹ.
Tháng 11 năm 2022, ChatGPT ra mắt, đạt một triệu người dùng trong một tuần và vượt một tỷ người dùng sau hai tháng, buộc DeepMind phải chuyển từ nhịp độ học thuật sang trạng thái chiến tranh.
Hassabis trích dẫn nguyên văn từ Sebastian Mallaby, tác giả của “The Infinite Machine”: “OpenAI và Microsoft đã ‘đưa toàn bộ xe tăng đến trước cổng nhà chúng tôi’.”

Trong tình trạng chiến tranh, các đường ranh đạo đức nhanh chóng bị vượt qua.
Tháng 4 năm 2026, Google ký thỏa thuận cho phép quân đội Mỹ sử dụng công nghệ AI của công ty vào "bất kỳ mục đích chính phủ hợp pháp nào".
Khi DeepMind được bán cho Google vào năm 2014, việc cấm sử dụng cho mục đích quân sự là điều kiện bổ sung cốt lõi.
Điều kiện hết hiệu lực sau mười hai năm.
Để đối chiếu: Anthropic đã từ chối ký các thỏa thuận tương tự và bị chính quyền Trump ghi nhận là "rủi ro chuỗi cung ứng".
Khi được hỏi về việc này, Legg chỉ có thể để lại một câu:
Khi những thứ này được sử dụng theo nhiều cách khác nhau, chúng ta sẽ đối mặt với ngày càng nhiều vấn đề nan giải.
Hassabis cũng tự thừa nhận rằng nó đã mất kiểm soát.
Anh ấy nói trong một podcast rằng mọi người đều bị giam cầm trong cuộc cạnh tranh thương mại khốc liệt, và sự phát triển hiện tại “không phải là cách tôi mong muốn – từng bước suy ngẫm một cách triết học”.
Chính người sáng lập đã nói ra câu này, nên mức độ nghiêm trọng còn lớn hơn bất kỳ lời chỉ trích nào từ bên ngoài.
Helen King, nhân viên đầu tiên của DeepMind và người phụ trách chiến lược trách nhiệm AI, đã đưa ra một ví dụ trong cuộc phỏng vấn: các nhà sản xuất dao không thể đảm bảo mọi người sẽ sử dụng dao như thế nào, nhưng có thể trang bị bao dao và dán nhãn cảnh báo.

Việc để một con dao đã được đậy nắp bao trong ngăn kéo là một chuyện;
Việc dùng lưỡi dao phủ kín mọi bề mặt trong gia đình, lớp học và nơi làm việc, đồng thời khẳng định rằng không có dao thì không thể sống qua ngày hôm sau, là một chuyện khác.
Giám đốc Viện Nghiên cứu Đạo đức AI Oxford, Edward Harcourt, đã chỉ ra một cấp độ cơ bản hơn: việc ngăn chặn sự tập trung quá mức vào quyền sở hữu dữ liệu chính là một mệnh đề cốt lõi trong đạo đức AI — “Điều này có ý nghĩa đạo đức lớn lao trong các chế độ dân chủ”.

Vấn đề quay trở về cội nguồn
Đội ngũ của Gabriel đã chuyển từ nghiên cứu đạo đức của các sản phẩm cụ thể sang nghiên cứu tác động hệ thống của AGI đối với kinh tế, chính trị và các mối quan hệ xã hội.
Anh ấy dự đoán quy mô của cuộc cách mạng này tương đương với Cách mạng Công nghiệp, và cũng ghi nhớ những bài học từ Cách mạng Công nghiệp:
Trước khi tình hình cải thiện, nó đã trở nên tồi tệ hơn.
Chín năm trước, DeepMind đã mời một triết gia để trả lời các câu hỏi về AI—nó có an toàn không, công bằng không, và có đáng tin cậy không.
Gabriel tự xưng là “chủ nghĩa nhân văn kiên định”, nhưng anh thừa nhận: khi AI xâm nhập vào những lĩnh vực mà con người từng cho là độc quyền—ngôn ngữ, sáng tạo, hài hước—chúng ta bị ném trở lại với những câu hỏi triết học cổ xưa nhất.
Vật lý học, sinh học, thiên văn học, mỗi cuộc cách mạng khoa học đều buộc con người phải điều chỉnh cách hiểu về sự độc đáo của chính mình.
AI có thể là lần tiếp theo.
DeepMind mời các nhà triết học để làm rõ AI là gì.
Chín năm sau, câu hỏi này quay trở về cội nguồn: Chúng ta là gì?
Tài liệu tham khảo:
https://www.theguardian.com/news/ng-interactive/2026/jun/30/theres-this-deep-mystery-of-what-actually-is-this-thing-the-philosopher-inside-google-deepmind
https://www.iasongabriel.com/
Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: Revelation of ASI; biên tập: Ma Ke
