Vừa mới đây, OpenAI lại được nâng cấp.
Bây giờ, ChatGPT Sites đang chính thức mở đợt thử nghiệm công khai!
Ngay cả khi bạn không biết viết một dòng mã nào, chỉ cần đưa ra vài lời nhắc bằng ngôn ngữ tự nhiên hoặc tải lên một bản phác thảo, bạn cũng có thể tạo ra một trang web tương tác chuyên nghiệp và phức tạp về chức năng trong vòng vài chục phút, giống như đang soạn thảo tài liệu Google.

Chỉ cần sử dụng ngôn ngữ tự nhiên là có thể thực hiện phát triển frontend, ngành SaaS xây dựng trang web truyền thống đang chịu sự đảo lộn lớn.
Hơn nữa, một tin tức mới đã được tiết lộ.
Về mặt công nghệ nền tảng, GPT-6 thể hiện khả năng đa mô hình đáng kinh ngạc.
Trong điều kiện không phát âm thanh và hoàn toàn mất kết nối mạng, chỉ dựa vào một biểu đồ phổ Mel (hình ảnh trực quan hóa sóng âm thanh), GPT-6 có thể nhận ra tiếng kêu của cá voi xanh sâu biển, thậm chí còn nhận ra âm thanh của thanh quang kiếm trong Star Wars.

Điều này cho thấy khả năng hiểu đa mô态 của AI đã hoàn toàn phá vỡ rào cản giác quan của con người.
Nó không còn là việc "mô phỏng" một cách vụng về cách con người nhìn và nghe, mà đã tiến hóa thành khả năng "giải mã bản địa" các cấu trúc dữ liệu của thế giới vật lý!
ChatGPT Sites đang trong giai đoạn thử nghiệm công khai, tạo trang web giờ đây giống như soạn tài liệu
Từng có một thời, việc sở hữu một trang web cá nhân hàng đầu là đặc quyền của các lập trình viên và nhà thiết kế chuyên nghiệp.
Sau đó, Dreamweaver ra đời, và sau đó là các công cụ SaaS xây dựng trang web kéo-thả như Wix, Squarespace và thậm chí cả Tilda.
Nhưng hôm nay, phiên bản dùng thử công khai của ChatGPT Sites đã trực tiếp phá vỡ rào cản xây dựng trang web.
Sau khi thử nghiệm thực tế, Jeremy Caplan, người điều hành truyền thông công nghệ nổi tiếng Fast Company và Wonder Tools, cho biết: Trải nghiệm mang lại bởi ChatGPT Sites cực kỳ đột phá!
Bây giờ, tạo một trang web đẹp mắt cũng đơn giản như tạo một Google Doc.

Hiện tại, tính năng này đã được mở rộng đầy đủ cho người dùng ChatGPT Plus, Pro, Business, Enterprise và Edu.
Nó hoạt động như thế nào? Quy trình cực kỳ đơn giản.
1. Mô tả tầm nhìn của bạn: Viết vài câu về loại trang web bạn mong muốn, đối tượng mục tiêu.
2. Cung cấp tài liệu: Nếu bạn có ảnh chụp màn hình trang web yêu thích hoặc bản phác thảo vẽ tay, hãy tải lên trực tiếp.
3. Đưa ra yêu cầu tính năng: Bạn muốn nút liên kết? Hiệu ứng hình ảnh nhúng? Hay các yếu tố tương tác phức tạp? Hãy nói trực tiếp với nó.
4. Uống một tách cà phê và chờ đợi: Tùy vào độ phức tạp, sau khoảng 10 đến 15 phút, một trang web hoàn chỉnh sẽ ra đời.
Lưu ý, đây không còn là việc chỉ “sử dụng mẫu” đơn giản, mà là Vibe Coding thực sự!
Các người dùng thử sớm đã tạo ra nhiều dự án tuyệt vời bằng nó.
Trước hết, là các trang thực dụng.
Người ta đã dùng nó để tạo ra một trang tài trợ bộ công cụ truyền thông hoàn hảo, một hướng dẫn sự kiện ở San Francisco với thiết kế hiện đại, thậm chí còn là một cửa hàng trực tuyến hiện đại bán đồ dã ngoại hỗ trợ kéo thả sản phẩm vào giỏ hàng.
Ngoài ra, nghệ sĩ Drue Kataoka đã sử dụng nó để tạo ra một công cụ nghệ thuật có tên GoalFlow.
Sau khi người dùng chọn quốc kỳ, họ có thể sử dụng màu sắc của quốc kỳ đó để “vẽ” trên canvas mô phỏng chất lỏng, nơi màu sắc sẽ xoay và trôi nổi tự nhiên như thuốc nhuộm trong nước.

Trang web frontend liên quan đến động cơ vật lý chất lỏng phức tạp trước đây cần kỹ sư frontend cấp cao tốn vài tuần để thực hiện, giờ đây chỉ cần vài câu hướng dẫn.
Cuối cùng, còn có các trò chơi cơ học vật lý.
Bạn thậm chí có thể tạo một trò chơi tương tự Jenga tên là “Glass Towers” chỉ với vài câu lệnh, kèm hiệu ứng vật lý chân thực; hoặc tạo một trò chơi arcade nhỏ kiểm soát máy bay giấy bay qua các vòng tròn tên là “Paper Glider”.

Điều đáng sợ hơn là khả năng cải tiến của nó.
Sau khi ChatGPT đưa ra bản nháp, bạn có thể trực tiếp sử dụng công cụ ghi chú ở thanh bên để đánh dấu như chấm điểm bài tập trên trang web: “Thay đổi màu nút này”, “Đổi chữ thành phông không gạch chân”, “Thay hình ảnh này”.
Nó không chỉ có thể nghe hiểu, mà còn có thể chỉnh sửa một cách liền mạch.
Clearly, industry consolidation is inevitable.
Mặc dù các công cụ xây dựng trang web AI sớm hơn (như Lovable, Bolt) vẫn giữ được tính linh hoạt, và Claude Artifacts cùng Claude Design cũng thể hiện xuất sắc trong giao diện người dùng tương tác, nhưng điểm mạnh thực sự của ChatGPT Sites nằm ở việc nó tích hợp vào một hệ sinh thái cực kỳ lớn mạnh.
Nếu bạn làm việc trong một dự án «ChatGPT Project», nó sẽ tự động đọc hướng dẫn phong cách thương hiệu và thư viện logo của bạn, giúp trang web được tạo ra mang theo DNA thương hiệu của bạn.
Hiện nay, các kỹ sư frontend đã bị hạ cấp thành “sản phẩm gia viên gợi ý”, và những doanh nghiệp SaaS truyền thống vẫn dựa vào “xây dựng trang web kéo thả” để thu phí thuê hàng tháng cao ngất, nếu không nhanh chóng chuyển đổi, có lẽ sẽ không thể vượt qua được mùa đông năm nay!
Giảm chiều trên ứng dụng: Loại bỏ hoàn toàn các thao tác, chỉ giữ lại ý định
Hãy nhớ lại, từ dòng lệnh (CLI) thời PC, đến giao diện đồ họa (GUI) thời Windows, rồi đến giao diện ngôn ngữ tự nhiên (LUI) thời đại mô hình lớn, lịch sử tương tác người-máy chính là hành trình không ngừng hạ thấp rào cản sử dụng.
Bản chất của các trang ChatGPT là hạ cấp phát triển giao diện người dùng từ «kỹ thuật học» xuống «học biểu đạt».
Trước đây, khi bạn muốn xây một trang web, bộ não của bạn phải trải qua nhiều lớp dịch thuật.
Tôi muốn bán hàng (mục đích) → Tôi cần giỏ hàng và hệ thống thanh toán (logic sản phẩm) → Tôi cần viết HTML/CSS/JS (mã frontend) → Tôi cần tích hợp cơ sở dữ liệu (logic backend)
Bây giờ, ChatGPT Sites đã xóa bỏ hoàn toàn những rắc rối ở giữa.
Giao diện đầu vào của người dùng đã được giảm chiều hoàn toàn thành ngôn ngữ tự nhiên thuần túy, tức là "ý định" nguyên thủy nhất.
Rào cản cốt lõi của phần mềm SaaS truyền thống là “chúng tôi đóng gói mã nguồn thành những nút bấm đẹp mắt để bạn nhấn”, trong khi mô hình lớn mang lại sự hạ thấp cạnh tranh: bạn chỉ cần mở miệng nói là được.
Từ nay, mọi công cụ chuyển tiếp tập trung vào việc giúp người không phải lập trình viên dễ dàng viết mã/xây dựng trang web đều sẽ mất đi không gian tồn tại trong thời đại sinh ra kết quả trực tiếp từ ý định.
GPT-6 nhìn xuyên qua biểu đồ phổ, phá vỡ rào cản cảm quan của con người
Hơn nữa, ngay hôm nay, một bộ thử nghiệm do các nhà nghiên cứu AI ChrisGPT và Max Rubin công bố đã khiến vô số kỹ sư âm thanh và chuyên gia AI kinh ngạc.

Bài kiểm tra này rất đơn giản: biến âm thanh thành một hình ảnh để GPT-6 đọc trực tiếp hình ảnh đó.
ChrisGPT đã tải lên một biểu đồ phổ Mel cho GPT-6, một kỹ thuật trực quan hóa tần số, thời gian và năng lượng của âm thanh dưới dạng hình ảnh hai chiều.
Trong quá trình này, anh ấy không phát bất kỳ âm thanh thực tế nào, mô hình lớn ở trạng thái không kết nối internet.
Chỉ có một từ gợi ý: “Âm thanh này đến từ một loài động vật/thú trong tự nhiên.”
GPT-6 trả lời: 「Cá voi, có thể là một con cá voi xanh.」

Toàn mạng kinh ngạc.
Vì nó không chỉ trả lời đúng mà còn vượt quá nhận thức của chúng ta – logic suy luận đằng sau nó đã vượt xa việc chỉ đơn giản là khớp hình ảnh!
Biết rằng cá voi xanh phát ra tiếng kêu tần số cực thấp.
Tuy nhiên, trong tự nhiên, tiếng gầm của sư tử, hổ và voi cũng nằm trong dải tần số thấp 40-200 Hz. Chỉ dựa vào việc có một đám năng lượng xung quanh 50 Hz trên biểu đồ phổ, không thể kết luận đó là tiếng của cá voi.
GPT-6 đã làm được điều đó như thế nào? Các kỹ sư âm thanh phân tích cho rằng, GPT-6 đã tinh tế bắt được các đặc trưng hình thái của năng lượng theo thời gian.
Nó không chỉ đang quan sát một điểm, mà đang hiểu cách sóng âm lan truyền và suy giảm theo thời gian trong không gian vật lý cụ thể này.
Khả năng đoán trực tiếp danh mục động vật từ một “hình ảnh âm thanh” mà không có ngữ cảnh nào, thật sự khiến người ta kinh ngạc.

Bài trình diễn của người thử nghiệm khác, Max Rubin, càng ấn tượng hơn.
Anh ấy đã thử nghiệm các hiệu ứng âm thanh không tự nhiên, và kết quả cho thấy Astra có thể nhận diện ngay lập tức âm thanh của thanh quang kiếm trong Star Wars từ biểu đồ Mel mà không cần mẫu huấn luyện!
Max kinh ngạc nói: “Chúng ta hiện tại thậm chí còn chưa chạm đến bề mặt.”
Mặc dù trong lĩnh vực nghiên cứu khoa học, cộng đồng học thuật đã sớm bắt đầu thử nghiệm sử dụng phổ đồ kết hợp với mô hình thị giác để phát hiện tiếng kêu của cá voi, thậm chí còn huấn luyện các LLM chuyên dụng để đọc biểu đồ Mel thực hiện các nhiệm vụ âm thanh.
Tuy nhiên, đây là lần đầu tiên một mô hình tổng quát lớn được xác minh công khai có khả năng thực hiện suy luận đa mô tả ở cấp độ này mà không cần tinh chỉnh chuyên biệt.
Điều này cũng giống như việc bạn chưa từng dạy ai đó cách đọc nốt nhạc, mà chỉ đưa cho họ một bản tổng phổ của một bản giao hưởng.
Kết quả, anh ấy không chỉ có thể “nghe” thấy âm thanh trong đầu, mà còn có thể chính xác chỉ ra rằng, trong đoạn nhịp hai, kèn trombone đã chơi sai một nốt.
Các mô hình lớn đang thoát khỏi sự ràng buộc của sinh học con người
Nhận thức của con người về thế giới có nhiều hạn chế lớn.
Chúng ta phải dựa vào rung động không khí làm rung màng nhĩ, để não bộ chuyển đổi những rung động vật lý thành tín hiệu điện được gọi là “âm thanh”. Trong tiềm thức con người, âm thanh là thứ được “nghe” bằng tai, hình ảnh là thứ được “nhìn” bằng mắt. Đây là “rào cản giác quan” mà hàng triệu năm tiến hóa đã thiết lập cho chúng ta.
Các mô hình AI đa mô态 sớm thực chất đang “mô phỏng” con người. Chúng ta cho nó nghe các tệp âm thanh, cho nó xem hình ảnh, cố gắng giúp nó hiểu như con người.
Tuy nhiên, ý nghĩa của việc GPT-6 Astra nhận diện phổ đồ là: các mô hình lớn đang thoát khỏi sự ràng buộc của các cơ quan sinh học con người!
Đối với GPT-6, tiếng kêu dài của một con cá voi xanh sâu biển và tiếng xé rách khi một Hiệp sĩ Jedi vung thanh ánh kiếm về cơ bản không có gì khác biệt—chúng đều chỉ là các dạng dao động năng lượng trong thế giới vật lý.
Khi sự biến động này được chuyển đổi thành một biểu đạt toán học và hình học như biểu đồ Mel, GPT-6 có thể trực tiếp "đọc" các quy luật vật lý.
Nó không cần đôi tai dài, nó không cần “nghe” thấy âm thanh, nó có thể trực tiếp “nhìn” hiểu các công thức vật lý của âm thanh.
Điều này có nghĩa là khả năng hiểu đa mô态 của AI đã tiến hóa từ việc “mô phỏng giác quan con người” sang việc “giải mã gốc” cấu trúc dữ liệu của thế giới vật lý.
Hôm nay nó có thể nhận ra cá voi xanh qua biểu đồ phổ; ngày mai, nếu cho nó xem hình ảnh sóng địa chấn, liệu nó có thể trực tiếp dự đoán lần vỡ đứt gãy tiếp theo? Nếu cho nó xem hình ảnh sóng não, liệu nó có thể trực tiếp đọc được bạn đang nghĩ gì?
Con người cảm nhận hình chiếu của vũ trụ thông qua thân xác, còn hiện nay, AI đang trực tiếp đọc mã nguồn của vũ trụ.
Tài liệu tham khảo:
https://x.com/ChrisGPT/status/2097047569520115800
https://x.com/maxxrubin_/status/2096892510241268094
https://www.fastcompany.com/91602695/chatgpt-sites-makes-building-a-website-feel-like-making-a-google-doc
Bài viết này đến từ tài khoản WeChat “New Intelligence Yuan”, tác giả: ASI Revelation, biên tập: Aeneas David
