さきほど、OpenAIがさらに進化しました。
注目のChatGPT Sitesがいよいよパブリックベータを開始!
たとえ一行のコードも書けなくても、自然言語での簡単な指示を数行与えるだけで、またはスケッチをアップロードするだけで、Googleドキュメントを書くように、わずか十数分で高度で機能豊かなインタラクティブなウェブサイトを生成できます。

自然言語だけでフロントエンド開発が可能になり、従来のウェブサイト構築SaaS業界は大きな打撃を受けています。
また、新たな情報が流れています。
底层技術面で、GPT-6は驚異的なマルチモーダル能力を示しています。
音声の再生なし、完全なネット切断状態で、GPT-6はMelスペクトログラム(音声の波形の可視化画像)のみから、深海のクジラの鳴き声を識別でき、さらに『スター・ウォーズ』のライトセーバーの音効まで判別できる。

これは、AIのマルチモーダル理解が人間の感覚の壁を完全に突破したことを示している。
それは、人間の視覚と聴覚を拙劣に「模倣」するのではなく、物理世界のデータ構造に対する「ネイティブなデコード」能力へと進化した!
ChatGPT Sitesのベータテスト開始。ウェブサイト構築がドキュメント作成のように簡単に
かつて、一流の個人ウェブサイトを持つことは、プログラマーや専門デザイナーの特権だった。
その後、Dreamweaverが登場し、さらにその後、Wix、Squarespace、Tildaなどのドラッグアンドドロップ式のWebサイト構築SaaSツールが登場しました。
しかし今日、ChatGPT Sitesのパブリックベータ版が、ウェブサイト構築の障壁を一気に打ち破った。
有名なテクノロジーメディアFast CompanyおよびWonder Toolsの運営者Jeremy Caplanが実測したところ、ChatGPT Sitesによる体験は非常に革新的であると評価しました。
今や、美しいウェブサイトを作成することは、Googleドキュメントを作成するのと同じくらい簡単です。

現在、この機能はChatGPT Plus、Pro、Business、Enterprise、Eduユーザーに全面的に開放されています。
それはどのように機能しますか?プロセスは非常に簡単です。
1. あなたのビジョンを説明してください:希望するウェブサイトのタイプ、ターゲット層を数文で書き下してください。
2. マテリアルをアップロードしてください:お気に入りのウェブページのスクリーンショットや手書きのスケッチがあれば、そのままアップロードしてください。
3. 提出機能要件:リンクボタンが欲しい?埋め込みビジュアル効果?それとも複雑なインタラクティブ要素?直接お知らせください。
4. コーヒーを飲みながらお待ちください:複雑さによりますが、約10〜15分後には完全なウェブサイトが完成します。
注意してください。これはもはや単なる「テンプレートを適用する」ことではなく、本物のVibe Codingです!
早期のテスト参加者たちは、すでに数多くの優れたプロジェクトを生み出しています。
まず、実用的なページです。
誰かがそれを使用して、完璧なメディアキットスポンサーページや、現代的なデザインのサンフランシスコイベントガイド、さらには商品をドラッグアンドドロップでカートに追加できる現代的なピクニック用品オンラインストアを作り出しました。
また、アーティストのDrue Kataokaは、これを用いて「GoalFlow」というアート制作ツールを生成しました。
ユーザーが国旗を選択すると、流体シミュレーションキャンバス上でその国旗の色を使って「描画」でき、顔料は水中の染料のように自然に回転し、漂います。

過去、このような複雑な流体物理エンジンを含むフロントエンドページの作成には上級フロントエンドエンジニアが数週間を要していましたが、今ではわずか数つのプロンプトで済みます。
最後に、物理エンジンゲームがあります。
あなたは、リアルな物理効果を備えたジャイアント・タワーのようなゲーム《Glass Towers》をわずか数行のコードで作ることもできます。あるいは、紙飛行機を輪を通すアーケードゲーム《Paper Glider》を作ることも可能です。

より恐ろしいのはその反復能力です。
ChatGPTが原稿を提示した後、サイドバーの「注釈ツール」を使って、ウェブページ上に丸を描いて「このボタンの色を変えてください」、「このフォントをセリフなしフォントに変更してください」、「この画像を差し替えてください」といった指示を直接行えます。
それは理解できるだけでなく、シームレスに修正できます。
明らかに、業界の再編は避けられません。
早期のAIサイト構築ツール(Lovable、Boltなど)は依然として柔軟性を有しているが、ClaudeのArtifactsやClaude DesignもインタラクティブUIで優れた性能を発揮している。しかし、ChatGPT Sitesの真の強みは、非常に広大なエコシステムとの統合にある。
「ChatGPT Project」で作業している場合、それは自動的にあなたのブランドスタイルガイドやロゴライブラリを読み取り、生成されたウェブサイトには自然にあなたのブランドのDNAが反映されます。
現在、フロントエンドエンジニアは「プロンプト製品マネージャー」に降格されてしまった。一方、「ドラッグアンドドロップでウェブサイト構築」を手がけ、高額な月額料金を徴収してきた従来のSaaS企業が迅速に転換できない場合、今年の冬を乗り越えられないだろう!
アプリ側の次元削減:「操作」を完全に排除し、「意図」のみを残す
PC時代のコマンドライン(CLI)から、ウィンドウ時代のグラフィカルユーザーインターフェース(GUI)へ、そして現在の大規模モデル時代の自然言語インターフェース(LUI)へ至るまで、人間とコンピュータのインタラクションの歴史は、操作のハードルを常に低くしていった歴史である。
ChatGPTサイトの本質は、フロントエンド開発を「工学」から「表現学」へ次元を下げることである。
過去、あなたがウェブサイトを構築するには、脳が複数の段階で翻訳を経なければならなかった。
物を売りたい(意図)→ カートと支払いシステムが必要(製品ロジック)→ HTML/CSS/JSを書く必要がある(フロントエンドコード)→ データベースと連携する必要がある(バックエンドロジック)
今、ChatGPT Sitesは中间の手間をすべて取り除きました。
ユーザーの入力は、純粋な自然言語、つまり最も原始的な「意図」にまで次元が削減された。
従来のソフトウェアSaaSの核心的な壁は「我々がコードを見やすいボタンに封じ込めて、あなたがクリックできるようにした」ことだが、大規模モデルによる次元圧縮の打撃は、あなたがただ口を開いて話すだけで済むということだ。
これより、非プログラマーがコードやウェブサイトを簡単に作成するための過渡的なツールは、意図を直接結果に生成する「エンドツーエンド」生成時代において、生存空間を失う。
GPT-6はスペクトログラムを一目で見抜き、人間の感覚の壁を突破する
そして、本日、AI研究者ChrisGPTとMax Rubinが発表した一連のテストが、無数のオーディオエンジニアとAI従事者を震撼させました。

このテストは簡単です:音声を画像に変換し、GPT-6に直接画像を読み込ませます。
ChrisGPTは、音声の周波数、時間、エネルギーを二次元画像として可視化する技術であるメルスペクトログラムをGPT-6にアップロードしました。
その過程で、彼は実際の音声を再生せず、大規模モデルはオフライン状態でした。
唯一のヒントは、「この音は自然界の動物・哺乳類からのものです。」
GPT-6は次のように回答しました:「鯨、おそらくクジラです。」

世界中が驚きました。
なぜなら、それは正解にとどまらず、私たちの認識を超えており、その背後にある推論ロジックは単なる画像マッチングを超えているからです!
ブルーウェールは非常に低周波の鳴き声を発します。
しかし自然界では、ライオン、トラ、ゾウの鳴き声も同様に40〜200ヘルツの低周波領域にあります。スペクトログラム上で50ヘルツ付近にエネルギーの塊があるだけでは、それがクジラであるとは断定できません。
GPT-6はどのようにしてそれを実現したのか?オーディオエンジニアの分析によると、GPT-6は「時間とともに継続するエネルギーの形態的特徴」を鋭く捉えた。
それは一点を見ているのではなく、この特定の物理空間において音波が時間とともにどのように流れ、減衰するかを理解することです。
極めて限られた文脈の中で、音の画像からゼロショットで動物の種類を当てられるという能力は、非常に驚異的である。

もう一人のテスト担当者、マックス・ルビンのデモはさらに印象的だった。
非自然音響をテストしたところ、AstraはMelスペクトログラムからゼロショットで『スター・ウォーズ』のライトセーバーの振り回す音を識別できました!
マックスは「我々はまだ表面にも触れていない。」と驚いた。
研究分野では、学術界はすでにスペクトログラムと視覚モデルを組み合わせてクジラの鳴き声を検出する試みを始め、さらにはMel図を読み取って音声タスクを実行するための専用LLMを訓練しています。
しかし、これは、特別な微調整なしに、このようなレベルのマルチモーダル推論を実行することが公に確認された、初の汎用大規模モデルです。
これは、あなたが誰かに楽譜の読み方を教えたことがなく、ただ交響楽の総譜を見せたようなものだ。
その結果、彼は頭の中で音を「聴く」だけでなく、第2小節のトロンボーンが1つの音を間違えたことを正確に指摘できるようになった。
大規模モデルは、人間の生物学的制約から脱却しつつある
人間の知覚する世界には大きな限界がある。
私たちは空気の振動によって鼓膜を振動させ、脳がその物理的振動を「音」の電気信号に変換しなければなりません。人間の無意識には、音は耳で「聞く」ものであり、画像は目で「見る」ものという概念が刻まれています。これは数百万年の進化によって私たちに組み込まれた「感覚の壁」です。
初期のマルチモーダルAIは、実際には人間を「模倣」していました。私たちは音声ファイルを聞かせ、画像を見せることで、人間のように理解させようとしてきました。
しかし、GPT-6 Astraがスペクトログラムの意味を認識することの意義は、大規模モデルが人間の生物学的器官からの束縛を脱却しつつあるということである!
GPT-6にとって、深海のクジラの長い鳴き声と、ジェダイがライトセーバーを振るったときの切り裂く音は、本質的に何の違いもない——両方とも物理世界におけるエネルギーの波動形態にすぎない。
このような変動がメル周波数スペクトログラムという数学的・幾何学的な表現に変換されると、GPT-6は物理法則そのものを直接「読み取る」ことができます。
それは長い耳を必要とせず、音を「聴く」必要もなく、音の物理的式を直接「理解」できる。
これは、AIのマルチモーダル理解が「人間の感覚を模倣」する段階から、物理世界のデータ構造に対する「ネイティブなデコード」へと進化したことを意味します。
今日はスペクトログラムを見てクジラを識別できる;明日、地震波の画像を見せれば、次に断層が破壊されるのを直接予測できるだろうか?脳波の画像を見せれば、あなたが何を考えているかを直接読み取れるだろうか?
人類は肉体を通じて宇宙の投影を体感しているが、現在、AIは宇宙のソースコードを直接読み取っている。
参考資料:
https://x.com/ChrisGPT/status/2097047569520115800
https://x.com/maxxrubin_/status/2096892510241268094
https://www.fastcompany.com/91602695/chatgpt-sites-makes-building-a-website-feel-like-making-a-google-doc
本文は微信公衆アカウント「新智元」より、著者:ASI启示録、編集:Aeneas デイビッド
