一枚の証明書は、現在の「機種変更」のペースに影響を与えません。記事作成者、出典:ゲークパーカー
7月下旬に戻ると、スマートフォン分野に注目していたなら、多くのスマートフォンメーカーが自社の端末が国家AI L3レベルの認証を取得したことを公式に発表したことを覚えているはずだ。
この一斉発表の出発点は、2026年7月17日に公表された最初のAIエンドポイントの知能レベル評価結果である。
最初のテストリストに基づき、モバイル端末のうち11製品がL3に達し、そのうち9台がスマートフォン、2台がタブレットです。スマートフォンは、Huawei、Motorola、Honor、vivo、OPPO、Xiaomi、Step星辰などのブランドをカバーしています。
リストが公開された後、各メーカーは技術テスト結果をソーシャルメディア向けに簡潔な言語に翻訳した。Huaweiは「初証」を強調し、Xiaomiは「国家級」を強調し、vivoはL3を現在の最高レベルの知能評価と直接称した。HuaweiとXiaomiは7月18日に公式発表し、OriginOSはその翌日に追随し、似たようなL3のポスターが珍しい一斉プレヒートを生み出した。
口径には若干の違いがあるが、これらの宣伝の背後には、工業情報化部が今年5月に発表した「人工知能端末の知能化レベル分類」という同じ認証テストが示されていることがわかる。
このL3能力とは具体的に何を意味するのでしょうか?私たちがこれらのL3スマホを使用できるのはいつでしょうか?また、自動車の基準で考えた場合、より長期的なL4レベルは、完全に人間の介入を必要としないAIエージェントのデバイス形態を意味するのでしょうか?
L3は「自動運転」を意味しません
認証規範全体を紹介する前に、実は2つのよくある誤解があります。
まず、対応するGB/Z 177—2026『人工知能端末の知能化段階分類』は、国家標準化指導性技術文書であり、強制性国家規格ではない。
これは、携帯電話の販売を左右する必須基準ではなく、業界で共通して使用される能力の指標です。これがタイトルで「国標」にクォーテーションマークを付けている理由でもあります。これは確かに国家標準体系に属していますが、現段階では主にガイドラインおよび評価の役割を担っています。
第二に、L3評価は特定の端末及其ソフトウェア・ハードウェアのバージョンに対するものであり、ブランド全体に段位を付与するものではありません。あるモデルがL3を通過したからといって、そのブランドのすべてのスマートフォンが自動的に昇格するわけではありません。初期リストに含まれていないからといって、テストに失敗したわけでもありません。なぜなら、初期結果はメーカーが自発的に送った製品に基づいており、市場からの無作為サンプリングではないからです。このリストには、市場で販売されているすべてのAI Agentスマートフォン製品が含まれているわけではありません。たとえば、7月下旬に内測段階への進入を公式に発表したOPPOのAI Agentスマートフォンプロジェクト「小布NEXT」も、このリストには含まれていません。
言い換えると、L3は製品の販売ポイントとなり得ますが、スマートフォン業界の総合ランキングではありません。
L1をL3に「アップグレード」する方法
また、あなたはおそらく気づいたでしょうが、この基準はモデルの能力をテストするためのものではありません。これは端末の能力を感知、認知、実行、記憶、学習の5つの次元に分け、さらにユーザー感知、タスク計画、ツール呼び出し、長期・短期記憶、状況適応などの14の能力に細分化しています。
これらの用語を日常的なシナリオに置き換えると、より理解しやすくなります。たとえば、ユーザーがスマートフォンに「週末に杭州への旅行を手配して」と言うとします。
L1は「応答レベル」です。スマートフォンはシンプルで明確な指示を理解し、確定されたツールを呼び出して、1ステップのタスクを完了します。たとえば、カレンダーを開く、または土曜日の朝にアラームを設定するなどです。これは音声でトリガーされる指のようなもので、どこを押してほしいかを指示すれば、その通りに動きます。
L2は「ツールレベル」です。スマートフォンはシンプルな意図を理解し、限定的な推論を行い、事前設定されたツールを呼び出して1ステップまたは経路が明確な複数ステップのタスクを完了できます。杭州の天気を調べたり、旅行プランを提案したり、その結果を現在の会話に残すことが可能です。ただし、プロセスは基本的に製品側で事前に用意されており、記憶も短期的な文脈に限定されます。実質的には、スマートフォンに「DouBao」アプリをインストールしたのと同等の効果です。
一方、携帯電話メーカーが一般的に言及するL3は、現在真正に達成すべき「補助レベル」です:携帯電話はより完全な目標を理解し、情報が不足した場合には自ら質問し、タスクを分割して状況に応じてツールを選択・編成する必要があります。また、短期記憶と長期記憶を備え、「朝の通勤電車に乗らない」「ホテルは西湖にできるだけ近い場所にしたい」などの好みを次のタスクでも継続して反映できるようにする必要があります。
「杭州旅行を手配する」という一文は、L3では、日付と予算の確認、交通手段と天候の検索、宿泊施設の選定、スケジュールの作成、カレンダーへの登録に分解される。支払い、機密データ、または取り消し不可能な操作に関わる場合は、確認権をユーザーに戻す。
L1からL3までの違いは、AIの回答が人間に越来越似ていくことではなく、携帯電話がタスクをより完全に担うようになっていることである。
モバイル端末のテストは、一枚のデモポスターよりも具体的である。端末は少なくとも3つの典型的なシナリオでテストされ、目標難易度のツール呼び出しタスクの達成率は80%以上である必要がある。各タスクはデフォルトで5分以内に完了し、最大3回の機会が与えられる。端末側の機能はオフライン環境で、端末とクラウドの連携機能はオンライン環境でテストされる。
また、L3の長期記憶は少なくとも以下の3種類の情報をカバーする必要がある:ユーザーの基本情報、ツールの好み、対話履歴、よく訪れる場所、スケジュールやタスク、または使用習慣。ただし、複雑な推論や計画はクラウドで実行でき、標準ではL3に継続的な進化学習機能を必須としない。
これはモデルとグレードとの関係を説明しています。大規模モデルは言語の理解、画像の認識、タスクの計画を担当し、スマートフォンの核心的な能力の源です。しかし、たとえモデルがどれほど強力でも、チャットボックス内に閉じ込められて質問に答えるだけでは、スマートフォン全体をL3とすることはできません。逆に、パラメータ数がそれほど大きくないモデルでも、オペレーティングシステム、ツールインターフェース、ユーザーの記憶、クラウド機能と連携すれば、L3タスクを実行できる可能性があります。
また、7月15日に公表されたモバイル端末モデルの届出リストとL3テストは同じものではありません。届出は生成AIサービスが規制に準拠して提供できるかどうかを決定するものであり、L3テストはモデルを具体的なスマートフォンに組み込んだ際に、システムやアプリと連携してタスクを完了できるかどうかを評価します。前者はサービスの規制上の最低基準であり、後者は端末の能力を示す尺度です。
実際に試験に参加するのはモデルではなく、モデル、システム、アプリケーション、および権限メカニズムからなる一チームである。
また、自動車の自動運転基準とは異なる点として、スマートフォンメーカーは一般的にL3を「現在の最上位レベル」と呼んでいます。
しかし、これは実際には言葉遊びでもあります。L3は現在、明確な要件が提示され、テストが可能な最高等級ですが、この認証体系における最高等級ではありません。標準の詳細仕様では、L4の名称は「協同レベル」とされていますが、具体的な要件は「未定」と明記されています。スマートフォンおよびタブレット向けのGB/Z 177.3—2026も、現在のところL1、L2、L3のテスト方法のみを規定しています。
言い換えれば、L3レベルのAIエージェントのスマートフォンは依然としてアシスタントであり、タスクを分解し、ツールを呼び出し、好みを記憶する一方で、主に1つの端末と1つのユーザー目標を中心に動作します。「協調」に至ると、問題は自然に複数のエージェント、複数のデバイス、複数のサービス主体に拡張されます。
スマートフォンは、予約を旅行エージェントに委ね、予算を支払いサービスに任せ、車載システム、ヘッドフォン、カレンダーが共同でスケジュールを調整できるか?タスクの実行に誤りが生じた場合、誰が責任を負うのか?あるエージェントが得た権限は、別のエージェントに引き継がれるのか?これらの質問には安定した答えがなく、L4では繰り返し可能なテスト問題を設けるのが難しい。
L4の自動運転が実現できないのは、モデルの能力不足ではなく、協調ルール、責任の境界、セキュリティメカニズムがまだ成熟していないからである。
スマートフォンのL1—L4にも、自動運転の責任の論理は適用できません。自動運転レベルは、車両が動的運転タスクを引き継ぎ、事故の責任をどのように分担するかに基づいています。一方、AI端末のレベルは、タスクの複雑さとシステムの能力を評価します。数字は同じに見えますが、試験科目は全く異なります。
したがって、現在、L3スマートフォンを「完全自動運転レベルのAI」と称する言い方は、すべて「プロモーション用語」と理解できます。真のL4スマートフォンについては、まず「協調」とは何を意味するのか、そして協調が失敗したときに誰がブレーキをかけるのかという基準が明確になるのを待つ必要があります。
電話を変える必要がありますか?
一般の消費者から、この基準について最も多く聞かれる質問は、このグレーディング基準が徐々に実施されるにつれて、より優れたAIエージェントの機能を利用するためには、新しいスマートフォンに買い替える必要があるのか、ということです。
国基準に厳密に従って質問した場合、L3スマホの発売時期は?答えは:既に発売されています。
最初のリストには、まだ発表されていない新機種だけが含まれているわけではありません。Huawei Pura X Maxは4月に発表されており、Lenovo motoの3機種も5月に登場しています。一方、リストにはまだ発表されていない製品も含まれており、たとえばHonor Robot Phoneなどが該当します。さらに、より広く知られている「Doubao Phone」の第2世代は、このリストには含まれていません。
しかし、消費者が実際に気にするのは、証明書意义上的なL3ではなく、もう一つの事実です:目標を安定して理解し、アプリ間でスムーズに動作し、最後のステップで失敗しないスマートフォンはいつ手に入るのか?
ホンダは明確なタイムラインを提示しました:Robot Phoneは2026年8月にAgenticOSカーネルを初搭載し、Magic9シリーズは第4四半期にベータ版を提供する予定です。
原生Android側でも、AppFunctionsとUI自動化フレームワークを推進しており、アプリの機能をエージェントに開放する予定です。2026年後半にさらに詳細を発表する予定です。
この判断から、2026年後半は「コンシューマーレベルのL3体験」が一斉に登場する最初の窓口となるが、それが今日のカメラや支払いのようにスマートフォンの安定した標準機能となることを期待するならば、より現実的な観察ポイントは2027年である。
Counterpointの予測によると、2027年までに生成AI搭載スマートフォンは全球出荷量の52%を占め、エージェント機能はフラッグシップ製品にさらに拡大する。
しかし、これは依然として国標L3の市場シェアに直接換算することはできず、両者の定義は異なります。しかし、これは私たちが期待できるスマートフォンの世代交代のリズムを示しています:2026年はフラッグシップ機の試験的導入を見、2027年はアプリエコシステムとミドルレンジ機が追いつけるかどうかを見ます。
したがって、現在の携帯電話のパフォーマンスやバッテリー持続時間が明確に問題がない場合、L3証明書のために早めに機種変更する必要はありません。
標準により、複雑な推論はクラウドを介して実行され、多くの機能もシステム更新によって既存のフラッグシップモデルに追加される可能性があります。実際の体験を決定するのは、メーカーがシステムを継続的にメンテナンスするかどうか、および一般的なアプリがツールインターフェースを開放する意愿があるかどうかです。
もともと機器交換のサイクルが来ている場合、L3は新しい選択基準となり得るが、少なくとも以下の3点を確認する必要がある:真のタスク成功率、一般的なアプリケーションのカバー範囲、および各操作が表示可能で、一時停止可能で、取り消し可能かどうか。
証明書は、携帯電話がその線を越えたことを示すだけで、それがあなたのデジタルライフを引き継ぐ価値があることを証明しない。
本当に待つに値するのは、それがどのランクに属しているかを気にしなくなる日であり、ただ「帮我办了」の一言の後、事が確実に完了したことを覚えていられるときだ。
