北京大、東京大、上海交通大のMemSlidesがAIによるPPT編集の課題を解決

iconMetaEra
共有
AI summary icon概要
MetaEraのAI+暗号通貨ニュースによると、北京郵電大学、清华大学、上海交通大学のチームがMemSlidesを発表しました。このシステムは、ユーザーのプロフィールメモリと作業メモリを組み合わせることで、AIによるPPT編集の課題を解決し、編集全体でユーザーの好みを一貫して維持し、ローカルな変更を可能にします。このプロジェクトは現在、Hugging FaceのDaily Papersの本日の論文となっており、GitHubで400以上のスターを獲得しています。暗号通貨ニュースでは、テクノロジー応用におけるAIの進歩が引き続き注目されています。
北京郵電大学、清華大学、上海交通大学が共同開発したMemSlidesシステムは、AI生成PPTにおける個別化と複数回の修正の課題を解決します。このシステムは、初回生成時にユーザーのプロフィールメモリを検索し、ユーザーの好みに応じてページの構成と表現方法に影響を与えます。また、作業メモリを導入して現在のタスクの一時的な制約を保存し、遅延して適用される好みを継続的に有効にします。さらに、Plan-Act-Guardプロセスにより局所的な正確な修正を実現し、変更がドキュメント全体に広がるのを防ぎます。実験結果によると、ツールメモリにより編集の収束率が2.27倍に向上し、コアツールの所要時間が0.327倍に短縮されました。本システムはHugging Face Daily Papersの「本日の論文」で1位となり、GitHubでは400以上のスターを獲得しました。この研究は、エージェントが長期タスクにおける記憶管理を行う上で参考となる価値を持っています。

記事執筆者、出典:新智元

最も恥ずかしい瞬間は、AIがPPTの生成に失敗したときではない。

むしろ、すでにかなり良いスライドが作成されているのに、あなたは「8ページの右下の部分をフローチャートのように修正してください」と言うだけです。

次の瞬間、8ページは確かに変更されたが、3ページの見出し階層が変わり、12ページの色調もずれ、前に繰り返し調整したスタイルがまた崩れた。

这才是真实PPTワークフローでより一般的な課題です。

最初のバージョンはあくまで下書きであり、修正版が主な戦場である。

「生成一套」から「このユーザーのように生成」

過去数年で、自動スライド生成は大幅に進歩しました。多くのシステムが、論文、製品説明、または1つのテーマから、構造が整い、視覚的にもそれなりの出来栄えの原稿を生成できるようになりました。

しかし実際の使用では、最初のスライドの鍵は「生成されたかどうか」ではなく、それがどのユーザーの表現習慣に近いかということです。

同じTransformer論文でも、基礎講座として説明することも、ミーティングでの発表、論文精読、または技術トレーニングとして構成することもできる。異なるユーザーが求めるページの役割、情報密度、証拠の範囲、メカニズムの展開方法はそれぞれ異なる。結論と学びを先に知りたい人もいれば、定義、メカニズム、境界条件を丁寧に分解したい人もいる。

これは、ユーザーのプロフィール記憶がラウンド0段階で果たす役割です。

北京郵電大学、清華大学、上海交通大学が共同で開発したMemSlidesは、ユーザーが繰り返し編集した後にようやく「記憶」を開始するのではなく、最初の生成段階で現在のタスクの意図に基づいてユーザーのプロフィールを検索し、互換性のある長期的な好みを現在の作業メモリにルーティングして、ページの構成や表現に影響を与えます。

論文リンク: https://arxiv.org/abs/2606.17162

プロジェクトページ: https://memslides.github.io/

デモリンク: https://memslides.com/

コードリンク: https://github.com/huohua325/Memslides

HFリンク: https://huggingface.co/papers/2606.17162

この作業はHugging Face Daily Papersの本日の論文に選ばれ、GitHubでは400以上のスターを獲得しました。デモウェブサイトの公開後には、100人以上の認証済みユーザーが試用しました。

図1は一般的な「生成イメージ」を示しているのではありません。これは、システムが論文の内容を定義、核心メカニズム、実験的根拠、一般的な誤解、境界条件などのページに分解する方法を説明しています。これらの選択は、ユーザーのプロファイルにおけるコンテンツ構造、情報密度、および証拠に基づく表現への好みに対応しています。

図1:第1ラウンドの生成は、完全性を示すだけでなく、ユーザー画像の記憶がページの構成、コンテンツ密度、および証拠の境界に与える影響も示しています。

プロジェクトにはオンラインデモも用意されています。ユーザーは資料をアップロードし、メモリープロファイルまたはテンプレートを選択して原稿を生成した後、修正を進め、現在のバージョンのPPTX、HTML、またはPDFをダウンロードできます。

つまり、MemSlidesは、パーソナライズされた原稿からその後の継続的な修正までの全体のプロセスを対象としています。

第一版がユーザーに近づき始めると、その後の課題はより鋭くなる:システムは複数回の修正を通じてこれらの好みを維持し続けられるか?現在のセッションで一時的に提示された要望は、数回のやり取り後に無効になってしまうのか?ユーザーが局部的な領域のみを変更したい場合、システムはすでに整列されたページを再び崩してしまうことなく対応できるか?

記憶を分担させる

「Agent memory」と聞いて、多くの人が自然に思い浮かべるのは:過去の会話をより長いコンテキストに保存することだ。

MemSlidesはそれをしなかった。

理由は単純です。歴史が長くなるほど、その中に含まれる矛盾も増えるからです。今日、ユーザーが「このレポートの見出しは青にしてほしい」と言ったからといって、今後すべてのPPTで見出しを青にしなければならないわけではありません。ある編集作業中にユーザーが遭遇したツールのエラーは、「彼が好むスタイル」と混同すべきではありません。

したがって、MemSlidesは、パーソナライズされたスライド生成をステートフルな作成プロセスとしてモデル化しています。システムは、ソース資料、ユーザーのプロフィール記憶、およびオプションのテンプレートに基づいてラウンド0のドラフトを生成し、その後、各フィードバックラウンドで現在のセッションステートを更新し、現在のスライドに対して局所的な編集を行います。

そのメモリの構成には二つの視点があります。

ライフサイクルの観点から、長期記憶と作業記憶があります。長期記憶はタスク間で安定して存在する情報を保存し、作業記憶は現在のデックにおいて有効な一時的な制約、変更目標、実行状態を保存します。

機能的な役割から見ると、ユーザー画像メモリとツールメモリがあります。前者は「このスライドセットにはどのような好みを反映すべきか」に答え、後者は「エージェントをより安定させるにはどう改善すべきか」に答えます。

言い換えれば、MemSlidesはAgentに不要な情報をたくさん覚えさせるのではなく、どの情報を長期的に保持すべきか、どの情報が現在のタスクでのみ有効か、どの情報がユーザーの好みに属するか、どの情報がツールの経験に属するかを教えることです。

図2:MemSlidesは、長期記憶、作業記憶、ユーザー画像記憶、およびツール記憶を同じマルチラウンドの校正プロセスに統合します。

ユーザーのプロフィール

本当のパーソナライズは、単一のロールプロンプトでは解決できません。

同じ学術発表でも、誰かは1ページに1つの核心的な結論だけを載せるのに対し、誰かは数式や実験の詳細を残す。同じビジネスプレゼンテーションでも、誰かは高密度のテーブルを好むのに対し、誰かはトレンドチャートや比較チャートに頼る。

これらの差異は、1回のプロンプト内のタグではなく、ユーザーが長期間にわたって執筆と修正を繰り返す中で徐々に現れた習慣です。

MemSlidesは、タスク間の好みを保存するためにユーザー画像メモリーを使用します。プロファイルをそのままプロンプトの先頭に貼り付けるのではなく、タスク開始時に現在の意図に応じて関連する好みを検索し、今回のリクエストと調整します。

長期的な好みと現在の明確な指示が互いに適合する場合、両者は作業記憶に同時に取り込まれます。対照的に、衝突が発生した場合は、現在のスライドに記載された明確な指示が優先されます。

このステップは重要です。そうでないと、システムは「今回は青いタイトルが欲しかった」ことを「ユーザーは常に青いタイトルを好む」と誤解しやすくなります。

タスク終了後、MemSlidesはすべてのフィードバックを長期プロフィールに書き戻すことはありません。安定し、再利用可能なインタラクションシグナルのみを蓄積し、次回の生成をユーザーにより近づけ、混乱を招かないようにします。

図3:ユーザー画像メモリは、検索、ルーティング、現在のタスクでの使用、およびタスク終了後の安定信号の蓄積を経験します。

作業記憶

複数回の修正稿の中には、さらに繊細な情報もある。

それは長期的な好みではないが、現在のデッキ内で継続して有効でなければならない。

たとえば、ユーザーが2回目のやり取りで「後でsummary/tip boxを追加する場合は、薄いグレーの背景を使用してください」と言った場合、当時はこのような要素がシステムに追加されていなかったため、この要望は即座に実行対象ではありませんでした。数回のやり取りの後、ユーザーがsummary boxを含むページの挿入を要求した場合、このルールが適用されるべきです。

エージェントが現在の入力のみを確認する場合、このような遅延して効力が発生する制約を忘れやすくなります。

MemSlidesの作業記憶は、現在の執筆タスクのステータスボードです。アクティブな一時的な設定、継続中の指示、解決済みのターゲット、カバレッジ状況がすべてここに格納されます。Planフェーズではこれらのステータスを読み取り、修正範囲を決定し、Actフェーズではそれに基づいて制限された編集を実行し、Guardフェーズでは更新されたチェック結果を確認します。

これにより、複数回の修正がそれぞれ独立したプロンプトではなく、同じスライドセットを中心に継続的に進める編集プロセスになります。

図4:作業記憶により、以前に提示され、後にトリガーされた一時的なスタイルの好みが継続して有効になります。

必要な部分だけ修正してください

人間の編集者にとって、「ここだけ変更する」は自然な言葉です。

生成システムにとって、この文は難しいです。

多くのシステムはフィードバックを処理する際に、広範囲のコンテンツを再読み取りまたは書き換えます。その結果、対象領域は正しく修正されましたが、非対象ページにも変更が生じてしまいます。ユーザーは小さな要望しか出していないのに、システムがPPT全体の状態を再構成してしまうのです。

MemSlides用スコープ付きスライドローカルリビジョンでこの問題を制約します。

フィードバックはまず最小有効修正領域にマッピングされ、その後Plan-Act-Guardプロセスに進みます。

Plan段階で自然言語のリクエストを実行契約に変換し、対象スライド、適用範囲、セレクターヒント、カバレッジ要件を明確にする。

Actステージでは、ページ構造に応じて編集ツールを選択し、制限された範囲内で最小限の有効操作を実行します。Guardステージでは、「完了」を確認が必要な状態に変更します:目標がカバーされていない場合は安易に最終化せず、スナップショットが期限切れの場合は再バインドが必要であり、局所的なリクエストを全体のデッキの書き直しに拡張してはなりません。

このステップでは、「モデルが自分自身で修正を完了したと判断する」ことを、「システムがこの修正が目標を本当にカバーしているか、範囲を超えていないかを確認する」ように変更します。

図5:Plan-Act-Guardは、局所的な変更を範囲計画、制御された実行、および結果チェックに分割します。

ツールメモリ

スライドの編集は単なるテキストの書き換えではありません。

一部的な変更は、ページ構造、セレクター、スタイルルール、レイアウトスナップショット、検証ロジックを含む可能性があります。エージェントはユーザーの意図を理解していても、ツール呼び出し時に誤った領域を読み取ったり、繰り返し試行錯誤したり、変更範囲を拡大したり、目標がまだカバーされていない段階で早期に終了したりする可能性があります。

したがって、MemSlidesはツールメモリーも導入しました。

ツールのメモリは「ユーザーが何を好むか」を記録するのではなく、「類似の編集タスクにおいて、どの実行パスが有効で、どのエラーを避けるべきか」を記録します。

論文は、2つの粒度で構成されています。round-scope task experience は、1ラウンドの修正における経験、エラーのまとめ、および移転可能なパターンを記録します。operation-scope tool-chain experience は、より細かい reasoning-tool-observation の断片を保存し、類似したツール呼び出しの前に参照として検索されます。

この設計は、目標と実行を分離しています。

ユーザーのプロファイルはスライドの方向性を決定し、ツールの記憶はエージェントが無駄な道をたどらず、無効な探索や実行の不確実性を減らします。

図6:ツールメモリはユーザーの美的好みではなく、ツール呼び出しの経験に注目します。

実験結果

MemSlidesの評価は、全体の生成スコアを単一で与えるのではなく、異なるメモリコンポーネントに対応する能力を分離して検証しています。ユーザー画像メモリはround-0のpersona alignmentに対応し、作業メモリは複数ラウンドの会話におけるdelayed preference carryoverに対応し、ツールメモリはdiagnostic matched-pair modify設定で分離して検証されます。

パーソナライズされた生成において、ユーザー画像の記憶は、複数の persona および複数の intent 設定における persona の整合性を向上させました。論文は、この向上が「特定のテンプレートにより似ている」という点だけでなく、コンテンツの重点、ページ上の役割、証拠の構成、および persona の区別などの計画的選択にも表れていると指摘しています。

局所的な修正ペア診断では、ツールのメモリによる変化がより直接的です:

同時に、コアツールの時間比率が0.327倍に低下しました。

これらの数値は診断用のマッチドペア修正設定から得られたものであり、あらゆるシナリオにおいて一貫して優位であるとは解釈できません。より正確には、これらの数値は、ツールのメモリが再利用可能な実行経験を提供する場合、エージェントが閉ループ完了、厳密な検証、および最初の正しい編集パスの発見において収束しやすくなるというプロセス的な結論を裏付けます。

図7:局部編集の比較は、論文内の定性的なケーススタディであり、ツールのメモリインジェクション前後における編集プロセスの差異を示すために使用されています。

PPTエージェントの次ステップ

長期的な協力です

MemSlidesはPPTについて議論していますが、その背後にある問題はPPTに限定されません。

エージェントがドキュメント生成、コード修正、データ分析、企業知識システムなどの長期タスクに従事する際、次のような課題に直面します:どの情報を長期的に保持すべきか、どの状態が現在のタスクにのみ関連するか、どの実行経験を再利用できるか、どの内容を局所的な変更時に必ず変更しないまま保持すべきか。

ワンクリック生成が0から1の課題を解決するのであれば、複数回の修正は1から実用可能にするための試練である。

将来のSlides Agentは、より美しい1枚目を生成するだけでなく、反復的な原稿修正の中でユーザーを継続的に理解し、編集の境界を維持しながら、1組のスライドをユーザーが本当に望むバージョンに安定して近づけることができるようになる。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。