MemSlides par Pékin U, Tsinghua et Shanghai Jiao Tong résout les problèmes d'édition de diaporamas AI

iconMetaEra
Partager
AI summary iconRésumé
Les actualités IA + crypto de MetaEra montrent qu'une équipe de l'Université des postes et télécommunications de Pékin, de Tsinghua et de l'Université Jiao Tong de Shanghai a lancé MemSlides. Le système résout les problèmes d'édition de diaporamas IA en combinant la mémoire du profil utilisateur avec la mémoire de travail. Il maintient la cohérence des préférences utilisateur à travers les modifications et permet des changements localisés. Le projet est désormais le Paper of the Day sur Hugging Face Daily Papers et compte plus de 400 étoiles sur GitHub. Les actualités crypto mettent continuellement en avant les avancées de l'IA dans les applications technologiques.
L'Université des télécommunications de Pékin, l'Université Tsinghua et l'Université Jiaotong de Shanghai ont conjointement développé le système MemSlides, qui résout les défis de personnalisation et de révisions itératives dans la génération automatique de présentations PowerPoint par l'IA. Le système effectue dès la première génération une recherche dans la mémoire du profil utilisateur, influençant ainsi l'organisation des pages et les modes d'expression selon les préférences de l'utilisateur. Il intègre également une mémoire de travail pour conserver les contraintes temporaires liées à la tâche en cours, garantissant que les préférences à effet différé restent actives. En outre, il utilise un processus Plan-Act-Guard pour effectuer des modifications locales précises, évitant ainsi la propagation des changements à l'ensemble du document. Les expériences montrent que la mémoire des outils augmente le taux de convergence de l'édition jusqu'à 2,27 fois et réduit le temps des outils principaux à 0,327 fois. Le système a été désigné « Paper of the Day » sur Hugging Face Daily Papers et a reçu plus de 400 étoiles sur GitHub. Cette recherche offre une référence précieuse pour la gestion de la mémoire dans les agents lors de tâches à long terme.

Auteur et source de l'article : Nouvelle Intelligence

Le moment le plus gênant n'est souvent pas lorsque la génération de PPT par l'IA échoue.

Au lieu de cela, il a déjà généré un ensemble de diapositives assez bonnes, et vous dites simplement : « Modifiez le coin inférieur droit de la 8e diapositive pour qu'il ressemble davantage à un organigramme. »

La prochaine seconde, la page 8 a peut-être été modifiée, mais la hiérarchie des titres de la page 3 a changé, et la palette de couleurs de la page 12 s'est décalée ; le style précédemment ajusté à plusieurs reprises a été déstabilisé.

Ces sont les difficultés les plus courantes dans les flux de travail réels avec PowerPoint.

La première version n'est qu'un brouillon ; la révision est le champ de bataille principal.

De « générer un ensemble » à « générer comme cet utilisateur »

Au cours des dernières années, la génération automatique de diaporamas a progressé rapidement. De nombreux systèmes sont désormais capables de générer des brouillons structurés et visuellement acceptables à partir d'articles scientifiques, de descriptions de produits ou même d'une simple phrase thématique.

Mais dans l'utilisation réelle, l'élément clé de la première version des diapositives n'est pas seulement « si elle a été générée », mais si elle s'approche déjà des habitudes d'expression d'un utilisateur.

Le même article sur les Transformers peut être présenté comme un cours de base, une présentation de réunion d'équipe, une lecture approfondie d'article ou une formation technique. Les rôles des pages, la densité des contenus, les limites des preuves et les modes d'explication des mécanismes varient selon les utilisateurs. Certains souhaitent d'abord recevoir les conclusions et les enseignements clés, tandis que d'autres préfèrent décomposer clairement les définitions, les mécanismes et les conditions limites.

C'est précisément le rôle de la mémoire du profil utilisateur à la phase round-0.

Développé en collaboration par l'Université des télécommunications de Pékin, l'Université Tsinghua et l'Université Jiaotong de Shanghai, MemSlides ne commence pas à « mémoriser » après plusieurs révisions de l'utilisateur, mais récupère dès la première génération le profil utilisateur en fonction de l'intention de la tâche actuelle, en acheminant les préférences à long terme compatibles vers la mémoire de travail courante afin d'influencer l'organisation et l'expression de la page.

Lien vers l'article : https://arxiv.org/abs/2606.17162

Page du projet : https://memslides.github.io/

Lien de démonstration : https://memslides.com/

Lien du code : https://github.com/huohua325/Memslides

Lien HF : https://huggingface.co/papers/2606.17162

Ce travail a été sélectionné comme Paper of the Day sur Hugging Face Daily Papers et a reçu plus de 400 étoiles sur GitHub ; après le lancement du site de démonstration, plus de 100 utilisateurs vérifiés ont testé la plateforme.

La Figure 1 ne présente pas un « rendu générique » général. Elle illustre plutôt la manière dont le système décompose le matériel académique en pages dédiées aux définitions, mécanismes centraux, preuves expérimentales, erreurs courantes et conditions limites. Ces choix correspondent directement aux préférences identifiées dans le profil utilisateur concernant la structure du contenu, la densité d'information et l'orientation vers des preuves.

Figure 1 : La première génération reflète non seulement l'intégrité, mais aussi l'impact de la mémoire du profil utilisateur sur l'organisation de la page, la densité des contenus et les limites des preuves.

Le projet propose également une démo en ligne. Les utilisateurs peuvent télécharger des documents, sélectionner un profil de mémoire ou un modèle, générer un brouillon, passer à la révision, puis télécharger la version actuelle au format PPTX, HTML ou PDF.

Autrement dit, MemSlides cible l'ensemble du processus, de la première version personnalisée aux modifications continues ultérieures.

Une fois la première version commencée à s'aligner sur les utilisateurs, les questions suivantes deviennent plus aigües : le système peut-il conserver ces préférences à travers plusieurs itérations ? Les exigences soumises temporairement au cours de la session actuelle perdront-elles leur efficacité après quelques tours ? Lorsqu'un utilisateur souhaite modifier uniquement une zone locale, le système peut-il éviter de désorganiser les parties déjà alignées ?

Répartir les souvenirs

Beaucoup de personnes, en entendant « mémoire d'agent », pensent naturellement : il suffit d'insérer les conversations précédentes dans un contexte plus long.

MemSlides n'a pas fait cela.

La raison est simple : plus l’historique est long, plus il contient de conflits. Aujourd’hui, un utilisateur dit « utilisez des titres bleus pour ce rapport » ne signifie pas que tous ses futurs PPT doivent avoir des titres bleus ; une erreur d’outil rencontrée lors d’une édition particulière ne devrait pas être confondue avec « ses préférences stylistiques ».

Ainsi, MemSlides modélise la génération de diapositives personnalisées comme un processus de création avec état : le système génère d'abord un brouillon round-0 à partir des matériaux sources, de la mémoire du profil utilisateur et d'un modèle facultatif ; chaque retour ultérieur met à jour l'état de la session actuelle, puis effectue des éditions locales autour du diaporama courant.

Il a deux perspectives d'organisation de la mémoire.

Du point de vue du cycle de vie, il existe une mémoire à long terme et une mémoire de travail. La mémoire à long terme conserve les informations stables à travers les tâches, tandis que la mémoire de travail conserve les contraintes temporaires, les objectifs modifiés et l'état d'exécution encore valables dans le deck actuel.

Du point de vue des rôles fonctionnels, il existe une mémoire de profil utilisateur et une mémoire d'outil. La première répond à la question « Quelles préférences ces diapositives doivent-elles refléter ? », la seconde répond à la question « Comment rendre l'agent plus stable ? »

Autrement dit, MemSlides ne consiste pas à faire en sorte que l'Agent retienne plus de détails inutiles, mais à lui apprendre quelles informations conserver à long terme, lesquelles ne s'appliquent qu'à la tâche en cours, lesquelles relèvent des préférences de l'utilisateur et lesquelles proviennent de l'expérience avec les outils.

Figure 2 : MemSlides organise la mémoire à long terme, la mémoire de travail, la mémoire du profil utilisateur et la mémoire des outils au sein d’un même processus de révision en plusieurs étapes.

Profil utilisateur

La véritable personnalisation ne peut généralement pas être résolue par une simple instruction de rôle.

Même pour des présentations académiques, certains préfèrent ne mettre qu'une conclusion clé par diapositive, tandis que d'autres conservent les formules et les détails expérimentaux ; de même, pour des présentations commerciales, certains privilégient des tableaux denses, tandis que d'autres s'appuient davantage sur des graphiques de tendance et de comparaison.

Ces différences ne sont pas des étiquettes d'une seule invite, mais des habitudes révélées progressivement par l'utilisateur au fil de ses écrits et révisions à long terme.

MemSlides utilise des mémoires basées sur les profils utilisateurs pour stocker ces préférences transversales. Au lieu d'insérer l'ensemble du profil au début du prompt, il récupère les préférences pertinentes en fonction de l'intention courante au démarrage de la tâche, puis les coordonne avec la demande actuelle.

Si les préférences à long terme sont compatibles avec les instructions actuelles explicites, elles entrent ensemble en mémoire de travail ; en cas de conflit, les exigences explicites de cette série de diapositives priment.

Cette étape est importante. Sinon, le système risque de confondre « cette fois-ci, je veux un titre bleu » avec « l'utilisateur aime toujours les titres bleus ».

Après la tâche terminée, MemSlides n’écrit pas chaque retour dans le profil à long terme. Il ne retient que les signaux d’interaction stables et transférables, afin que la prochaine génération soit plus proche de l’utilisateur, et non plus confuse.

Figure 3 : Le profil utilisateur en mémoire passe par la récupération, le routage, l'utilisation lors de la tâche actuelle et la sédimentation de signaux stables après la fin de la tâche.

Mémoire de travail

Dans les multiples révisions, il existe également un type d'information plus subtil.

Ce n'est pas une préférence à long terme, mais il doit rester valide dans le deck actuel.

Par exemple, si l'utilisateur dit lors du deuxième tour : « Si des boîtes de résumé/conseil sont ajoutées plus tard, utilisez un fond gris clair. » À ce moment-là, le système n'avait pas encore ajouté ce type d'élément, donc cette exigence n'avait pas encore d'objet à appliquer. Plusieurs tours plus tard, si l'utilisateur demande d'insérer une page avec une boîte de résumé, cette règle devrait être déclenchée.

Si l'agent ne prend en compte que l'entrée actuelle, il risque facilement d'oublier ces contraintes à effet différé.

La mémoire de travail de MemSlides est le tableau de bord de l'état de la tâche d'écriture actuelle : les préférences temporaires actives, les instructions transférées, les cibles résolues et l'état de couverture sont tous stockés ici. La phase Plan lit ces états pour déterminer la portée des modifications, la phase Act exécute des éditions limitées en se basant dessus, et la phase Guard met à jour les résultats de vérification.

Cela transforme les modifications en plusieurs étapes en un processus d’édition continu, centré sur les mêmes diapositives.

Figure 4 : La mémoire de travail permet de maintenir les préférences de style temporaires, formulées précédemment et déclenchées ultérieurement.

Ne modifiez que ce qui doit être modifié

Pour un éditeur humain, « changez seulement cela » est une phrase naturelle.

Pour un système génératif, cette phrase est difficile.

Étant donné que de nombreux systèmes relisent ou réécrivent de vastes portions de contenu lors du traitement des commentaires, la zone cible peut être corrigée, mais d'autres pages non ciblées subissent également des modifications. L'utilisateur n'a fait qu'une petite demande, mais le système a réorganisé l'ensemble du présentation.

MemSlides utilise des révisions locales au diapositive pour limiter ce problème.

Chaque retour est d'abord cartographié sur la zone de modification minimale efficace, puis entre dans le processus Plan-Act-Guard.

À la phase Plan, convertissez la demande en langage naturel en un contrat d'exécution, en définissant clairement le slide cible, la portée, les indices de sélecteur et les exigences de couverture.

À l'étape Act, sélectionnez l'outil d'édition en fonction de la structure de la page et effectuez les opérations minimales efficaces dans les limites imposées. À l'étape Guard, transformez « Terminé » en un état nécessitant une vérification : si l'objectif n'est pas couvert, ne finalisez pas précipitamment ; si l'instantané est périmé, rétablissez la liaison ; les demandes locales ne doivent pas être étendues en une réécriture complète de l'ensemble du deck.

Cette étape transforme « le modèle pense qu’il a terminé » en « le système peut vérifier si cette modification couvre effectivement l’objectif et ne dépasse pas les limites ».

Figure 5 : Plan-Act-Guard divise les modifications locales en planification de portée, exécution contrôlée et vérification des résultats.

Mémoire d'outils

L'édition des diapositives n'est pas une réécriture textuelle pure.

Une modification locale peut impliquer la structure de la page, les sélecteurs, les règles de style, les captures d'architecture et la logique de validation. Même en comprenant ce que l'utilisateur souhaite, l'agent peut mal interpréter la zone lors de l'appel d'outils, répéter des essais et erreurs, élargir la portée des modifications ou terminer prématurément avant d'avoir couvert l'objectif.

Ainsi, MemSlides introduit également la mémoire d'outils.

L'outil de mémoire ne stocke pas « ce que l'utilisateur aime », mais plutôt « quelles trajectoires d'exécution sont efficaces dans des tâches d'édition similaires, et quelles erreurs éviter ».

L'article organise les données en deux niveaux de granularité : les expériences à l'échelle des rounds, qui enregistrent les expériences, les résumés d'erreurs et les modèles transférables d'une seule itération ; et les expériences à l'échelle des opérations, qui conservent des fragments plus fins de reasoning-tool-observation, récupérés comme référence avant des appels d'outils similaires.

Cette conception sépare les objectifs de l'exécution.

Le profil utilisateur détermine la direction à prendre pour les diapositives, tandis que la mémoire des outils permet à l'agent d'éviter les erreurs, de réduire les explorations inutiles et d'atténuer l'incertitude dans l'exécution.

Figure 6 : La mémoire des outils se concentre sur l'expérience d'appel des outils, et non sur les préférences esthétiques de l'utilisateur.

Résultats de l'expérience

L'évaluation de MemSlides ne fournit pas uniquement un score global de génération, mais vérifie séparément les capacités associées à différents composants de mémoire : la mémoire de profil utilisateur correspond à l'alignement de la personnalité au round-0, la mémoire de travail correspond au report des préférences retardées dans les conversations multiround, et la mémoire des outils est validée de manière isolée dans un réglage diagnostic matched-pair modify.

Sur la génération personnalisée, la mémoire des profils utilisateurs améliore l'alignement des personas dans les configurations multi-persona et multi-intent. L'article souligne que cette amélioration se manifeste non seulement par une ressemblance accrue avec un modèle donné, mais aussi au niveau des choix de planification, tels que les points focaux du contenu, les rôles de page, l'organisation des preuves et la distinction entre les personas.

Dans le diagnostic des paires modifiées localement, les changements apportés par la mémoire de l'outil sont plus directs :

En même temps, le ratio de temps de l'outil principal est descendu à 0,327x.

Il convient de noter que ces chiffres proviennent d’un paramètre de modification par paires appariées de diagnostic et ne doivent pas être interprétés comme une supériorité monotone dans tous les scénarios. Plus précisément, ils soutiennent une conclusion procédurale : lorsque la mémoire de l’outil fournit une expérience d’exécution réutilisable, l’agent converge plus facilement vers une achèvement en boucle fermée, une vérification stricte et la découverte du premier chemin d’édition correct.

Figure 7 : La comparaison d'édition locale est un cas qualitatif issu de l'article, utilisé pour illustrer les différences du processus d'édition avant et après l'injecton de la mémoire de l'outil.

La prochaine étape du PPT Agent

Coopération à long terme

MemSlides parle des PPT, mais le problème sous-jacent ne concerne pas uniquement les PPT.

Lorsque l'Agent entre dans des tâches à long terme telles que la génération de documents, la modification de code, l'analyse de données ou les systèmes de connaissances d'entreprise, il rencontre des défis similaires : quelles informations doivent être conservées à long terme, quels états appartiennent uniquement à la tâche en cours, quelles expériences d'exécution peuvent être réutilisées et quels contenus doivent rester inchangés lors de modifications locales.

Si la génération en un clic résout le passage de 0 à 1, alors les modifications itératives testent le passage de 1 à une version utilisable.

L'agent Slides futur ne se contentera pas de générer une première page plus belle, mais saura également comprendre en continu l'utilisateur et maintenir les limites de l'édition pendant les multiples révisions, afin que la présentation converge stablement vers la version que l'utilisateur souhaite réellement.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.