MemSlides від Пекінського університету, Цінхуа та Шанхайського університету Цзяотон вирішує проблеми редагування AI-презентацій

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Новини про штучний інтелект і криптовалюту від MetaEra показують, що команда з Пекінського університету зв’язку та інформатики, Цінхуа та Шанхайського університету Джiao Тонг запустила MemSlides. Система вирішує проблеми редагування AI-презентацій, поєднуючи пам’ять про профіль користувача з робочою пам’яттю. Вона забезпечує сталість користувацьких налаштувань під час редагування та дозволяє локальні зміни. Проект вже отримав статус «Папер дня» на Hugging Face Daily Papers і має понад 400 зірок на GitHub. Новини про криптовалюту продовжують підкреслювати досягнення у сфері штучного інтелекту у технологічних застосуваннях.
Пекінський університет зв’язку та інформаційних технологій, Цинхуа та Шанхайський джіаотунський університет спільно розробили систему MemSlides, яка вирішує проблеми персоналізації та багатократного редагування в AI-згенерованих презентаціях. Під час першого генерування система отримує доступ до пам’яті профілю користувача, щоб впливати на організацію сторінок та стиль вираження згідно з його уподобаннями. Крім того, система використовує робочу пам’ять для зберігання тимчасових обмежень поточного завдання, забезпечуючи збереження дії уповільнених уподобань. За допомогою процесу Plan-Act-Guard досягається точне локальне редагування, уникнувши поширення змін на весь документ. Експерименти показали, що використання пам’яті інструментів збільшило швидкість збіжності редагування у 2,27 рази та скоротило час виконання ключових інструментів до 0,327 від початкового значення. Система посіла перше місце у Hugging Face Daily Papers як Paper of the Day та отримала понад 400 зірок на GitHub. Це дослідження має значення для управління пам’яттю агентів під час довготривалих завдань.

Автор статті, джерело: NewZeal

Найбільш незручний момент — це не тоді, коли AI не вдається згенерувати PPT.

Але він вже створив досить гарні слайди, а ти просто кажеш: «Зробіть правий нижній кут 8-го слайду схожим на діаграму процесу».

У наступну секунду можливо змінилася 8-та сторінка, але на 3-й сторінці змінився ієрархічний рівень заголовків, а на 12-й сторінці змінився колір, і раніше вирівняний стиль знову розбився.

Це саме ті болі, які частіше зустрічаються у справжньому робочому процесі PPT.

Перша версія — це лише чернетка, саме редагування — це головне поле битви.

Від «згенерувати набір» до «згенерувати, як цей користувач»

За останні кілька років автоматичне створення слайдів значно просунулось. Багато систем вже можуть генерувати повноцінні чернетки зі структурою та прийнятним візуальним виглядом на основі наукових статей, описів продуктів або навіть однієї теми.

Але у реальному використанні ключовим у першій версії слайдів є не те, «чи вона була згенерована», а чи вона вже наближена до манери висловлювання певного користувача.

Ту саму статтю про Transformer можна подати як базовий навчальний курс, або організувати як презентацію на зустрічі групи, глибоке читання статті або технічне навчання. Різні користувачі цікавляться різними ролями сторінок, щільністю контенту, межами доказів і способами розкриття механізмів. Хтось хоче спочатку отримати висновки та ключові висновки, а іншому важливо чітко розібрати визначення, механізми та умови меж.

Це саме й є роль пам’яті про профіль користувача на етапі round-0.

MemSlides, розроблений Пекінським університетом зв’язку та інформаційних технологій, Цинхуа та Шанхайським джіаотунським університетом, не чекає, поки користувач багато разів редагуватиме, щоб почати «пам’ятати» — замість цього він під час першого генерування отримує профіль користувача на основі поточної мети завдання та направляє сумісні довгострокові переваги до поточної робочої пам’яті, щоб впливати на організацію сторінки та спосіб вираження.

Посилання на статтю: https://arxiv.org/abs/2606.17162

Головна сторінка проекту: https://memslides.github.io/

Посилання на демонстрацію: https://memslides.com/

Посилання на код: https://github.com/huohua325/Memslides

HF посилання: https://huggingface.co/papers/2606.17162

Ця робота зайняла перше місце у Hugging Face Daily Papers як Paper of the Day; на GitHub отримала понад 400 зірок; після запуску демовебсайту його випробували понад 100 підтверджених користувачів.

Рисунок 1 показує не загальний «генерований ефект». Він більше ілюструє, як система розбиває матеріали статті на сторінки з визначеннями, основними механізмами, експериментальними даними, поширеними помилками та граничними умовами. Ці вибори відповідають профілю користувача щодо предпочтень у структурі контенту, щільності інформації та орієнтації на доказове викладання.

Рисунок 1: Перший цикл генерації не лише демонструє цілісність, а й вплив пам’яті про профіль користувача на організацію сторінки, щільність контенту та межі доказів.

Проект також надає онлайн-демо. Користувачі можуть завантажувати матеріали, вибирати профіль пам’яті або шаблон, після генерації чернетки продовжувати редагування та завантажувати поточну версію у форматі PPTX, HTML або PDF.

Тобто MemSlides орієнтовано на повний процес — від персоналізованого чернетки до подальших постійних правок.

Але щойно перша версія почне наближатися до користувачів, наступні питання стають гострішими: чи зможе система зберігати ці уподобання під час кількох циклів змін? Чи зникнуть вимоги, тимчасово висунуті в поточному сеансі, через кілька циклів? Коли користувач хоче змінити лише окрему область, чи зможе система уникнути розбивання вже відповідних елементів сторінки?

Розподіл пам’яті

Багато хто, почуваючи «пам’ять агента», автоматично думає: просто помістіть історію діалогу в більш довгий контекст.

MemSlides цього не робив.

Причина проста: чим довша історія, тим більше конфліктів у ній. Якщо сьогодні користувач каже «цей звіт має сині заголовки», це не означає, що всі його майбутні презентації також повинні мати сині заголовки; помилка інструменту, з якою зустрівся користувач під час одного з редагувань, також не повинна змішуватися з «його уподобаннями щодо стилю».

Тому MemSlides моделює персоналізоване створення слайдів як становий процес авторства: система спочатку генерує чернетку round-0 на основі вихідного матеріалу, пам’яті про користувача та необов’язкового шаблону; після цього кожна ітерація зворотного зв’язку оновлює поточний стан сесії, а потім виконується локальне редагування поточного набору слайдів.

Його організація пам’яті має два погляди.

З точки зору життєвого циклу існують довготривала пам’ять та робоча пам’ять. Довготривала пам’ять зберігає інформацію, яка залишається стабільною між завданнями, а робоча пам’ять зберігає тимчасові обмеження, змінені цілі та стан виконання, які залишаються дійсними в поточному колоді.

З точки зору функціональних ролей існують пам’ять про профіль користувача та пам’ять про інструменти. Перша відповідає на питання «Які переваги слід відобразити в цих слайдах?», а друга — на питання «Як зробити агента більш стабільним?»

Іншими словами, MemSlides не навчає агента пам’ятати більше марної інформації, а допомагає йому розуміти, яка інформація має зберігатися довгостроково, яка діє лише під час поточної задачі, яка належить до користувацьких налаштувань, а яка — до досвіду роботи з інструментами.

Рисунок 2: MemSlides об’єднує довготривалу пам’ять, робочу пам’ять, пам’ять про профіль користувача та пам’ять інструментів у єдиний багатокроковий процес редагування.

Профіль користувача

Справжня персоналізація зазвичай не може бути досягнута лише одним role prompt.

Так само, як і під час академічних доповідей: хтось віддає перевагу одному основному висновку на слайді, а хтось зберігає формули та експериментальні деталі; так само, як і під час комерційних презентацій: хтось віддає перевагу щільним таблицям, а хтось більше полагоджується на графіках трендів та порівняльних діаграмах.

Ці відмінності — не мітки одного запиту, а звички, які користувач поступово проявляє під час тривалого письма та редагування.

MemSlides використовує профілі користувачів для збереження таких міжзавданьних уподобань. Він не копіює весь профіль на початок запиту, а замість цього на початку завдання витягує відповідні уподобання на основі поточного наміру, а потім координує їх із поточним запитом.

Якщо довгострокові уподобання та поточні чіткі інструкції сумісні, вони разом потрапляють у робочу пам’ять; якщо виникає конфлікт, пріоритет мають чіткі вимоги цих слайдів.

Цей крок дуже важливий. Інакше система легко може сприйняти «це тимчасове бажання синього заголовка» як «користувач завжди любить синій заголовок».

Після завершення завдання MemSlides не записує кожну відповідь у довгостроковий профіль. Вона зберігає лише стабільні, переносні сигнали взаємодії, щоб наступне генерування було ближчим до користувача, а не більш хаотичним.

Рисунок 3: Пам’ять про профіль користувача пройде через пошук, маршрутизацію, використання поточної задачі та осідання стабільних сигналів після завершення задачі.

Робоча пам'ять

У багаторазових редагуваннях є ще один тип інформації, який більш тонкий.

Це не довгострокова перевага, але повинно залишатися дійсним у поточному деку.

Наприклад, користувач у другому раунді сказав: «Якщо в майбутньому додадуть блок summary/tip, використовуйте світло-сірий фон». На той момент система ще не мала таких елементів, тому ця вимога не мала відразу об’єкта для виконання. Через кілька раундів, якщо користувач попросить вставити сторінку з блоком summary, це правило має бути активовано.

Якщо агент враховує лише поточний вхід, він легко може забути про такі обмеження, які вступають в дію з затримкою.

Робоча пам’ять MemSlides — це дошка стану поточної редагувальної задачі: тут зберігаються активні тимчасові налаштування, інструкції, що переносяться, вирішені цілі та статус охоплення. На етапі Plan вони читаються для визначення діапазону змін, на етапі Act виконуються обмежені редагування, а на етапі Guard оновлюються результати перевірки.

Це робить багатоетапні зміни не окремими, ізольованими запитами, а неперервним процесом редагування, спрямованим на ті самі слайди.

Рисунок 4: Робоча пам’ять забезпечує продовження дії тимчасових преференцій стилю, запропонованих раніше, але активованих пізніше.

Змініть тільки необхідне

Для людських редакторів фраза «змінити лише це місце» звучить дуже природно.

Для генеративної системи це речення важке.

Оскільки багато систем при обробці відгуків повторно читають або переписують великі обсяги контенту, це призводить до того, що цільова область виправляється правильно, але змінюються й нецільові сторінки. Користувач здається, що просить лише невелику зміну, а система перезапускає стан усієї презентації.

MemSlides використовує обмежені слайд-локальні ревізії, щоб вирішити цю проблему.

Кожна відповідь спочатку відображається на мінімальну ефективну зону змін, а потім входить у процес Plan-Act-Guard.

На етапі Plan перетворіть запити на природній мові на execution contract, чітко визначивши цільовий слайд, діапазон дії, підказки selector та вимоги до покриття.

На етапі Act виберіть інструмент редагування відповідно до структури сторінки та виконайте мінімальну ефективну дію в межах обмежень. На етапі Guard перетворіть «завершено» на стан, що потребує перевірки: ціль не охоплена — не можна поспішно фіналізувати, знімок застарів — потрібно повторно прив’язати, локальні запити не слід розширювати до переписування всього набору deck.

Цей крок перетворює «модель вважає, що вона завершила зміни», на «система може перевірити, чи ця зміна дійсно охоплює мету чи вийшла за межі».

Рисунок 5: Plan-Act-Guard розбиває локальні зміни на планування діапазону, контролюване виконання та перевірку результатів.

Запам’ятовування інструментів

Редагування слайдів — це не просто переписування тексту.

Одне локальне виправлення може стосуватися структури сторінки, селекторів, правил стилів, знімків макету та логіки перевірки. Агент, навіть розуміючи, чого хоче користувач, може неправильно прочитати область під час виклику інструменту, повторювати спроби, розширити діапазон виправлення або завершити його рано, перш ніж мета буде досягнута.

Тож MemSlides ввів інструмент пам’яті.

Інструменти пам’яті не зберігають, що користувачам подобається, а зберігають, які шляхи виконання працюють у подібних завданнях редагування та які помилки слід уникати.

Папер організовується на двох рівнях деталізації: досвід завдань у межах раунду — записує досвід, висновки про помилки та переносні шаблони, отримані під час одного раунду змін; досвід інструментального ланцюжка у межах операції — зберігає більш дрібні фрагменти reasoning-tool-observation, які вилучаються як довідка перед подібними викликами інструментів.

Цей дизайн розділяє мету та виконання.

Профіль користувача визначає, у якому напрямку слід змінювати слайди, а пам’ять інструментів допомагає агенту уникати зайвих шляхів, зменшуючи невизначеність у пошуках та виконанні.

Рисунок 6: Пам’ять інструментів зосереджена на досвіді виклику інструментів, а не на смаках користувача.

Результати експерименту

Оцінка MemSlides не обмежується єдиним загальним балом за генерацію, а розбиває різні компоненти пам’яті для окремої перевірки: пам’ять про користувача перевіряється через відповідність персони на round-0, робоча пам’ять — через перенесення запасених переваг у багатокрокових діалогах, а пам’ять інструментів — у ізольованому діагностичному налаштуванні matched-pair modify.

У персоналізованих генераціях пам’ять про користувацький профіль покращує відповідність персонажів у налаштуваннях з кількома персонажами та кількома інтентами. У статті зазначається, що це покращення проявляється не лише у «більшій схожості з певним шаблоном», а й у виборі на рівні планування: ключові аспекти контенту, роль сторінки, організація доказів та розрізнення персонажів.

У діагностиці пар з локальними змінами зміни, пов’язані з пам’яттю інструменту, є більш прямими:

Також співвідношення часу core tool знизилося до 0,327x.

Варто зазначити, що ці цифри походять із діагностичних matched-pair modify setting і не можуть тлумачитися як універсальна перевага в усіх сценаріях. Точніше, вони підтверджують процесуальний висновок: коли пам’ять інструменту надає повторно використовувані досвід виконання, агент легше збігається при завершенні замкненого циклу, строгій перевірці та пошуку першої правильної шляху редагування.

Рисунок 7: Порівняння локального редагування — якісний приклад із статті, що демонструє різницю в процесі редагування до та після введення пам’яті інструменту.

Наступний крок PPT Agent

Це довгострокова співпраця

MemSlides обговорює PPT, але проблеми, що лежать в основі, не обмежуються лише PPT.

Коли агент виконує довготривалі завдання, такі як генерація документів, зміна коду, аналіз даних або робота з корпоративними знаннями, він стикається з подібними викликами: яка інформація повинна зберігатися довгостроково, який стан належить лише поточному завданню, який досвід виконання можна повторно використовувати, а який вміст має залишатися незмінним під час локальних змін.

Якщо одноклікова генерація вирішує проблему від 0 до 1, то багатоетапне редагування перевіряє від 1 до придатності.

Майбутній Slides Agent має не лише генерувати красочніші перші слайди, а й здатний у процесі багаторазових редагувань постійно розуміти користувача, зберігати межі редагування та поступово наближати набір слайдів до справжньої версії, яку шукає користувач.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.