MemSlides do Beijing U, Tsinghua và Thượng Hải Giao Thông giải quyết các vấn đề chỉnh sửa PPT AI

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + crypto từ MetaEra cho thấy một nhóm từ Đại học Bưu chính Viễn thông Bắc Kinh, Thanh Hoa và Giao Thông Thượng Hải đã ra mắt MemSlides. Hệ thống giải quyết các vấn đề chỉnh sửa AI PPT bằng cách kết hợp bộ nhớ hồ sơ người dùng với bộ nhớ làm việc. Nó duy trì sự nhất quán về sở thích người dùng qua các lần chỉnh sửa và cho phép thay đổi cục bộ. Dự án hiện là Bài báo của Ngày trên Hugging Face Daily Papers và đã nhận hơn 400 sao trên GitHub. Tin tức crypto tiếp tục nhấn mạnh những tiến bộ của AI trong các ứng dụng công nghệ.
Đại học Bưu chính Viễn thông Bắc Kinh, Đại học Thanh Hoa và Đại học Giao thông Thượng Hải đã hợp tác phát triển hệ thống MemSlides để giải quyết các vấn đề về cá nhân hóa và chỉnh sửa nhiều vòng trong PPT do AI tạo ra. Hệ thống này ngay từ lần tạo đầu tiên sẽ truy vấn bộ nhớ hồ sơ người dùng, ảnh hưởng đến cách tổ chức trang và phong cách biểu đạt dựa trên sở thích của người dùng. Đồng thời, hệ thống tích hợp bộ nhớ làm việc để lưu trữ các ràng buộc tạm thời của nhiệm vụ hiện tại, đảm bảo các sở thích có hiệu lực trễ vẫn duy trì tác dụng. Qua quy trình Plan-Act-Guard, hệ thống thực hiện chỉnh sửa chính xác ở mức cục bộ, tránh để thay đổi lan rộng đến toàn bộ tài liệu. Thí nghiệm cho thấy bộ nhớ công cụ giúp tăng tỷ lệ hội tụ chỉnh sửa lên 2,27 lần và giảm thời gian sử dụng công cụ cốt lõi xuống còn 0,327 lần. Hệ thống đã đạt vị trí số một trên Hugging Face Daily Papers Paper of the Day và nhận hơn 400 sao trên GitHub. Nghiên cứu này mang tính tham khảo đối với việc quản lý bộ nhớ của Agent trong các nhiệm vụ dài hạn.

Tác giả bài viết, nguồn: Newzhong

Khoảnh khắc ngượng ngùng nhất thường không phải là khi AI tạo PPT thất bại.

Nhưng nó rõ ràng đã tạo ra một bộ slide khá tốt, và bạn chỉ nói: “Chỉnh phần góc dưới bên phải trang thứ 8 sao cho giống sơ đồ quy trình hơn.”

Ngay giây tiếp theo, trang thứ 8 có thể đã được thay đổi, nhưng cấp độ tiêu đề của trang thứ 3 đã thay đổi, màu sắc của trang thứ 12 cũng lệch đi, phong cách đã điều chỉnh lại nhiều lần trước đó lại bị phá vỡ.

Đây mới là những điểm đau thường gặp hơn trong quy trình làm việc PPT thực tế.

Bản đầu tiên chỉ là bản nháp, bản sửa đổi mới là chiến trường chính.

Từ “tạo một bộ” đến “tạo giống như người dùng này”

Trong vài năm qua, việc tạo tự động slide đã tiến bộ nhanh chóng. Nhiều hệ thống đã có thể tạo ra bản nháp có cấu trúc hoàn chỉnh và hình thức không quá thô sơ, bắt đầu từ các bài báo, mô tả sản phẩm hoặc một câu chủ đề.

Tuy nhiên, trong thực tế sử dụng, điều cốt lõi của bản slide phiên bản đầu tiên không chỉ là "đã được tạo ra chưa", mà là nó đã gần với phong cách biểu đạt của người dùng nào đó chưa.

Cùng một bài báo Transformer, có thể được trình bày dưới dạng bài học cơ bản, hoặc được tổ chức thành báo cáo nhóm, đọc kỹ bài báo hoặc đào tạo kỹ thuật. Các người dùng khác nhau quan tâm đến vai trò trang, mật độ nội dung, ranh giới bằng chứng và cách triển khai cơ chế đều khác nhau. Có người muốn biết kết luận và điểm chính trước, trong khi người khác lại muốn làm rõ định nghĩa, cơ chế và các điều kiện biên.

Đây chính là vai trò của bộ nhớ hồ sơ người dùng ở giai đoạn round-0.

MemSlides do được thực hiện bởi Đại học Bưu chính Viễn thông Bắc Kinh, Đại học Thanh Hoa và Đại học Giao thông Thượng Hải; thay vì đợi người dùng sửa đổi nhiều lần mới bắt đầu “ghi nhớ”, nó sẽ truy vấn hồ sơ người dùng dựa trên ý định nhiệm vụ hiện tại ngay trong lần tạo đầu tiên, đồng thời định tuyến các sở thích dài hạn phù hợp vào bộ nhớ làm việc hiện tại để ảnh hưởng đến cách tổ chức và thể hiện trang.

Liên kết bài báo: https://arxiv.org/abs/2606.17162

Trang chủ dự án: https://memslides.github.io/

Liên kết trình diễn: https://memslides.com/

Liên kết mã: https://github.com/huohua325/Memslides

Liên kết HF: https://huggingface.co/papers/2606.17162

Công việc này đạt vị trí đầu trên Hugging Face Daily Papers Paper of the Day, GitHub đã nhận được hơn 400 sao; trang web demo sau khi ra mắt cũng đã thu hút hơn 100 người dùng xác minh thử nghiệm.

Hình 1 không hiển thị một “hình ảnh minh họa tổng quát”. Thay vào đó, nó mô tả cách hệ thống tách nội dung bài báo thành các trang như định nghĩa, cơ chế cốt lõi, bằng chứng thực nghiệm, những sai lầm phổ biến và các điều kiện biên. Những lựa chọn này phản ánh sở thích của người dùng về cấu trúc nội dung, mật độ thông tin và phong cách trình bày có căn cứ.

Hình 1: Lần tạo đầu tiên không chỉ thể hiện tính toàn vẹn, mà còn thể hiện ảnh hưởng của bộ nhớ hồ sơ người dùng đến cách tổ chức trang, mật độ nội dung và ranh giới bằng chứng.

Dự án cũng cung cấp bản dùng thử trực tuyến. Người dùng có thể tải lên tài liệu, chọn profile bộ nhớ hoặc mẫu, tạo bản nháp ban đầu, sau đó tiếp tục vào giai đoạn chỉnh sửa và tải về phiên bản hiện tại dưới định dạng PPTX, HTML hoặc PDF.

Nói cách khác, MemSlides hướng đến toàn bộ quy trình từ bản nháp cá nhân hóa đến các lần chỉnh sửa liên tục sau đó.

Và một khi phiên bản đầu tiên đã bắt đầu tiếp cận người dùng, các vấn đề sau đó trở nên sắc nét hơn: hệ thống có thể tiếp tục duy trì những sở thích này qua nhiều vòng chỉnh sửa không? Những yêu cầu được đưa ra tạm thời trong phiên hiện tại có sẽ mất hiệu lực sau vài vòng không? Khi người dùng chỉ muốn thay đổi một khu vực nhỏ, hệ thống có thể tránh làm xáo trộn lại những phần đã được căn chỉnh không?

Phân công trí nhớ

Nhiều người khi nghe đến "Agent memory" sẽ tự nhiên nghĩ: vậy thì đưa các cuộc hội thoại trước đó vào ngữ cảnh dài hơn.

MemSlides đã không làm như vậy.

Lý do rất đơn giản: càng lâu năm, càng có nhiều xung đột. Hôm nay người dùng nói “báo cáo này dùng tiêu đề màu xanh”, không có nghĩa là tất cả các bản trình bày sau này của họ đều phải dùng tiêu đề màu xanh; lỗi công cụ mà người dùng gặp phải trong một lần chỉnh sửa nào đó cũng không nên trộn lẫn với “họ thích phong cách gì”.

Do đó, MemSlides mô hình hóa quá trình tạo slide cá nhân hóa thành một quy trình biên tập có trạng thái: hệ thống trước tiên tạo bản nháp round-0 dựa trên tài liệu nguồn, bộ nhớ hồ sơ người dùng và mẫu tùy chọn; sau đó, mỗi vòng phản hồi sẽ cập nhật trạng thái phiên hiện tại, rồi thực hiện chỉnh sửa cục bộ xung quanh bản trình bày hiện tại.

Nó có hai góc nhìn về tổ chức bộ nhớ.

Về mặt chu kỳ sống, có bộ nhớ dài hạn và bộ nhớ làm việc. Bộ nhớ dài hạn lưu trữ thông tin ổn định xuyên suốt các tác vụ, trong khi bộ nhớ làm việc lưu trữ các ràng buộc tạm thời, mục tiêu sửa đổi và trạng thái thực thi vẫn còn hiệu lực trong deck hiện tại.

Về mặt vai trò chức năng, có bộ nhớ hồ sơ người dùng và bộ nhớ công cụ. Bộ nhớ đầu tiên trả lời câu hỏi “Bộ slide này nên thể hiện sở thích gì”, bộ nhớ thứ hai trả lời câu hỏi “Agent nên được cải tiến như thế nào để ổn định hơn”.

Nói cách khác, MemSlides không giúp Agent ghi nhớ nhiều thông tin vô ích, mà giúp nó biết rõ thông tin nào nên lưu trữ lâu dài, thông tin nào chỉ hiệu lực trong nhiệm vụ hiện tại, thông tin nào thuộc sở thích người dùng và thông tin nào là kinh nghiệm công cụ.

Hình 2: MemSlides tổ chức trí nhớ dài hạn, trí nhớ làm việc, trí nhớ hồ sơ người dùng và trí nhớ công cụ vào cùng một quy trình chỉnh sửa đa vòng.

Hồ sơ người dùng

Sự cá nhân hóa thực sự thường không thể giải quyết chỉ bằng một câu role prompt.

Cũng là báo cáo học thuật, có người thích chỉ đặt một kết luận cốt lõi trên mỗi trang, trong khi người khác giữ lại các công thức và chi tiết thí nghiệm; cũng là thuyết trình thương mại, có người ưa chuộng bảng dữ liệu dày đặc, trong khi người khác lại dựa nhiều hơn vào biểu đồ xu hướng và biểu đồ so sánh.

Những khác biệt này không phải là các nhãn trong một prompt duy nhất, mà là những thói quen dần dần bộc lộ qua quá trình viết và chỉnh sửa kéo dài của người dùng.

MemSlides sử dụng hồ sơ người dùng để lưu trữ các sở thích xuyên nhiệm vụ. Thay vì dán toàn bộ hồ sơ vào đầu prompt, nó truy xuất các sở thích liên quan dựa trên ý định hiện tại khi bắt đầu nhiệm vụ, sau đó phối hợp với yêu cầu trong lượt này.

Nếu sở thích dài hạn và chỉ thị rõ ràng hiện tại tương thích, chúng sẽ cùng được đưa vào trí nhớ làm việc; nếu xảy ra xung đột, yêu cầu rõ ràng trong các slide hiện tại sẽ được ưu tiên.

Bước này rất quan trọng. Nếu không, hệ thống rất dễ nhầm lẫn “lần này muốn tiêu đề màu xanh” với “người dùng luôn thích tiêu đề màu xanh”.

Sau khi hoàn thành nhiệm vụ, MemSlides cũng không ghi lại từng phản hồi vào hồ sơ dài hạn. Nó chỉ ghi nhận các tín hiệu tương tác ổn định và có thể chuyển giao, giúp lần tạo tiếp theo sát với người dùng hơn, chứ không trở nên hỗn loạn hơn.

Hình 3: Bộ nhớ hồ sơ người dùng sẽ trải qua các bước truy xuất, định tuyến, sử dụng trong nhiệm vụ hiện tại và lắng đọng tín hiệu ổn định sau khi hoàn thành nhiệm vụ.

Bộ nhớ làm việc

Trong các lần chỉnh sửa nhiều vòng, còn có một loại thông tin tinh vi hơn.

Đó không phải là sở thích dài hạn, nhưng phải duy trì hiệu lực trong bộ bài hiện tại.

Ví dụ: Người dùng nói ở vòng thứ 2: “Nếu sau này thêm summary/tip box, hãy dùng nền xám nhạt.” Lúc đó, hệ thống chưa thêm các yếu tố này, nên yêu cầu này chưa có đối tượng thực thi ngay lập tức. Sau vài vòng, nếu người dùng yêu cầu chèn trang có summary box, quy tắc này nên được kích hoạt.

Nếu Agent chỉ xem đầu vào của vòng hiện tại, thì rất dễ quên những ràng buộc có hiệu lực trễ như vậy.

Bộ nhớ làm việc của MemSlides là bảng trạng thái cho nhiệm vụ viết hiện tại: tất cả các ưu tiên tạm thời đang hoạt động, hướng dẫn được giữ lại, các mục tiêu đã giải quyết và trạng thái bao phủ đều được đặt ở đây. Giai đoạn Plan đọc các trạng thái này để xác định phạm vi sửa đổi, giai đoạn Act thực hiện các chỉnh sửa bị hạn chế dựa trên chúng, và giai đoạn Guard cập nhật kết quả kiểm tra.

Điều này giúp các lần chỉnh sửa nhiều vòng không còn là những prompt riêng lẻ, mà trở thành quá trình biên tập liên tục xung quanh cùng một bộ slide.

Hình 4: Bộ nhớ làm việc giúp các sở thích mẫu tạm thời đã được đưa ra trước đó nhưng được kích hoạt sau vẫn tiếp tục có hiệu lực.

Chỉ sửa những chỗ cần sửa

Đối với người biên tập, "chỉ sửa một chỗ này" là một câu rất tự nhiên.

Đối với hệ thống sinh tạo, câu này lại rất khó.

Vì nhiều hệ thống khi xử lý phản hồi sẽ đọc lại hoặc ghi lại toàn bộ nội dung rộng lớn. Kết quả là, khu vực mục tiêu đã được sửa đúng, nhưng các trang không phải mục tiêu cũng thay đổi. Người dùng tưởng chỉ đưa ra một yêu cầu nhỏ, nhưng hệ thống lại làm rối tung toàn bộ trạng thái của bản PowerPoint.

MemSlides sử dụng bản sửa đổi slide cục bộ có phạm vi để giới hạn vấn đề này.

Mỗi phản hồi được ánh xạ đầu tiên đến khu vực sửa đổi hiệu quả nhỏ nhất, sau đó đi vào quy trình Plan-Act-Guard.

Giai đoạn Plan chuyển yêu cầu ngôn ngữ tự nhiên thành execution contract, xác định slide mục tiêu, phạm vi tác động, các gợi ý selector và yêu cầu bao phủ.

Ở giai đoạn Act, chọn công cụ chỉnh sửa dựa trên cấu trúc trang và thực hiện các thao tác tối thiểu có hiệu quả trong phạm vi hạn chế. Giai đoạn Guard biến “Hoàn thành” thành một trạng thái cần kiểm tra: nếu mục tiêu chưa được bao phủ thì không được kết thúc vội vàng, nếu snapshot đã hết hạn thì cần liên kết lại, các yêu cầu cục bộ cũng không nên được mở rộng thành việc viết lại toàn bộ bộ deck.

Bước này chuyển từ “mô hình cho rằng đã hoàn thành chỉnh sửa” thành “hệ thống có thể kiểm tra xem lần chỉnh sửa này có thực sự bao phủ mục tiêu hay không, có vượt quá giới hạn hay không”.

Hình 5: Plan-Act-Guard chia nhỏ các thay đổi cục bộ thành lập kế hoạch phạm vi, thực thi có kiểm soát và kiểm tra kết quả.

Công cụ ghi nhớ

Slides chỉnh sửa không phải là việc viết lại văn bản thuần túy.

Một thay đổi cục bộ có thể liên quan đến cấu trúc trang, bộ chọn, quy tắc định dạng, bản ghi bố cục và logic xác minh. Ngay cả khi Agent hiểu được người dùng muốn gì, nó vẫn có thể đọc nhầm khu vực, lặp lại thử và sai, mở rộng phạm vi thay đổi hoặc kết thúc sớm trước khi mục tiêu được bao phủ.

Vì vậy, MemSlides còn giới thiệu công cụ ghi nhớ.

Công cụ ghi nhớ không ghi lại "người dùng thích gì", mà ghi lại "trong các tác vụ chỉnh sửa tương tự, đường dẫn thực thi nào hiệu quả và nên tránh những lỗi nào".

Bài viết tổ chức nó thành hai mức độ chi tiết: kinh nghiệm nhiệm vụ phạm vi vòng lặp ghi lại kinh nghiệm, tổng hợp lỗi và các mô hình có thể chuyển đổi trong một vòng chỉnh sửa; kinh nghiệm chuỗi công cụ phạm vi thao tác lưu trữ các đoạn reasoning-tool-observation chi tiết hơn, được truy xuất làm tài liệu tham khảo trước các lần gọi công cụ tương tự.

Thiết kế này tách biệt mục tiêu và việc thực hiện.

Hồ sơ người dùng quyết định hướng thay đổi của các slide, trong khi bộ nhớ công cụ giúp Agent tránh đi đường vòng, giảm thiểu việc khám phá và thực thi không hiệu quả.

Hình 6: Công cụ ghi nhớ tập trung vào kinh nghiệm gọi công cụ, chứ không phải sở thích thẩm mỹ của người dùng.

Kết quả thí nghiệm

Đánh giá MemSlides không chỉ cung cấp một điểm tổng thể, mà còn tách riêng các khả năng tương ứng với các thành phần trí nhớ khác nhau: trí nhớ hồ sơ người dùng được kiểm tra thông qua round-0 persona alignment, trí nhớ làm việc được kiểm tra thông qua delayed preference carryover trong các cuộc hội thoại đa vòng, và trí nhớ công cụ được kiểm tra độc lập trong cài đặt diagnostic matched-pair modify.

Trong việc tạo nội dung cá nhân hóa, bộ nhớ hồ sơ người dùng đã cải thiện sự phù hợp persona trong các thiết lập đa persona và đa intent. Bài báo còn chỉ ra rằng sự cải thiện này không chỉ thể hiện ở việc “giống một mẫu nào đó”, mà còn ở các lựa chọn ở cấp độ lập kế hoạch như trọng tâm nội dung, vai trò trang, tổ chức bằng chứng và phân biệt persona.

Trong chẩn đoán cặp được sửa đổi cục bộ, những thay đổi do công cụ ghi nhớ mang lại trực tiếp hơn:

Đồng thời, tỷ lệ thời gian công cụ lõi giảm xuống 0,327x.

Cần lưu ý rằng các con số này đến từ cài đặt matched-pair chẩn đoán, không thể được diễn giải là sự dẫn đầu đơn điệu trong mọi tình huống. Chính xác hơn, chúng hỗ trợ một kết luận quy trình: khi bộ nhớ công cụ cung cấp kinh nghiệm thực thi có thể tái sử dụng, Agent dễ dàng hội tụ hơn trong việc hoàn thành vòng kín, xác minh nghiêm ngặt và tìm ra đường dẫn chỉnh sửa đúng đầu tiên.

Hình 7: So sánh chỉnh sửa cục bộ là một ví dụ định tính trong bài báo, dùng để hiển thị sự khác biệt trong quá trình chỉnh sửa trước và sau khi chèn bộ nhớ công cụ.

Bước tiếp theo của PPT Agent

Là sự hợp tác lâu dài

MemSlides đang thảo luận về PPT, nhưng vấn đề đằng sau nó không chỉ thuộc về PPT.

Khi Agent thực hiện các tác vụ chu kỳ dài như tạo tài liệu, sửa đổi mã, phân tích dữ liệu hoặc hệ thống tri thức doanh nghiệp, đều gặp phải những thách thức tương tự: những thông tin nào nên lưu trữ lâu dài, trạng thái nào chỉ thuộc về nhiệm vụ hiện tại, kinh nghiệm thực thi nào có thể tái sử dụng, và nội dung nào phải được giữ nguyên khi thực hiện sửa đổi cục bộ.

Nếu tính năng tạo một cú nhấp giải quyết vấn đề từ 0 đến 1, thì nhiều vòng chỉnh sửa sẽ kiểm tra khả năng từ 1 đến khi sử dụng được.

Slides Agent trong tương lai không chỉ có thể tạo ra trang đầu tiên đẹp hơn, mà còn phải liên tục hiểu người dùng và duy trì ranh giới biên tập qua nhiều lần chỉnh sửa, giúp bộ slides ổn định tiến gần hơn đến phiên bản người dùng thực sự mong muốn.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.