Андрей Карпати предсказывает, что для достижения непрерывного обучения ИИ потребуется 10 лет

icon MarsBit
Поделиться
AI summary iconСводка
Андрей Карпафти в подкасте 2025 года отметил, что крупные языковые модели все еще не обладают непрерывным обучением, и он оценивает, что решение этой проблемы займет десятилетие. Исследования включают системы внешней памяти и самоизменяющиеся модели для предотвращения катастрофического забывания. Альткоины, за которыми стоит следить, могут отражать прогресс в этой области. Индекс страха и жадности остается нестабильным, поскольку инвесторы отслеживают инновации, основанные на ИИ. Стартапы и университеты тестируют новые методы для повышения адаптивности моделей.

Недавно мы освещали множество стартапов и исследовательских работ, направленных на «непрерывное обучение», например: «Mind Lab последовательно представляет новые достижения LoRA: появляется новая парадигма непрерывного обучения больших моделей», «Прощай, оковы KV Cache: встраивание длинного контекста в веса — есть ли надежда на непрерывное обучение больших моделей?», «ICML 2026 | Прорыв! Университет Гонконга представил первую архитектуру непрерывного обучения, адаптированную для 300+ задач, и решил проблему забывания», «Может ли DeepSeek Самоэволюционирующий Harness! Автор LlamaFactory выпустил новый инструмент с открытым исходным кодом: автоматическое создание агентов за 0,2 юаня. >>> Когда «увеличение» больше не единственный путь — еще одна китайская модель с открытым исходным кодом.

Да, довольно плотно, «постоянное обучение» также становится одним из самых часто встречающихся ключевых слов. Это также указывает на постоянно повторяемое суждение.

В октябре 2025 года Андрей Карпати на подкасте Дваркеша Пателя сказал: «Современные крупные модели не обладают непрерывным обучением. Вы не можете сообщить им что-то и ожидать, что они это запомнят». Он считает, что устранение этих когнитивных недостатков займет примерно десять лет. Два месяца спустя, в своем годовом обзоре, он поместил это утверждение в более широкий контекст: прыжок в возможностях моделей в 2025 году в основном произошел благодаря усилению обучения с проверяемыми наградами (RLVR), однако в всей технологической стеке LLM память, мультимодальное восприятие, непрерывное обучение и способность управлять компьютером остаются явными слабыми местами: «У нас есть прототипы, но еще нет агентов, которых можно было бы использовать как коллег».

Агент

Постоянное обучение (Continual Learning, также известное как пожизненное обучение/Lifelong Learning) стало одним из самых популярных понятий за последний год.

Это означает, что модель после развертывания может продолжать постоянно усваивать новые задачи, новые знания и новый опыт, как человек, не забывая при этом ранее изученного.

Это звучит само собой разумеющимся, но на практике чрезвычайно сложно — настолько сложно, что становится самым твердым костью на пути к «AI-коллеге». Приведенные выше новости также показывают, что этот путь уже не является одним направлением, а представляет собой несколько параллельных маршрутов, одновременно продвигающихся вперед.

За последний год академическое и промышленное сообщества разработали несколько различных технических подходов к тому, как заставить модель «учиться в процессе использования». Одни добавляют память к модели, другие постоянно перезаписывают веса, третьи полностью переобучают модель с нуля, а более новые идеи пытаются переопределить само понятие «обучения». В этой статье мы пошагово рассмотрим каждый из этих направлений, объясняя, на что они делают ставку и где сталкиваются с трудностями.

Сначала ясно: сложнее не «учиться», а «не забывать»

Основным препятствием для непрерывного обучения является специальный термин: катастрофическое забывание. Знания нейронной сети хранятся в миллиардах весов; когда вы дообучаете модель на новых данных и обновляете эти веса, модель часто перезаписывает параметры, отвечающие за прежние навыки, что приводит к резкому падению производительности на задачах, которые раньше выполняла успешно.

Агент

Схема катастрофического забывания. Когда искусственная глубокая нейронная сеть последовательно обучается на двух задачах, она быстро и полностью забывает первую задачу при обучении второй.

Это явление активно изучалось в эпоху малых моделей, но у крупных языковых моделей возникли новые проблемы. Бенчмарк TRACE, специально разработанный для оценки непрерывного обучения LLM, обнаружил, что непрерывная тонкая настройка уже согласованной модели не только заставляет её забывать старые задачи, но и ухудшает общие способности и способность следовать инструкциям. Другими словами, если вы хотите научить модель чему-то новому, цена может заключаться в том, что она в целом станет менее умной и менее послушной.

Поскольку прямое изменение весов несет столь высокий риск, «постоянное обучение» разделилось на несколько направлений. Их основное различие заключается в том, что они по-разному решили вопросы: «изменять ли веса» и «где хранить новые знания».

Повесить память вне модели

Самый прямой и быстрый подход: вообще не трогать веса модели, а хранить новые знания во внешней базе данных и извлекать их в контекст по мере необходимости. Этот подход эволюционировал от RAG (поиск, усиленный генерацией), и сегодня превратился в отдельную область — память агентов (Agent Memory).

Репрезентативной работой является MemGPT (компания, стоящая за ней, теперь называется Letta). Она сравнивает управление контекстом LLM с управлением памятью в операционной системе, разделяя ограниченный «рабочий контекст» и более крупное «внешнее хранилище», позволяя модели самостоятельно решать, что загружать в контекст, а что записывать в архив, подобно тому, как операционная система управляет памятью.

В этом направлении появилась серия систем с различными акцентами: Mem0 фокусируется на производственном уровне и масштабируемом доступе к долгосрочной памяти; Zep добавляет к поиску хронологическую знаниевую сеть для обработки временных рассуждений между сессиями; A-MEM вдохновлена методом карточных ящиков (Zettelkasten), присваивая каждой памяти структурированные метки и автоматически связывая их с соответствующими предыдущими записями, чтобы поиск лучше соответствовал контексту.

Карпати сам также сделал ставку на это направление. Он неоднократно подчеркивал, что в будущем потребуется не «больший жесткий диск» для памяти, а компактное «когнитивное ядро» (cognitive core, по его оценке, достаточно одного-двух миллиардов параметров) плюс структурированная внешняя память, способная самостоятельно приносить доход.

Следуя этой идее, он опубликовал на GitHub модель под названием «LLM Wiki»: вместо того чтобы каждый раз запрашивать исходные фрагменты текста с помощью RAG, агент активно компилирует информацию в постоянно обновляемую и взаимосвязанную базу знаний, которую затем можно запрашивать.

Агент

Документация LLM Wiki Карпати получила почти 45 000 звезд и была форкнута более 9 000 раз.

Летта сама подняла эту идею до уровня утверждения «непрерывного обучения в пространстве токенов». Они отмечают, что сегодня стандартной практикой является подход «сначала добавить, потом сжать»: исходный опыт накапливается до переполнения контекста, а затем сжимается в краткое изложение, что имеет два недостатка: добавление перекладывает всю работу по представлению на этап вывода, заставляя каждый прямой проход повторно обрабатывать исходные журналы; а сжатие является потерянным и резким — важные детали исчезают без предупреждения. Ставка Летты заключается в том, что память, обученная в пространстве токенов в будущем, будет ценнее, чем веса самой модели.

Преимущества этого подхода — безопасность, управляемость и объяснимость: ошибки можно сразу удалить; недостаток в том, что он не интегрирует знания непосредственно в модель — каждый раз необходимо полагаться на поиск и контекст как на узкое входное отверстие; при расширении базы данных точность и стоимость поиска становятся узким местом.

Позвольте контексту эволюционировать в «руководство по стратегии»

За пределами использования внешней памяти лежит более изощренный подход: не изменять веса, а позволять самому контексту, подаваемому модели, постоянно эволюционировать. Это называется инженерией контекста (Context Engineering).

В октябре 2025 года ACE (Agentic Context Engineering), предложенный Стэнфордом, SambaNova и UC Беркли, является ярким примером. Он рассматривает контекст как постоянно развивающуюся «руководство» (playbook), которое поддерживается тремя специализированными ролями: Generator отвечает за генерацию цепочки рассуждений, Reflector извлекает конкретный опыт из успехов и неудач, а Curator структурирует этот опыт в виде инкрементальных обновлений и интегрирует их в руководство.

Агент

ACE направлен на решение двух общих проблем аналогичных методов: во-первых, «предпочтение краткости» (brevity bias): при повторном переписывании контекста LLM склонен сжимать его и упускать отраслевые детали; во-вторых, «коллапс контекста» (context collapse): повторное переписывание приводит к постепенной потере деталей.

ACE использует инкрементальные небольшие изменения (delta updates), а не полную перезапись, чтобы избежать этих двух проблем. Согласно данным из статьи, ACE показывает улучшение на 10,6% по задачам агентов и на 8,6% по финансовой логике по сравнению с базовыми моделями, одновременно сокращая задержку адаптации примерно на 86,9%; в рейтинге AppWorld с использованием меньших открытых моделей DeepSeek -V3.1 с ACE средний балл достигает уровня производственного интеллектуального агента IBM CUGA на базе GPT-4.1.

Стоит отметить, что ACE подчеркивает, что он может работать без аннотированного набора данных; он использует естественные сигналы обратной связи, возникающие в процессе выполнения (например, успешно ли запустился код или возникла ошибка), для направления рефлексии и структурирования. Это связывает его с более широкой концепцией «агентов, обучающихся на собственном опыте».

Continued post-training: adjust weights, but do it wisely

Внешняя память и инженерия контекста избегают рисков изменения весов, но также избегают настоящего усвоения знаний. Другая группа исследователей считает, что в долгосрочной перспективе некоторые знания и навыки все же необходимо закодировать в параметры. Это называется непрерывным пост-обучением (Continual Post-training), которое в основном включает этапы непрерывной тонкой настройки по инструкциям и непрерывного выравнивания предпочтений.

Джон Шульман из Thinking Machines предложил иерархический подход: он сравнил обучение с психологическими категориями, такими как обучение движению, эпизодическая память и процедурная память, считая, что обучение в контексте эффективно справляется с краткосрочными задачами обучения, а тонкая настройка параметров (включая методы, такие как LoRA), накладывается поверх него и особенно подходит для задач, требующих большого объема и настоящего усвоения знаний — когда временной масштаб увеличивается, и обучение в контексте перестает быть достаточным, тонкая настройка параметров побеждает.

Самым большим врагом этого подхода по-прежнему остается катастрофическое забывание, и недавно интересное решение предложила Thinking Machines с помощью Tinker.

Агент

Tinker — их первый продукт, запущенный в октябре 2025 года, — это API для тонкой настройки на основе LoRA, который абстрагирует сложности распределённого обучения, предоставляя лишь низкоуровневые примитивы, такие как forward_backward и optim_step, чтобы исследователи могли сосредоточиться на данных и алгоритмах.

В области непрерывного обучения они продвигают метод под названием Self-Distillation Fine-Tuning (SDFT): ключевая идея заключается в том, что обычное надзорное дообучение является «офф-политикой» (off-policy), из-за чего модель вынуждена имитировать токены, которые сама никогда не сгенерировала бы, и каждое новое умение подрывает прежние навыки; SDFT позволяет модели выступать в роли собственного учителя, осваивая новые навыки на примерах, не забывая при этом старые. Стартап Trajectory уже использует Tinker в качестве основной инфраструктуры своей платформы непрерывного обучения.

Кстати, использование LoRA вместо полной дообучки у Tinker имеет еще одно практическое преимущество: несколько задач дообучки могут совместно использовать один и тот же пуловый ресурс, что снижает затраты. Это также объясняет, почему «обучение в реальном времени как услуга» становится бизнесом: превращение частых обновлений моделей в API, доступный по запросу, — именно то направление, которое сейчас активно развивается в промышленности.

Переобучение и непрерывное предобучение

Если послеобучение — это вмешательство на «поверхностном» уровне модели, то непрерывное предобучение (Continual Pre-training, CPT) возвращает нас к самой основе: с помощью новых текстовых данных модель продолжает предобучение, адаптируясь к новым областям, языкам или изменяющимся со временем распределениям знаний. По сравнению с повторным обучением модели с нуля на смешанных данных, CPT строится на основе уже существующей модели и требует значительно меньше вычислительных ресурсов.

Его типичные области применения включают смещение знаний со временем, межъязыковое расширение и адаптацию междисциплинарно. Однако цена также очевидна: многочисленные эмпирические исследования неоднократно показывали, что непрерывное предобучение требует значительных вычислительных ресурсов и легко вызывает катастрофическое забывание уже усвоенных знаний. Поэтому научное сообщество постоянно ищет методы непрерывного предобучения «без повторного воспроизведения и без аннотирования задач», стремясь достичь отсутствия забывания на масштабе крупных языковых моделей.

Для подавляющего большинства компаний стоимость повторного предварительного обучения передовой модели с нуля слишком высока, чтобы быть реалистичной — именно поэтому Карпати сказал: «Крупные модели не подходят для частого повторного обучения». Таким образом, строгое «повторное предварительное обучение» в основном является вариантом внутри передовых лабораторий, тогда как непрерывное предварительное обучение представляет собой более реалистичный компромисс.

Обновленная идея: заставить модель учиться самостоятельно изменять себя

Первые четыре направления всё ещё в какой-то мере крутятся в рамках бинарной модели «читы против изменения весов». Однако за последний год появился ряд новых работ, пытающихся выйти за пределы этой модели и переопределить сам процесс обучения.

Один из подходов — заставить модель самостоятельно генерировать обучающие данные и решать, как обновлять себя.

MIT’s SEAL (Self-Adapting Language Models) является типичным примером. При получении нового входа модель генерирует фрагмент «саморедактирования» (self-edit) — это естественноязыковая инструкция, объясняющая, как перестроить информацию, какие гиперпараметры использовать для обновления весов и какие инструменты вызвать для усиления данных; затем модель на основе этого выполняет тонкую настройку собственных весов, обеспечивая долгосрочные обновления. Критерий «какое саморедактирование является эффективным» обучается с помощью внешнего цикла обучения с подкреплением, где сигналом награды является производительность обновленной модели на последующих задачах.

Агент

Версия NeurIPS 2025 дополнительно подтвердила, что эта адаптивная способность усиливается с увеличением размера модели и использует обучение с подкреплением для смягчения забывания. Её авторы предвосхищают модель, способную в процессе вывода самостоятельно решать, «стоит ли сейчас что-то изучить», превращая одноразовую цепочку рассуждений в постоянную способность.

Еще один более агрессивный подход исходит от вложенного обучения (Nested Learning) от Google, опубликованного на NeurIPS 2025. Его суть заключается в переосмыслении модели как набора взаимно вложенных, многоуровневых задач оптимизации, каждая из которых имеет свой собственный «поток контекста» и разную частоту обновления — архитектура и алгоритм оптимизации в этой перспективе объединяются как разные уровни одного и того же явления.

Агент

В качестве доказательства концепции они создали самоизменяющуюся архитектуру под названием Hope, которая расширяет архитектуру Titans Long-Term Memory двумя компонентами: неограниченной вложенностью уровней обучения и системой «непрерывной памяти» (CMS). Проще говоря, вместо простого разделения на краткосрочную и долгосрочную память появляется целый спектр модулей памяти, обновляющихся на различных временных масштабах.

Агент

В экспериментах Hope превосходит стандартные Transformer и современные рекуррентные модели в задачах языкового моделирования, длинного контекста и непрерывного обучения. Интересно, что последующие работы ввели для таких архитектур «фазу сна» — аналогично тому, как человек консолидирует память во сне, модель выделяет вычислительные ресурсы между активными сессиями, чтобы дистиллировать полезные абстракции в более долговременную параметрическую память.

На более высоком уровне абстракции — это нарратив «Эры опыта», предложенный Дэвидом Сильвером и Ричардом Саттоном.

Агент

Их вывод заключается в том, что в ключевых областях, таких как математика, кодирование и наука, знания, извлекаемые из человеческих данных, приближаются к пределу; чтобы двигаться дальше, необходимо, чтобы ИИ постоянно учился на опыте, полученном в результате взаимодействия со средой, создавая замкнутый цикл самообеспечения данными. Они рассматривают AlphaProof от DeepMind в 2024 году (получившего медаль IMO через «постоянное взаимодействие с формальными доказательными системами») как начало этой эпохи. Эта нарративная линия связывает непрерывное обучение, усиленное обучение и автономное исследование агентами, одновременно оставляя нерешённой проблему: кто будет проектировать функции вознаграждения, преобразующие первичные сигналы в полезные указания.

Еще одним смежным направлением, которое легко спутать с непрерывным обучением, но имеющим другую цель, является редактирование знаний (Knowledge Editing). Представленное такими методами, как ROME и MEMIT, оно обеспечивает точное обновление отдельных или пакетных фактов за счет локализации и изменения слоев MLP, хранящих конкретную информацию, без необходимости полной переобучения модели. Однако его цель отличается от цели непрерывного обучения: редактирование знаний стремится к точному перезаписыванию определенного факта; в сценариях последовательного и постоянного редактирования повторные изменения параметров начинают мешать друг другу, постепенно накапливая «токсичность», что приводит к коллапсу модели. Это породило появление таких методов, как WISE и AlphaEdit, специально разработанных для обработки последовательных редактирований.

Агент

Заключение

Глядя на эти направления вместе, можно заметить, что они фактически расположены вдоль оси «где существует знание».

Агент

Самый внешний уровень — это внешняя память и инженерия контекста, где знания полностью существуют вне модели, в пространстве токенов, безопасны и контролируемы, но не интегрированы внутрь; средний уровень — это непрерывное постобучение и непрерывное предобучение, где знания записываются в веса, обеспечивая более высокий потенциал, но сталкиваясь с катастрофическим забыванием; самый внутренний и наиболее передовой уровень — это новые подходы, позволяющие модели самостоятельно изменяться и эволюционировать, стремящиеся превратить сам процесс «обучения» в часть способностей модели.

Практическое наблюдение: эти направления, скорее всего, не взаимоисключающие, а будут взаимодействовать на разных уровнях. Идеи Шульмана о иерархическом обучении и концепция Карпати «когнитивное ядро + внешняя память» по сути говорят об одном и том же: краткосрочные, изменчивые знания передаются контексту и внешней памяти, а долгосрочные, требующие накопления способности — тонкой настройке параметров, каждая компонента выполняет свою роль. ACE способен эволюционировать без наблюдения за счет обратной связи от выполнения, SEAL использует обучение с подкреплением для оптимизации саморедактирования — оба примера указывают на общую тенденцию: будущее непрерывного обучения, вероятно, заключается в том, чтобы позволить модели самой управлять тем, «что учить и как учить».

Таким образом, вернемся к оценке Карпати о «еще десяти годах» — удалось ли решить проблему непрерывного обучения? Ответ, вероятно, такой: пока нет, но ситуация уже не является полностью пустой. Основное препятствие — катастрофический забывание — до сих пор не преодолено полностью; методы, такие как SDFT и вложенное обучение, лишь смягчают его, но не устраняют. Можно ли решить проблему непрерывного обучения исключительно за счет более эффективного управления контекстом и тонкой настройки, или же необходимы совершенно новые идеи? Этот более фундаментальный вопрос даже Шульман сам признает, что пока не имеет однозначного ответа.

Одно можно сказать точно: в период с 2025 по 2026 год непрерывное обучение превратилось из постоянно упоминаемой «недостающей способности» в активную область, где появляются множество направлений и стартапы начинают разрабатывать продукты. Следует продолжать следить за тем, какой путь первым превратит «AI-коллегу» из прототипа в реальность.

Ссылка для справки

https://www.lesswrong.com/posts/qBsj6HswdmP6ahaGB/andrej-karpathy-on-llm-cognitive-deficits

https://karpathy.bearblog.dev/year-in-review-2025/

https://www.letta.com/blog/continual-learning/

https://arxiv.org/abs/2510.04618

https://arxiv.org/abs/2402.01364

https://thinkingmachines.ai/tinker/

https://arxiv.org/pdf/2604.05096

https://arxiv.org/pdf/2606.03979

Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Machine Heart, обучающаяся непрерывно, редактор: Panda

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.