Математический прорыв, применённый к ИИ: GeoLAN решает проблему «чёрного ящика» с помощью гипотезы Какея

iconMetaEra
Поделиться
AI summary iconСводка
Новости об ИИ и криптовалюте стали центральной темой, когда команда Университета Флориды применила трехмерную гипотезу Какея к обучению ИИ, создав GeoLAN для решения проблемы «черного ящика». Метод использует геометрические ограничения, чтобы сделать рассуждения ИИ прослеживаемыми. В новостях на блокчейне Джейкоб Цимерман, лауреат Филдсовской премии, присоединился к OpenAI, что сигнализирует о более глубокой интеграции математики и ИИ.
Группа из Университета Флориды применила недавно доказанную трёхмерную гипотезу Куги к обучению крупных моделей, разработав метод GeoLAN для решения проблемы «чёрного ящика» ИИ. Метод использует концепцию «вискозных множеств Куги», возникшую в ходе доказательства гипотезы Куги, чтобы наложить геометрические ограничения на семантическое пространство крупных моделей, упорядочивая концепции уже на этапе обучения и делая путь рассуждений ИИ прослеживаемым. Эксперименты на моделях Llama-3-8B, Gemma-3-4B и других показали значительное улучшение результатов. В тот же день, когда был вручен Филдсовская премия, её лауреат Джейкоб Цимерман объявил о присоединении к OpenAI для работы в области безопасности ИИ, что демонстрирует беспрецедентное сближение математики и ИИ.

Автор статьи, источник: Leiphone

Математики прокладывают путь вперед, исследователи ИИ собирают сокровища позади — можно ли использовать премию Филдса для раскрытия «черного ящика» ИИ?

Математическое сообщество и сообщество ИИ тесно взаимодействуют

Чистые математические достижения уровня уже напрямую применены в обучении крупных моделей.

Автор Xiaohongshu Z9 обнаружил, что недавно ставший вирусным трехмерный гипотез Гонсареса теперь была интегрирована командой Университета Флориды в процесс обучения нейронных сетей для решения «проблемы черного ящика» в крупных моделях.

Их статья называется «GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models». Ее суть заключается в использовании ключевого понятия «липкое множество Геометрии», возникшего в ходе доказательства гипотезы Кёнига, для установления «правил размещения» в внутреннем семантическом пространстве больших моделей, упорядочивания запутанных концепций еще на этапе обучения и делая мыслительные пути ИИ по-настоящему прослеживаемыми.

Математики прокладывают путь вперед, исследователи ИИ собирают сокровища позади — можно ли использовать премию Филдса для раскрытия «черного ящика» ИИ?

Поистине, впереди математические гении прокладывают путь, а позади исследователи ИИ находят сокровища.

Основная проблема крупных моделей: коллапс представлений

Начнем с «черного ящика», который ощущают все.

Современные крупные модели показывают высокую точность при решении задач, написании кода и анализе, но когда вы спрашиваете их: «Как пришли к этому шагу?», они либо не могут объяснить, либо просто придумывают ложное обоснование.

Корень этой проблемы скрыт в фундаментальной особенности, называемой репрезентационным коллапсом.

Вы можете представить семантическое пространство большой модели как огромный умный склад с тысячами уровней, где теоретически можно разместить бесчисленное количество понятий: логику, эмоции, факты, рассуждения и т.д., каждое на своём месте.

Но во время обучения Transformer он особенно «ленив» — он всегда скапливает всю семантическую информацию на небольшой площади у входа в склад, оставляя остальные 90% пространства полностью неиспользованными.

В результате все концепции сжимаются в узкую высокоразмерную коническую область, что в академической среде называется «анизотропией».

А последствия тесного скопления могут привести ко многим проблемам.

Например, концептуальная запутанность заставляет объединять совершенно не связанные между собой элементы в одном направлении, заставляя один нейрон одновременно реагировать на «кошку» и активироваться на «библейские стихи».

И ты вообще не можешь определить, какая часть представления соответствует какой логике, даже сама модель не может восстановить реальный путь мышления.

Когда близкие, но разные понятия сжимаются в одно, легко запутаться; немного изменив вопрос, ИИ легко начинает нести чушь.

В статье есть точное резюме: несколько «враждебных измерений» доминируют над большей частью дисперсии информации, полностью тратя эффективную емкость модели.

Эта проблема является недостатком практически всех основных архитектур Transformer — от GPT и Llama до Gemma.

В такой ситуации ранее отрасль обычно применяла метод «устранения последствий»: дожидаясь завершения обучения модели, использовались инструменты, такие как разреженные автокодировщики, чтобы насильственно разделить запутанные концепции.

Однако результаты, полученные таким методом, лишь «выглядят разумно» и не обязательно соответствуют реальной логике внутри модели; точность всегда снижается.

Сейчас GeoLAN изменил подход: не ждите, пока всё запутается, а сразу всё расположите по правилам. На протяжении всего обучения добавляйте геометрические ограничения к пространству представлений, чтобы каждое понятие оказалось на своём месте.

Как связано предположение Гаи с ИИ?

Чтобы понять идею GeoLAN, нужно сначала узнать, о чем гипотеза Ояма.

В 1917 году математик Согэй Какутани поставил кажущуюся простой, но мучившую математическое сообщество полвека задачу: взяв иглу длиной 1 сантиметр, повернуть её на полный круг на поверхности стола. Какую минимальную площадь она может охватить?

Вы можете подумать, что, чтобы сделать полный оборот, нужно нарисовать круг, площадь которого не может быть маленькой. Но математики обнаружили, что она может приближаться к нулю.

Как это сделать?

Если вы заставите иглу вращаться и одновременно скользить, она сможет описать странную фигуру с площадью, почти равной нулю. То есть в двумерном мире вы можете поместить все геометрические траектории в крайне маленькую область.

Задача становится еще сложнее: а что, если в трехмерном пространстве? Когда эта игла может вращаться во всех возможных направлениях — вверх, вниз, влево, вправо и во всех других трехмерных направлениях — какого минимального размера должно быть пространство, чтобы вместить все эти иглы во всех направлениях?

Согласно двухмерному опыту, в трехмерном пространстве абсолютный объем этой фигуры все еще можно сжать до почти нуля.

Но здесь возникает новая загадка: хотя эта фигура пуста и не имеет объема, уменьшилась ли она и деградировала ли на микроскопическом уровне? Математики ввели понятие «фрактальная размерность», чтобы измерить плотность ее структуры.

В конце концов, Ван Хун и другие обнаружили, что даже если вы максимально обесцениваете объем графика, чтобы учесть каждую иглу в каждом направлении, его внутренняя переплетенная структура сохраняет прочную «трехмерную насыщенность» и не деградирует на микроскопическом уровне. Именно в этом заключается величие Ван Хун в решении вековой проблемы.

В процессе этого строгого доказательства возникло чрезвычайно важное понятие, называемое «липкое множество Гута».

«Липкость» — это просто набор правил против сжатия. Она специально предназначена для управления отрезками и трубками, чтобы предотвратить их сближение.

Если группа труб соблюдает эти правила, они равномерно распределяются, и пространство остаётся того же размера; но если они не соблюдают правила и все сжимаются в маленьком уголке, «размер» пространства уменьшается, и оно выглядит сжатым.

До сих пор вы, вероятно, уже поняли: катастрофа представления большой модели — это не то же самое, что «семантическая трубка не удовлетворяет условию вязкости, и всё скопилось в одном месте»?

GeoLAN просто использует математический вывод гипотезы Гу Гу в качестве инженерного стандарта: раз математически строго доказано, что «удовлетворяется вязкость, пространство не коллапсирует», то мы также добавляем аналогичное вязкостное ограничение к семантическому пространству крупных моделей, чтобы их представления естественным образом не сжимались в кучу.

Включить это правило в процесс обучения, ключевым является создание количественно измеримой функции штрафа, то есть правила, которое модель может вычислить и знать, как его исправить.

Затем GeoLAN разработал две системы штрафных правил, превратив геометрические правила гипотезы Гео в обучающие цели. Одна называется KT-CW и предназначена для устранения «семантического скопления», а другая — KT-Attn — для борьбы с «ленью внимания».

Проще говоря, KT-CW заключается в случайной выборке различных направлений в семантическом пространстве во время обучения. Если обнаруживается, что какое-то направление содержит слишком много семантической информации, модель получает штраф. Это заставляет модель равномерно распределить знания по всем уголкам высокомерного пространства, полностью используя ранее неиспользуемые измерения и从根本上 решая проблему «скопления».

Другой набор KT-Attn специально борется с ленью в механизме внимания. На поздних этапах обучения крупные модели часто сталкиваются с серьезной гомогенизацией голов внимания: многие головы всё время фокусируются на одном и том же слове и одной и той же позиции, а эффективно работающих «рабочих сил» крайне мало. Это правило жестко требует, чтобы каждая голова внимания фокусировалась на совершенно разных семантических областях, обеспечивая всестороннее покрытие внимания и полностью устраняя явление вырождения ранга голов внимания.

После применения этого комплекса мер эффект был мгновенным.

На Llama-3-8B GeoLAN преобразовал искаженное коническое представление в гладкую сферическую форму, значительно снизив степень сжатия и значительно повысив равномерность по всем направлениям, сохранив при этом точность задачи.

На Gemma-3-4B точность MMLU повысилась с 0,59 до 0,60, что составляет примерно 0,75 процентных пункта. Семантическая стабильность TruthfulQA значительно улучшилась.

На более крупной модели Gemma-3-12B показатель предвзятости также продемонстрировал статистически значимое снижение.

Более интересно то, что в статье также был обнаружен интересный феномен, называемый «зоной Золушки».

То есть равномерное распределение этих строгих геометрических ограничений становится катастрофой для моделей с слишком малым количеством параметров: малые модели по своей природе должны полагаться на запутывание концепций для достижения экстремальной семантической компрессии, и насильственное разрушение этой структуры лишь полностью ухудшит их внутреннюю геометрию.

Для сверхкрупных моделей, чей объем слишком велик, процесс предварительного обучения уже самостоятельно сформировал чрезвычайно сложную многообразную структуру; добавление этих правил не только не подходит, но и замедлит общую производительность.

Лучшие результаты показывают модели среднего размера, такие как четыре-восемь миллиардов параметров, которые имеют достаточный объем для эффективного использования преимуществ, связанных с равномерным распределением.

Более того, в статье выводится изящная теорема — «теорема семантической вязкости»: когда представления удовлетворяют «правилу предотвращения вытеснения», различные семантические концепции автоматически разлагаются на приблизительно взаимно перпендикулярные подпространства, которые авторы статьи образно называют «зернами». Каждое подпространство можно интерпретировать и настраивать независимо, что делает проблему «черного ящика», мучившую отрасль много лет, прозрачной.

Статья ACL привела гипотезу Окада из чисто математической сферы прямо в инженерию ИИ.

Лауреат премии Филдса объявил о присоединении к OpenAI в тот же день

Еще одним примечательным моментом является то, что один из лауреатов Филдсовской премии, известный математик Джейкоб Цимерман, в день получения награды объявил, что вскоре присоединится к OpenAI для работы в области безопасности ИИ.

Математики прокладывают путь вперед, исследователи ИИ собирают сокровища позади — можно ли использовать премию Филдса для раскрытия «черного ящика» ИИ?

Это заставляет обратить внимание на тесную связь передовой математики и ИИ.

Ровно год назад он совместно с исследователем по безопасности ИИ из Беркли Эндрю Кричом написал статью «A Taxonomy of Omnicidal Futures Involving Artificial Intelligence», в которой с максимальной строгостью математика построил подробную классификацию путей риска ИИ.

Он сам является крупным受益ителем ИИ: в 2025 году у него было опубликовано 5 математических статей на arXiv, и он прямо заявил, что ИИ удвоил его научную продуктивность.

Еще более драматично: за три дня до церемонии награждения кто-то с помощью последней версии Claude Fable 5 от Anthropic за одну ночь опроверг гипотезу Якоби, остававшуюся нерешенной 87 лет, и потряс мировое математическое сообщество. Этим человеком был его студент Левент Альпёге.

面对人工智能不断逼近甚至超越顶尖数学家的“智商”,数学界泰斗蒂莫西公开感叹:这是他一生中第一次看到大型语言模型在自己完全陌生的领域轻松攻克了举世闻名的世纪难题。

Связь между математикой и ИИ давно вышла за рамки слова «неразделимая» — они сливаются друг с другом с поразительной скоростью.

За прошедший год ИИ продемонстрировал выдающиеся результаты в математических соревнованиях: от серебряной медали AlphaProof от DeepMind на Международной математической олимпиаде до того, как модель рассуждений от OpenAI разрешила восьмидесятилетнюю гипотезу Эрдёша о единичных расстояниях, а затем GPT-5.6 справился с гипотезой циклического двойного покрытия всего за один час, и Claude Fable 5 за одну ночь решил гипотезу Якоби. За два месяца ИИ установил несколько столетних рекордов, и скорость решения сложных задач продолжает расти экспоненциально.

В интервью AMS Якоб прямо заявил: «В математическом сообществе существует огромное количество самободрения: люди видят, что ИИ сейчас уступает математикам, и делают вывод, что он никогда не превзойдет их». Он сам доказал на практике, что, хотя доказательства модели «неполны и нестроги», они «обычно позволяют найти примерно правильный подход и пройти восемьдесят процентов пути».

Он даже считает, что в течение двух лет ИИ превзойдет людей в математических доказательствах.

Тогда возникает вопрос: будут ли в 2030 году на премии Филдса человеческие лауреаты?

Премия Филдса имеет строгий возрастной лимит: лауреаты должны быть младше 40 лет. Это означает, что если ИИ в ближайшие четыре года систематически превзойдет способность человеческих математиков к оригинальным открытиям, жюри столкнется с беспрецедентной дилеммой: вы награждаете человека, сделавшего лучшую математическую работу, или человека, сделавшего лучшую математическую работу среди людей?

Еще более захватывающим является двустороннее ускорение между математикой и ИИ. Трехмерная гипотеза Кагана только что доказана, и через три месяца появился GeoLAN — чисто математическое открытие сразу превратилось в инструмент для обучения больших моделей. Какие новые возможности ИИ появятся завтра на основе достижений в гипотезе Андре—Оорта и шестой проблеме Гильберта, отмеченных сегодня на Филдсовской премии?

Раньше всегда говорили, что математики идут впереди, прокладывая путь, а ИИ следует за ними, собирая сокровища. Но теперь тот, кто собирал сокровища, уже сам начал прокладывать путь.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.