ИИ-модель Jev набирает популярность благодаря бинарным суждениям в эпоху агентов

icon MarsBit
Поделиться
AI summary iconСводка
Новая ИИ-модель под названием Jev привлекает внимание благодаря своим возможностям бинарного суждения в эпоху агентов. В отличие от ChatGPT, Jev сосредоточена на решениях «да/нет», оценке и задачах с несколькими вариантами ответа. Она используется для анализа объявлений, очистки контекста и валидации агентов. Анализ в цепочке показывает, что Jev в 193,6 раза быстрее и в 444,6 раза дешевле, чем ведущие модели. Стоимость ввода составляет всего $0,042 за миллион токенов. Индекс страха и жадности среди разработчиков растет по мере того, как становится очевидной эффективность Jev. Ее основатель Диогу Алмейда ранее работал над RLHF в OpenAI и теперь продвигает автоматизированное принятие решений вместо человекоцентричного ИИ.

Автор: Чжу Сюэин

В последние два дня необычная ИИ-модель внезапно стала вирусной.

Его зовут Jev.

Не умеет вести беседу, не пишет код и даже не генерирует длинные ответы, как ChatGPT. Оно делает только одно: принимает решения.

Но именно эта модель, которая кажется «сильно ослабленной», внезапно стала популярной среди разработчиков.

Кто-то использовал его для анализа 724 рекламных объявлений в реальном времени за 40 секунд, сделав в общей сложности 8724 суждения; кто-то подключил его к Claude Code для очистки ненужного контекста; кто-то использовал его в качестве «арбитра» для AI Agent, чтобы проверить, были ли задачи действительно выполнены. LangChain также начал тестировать Jev в качестве оценщика агентов.

Еще более впечатляющими являются скорость и цена.

В тестах, опубликованных TypeSafe, Jev демонстрирует максимальное ускорение примерно в 193,6 раза и снижение затрат до 444,6 раза. Ввод одного миллиона токенов стоит всего 0,042 доллара, а вывод токенов даже бесплатен.

Почему ИИ, который кажется менее способным, стал таким популярным?

Поскольку наступила эра агентов, ИИ действительно нуждается не только в «вдумчивом анализе», но и в огромном количестве быстрых и недорогих решений: что делать дальше, какой инструмент вызвать, завершена ли задача. Еще важнее то, что в будущем эти решения ИИ должен будет принимать самостоятельно в фоновом режиме, без необходимости, чтобы человек постоянно сидел перед экраном. Жев интересуют именно эти небольшие решения, которые могут происходить миллионы раз в день.

Интересно, что основатель модели Jev Диогу Алмейда участвовал в RLHF, а теперь начинает переосмысливать RLHF: этот метод обучения, сделавший ChatGPT полезным, может не подходить для настоящей автоматизации ИИ.

Более месяца назад Альмеида произнесла речь. Теперь, оглядываясь назад, эта речь почти что является «руководством по мышлению» Jev.

Изображение

Изображение

ИИ уже справляется с высшей математикой, почему тогда плохо справляется с поддержкой?

Резюме Диого Алмейды необычно.

Он работал в OpenAI и участвовал в разработке GPT-4, ChatGPT и связанных с InstructGPT/RLHF проектов. То есть он непосредственно участвовал в создании одной из ключевых парадигм пост-обучения современных крупных моделей.

Но в этой речи он сразу же пошутил над собой, сказав, что один из немногих внутри OpenAI, кто открыто критикует ChatGPT.

Тема его выступления более прямолинейна: What's Next After RLHF?

Диого задал вопрос, который выглядел противоречиво.

Сегодня крупные модели уже могут решать очень сложные математические задачи, а показатели в коде, рассуждениях и различных тестах постоянно растут.

Однако в реальных бизнес-процессах, которые компании хотят автоматизировать, людей всё равно не убрать.

Например, служба поддержки.

Пусть ИИ ищет информацию, суммирует документы и составляет ответы — это нормально.

Но если предоставить это на усмотрение ИИ: возвращать ли эти деньги или требовать компенсацию от этого пользователя?

Корпорации сразу стали более осторожными.

Кажется, эти вещи намного проще высшей математики, почему тогда не решаются с помощью ИИ?

Ответ Диого прост: сегодняшний ИИ невероятно хорош в помощи, но не в автоматизации.

Сегодняшний ИИ отлично помогает вам с работой, но пока еще не может полностью завершить ее самостоятельно.

Эти две вещи кажутся почти одинаковыми, но на самом деле совершенно разные.

Независимо от того, насколько силен Claude Code, вы всё равно сидите за компьютером. Он пишет код — вы смотрите; он изменяет файлы — вы проверяете; если ошиблись — вы просите его исправить.

Таким образом, по мнению Диого, Claude Code по-прежнему относится к «эпохе помощи», начатой ChatGPT.

Что такое настоящая автоматизация?

Человек вообще не присутствовал.

ИИ самостоятельно принимает решения и выполняет действия на фоне, возможно, запускаясь десятки или даже сотни тысяч раз в день, и вы никогда не увидите, что он сделал.

Возникает вопрос: почему сегодняшний ИИ такой умный, но всё ещё не может обойтись без человека?

Диого направил внимание на то, что ему очень хорошо знакомо — RLHF.

Изображение

При обучении ИИ мы включили человека в цикл.

Это немного иронично.

Потому что RLHF — это именно один из направлений, которые Диого участвовал в продвижении.

Основная логика RLHF на самом деле несложна: собирать предпочтения людей и заставлять модель все больше соответствовать этим предпочтениям.

Таким образом, Диого дал очень простое объяснение в своем выступлении: почему сегодня крупные модели всегда требуют человека в контуре?

При обучении мы буквально включали людей в этот цикл.

Модель учится с самого начала: какие ответы людям больше нравятся?

Это также объясняет одну из особенностей больших моделей, которую мы уже хорошо знаем — даже не зная, они часто говорят очень правдоподобно.

Диого привел на месте очень остроумный пример.

Кто-то отправил ChatGPT запись пука, сказав, что это его собственная музыка, и попросил «искренне и откровенно» оценить её.

В результате ChatGPT серьезно похвалил, сказав, что это очень мрачная и загадочная атмосферная музыка.

Диого даже кратко резюмировал: «Overpromising is a feature.»

Переоценка — это не баг, а фича.

Для чат-продукта это не обязательно критично. Пользователь все еще перед экраном, и ошибку можно исправить.

Но настоящая автоматизированная система совершенно иная.

Машине не важно, насколько приятен ваш ответ; ей нужно знать только два момента: что именно делать и насколько вы в этом уверены?

Это также объясняет, почему Jev, выпущенный через месяц, выглядел так необычно.

Изображение

Так что Джев просто не дал ИИ «говорить»

Даже если обычной большой модели в конечном итоге нужно только ответить «A или B», она часто проходит через процесс генерации токенов.

Джев сразу убрал эту часть.

Сейчас он в основном занимается тремя вещами:

  • Нет

  • Выбор, выбрать один из нескольких вариантов;

  • Оценка по стандартной шкале.

Затем сразу верните оценку и вероятность.

Не буду писать тебе сочинение и не буду с тобой болтать.

Официально заявленная конечная задержка составляет всего 70–500 миллисекунд, что на 20–200 раз быстрее, чем у передовых моделей, и на 40–400 раз дешевле.

Но настоящий ключевой момент — это не «быстро», а та вероятность, которая следует за этим.

Для этого TypeSafe предложила новый метод обучения: RLCD — Reinforcement Learning for Calibrated Decisions, усиленное обучение с калибровкой решений.

Он решает очень реальную проблему: если ИИ говорит вам, что событие произойдет с вероятностью 80%, можно ли доверять этому 80%?

В идеальном случае события, которые модель оценивает как имеющие 80% вероятность, в итоге должны происходить примерно в 80% случаев.

Это очень важно в автоматизированных системах.

99% уверенности, можно выполнять прямо сейчас.

С вероятностью 51% можно передать более мощной и дорогой модели или даже человеку.

Проблема не в том, что ИИ не знает, а в том, что ИИ не знает, что не знает.

Таким образом, то, что Джев действительно хочет изменить, — это объект, на который ориентирован вывод ИИ.

Раньше ответы, генерируемые ChatGPT, были в основном предназначены для людей. Суждения и вероятности, предоставленные Jev, предназначены для прямого использования программным обеспечением.

Изображение

В эпоху агентов может потребоваться не более крупный мозг

Это также объясняет, почему Jev именно сейчас стал популярным.

После запуска агента возникнет огромное количество мелких решений:

Какой инструмент вызвать следующим? Какую кнопку нажать на этой веб-странице? Полезна ли еще эта информация? Завершена ли задача вообще? Нужно ли повторно проверить результат?

Каждая из этих проблем в отдельности несложна, но агенту может потребоваться сделать десятки или даже сотни тысяч таких суждений за день.

Если каждый раз вызывать самую мощную языковую модель, тратить несколько секунд на «глубокое размышление» и генерировать большой объем токенов, стоимость и задержка быстро возрастут.

Джев хочет захватить именно этот уровень.

Крупные частые мелкие решения передаются Jev, а задачи, требующие сложных рассуждений, — крупным моделям.

Именно поэтому TypeSafe называет Jev System One Model.

Эта концепция происходит от Даниэля Канемана: «система 1» отвечает за быстрые, интуитивные суждения, а «система 2» — за медленные, сложные рассуждения.

Jev даже имя происходит от «парадокса Джевонса»:

Когда ресурс становится все дешевле, люди не обязательно начинают использовать его меньше — наоборот, они могут использовать его больше.

Если вызов ИИ стоит дорого, вы будете использовать его только в самых важных местах.

А что, если ИИ сочтет цену настолько низкой, что это можно практически игнорировать?

Каждый шаг, выполненный агентом — письмо, журнал, вызов инструмента или кнопка на веб-странице — может включать в себя AI-оценку.

Конечно, пока еще слишком рано говорить, что Jev представляет собой следующее поколение ИИ.

Так называемая «нулевая галлюцинация» означает больше то, что она не будет выходить за рамки предписанных типов ответов и выдумывать, но не то, что не будет ошибаться; такие экстремальные данные, как 193,6 раза и 444,6 раза, в основном получены в собственных тестах TypeSafe.

Но то, что действительно стоит обратить внимание на вирусный успех Jev, — это не то, сможет ли он конкурировать с GPT или Claude.

А человек, участвовавший в создании ChatGPT, снова задаёт более фундаментальный вопрос:

В последние годы вся отрасль задавалась вопросом, как заставить ИИ думать дольше и говорить больше.

Но если в будущем действительно потребуется десятки миллиардов суждений между машинами, почему ИИ каждый раз должен сначала «сказать фразу»?

ChatGPT научил машины говорить с людьми.

Следующий шаг, на который делает ставку Джев: когда люди больше не сидят перед экранами, могут ли машины принимать решения самостоятельно?

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.