Модель ШІ Jev набуває популярності через бінарні судження в еру агентів

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Нову модель штучного інтелекту під назвою Jev активно обговорюють через її здатність до бінарних рішень у еру агентів. На відміну від ChatGPT, Jev зосереджений на відповідях «так/ні», оцінках та завданнях з вибором відповіді. Її використовують для аналізу оголошень, очищення контексту та перевірки агентів. Аналіз у блокчейні показує, що Jev у 193,6 раза швидший і у 444,6 раза дешевший, ніж лідери ринку. Витрати на введення даних становлять лише $0,042 на мільйон токенів. Індекс страху та жадібності серед розробників зростає, оскільки ефективність Jev стає очевидною. Його засновник, Діого Алмейда, раніше працював над RLHF у OpenAI і зараз закликає до автоматизованого прийняття рішень замість людино-орієнтованого ІІ.

Автор: Чжу Сюєїн

Протягом останніх двох днів несподівана AI-модель раптово стала вірусною.

Його звуть Jev.

Не веде діалогів, не пише коду і навіть не генерує довгих відповідей, як ChatGPT. Вони роблять лише одне: приймають рішення.

Але саме ця модель, яка здається «втратила більшість своїх можливостей», раптово стала популярною серед розробників.

Хтось використовував його для аналізу 724 реальних оголошень за 40 секунд, зробивши загалом 8724 судження; хтось під’єднав його до Claude Code, щоб спеціально очищати непотрібний контекст; а хтось використовував його як «арбітра» для AI Agent, щоб перевіряти, чи було справді виконано завдання. LangChain також розпочав тестування Jev як оцінювача агентів.

Ще більш вражаючими є швидкість і ціна.

У тестах, опублікованих TypeSafe, Jev досяг максимального прискорення приблизно в 193,6 раза та зменшення витрат до 444,6 раза. Введення кожного мільйона токенів коштує лише 0,042 долара США, а вивід токенів взагалі безкоштовний.

Чому став популярним штучний інтелект, який здається менш здатним?

Оскільки настав епоха агентів, ІШ справді може знадобитися не лише «глибоке міркування», а й величезна кількість швидких та недорогих рішень: що робити далі, який інструмент викликати, чи завдання дійсно завершено. Ще важливіше те, що ці рішення в майбутньому мають бути прийняті ІШ самостійно в тилу, без необхідності постійного перебування людини перед екраном. Jev звернув увагу саме на ці мікрорішення, які можуть відбуватися мільйони разів щодня.

Цікаво, що Діого Алмейда, засновник моделі Jev, сам брав участь у RLHF, а зараз він почав переосмислювати RLHF: цей метод навчання, який зробив ChatGPT корисним, може не підходити для справжньої автоматизації ШІ.

Більше ніж місяць тому Альмеїда зробила промову. Зараз, дивлячись назад, ця промова майже є «інструкцією з думок» Jev.

Зображення

Зображення

Штучний інтелект вже вміє вирішувати вищу математику, чому тоді погано справляється з службою підтримки?

Резюме Діого Алмейди дуже унікальне.

Він працював у OpenAI і брав участь у роботі над GPT-4, ChatGPT та InstructGPT/RLHF. Іншими словами, він безпосередньо брав участь у створенні найважливішої сьогодні системи післянавчання великих моделей.

Але на тій промові він відразу ж підтікав себе, як один з небагатьох у OpenAI, хто відкрито жартував над ChatGPT.

Його тема виступу була більш прямою: What's Next After RLHF?

Діого першим поставив питання, яке здається суперечливим.

Сьогодні великі моделі вже можуть вирішувати дуже складні математичні задачі, а також показують постійний прогрес у кодуванні, міркуванні та різних бенчмарках.

Але в багатьох бізнес-процесах, які компанії справді хочуть автоматизувати, людський фактор залишається незамінним.

Наприклад, служба підтримки.

Дозвольте ШІ шукати інформацію, резюмувати документи та складати відповіді — це нормально.

Але якщо дати ІІ вирішити: чи повертати ці гроші? Чи повинен цей користувач сплатити компенсацію?

Компанії відразу стали обережнішими.

Здається, ці речі набагато простіші, ніж вища математика, чому тоді не хочеться покладатися на ШІ?

Відповідь Діого проста: Сьогоднішній ІІ чудово допомагає, але не автоматизує.

Сьогоднішній ІІ допомагає тобі виконувати роботу, але ще не може повністю завершити її самостійно.

Ці дві речі виглядають майже однаково, але насправді дуже відрізняються.

Навіть якщо Claude Code дуже потужний, ви все одно сидите за комп’ютером. Він пише код — ви дивитеся; він змінює файли — ви перевіряєте; якщо помилка — ви просите його виправити.

Отже, за думкою Діого, Claude Code все ще належить до «епохи допомоги», яку розпочав ChatGPT.

Що таке справжня автоматизація?

Люди взагалі не були там.

Штучний інтелект самостійно приймає рішення та виконує їх у тилу, можливо, запускаючи десятки тисяч або навіть мільйони разів на день — ви навіть не побачите, що він зробив.

Виникає питання: чому сьогоднішній ШІ такий розумний, але все одно не може обійтися без людини?

Діого спрямував свою увагу на те, що йому дуже добре відомо — RLHF.

Зображення

Під час навчання ІМ ми включили людину до ланцюга.

Це трохи іронічно.

Оскільки RLHF — це саме та напрямок розробки, у якому Діогу брав участь.

Основна логіка RLHF досить проста: збирати людські уподобання та поступово робити модель все більш відповідною до них.

Тоже Діого у своїй промові дав дуже просте пояснення: чому сьогодні великі моделі завжди потребують людини у циклі?

Під час навчання ми буквально включали людей у цей цикл.

Модель навчається з самого початку: які відповіді людям подобаються більше?

Це також пояснює одну з характеристик великих моделей, яка нам уже дуже добре відома — навіть якщо вони не знають, вони часто говорять дуже впевнено і правдоподібно.

Диого навів на місці досить жорсткий приклад.

Хтось надіслав ChatGPT аудіозапис під час випуску газів, сказавши, що це його власна музична композиція, і попросив «щиро та відверто» оцінити її.

Результатом стало те, що ChatGPT серйозно похвалив, сказавши, що це дуже жахливий та дивний енвіронмент-трек.

Діого навіть коротко звів це до одного речення: «Overpromising is a feature.»

Перевищення обіцянь — це не баг, а фіча.

Для чат-продукту це не обов’язково смертельне. Користувачі ще перед екраном, і помилку можна виправити.

Але справжні автоматизовані системи дуже відрізняються.

Машина не цікавиться, чи звучить ваша відповідь приємно; їй потрібно знати лише дві речі: як саме діяти та наскільки ви впевнені у цьому?

Це пояснює, чому Jev, опублікований понад місяць потому, виглядав так незвично.

Зображення

Тоже саме, Джев просто не дозволив ШІ «говорити»

Навіть звичайна велика модель, навіть якщо в кінцевому підсумку потрібно лише відповісти «А чи Б», часто проходить через процес генерації токенів.

Jev直接把这部分砍掉。

Він зараз основною мірою робить три речі:

  • Ні

  • Вибір, виберіть один із кількох варіантів;

  • Оцінка, за стандартною шкалою.

Потім безпосередньо поверніть оцінку та ймовірність.

Не буду писати вам твір і не буду з вами розмовляти.

Офіційно оголошена кінцева затримка від 70 до 500 мілісекунд, що на 20–200 разів швидше, ніж у передових моделей, і на 40–400 разів дешевше.

Але справжньо ключовим є не «швидкість», а та ймовірність, що йде за ними.

Для цього TypeSafe запропонувала новий метод навчання: RLCD, Reinforcement Learning for Calibrated Decisions, підсилене навчання для каліброваних рішень.

Проблема, яку він намагається вирішити, дуже реальна: якщо ШІ каже вам, що подія має 80%-ву ймовірність відбутися, чи можна вірити цим 80%?

У ідеалі події, які модель оцінює як із 80%-ю ймовірністю, насправді повинні відбуватися приблизно в 80% випадків.

Це дуже важливо в автоматизованих системах.

99% впевненості, можна виконувати безпосередньо.

51% впевненості — можна передати сильнішій, дорожчій моделі або навіть людині.

Справжня проблема не в тому, що ШІ не знає, а в тому, що ШІ не знає, що не знає.

Отже, Єв справді хоче змінити об’єкт виводу ШІ.

Попередні відповіді, згенеровані ChatGPT, були призначені переважно для людей. Оцінки та ймовірності, надані Jev, підготовлені для безпосереднього використання програмним забезпеченням.

Зображення

У епоху агентів, можливо, знадобиться не більший мозок

Це також пояснює, чому саме зараз став популярним Jev.

Оскільки після запуску агента виникає величезна кількість дрібних рішень:

Який інструмент викликати наступним? Яку кнопку на цій сторінці натиснути? Чи ще корисна ця інформація? Чи завершено завдання? Чи потрібно перевірити результат знову?

Ці питання окремо взяті не складні, але агенту може знадобитися вирішити їх десятки тисяч або навіть мільйони разів за день.

Якщо кожного разу використовувати найпотужнішу модель, витрачаючи кілька секунд на «глибоке обдумування» і видавати великий обсяг токенів, витрати та затримки швидко зростуть.

Ев хоче захопити саме цей рівень.

Велику кількість частих малих рішень передайте Jev, а складні завдання, що вимагають складного міркування, — великої моделі.

Також саме тому TypeSafe називає Jev System One Model.

Ця концепція походить від Деніела Канемана: «система 1» відповідає за швидкі, інтуїтивні судження, а «система 2» — за повільні, складні міркування.

Jev навіть походить ім’ям від «парадоксу Джевонса»:

Коли ресурс стає все дешевшим, люди не обов’язково починають використовувати його менше — навпаки, вони можуть використовувати його більше.

Якщо виклик AI коштує дорого, ви використовуєте його лише в найважливіших місцях.

Але що, якщо штучний інтелект вважає, що ціна дешева настільки, що це майже не має значення?

Кожен лист, кожен журнал, кожен виклик інструменту, кожна кнопка на веб-сторінці, кожен крок, виконаний агентом, може включати AI-прийняття рішення.

Звичайно, зараз ще передчасно стверджувати, що Jev є представником майбутнього ШІ.

Те, що вони називають «нульовими галюцинаціями», більше означає, що вони не вигадуватимуть відповіді поза встановленими типами, але це не означає, що вони не зможуть вибрати неправильну; такі екстремальні дані, як 193,6 разів і 444,6 разів, походять переважно з власних тестів TypeSafe.

Але справжньою цікавою річчю у цьому вибуховому успіху Jev, можливо, не є те, чи зможе він викликати GPT або Claude.

Але це людина, яка брала участь у створенні ChatGPT, що знову ставить більш фундаментальне питання:

Протягом останніх кількох років уся галузь думала, як змусити ШІ думати довше і говорити більше.

Але якщо майбутнє справді вимагатиме десятків мільярдів суджень між машинами, чому штучний інтелект кожного разу має спочатку «сказати речення»?

ChatGPT навчив машини розмовляти з людьми.

Наступним кроком, на який ставить Jev, є: чи зможуть машини приймати рішення самі, коли люди більше не сидят перед екранами?

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.