source avatarDami-Defi

Поделиться

Оценки агентов имеют скрытую проблему: Сам судья может быть ненадежным. Новый эксперимент протестировал Jev против GPT-5.6 Luna, Terra и Claude Sonnet 4.6. Результаты: → 500/500 бинарных решений совпали с человеческим оракулом → вариативность оценок на 92–913× ниже → средняя задержка 0,44 с → 0,00035 $ за оценку Jev не генерирует абзац, а затем превращает его в оценку. Он принимает структурированное решение напрямую. Это может изменить экономическую модель оценки агентов. Более дешевые и быстрые судьи позволяют командам оценивать больше трасс, запускать больше регрессионных проверок и сокращать цикл обратной связи после каждого обновления агента. Важное уточнение: это было узкое раннее исследование. Но направление захватывающее: Надежные агенты могут требовать не просто лучшие модели, а лучшие судьи.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.