Google запускает фреймворк Science One для борьбы с фальсификацией исследований в области ИИ

iconMetaEra
Поделиться
AI summary iconСводка
Google запустила фреймворк Science One 30 июля 2026 года на базе MetaEra для решения проблемы фальсификации исследований в области ИИ. Фреймворк использует Chain-of-Evidence (CoE) для связи каждого вывода с проверяемыми источниками, кодом и экспериментами. Он достиг нулевого количества вымышленных цитат и полностью воспроизводимых результатов. Сбор доказательств в реальном времени интегрирован в процесс генерации контента. Система показала высокие результаты на MLE-Bench и Parameter-Golf. Google заявляет, что Science One — это экспериментальный прототип, еще не предназначенный для промышленного использования. Это обновление новостей об ИИ и криптовалюте подчеркивает развитие на-chain новостей в области целостности исследований.
Google Research объявила о框架е Science One 30 июля 2026 года, основой которого является механизм, называемый «цепочкой доказательств» (Chain-of-Evidence, CoE), требующий, чтобы каждое заключение ИИ в научных исследованиях сопровождалось источниками, кодом и записями экспериментов.

Автор статьи, источник: 0x9999in1, ME News



Коротко

  • Google Research объявила о框架е Science One 30 июля 2026 года, основой которого является механизм, называемый «цепочкой доказательств» (Chain-of-Evidence, CoE), требующий, чтобы каждое заключение ИИ в научных исследованиях сопровождалось источниками, кодом и записями экспериментов.
  • У старых проблем существующих AI-исследовательских систем твердая привычка: выдумывать ссылки, неповторимые результаты, несоответствие описаний методов и кода. У базовых систем уровень иллюзорных ссылок достигает 21%, а воспроизводимость результатов опускается до 42%.
  • Результаты Science One: ноль иллюзий в цитатах, все оценки по верификации правильные, наивысшая согласованность между методами и кодом. Согласно раскрытым данным, все 337 цитат, сгенерированных системой, являются реальными, все 12 воспроизводимых экспериментов совпадают, и 14 из 15 статей согласуются с кодом.
  • Ключевой подход — «генерация с одновременным сбором доказательств», а не «написание, а затем добавление ссылок». Ссылки извлекаются не из памяти модели, а путем реального поиска через API Semantic Scholar.
  • Более важный вывод: Science One не пожертвовала «компетентностью» ради «честности». Она завоевала 2 золота и 2 серебра на MLE-Bench и установила лучший результат на тот момент на Parameter-Golf.
  • Смысл этого события не в том, что еще один ИИ может писать статьи, а в том, что он впервые сделал «проверяемость» фундаментом архитектуры, а не дополнительной доработкой.

Задайте себе больной вопрос: вы верите в статьи, написанные ИИ?

За последние два года прогресс в AI-исследовательских системах был поразительным.

Он может читать научные статьи, формулировать гипотезы, проводить эксперименты и полностью написать академическую статью с целостной структурой и профессиональным тоном. Вы бегло просмотрите её — не найдёте ни одного недостатка.

Но проблема скрыта в этом «быстром взгляде».

Поверхностно — всё в порядке, а если углубиться?

Google Research занимается глубоким анализом этого вопроса. Они взяли пять основных автономных научных систем, провели пять задач по оптимизации систем и сгенерировали в общей сложности 75 научных статей, а затем тщательно проверили: существует ли действительно цитируемая вами статья? Соответствует ли указанная вами оценка результатам повторного запуска кода? Использовали ли вы действительно указанный алгоритм — так ли он написан в коде?

Результат выглядит плохо.

Каждая базовая система допускает как минимум одну системную ошибку. Уровень галлюцинаций в цитатах достигает 21% — то есть каждая пятая цитата может указывать на статью, которой не существует. Процент прохождения проверки результатов может быть таким низким, как 42%. Согласованность методов и кода варьируется от 20% до 80%.

Почувствуйте этот 42%. Более половины статей, результаты которых заявлены, не могут быть воспроизведены при повторном запуске кода.

Это не мелкая ошибка. Это крах доверия.

Потому что основная логика научных исследований — это «воспроизводимость» и «отслеживаемость». Ценность научной статьи заключается не в том, насколько легко её читать, а в том, могут ли другие, следуя по её ссылкам, коду и данным, восстановить весь путь и убедиться, что авторы не лгут. ИИ поднял «поверхностное качество» статей, но убрал этот фундаментальный столп.

Чем ярче внешний вид, тем скрытнее проблемы. Именно это и есть самое опасное.

Ответ Google: не на доверии, а на цепочке

Идея Science One, по сути, очень проста.

Поскольку нельзя полагаться на то, что ИИ будет честен сам по себе, не ожидайте этого от него. Привяжите его цепями.

Эта цепочка — это «цепочка доказательств» (Chain-of-Evidence).

Google нашло для этого очень точную аналогию: в области баз данных существует понятие ACID, которое не зависит от того, как вы создаете базу данных, а лишь определяет, какие свойства должна иметь транзакция, чтобы считаться надежной. То же самое и с цепочкой доказательств. Оно не регламентирует, как вы создаете научный агент, а лишь устанавливает: каждый ваш результат, чтобы вызывать доверие, должен удовлетворять определенным требованиям.

Один принцип, две половины.

Первая половина — это целостность: каждое утверждение в статье — будь то цитата, цифра, описание метода или вывод — должно быть подкреплено задокументированной цепочкой доказательств.

Вторая половина — это корректность: эта цепочка должна действительно поддерживать ту фразу, которую она несет.

Проще говоря: каждое твоё утверждение должно иметь источник, и этот источник должен действительно подтверждать твоё утверждение.

Как это реализовать? Ключ — в выборе момента.

Как работает существующая система? Сначала пишут длинную статью, а потом возвращаются, чтобы добавить ссылки и доказательства. Это как придумать историю, а потом искать доказательства, чтобы её подтвердить. Там, где не получается подтвердить, приходится выдумывать. Именно так и появляются фантомные ссылки.

Science One наоборот. В тот самый момент, когда генерируется это утверждение, сразу же формируется цепочка доказательств. Утверждения и доказательства растут вместе, а не склеиваются после факта.

Смена порядка — это суть всего дела.

Разберем по частям: три модуля, каждый отвечает за свою ложь

Архитектура Science One состоит из трех компонентов, каждый из которых точно устраняет возможность мошенничества.

Первый блок — исследователь проблем, отвечает за фальсификацию ссылок.

Он не полагается на «память» модели для цитирования источников. Память модели — это рассадник иллюзий: она может «помнить» статью, которой на самом деле не существует. Science One напрямую подключен к API Semantic Scholar для построения реальной карты цитирований, анализируя до 100 полнотекстовых PDF-файлов по каждой теме и генерируя структурированный исследовательский обзор. Каждая ссылка в итоговой статье происходит исключительно из реального поиска через API, полностью исключая зависимость от памяти модели.

Цитаты не «придумываются», а «находятся». Этим ударом корень иллюзорных цитат перерезан.

Второй блок — двигатель обнаружения, отвечающий за выявление фальсификации экспериментальных записей.

Он использует параллельную стратегию «исследование — использование», одновременно пробуя решения на нескольких ветвях. На каждом цикле один Solver реализует решение, а специальный оценщик присваивает ему оценку. Хорошо показавшие себя ветви тонко дорабатываются, а все исходные оценочные результаты заносятся в строгий, только для чтения журнал.

Только для чтения. Эти два слова важны. Как только первоначальная оценка занесена, ее нельзя изменить. Хотите позже написать дипломную работу с более красивой оценкой? Извините, реестр здесь — изменить нельзя.

Третий блок: автор статей и проверяющий заявления, отвечает за несоответствие методов и кода.

Прежде чем полностью сформировать статью, она структурирует каждое фактическое утверждение, присваивая каждой фразе встроенный ярлык доказательства, связанный с конкретным продуктом в рабочей области. Затем специальный проверяющий сопоставляет каждое утверждение с указанным им источником.

Что делать, если не совпадает? Здесь есть один особенно удачный нюанс: вместо того чтобы просто и грубо удалить, его «откатывают» — формулируют более осторожно, чтобы вернуться в рамки, поддерживаемые доказательствами. До какого уровня могут дотянуться доказательства, до того уровня и следует говорить.

Не хвастаюсь, но и не трачу зря. Такое чувство меры — выше, чем одноразовый подход.

Транскрипт: Цена честности — стало ли глупее?

Здесь должен возникнуть острый вопрос.

Надевая на ИИ столько цепей, заставляя его каждый раз с трепетом искать доказательства для каждого предложения, не перестанет ли он смело исследовать? Не жертвует ли ради «честности» его «умение»?

Это очень разумное беспокойство. Это классическое противоречие между «безопасностью» и «возможностями».

Ответ Science One: нет.

Сначала посмотрим на столбец «Честность». В рамках одной и той же системы аудита — Google называет её CoE Audit, автоматическим инструментом, напоминающим криминалиста, который сверяет каждую ссылку с актуальными академическими базами данных — Science One показала наилучшие результаты по всем четырём проверкам целостности. Её ссылки не содержат иллюзий: каждая ведёт на реальную, доступную для поиска статью; проверка баллов выполнена идеально; согласованность методов и кода также наивысшая. Согласно раскрытым данным, все 337 ссылок, сгенерированных ею, являются подлинными, все 12 воспроизводимых экспериментов дали точные результаты, и в 14 из 15 статей код совпадает с фактическим.

Сравните с теми «гибридными нейросимволическими решателями» из базового набора — звучит впечатляюще, но как только заглянешь в код — оказывается, это просто простые детерминированные эвристические правила. Имена предназначены для людей, а код — это правда.

Снова посмотрите на столбец «Способности».

На пяти задачах с использованием базы данных ADRS Science One достигла уровня или превзошла уровень человеческих экспертов, причем в двух из них (Cloudcast и EPLB) показала лучшие результаты среди всех систем.

Вне этого круга он также справился с более сложными внешними задачами. В MLE-Bench, среди пяти жестких соревнований Kaggle, охватывающих медицинскую визуализацию, тонкую классификацию и 3D-восприятие, он завоевал две золотые и две серебряные медали — в соревновании по 3D-обнаружению объектов другие системы полностью провалились, а он занял первое место с рекордным результатом. В соревновании Parameter-Golf, где жестко ограничены аппаратные ресурсы и размер файлов для обучения LLM в реальном времени, другие системы не смогли даже сделать корректную отправку, тогда как он не только соблюдал все ограничения, но и установил лучший результат на 27 апреля 2026 года. И это было достигнуто благодаря открытию по-настоящему новаторских алгоритмических методов, а не просто подбором гиперпараметров.

Так что ответ ясен: честно, без упрощения.

Это именно то, что я ценю больше всего. Если Science One достигает чистоты за счет ограниченных возможностей, то он не имеет никакой ценности — ведь никто не будет использовать笨拙ный и честный научный инструмент. Но он доказал, что проверяемость и высокая производительность могут существовать одновременно. Именно это превращает идею «сделать честность жестким ограничением» из моральной инициативы в инженерно выгодное решение.

Мое мнение: это важно, но не стоит спешить возводить это в ранг мифа

Сказано столько хороших слов, теперь нужно泼两盆冷水。

Первая точка: Google сама четко указывает в конце текста, что Science One — это экспериментальный исследовательский прототип, а не инструмент, готовый к использованию в продакшене.

Это не скромность, а граница. Пять задач, которые он выполняет, относятся к областям, таким как оптимизация системы, где есть четкие оценщики и возможность автоматической оценки. Другими словами, хорошее и плохое можно объективно определить машиной. А что насчет настоящих передовых научных исследований? Ценность многих гипотез и значимость многих выводов в краткосрочной перспективе вообще не могут быть оценены никаким оценщиком. Доказательная цепочка может защитить от «фальсификации ссылок», но не может защитить от «выбора посредственной проблемы». Он контролирует честность, но не контролирует вкус.

Второй пункт: Сама цепочка доказательств также имеет стоимость. Чтение 100 PDF-файлов по каждой теме, построение доказательств для каждого предложения, привязка меток и повторная проверка — эта процедура не дешева. В то время как она стремится к истине, она также потребляет вычислительные мощности и время. При масштабировании пока нет ответа на вопрос, как рассчитать эти затраты.

Но после того как я вылил эти две чашки воды, я все еще считаю, что это недооцененное дело.

Почему?

Потому что он изменил способ задания вопроса.

За последние два года все спрашивали: может ли ИИ проводить научные исследования? Насколько сильно он может это делать? Все соревновались в способности решать задачи и набирать баллы в рейтингах. Вопрос, который задаёт Science One, другого порядка: можно ли доверять научным исследованиям, проведённым ИИ?

Эти два вопроса не относятся к одной категории.

По мере того как все больше систем способны генерировать красивые решения, способность решать задачи перестает быть различающим фактором. В тот момент истинным критерием станет то, можно ли доверять их результатам. Google повысил «проверяемость» до уровня «первоклассного гражданина», заявив, что она должна быть архитектурным ограничением, а не запоздалым исправлением — я считаю, что это суждение верно и пришло вовремя.

Потому что доверие накапливается медленно, а рушится быстро. Если исследования в области ИИ изначально истощат доверие всего академического сообщества, опираясь на множество выглядящих привлекательно, но на самом деле полных уязвимостей статей, то попытки восстановить его впоследствии обойдутся в неподъемную цену. Science One действует так, чтобы до того, как доверие рухнет, сначала укрепить арматуру в фундаменте.

Эпилог

Вернёмся к первому вопросу: Вы поверите, что статью написал ИИ?

До Science One честный ответ — не очень смело. Чем лучше он написан, тем больше стоит насторожиться.

Science One не сделал ИИ более умным. Он сделал другое, более простое, но и более сложное дело: заставил ИИ оставлять проверяемые доказательства для каждого сказанного им утверждения.

Умных ИИ уже достаточно.

AI, который отвечает за себя сам, только начинается.

Этот шаг небольшой, это прототип, и ещё много нерешённых вопросов. Но направление правильное. Иногда истинный вес чего-то заключается не в том, насколько быстро оно может работать сейчас, а в том, где оно установило мерилo.

Science One переместил масштаб с «пишет ли как надо» на «выдерживает ли проверку».

Это движение того стоит.

Справочные материалы

  1. Блог исследований Google. «Science One Framework: Проверяемая автономная исследовательская платформа через Chain-of-Evidence», 30 июля 2026 года.
  2. Исследования в области ИИ от Google Cloud. arXiv:2605.26340 Статья «Science One Framework / Chain-of-Evidence».
  3. AlphaSignal.《Рамки Google Science One решают кризис фальшивых цитирований в исследовании ИИ》, июль 2026 года.
  4. Zhiding.com. «Рамка Science One: проверяемая автономная научная система на основе цепочки доказательств», 31 июля 2026 года.
  5. Sakana AI. arXiv:2504.08066 «The AI Scientist v2» (сравнение с базовой линией).
  6. OpenAI. Проект GitHub «Parameter-Golf» Benchmark.
  7. arXiv:2410.07095 Статья о базе данных MLE-Bench.
  8. Бенчмарк arXiv:2510.06189 «Automated Design of Research Systems (ADRS)».
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.