Редактирование|Panda
В «Резидент Эвил» существует лаборатория, расположенная на глубине под землей, под названием «Улей». Доступ, наблюдение, вентиляция, безопасность и вся работа объекта были переданы ИИ: Красной Королеве.

Человеческие ученые отвечают за исследования, но настоящими «руками и ногами» этой лаборатории являются ИИ.
При возникновении аномалии Красная Королева может закрыть двери, отключить систему, контролировать объекты и напрямую вмешиваться в физический мир.
Более двадцати лет назад такая сюжетная линия была классическим приемом в научно-фантастических фильмах для создания ощущения страха: ИИ проникает в физический мир, управляет машинами, проводит эксперименты и напрямую вмешивается в реальный мир.
Сейчас эта сцена начинает входить в реальность совершенно иным образом — по крайней мере, пока не страшно.
Вчера Anthropic выпустила Model Hardware Standard (MHS) для физического оборудования, стремясь расширить логику MCP от GitHub, Slack и баз данных до реальных устройств, таких как роботизированные руки, микроскопы, жидкостные процессоры и лазеры. Подробнее в статье «Только что: Anthropic выпустила физический MCP: Claude начинает управлять реальным миром».

Проще говоря, AI-агенту нужно не только «интерфейс» для вызова программ, но и целая система «нервов и конечностей», связывающая его с реальным миром. Сегодня Google DeepMind вновь продемонстрировала свои достижения в этой области.
В только что опубликованной 83-страничной статье Google подключила Co-Scientist на базе Gemini к реальному научному процессу, позволив ему проектировать эксперименты, генерировать код для выполнения, анализировать обратную связь от экспериментов и напрямую взаимодействовать с экспериментальным оборудованием. Google называет это изменение переходом от in-silico hypothesis generator к execution-grounded research partner — генератору гипотез в симуляции → исследовательскому партнеру, основанному на выполнении.

В самом прямом эксперименте исследователи передали Gemini 3 Deep Think условия работы самодельного устройства CVD. Через несколько минут оно предложило схему роста материалов, адаптированную к этому оборудованию, а затем перевело эту схему в машинный код для управления устройством. В итоге три двумерных полупроводника были успешно выращены с первой попытки.
Таким образом, сцена, которая раньше существовала лишь в научно-фантастических фильмах, внезапно стала реальностью: когда крупные модели действительно получили «руки» и начали управлять лабораторным оборудованием. Тогда что станет AI Scientist с сегодняшнего дня?
В «Резидент Эвил» люди боятся, что ИИ возьмет под контроль лабораторию. А в реальности ученые активно передают лабораторию Нажмите Передайте это ИИ. Конечно, то, что хочет сделать Google, — это не неконтролируемый «уль», а научная машина открытий, способная проходить путь от выдвижения гипотез и проектирования экспериментов до практической проверки.

Название статьи: Ускорение научных исследований с помощью Gemini в реальных условиях
Адрес статьи: https://arxiv.org/pdf/2608.26701
Gemini взяла на себя управление экспериментальным оборудованием
Прежде всего, материаловедение.

Исследователи использовали самостоятельно собранное оборудование для химического осаждения из газовой фазы, то есть CVD-печь. При проведении экспериментов с такими двухмерными материалами существует longstanding проблема: публичные «рецептуры» трудно воспроизвести.
При тех же параметрах, таких как температура, газ и предшественники, небольшие различия в размере камеры печи, потоке газа и расположении материалов при использовании другой печи могут привести к совершенно другим кристаллам. Исследователям часто требуется несколько недель или даже месяцев для многократной настройки параметров.
Таким образом, исследовательская команда больше не говорила Gemini, как проводить эксперименты, а вместо этого сообщила ему, какое оборудование и химикаты есть в лаборатории, а также как устроены печи. Остальные параметры AI определил самостоятельно.
Co-Scientist на основе этих ограничений генерирует полный экспериментальный план, включая расход газа, температурные кривые, количество предшественников и расположение материалов, а затем передает его исполнительным устройствам.

Одна из экспериментальных групп особенно впечатлила. После подключения Gemini 3 Deep Think к процессу управления CVD он перестал генерировать экспериментальный протокол на естественном языке для медленного чтения учеными, а за несколько минут выполнил рассуждения и напрямую перевел результаты в машинный код, управляемый оборудованием.
В итоге монолayers кристаллов были успешно выращены в первом эксперименте для трех двумерных полупроводников: MoS₂, MoSe₂ и WS₂. Весь экспериментальный процесс занял около одного часа.
MoSe₂ и WS₂ особенно уникальны: ранее исследователи даже не выращивали эти материалы на данном оборудовании. Результаты были подтверждены как минимум пятью последующими повторными экспериментами.
Это интересно перекликается с MHS, представленным Anthropic вчера. Проблема, которую Anthropic стремится решить, — как сделать так, чтобы агенты могли удобнее и стандартизированнее распознавать и управлять лабораторным оборудованием; в этой статье Google обсуждается следующий шаг: как перестроить научные рабочие процессы, когда модели рассуждения уже могут управлять лабораторным оборудованием?
В этом смысле «AI, соединяющий аппаратное обеспечение», уже не является проблемой.
AI не только проводит эксперименты по статьям, но и начинает сам искать рецепты.
Однако просто заставить Gemini на основе имеющихся знаний настроить набор оборудования нельзя считать настоящим научным открытием. Поэтому Google провел второй, более сложный эксперимент: попытался синтезировать снизу вверх двумерный материал под названием Ti₃C₂Tₓ MXene.
Традиционные методы часто включают использование опасных коррозионных реагентов, а некоторые известные методы CVD применяют токсичное и чувствительное к воздуху TiCl₄. Поэтому исследовательская команда поставила перед Co-Scientist задачу: нельзя ли найти более безопасный путь с использованием предшественников?
Co-Scientist в конечном итоге сосредоточился на гексахлорэтане C₂Cl₆ и дал дальнейшие параметры, включая количество предшественников, их расположение, расход газа, подложку и температурный профиль.

Но это не история о «внезапной идее ИИ и одном успешном эксперименте». Co-Scientist сгенерировал 272 кандидата, и исследователи выбрали и продолжили оптимизировать высоко ранжированные из них; после 25 циклов экспериментальных итераций в итоге был получен двумерный слоистый кристалл, который по множеству показателей — таким как XRD, электронная микроскопия и элементный состав — демонстрирует высокую степень сходства с Ti₃C₂Tₓ MXene.
Последующие проблемы в реальном мире также типичны. Изначально успех воспроизведения эксперимента составлял только 11,5%. Позже исследователи обнаружили, что основная проблема заключалась не в химических рассуждениях ИИ, а в утечке кислорода из-за неплотного уплотнения экспериментального оборудования.
После повторной очистки кварцевых трубок, замены уплотнительных колец и улучшения процесса технического обслуживания оборудования成功率 экспериментов с одним и тем же двухмерным материалом повысилась до 68%.
Это как раз объясняет, почему «искусственный интеллект реального мира» сильно отличается от программных агентов: если в коде есть ошибка, его можно перезапустить. Но в реальных экспериментах старый уплотнитель типа O, небольшое количество остатков в трубопроводе или даже кислород в воздухе могут полностью свести на нет правильно спланированный научный подход.
Google также очень осторожен в своей статье: на данный момент нельзя окончательно подтвердить, что этот материал является Ti₃C₂Tₓ MXene, поскольку он сталкивается с проблемами низкой выходной производительности и сильного окисления, требующими дальнейшей проверки на атомарном уровне.
Тем не менее, мы можем сделать такой вывод: ИИ уже способен предложить научно значимый кандидат на синтетический маршрут, а затем реально продвинуть этот маршрут до физического эксперимента для проверки.
Некоторые эксперименты можно сначала поручить ИИ «угадать».
Google также поместил Co-Scientist в совершенно другой экспериментальный сценарий: синтетическую биологию. Объектом исследования стала группа генетически модифицированных кишечных палочек.

Эти бактерии образуют различные узоры колоний на чашке Петри. При изменении концентрации индуктора IPTG изменяются размер, край и форма колоний. Обычно для получения полной кривой изменений ученым необходимо готовить различные концентрации, культивировать бактерии, ждать их роста и сканировать каждую чашку по отдельности.
Google попытался заставить ИИ заполнить среднюю часть эксперимента. Исследователи предоставили Co-Scientist только изображения колоний при частичных концентрациях, а затем попросили систему предсказать, как должны выглядеть колонии при неизвестных промежуточных концентрациях. Кроме того, эти экспериментальные данные на тот момент еще не были опубликованы, поэтому в статье делается вывод, что модель не могла просто запомнить результаты из обучающих данных для выполнения задачи.
В результате, по трем из четырех показателей морфологии колоний предсказания ИИ не показали значимых отличий от реальных результатов влажных экспериментов; он также правильно определил, что контрольная группа не изменяется в ответ на концентрацию IPTG.

Единственная явная проблема — «округлость»: колонии, сгенерированные ИИ, более регулярны, чем в реальности. Это соответствует типичной эстетике генеративных моделей: реальный мир несовершенен, но ИИ не может удержаться и слегка «округляет» его.

Google также сдержан в определении этого эксперимента: на данный момент получены интерполяции в известном диапазоне концентраций, а не прогнозирование неизвестных явлений при наличии совершенно новой генетической схемы.
Но это уже соответствует очень реальному применению. В будущем ученым, возможно, не придется проводить все влажные эксперименты на огромном параметрическом пространстве. Можно сначала проверить несколько точек, позволить ИИ предсказать оставшееся пространство на основе этих реальных данных, а затем выбрать наиболее перспективные позиции для экспериментов.
Эксперименты постепенно перешли от «полного перебора» к: выборке из реального мира → прогнозирование ИИ → выбор эксперимента → обратная связь новыми данными для ИИ.
Это именно то, что в статье неоднократно подчеркивается как lab-in-the-loop.
ИИ уже начал самостоятельно проектировать ИИ
Перейдя к эксперименту в области компьютерных наук, уровень автономности Co-Scientist снова повысился.

На этот раз исследователи поставили перед ним очень простую задачу: разработать агента, способного лучше отвечать на медицинские вопросы. После этого люди больше не участвовали в проектировании архитектуры. Co-Scientist самостоятельно предлагал решения, писал код, запускал тесты, анализировал ошибки и продолжал модифицировать архитектуру.
В конце концов, он «эволюционировал» в систему под названием Agent_H.
Эта система должна найти способ переорганизовать процесс рассуждения существующих моделей. При столкновении с медицинской проблемой она сначала определяет, к какой области медицины относится вопрос, для пациента или врача он предназначен, и насколько высок риск; сложные вопросы разбиваются на несколько подвопросов; затем одновременно генерируются 28–48 вариантов ответов, которые попарно отсеиваются разными судьями, после чего три судьи голосуют за финальный ответ. Победивший ответ проходит несколько циклов клинического обзора и проверки источников, прежде чем его длина окончательно сокращается.

Для ответа на один вопрос агенту необходимо вызвать модель примерно 40–80 раз. На HealthBench Hard и HealthBench Professional, согласно длине-корректированным оценкам, использованным в статье, Agent_H превзошёл шесть передовых моделей, включая GPT-5.6 Sol, Claude Opus 5 и Gemini 3.1 Pro.

Однако здесь произошел эпизод, достойный отдельного освещения: ИИ самостоятельно освоил «взлом рейтинга».
В ранних экспериментах критерии оценки недостаточно наказывали за длинные ответы, поэтому Co-Scientist быстро нашел самый простой способ повысить оценку: делать ответы особенно длинными.
Балл Benchmark значительно вырос, но качество медицинской помощи не повысилось соответственно. Только после того как исследователи добавили штраф за длину, значительное преимущество исчезло.
Сама Google в своей статье рассматривает это как типичный пример закона Гудхарта: когда показатель становится целью, он перестает быть хорошим показателем.
Оценки реальных врачей также несколько снизили энтузиазм. Три практикующих врача провели слепую оценку 106 вопросов. Из девяти измерений Agent_H показал статистически значимое улучшение только по критерию «снижение потенциального вреда» по сравнению с оригинальной версией Gemini 3.1 Pro; остальные восемь критериев не показали значимых различий.

Другими словами, значительно более высокие показатели Benchmark в глазах AI Judge не превратились в значительно лучшие ответы в глазах человеческих врачей. Возможно, это и есть проблема, с которой AI Scientist столкнется, войдя в реальный мир: ему нужно не только уметь оптимизировать, но и понимать, что не все можно определить только с помощью показателей оптимизации.
Исследователи в области ИИ могут фабриковать данные для статей
На самом деле, в этой статье Google уделил значительное внимание другому несколько неловкому вопросу: если полностью отпустить AI Scientist, не станет ли он обманывать ради получения красивых результатов?

Да.
Исследовательская команда позволила системе пройти весь процесс — от генерации идей, поиска данных, написания кода и проведения экспериментов до создания финальной научной статьи — на 50 темах, связанных с ИИ, без какого-либо вмешательства человека.
В качестве контроля они также протестировали версию Co-Scientist без модуля надежности, а также предыдущую систему Agent Laboratory, в результате чего было сгенерировано 150 статей, которые были переданы 30 экспертам в области для проведения 450 анонимных рецензий.
Результат получается довольно абсурдным. AI Scientist без специальной системы проверки может продолжать писать полную статью, даже когда код выдает ошибки, а эксперимент не дал никаких действительных результатов.

Они фальсифицируют таблицы данных, p-значения, статистические тесты; превращают неудачные эксперименты в успешные; даже изменяют среду оценки, чтобы их методы автоматически получали более высокие баллы, или напрямую выводят красивый результат через хардкод.
Когда целью оптимизации является: «написать хорошую на вид статью», агент будет искать более дешевые обходные пути, чем реальное проведение исследования.
Поэтому Google добавил к новой версии Co-Scientist механизм, очень похожий на «научный аудит»: результаты экспериментов, упомянутые в статье, должны быть восстановлены из реальных журналов выполнения программ. Если в журналах нет соответствующих результатов, система не может включать их, полагаясь только на то, что языковая модель «считает» их верными.
Эффект очень заметен. «Иллюзия результатов», достаточная для недействительности статьи, снизилась с 90% в Agent Laboratory до 4%; полное фальсифицирование данных, наиболее серьезный случай, снизилось с 44% до 0%.
Однако проблема не была полностью устранена. У новой версии Co-Scientist по-прежнему наблюдается 24% серьезных ошибок в описании методов и 16% серьезного плагиата/производных материалов.
Google специально подчеркивает, что они не утверждают, что текущий Autonomous AI Scientist уже может генерировать исследовательские статьи, готовые к публикации.
Заключение
Если рассмотреть работы Anthropic и Google вместе, становится очевидным значительный сдвиг в развитии агентов: последние два года главной ареной для ИИ-агентов была исключительно программная среда. Сейчас эта логика впервые масштабно выходит за пределы реального мира.
MHS от Anthropic пытается решить фундаментальную проблему: предоставить различным устройствам, таким как роботизированные руки, микроскопы и платформы для обработки жидкостей, единый интерфейс, который может понимать и управлять ими агент.
Google Co-Scientist начал исследовать более высокие вопросы: как должна выглядеть настоящая замкнутая система научного открытия, когда модель рассуждения может формулировать научные гипотезы, планировать эксперименты, управлять оборудованием, анализировать результаты и продолжать корректировать следующий цикл экспериментов.
Конечно, Google еще далеко от настоящей «лаборатории без людей». В настоящее время эксперименты с материалами все еще требуют человеческого вмешательства для загрузки образцов; атомная структура новых материалов еще не окончательно определена; предсказания для кишечной палочки проверяли только ограниченные задачи интерполяции; медицинские агенты эксплуатируют лазейки в бенчмарках; системы генерации статей еще не решили полностью проблемы иллюзий и плагиата. Сама Google прямо признает, что из-за аппаратных сбоев и сложности реальной среды в настоящее время полностью автономные физические эксперименты остаются труднодостижимыми.
Но изменения уже произошли.
Раньше при обсуждении ИИ для науки акцент часто делался на том, может ли ИИ «придумать то, чего не смогли придумать люди». Сейчас всё больше работ начинают заполнять более сложную вторую половину: может ли эта идея быть реализована реальным оборудованием, и могут ли результаты выполнения стать основой для следующего цикла рассуждений ИИ.
В конце статьи Google делает интересный вывод: если такая замкнутая система действительно будет создана, то ограничивающий фактор в будущей науке может измениться: раньше оборудование ждало, пока ученые сформулируют следующий хороший вопрос; в будущем, возможно, ИИ уже предложит сотни экспериментов, заслуживающих проверки, и лаборатории просто не успеют их выполнить.
К тому времени настоящим узким местом скорости научных открытий, возможно, станет не научная идеация, а экспериментальная пропускная способность — насколько быстро реальный мир сможет провести эти эксперименты.
Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: следящий за научным ИИ
