ИИ-агенты обнаружили ошибки в научных публикациях, которые сохранялись десятилетиями
Учёные обнаружили ошибки в научных данных, которые могли оставаться незамеченными на протяжении нескольких десятилетий. Исследователи использовали систему искусственного интеллекта для прогнозирования температуры кипения различных молекул и получили значения, не совпадавшие с данными из научной базы, которой химики пользуются уже около 75 лет. Однако после проверки исходной научной литературы выяснилось, что ошибались не алгоритмы, а сама база данных.
Исследователи отмечают, что этот случай показывает потенциальную пользу искусственного интеллекта для проверки научных работ и справочных данных. Одновременно он демонстрирует, насколько важно перепроверять исходные данные, особенно в период стремительного развития ИИ.
Развитие больших языковых моделей постепенно меняет методы проведения научных исследований. Современные системы искусственного интеллекта способны автоматизировать многие трудоёмкие операции, включая написание сложного программного кода, поиск закономерностей в больших массивах данных и участие в проверке математических и физических рассуждений.
Количество научных публикаций в последние годы значительно выросло. Использование ИИ и автоматизации может ещё больше ускорить этот процесс. Однако рост числа исследований создаёт дополнительную нагрузку на систему научного рецензирования. Экспертам необходимо проверять научную строгость работ, воспроизводимость результатов и наличие возможных ошибок.
Проблема заключается в том, что объём научной информации растёт быстрее, чем возможности людей проверять её вручную. В некоторых областях, например в математике и теоретической информатике, полноценная проверка одной работы может потребовать последовательного анализа сложных доказательств буквально по строкам и занимать у рецензента несколько дней.
ИИ помог найти ошибки в справочной базе
Одним из примеров использования ИИ для такой проверки стала работа теоретических химиков из лаборатории Zhejiang в китайском городе Ханчжоу. Исследователи применили систему искусственного интеллекта для прогнозирования температуры кипения нескольких молекул.
Полученные алгоритмом значения отличались от данных, содержащихся в научной справочной базе, которой химики по всему миру пользовались на протяжении многих десятилетий.
Первоначально могло показаться, что искусственный интеллект допустил ошибку. Однако исследователи решили проверить первоисточники вручную и изучили оригинальные научные публикации, на основании которых формировались справочные данные.
В результате выяснилось, что некоторые значения в самой базе данных были ошибочными.
Учёные обнаружили ошибки и в старых научных статьях и справочных изданиях. В некоторых случаях речь шла о простых опечатках, а в других — о неправильных измерениях температуры кипения.
Проблема заключалась в том, что последующие исследователи использовали уже опубликованные значения в качестве исходных данных. В результате ошибки из старых публикаций могли автоматически переноситься в новые научные работы.
По словам теоретического химика Себастьяна Пиоса из Zhejiang Lab, такие ошибки могли создавать проблемы для последующих исследований, поскольку некорректные значения продолжали восприниматься как достоверные справочные данные.
Таким образом, необычный результат, полученный ИИ, оказался не свидетельством так называемой «галлюцинации» модели, а сигналом о том, что сами общепринятые научные данные могут содержать ошибки.
ИИ-агенты начинают проверять научные статьи
Другой пример связан с использованием целой системы ИИ-агентов для проверки научных публикаций.
Исследователи из SAI Labs разработали экосистему ИИ-агентов для анализа научных работ, отобранных для устных докладов на Международной конференции по машинному обучению ICML 2026 года.
Всего система проанализировала 168 научных статей. Для 105 из них была проведена полноценная попытка воспроизведения результатов.
Разработчики использовали систему SAI Review, которая расширяет их предыдущие проекты с открытым исходным кодом OpenAIReview и Veritas.
Система начинает с анализа самой научной статьи. Она извлекает основные утверждения авторов, получает доступ к предоставленным материалам и пытается воспроизвести заявленные результаты. Затем полученные результаты сравниваются с утверждениями из оригинальной работы.
При этом система может анализировать статью и без непосредственного выполнения всех описанных в ней экспериментов, то есть частично выполнять функции, аналогичные научному рецензированию.
Однако результаты показали, что возможности таких систем пока далеки от полной автоматической проверки научных публикаций.
Из 168 проанализированных статей в 92 было обнаружено как минимум пять утверждений, которые можно было оценивать. Только в 34 из этих работ ИИ-агентам удалось воспроизвести более 40 процентов проверяемых утверждений.
Среди 92 статей с минимум пятью оцениваемыми утверждениями только в восьми случаях ИИ смог воспроизвести более 80 процентов проверенных утверждений.
ИИ пока не может заменить научного рецензента
Эксперты, опрошенные журналом , подчёркивают, что искусственный интеллект, как и люди, способен ошибаться. Поэтому результаты его проверки необходимо дополнительно оценивать вручную.
Алгоритмы могут пропустить важные исходные предположения, неправильно интерпретировать результаты или даже сгенерировать несуществующие факты. Поэтому обнаруженное ИИ несоответствие не является автоматически доказательством ошибки в научной работе.
Тем не менее исследователи считают, что такие системы могут оказаться полезным инструментом для научных рецензентов. ИИ способен быстро просматривать большие объёмы информации, выявлять подозрительные значения, находить несоответствия между утверждениями и результатами и указывать специалисту на места, которые требуют дополнительной проверки.
История с температурами кипения показывает ещё одну важную особенность такого подхода. Иногда необычный результат работы искусственного интеллекта может оказаться не ошибкой самого алгоритма, а указанием на проблему в данных, которые научное сообщество долгое время считало правильными.
На данном этапе ИИ-агенты для поиска ошибок в научных исследованиях скорее подходят для привлечения внимания экспертов к потенциальным проблемам, чем для самостоятельного определения того, содержит ли научная публикация недостоверные данные.
В будущем такие системы могут стать дополнительным уровнем проверки научных исследований, однако окончательная оценка результатов по-прежнему требует участия специалистов и проверки исходных данных.