Искусственный интеллект

Популярные тесты могли сильно недооценивать способности ИИ решать задачи по физике

Современные системы искусственного интеллекта могут значительно лучше справляться со сложными задачами по физике, чем показывают популярные тесты. Международная группа исследователей повторно проверила результаты ведущих ИИ-моделей и обнаружила, что значительная часть зафиксированных ошибок была связана не с рассуждениями ИИ, а с проблемами самих тестов — неверными эталонными ответами, неоднозначными условиями и ошибками автоматической проверки.

Исследователи проанализировали шесть широко используемых физических бенчмарков, предназначенных для оценки способности языковых моделей решать научные и количественные задачи. Для разных разделов физики к проверке привлекали преподавателей и аспирантов с соответствующей специализацией. Эксперты изучали не только ответы моделей, но и условия задач, эталонные решения и результаты автоматического оценивания.

Оказалось, что во многих проверенных случаях ответы, первоначально отмеченные как неправильные, на самом деле не свидетельствовали об ошибке ИИ в физическом рассуждении. Причиной могли быть ошибочные эталонные решения или задачи, допускающие несколько интерпретаций. После экспертной проверки исследователи исправили такие эталоны, а некорректные или недостаточно определённые задания отредактировали либо исключили из оценки.

После этого результаты моделей заметно выросли. Например, показатель GPT-5.6 Sol на наборе HLE-Physics увеличился с 47,3 до 78,7%, а на CMT-Benchmark — с 61,0 до 87,2%. На 54 оставшихся после проверки задачах CritPt показатель corrected pass@4 достиг 94,4%. Существенный рост после исправления тестов наблюдался также на UGPhysics, PRISM-Physics и PHYBench.

При этом результаты не означают, что ИИ уже способен заменить физиков или самостоятельно проводить полноценные научные исследования. Авторы оценивали прежде всего текстовые задачи с проверяемым конечным ответом. Реальная научная работа требует постановки новых вопросов, оценки предположений, работы с экспериментальными данными и проверки новых гипотез — это гораздо более широкий набор способностей.

Исследование указывает на другую проблему: некоторые существующие тесты могут уже плохо подходить для оценки наиболее мощных ИИ-систем. Если после экспертной корректировки модели решают подавляющую часть закрытых задач, дальнейшее сравнение систем потребует более сложных и тщательно проверенных специалистами заданий. Авторы считают, что результаты популярных бенчмарков сегодня могут существенно недооценивать способность передовых моделей решать корректно сформулированные задачи по физике.

Исследование опубликовано на сервере препринтов arXiv и пока не прошло рецензирование.

Подпишитесь на нас: Вконтакте / Telegram / Дзен Новости / MAX
Back to top button