Маленькая модель ИИ обошла гораздо более крупные системы в специализированном тесте
Небольшая языковая модель всего с 4 миллиардами параметров показала результат выше двух протестированных конфигураций GPT-5.6 в специализированном тесте, имитирующем работу автоматов по продаже билетов в метро. Результат показывает, что для узких практических задач размер модели может быть менее важен, чем её специализированное обучение. При этом речь не идёт о превосходстве небольшой модели над крупными ИИ в целом — сравнение проводилось только в рамках конкретного теста MetroLLM-Bench.
MetroLLM-Bench разработан для проверки способности языковых моделей выполнять роль управляющей системы транспортного терминала. Вместо обычных вопросов и ответов ИИ должен взаимодействовать со структурированными инструментами, выбирать маршрут, рассчитывать стоимость поездки, учитывать сбои в движении, требования доступности и другие условия, после чего выдавать результат в формате, который может использовать программная система.
Всего исследователи подготовили 955 сценариев, охватывающих шесть реальных систем метро размером от 37 до 414 станций. Задачи разделили на 11 категорий, включая построение маршрутов, расчёт тарифов, нарушения движения, доступность транспорта и специально созданные провокационные запросы. Для итоговой проверки использовали 238 сценариев, которые не входили в данные для обучения.
Авторы протестировали 26 моделей от шести поставщиков, из которых 23 вошли в итоговый рейтинг. Особое внимание исследователи уделили семейству Qwen 3.5. Небольшую модель Qwen 3.5 4B дополнительно обучили для выполнения задач MetroLLM-Bench с помощью параметрически эффективного дообучения PEFT.
В детерминированной части теста дообученная Qwen 3.5 4B получила 91,3 балла. Две протестированные конфигурации GPT-5.6 набрали 90,6 и 90,0 балла соответственно. Результат маленькой модели оказался практически равен показателю GPT-5.4 при максимальном уровне рассуждений — 91,4 балла.
При этом локальная версия Qwen 3.5 4B после квантизации Q4_K_M занимает всего около 2,6 ГБ. Это делает результат особенно интересным с практической точки зрения: специализированную систему такого размера потенциально значительно проще запускать непосредственно на локальном оборудовании, чем крупные универсальные модели.
Ещё более неожиданным оказалось сравнение моделей Qwen разного размера. Увеличение числа параметров до 9 и 27 миллиардов не дало дальнейшего улучшения результата в основной детерминированной части теста при использованном объёме специализированного обучения. Иными словами, в данном эксперименте простое увеличение модели не сделало её лучше в решении поставленной задачи.
Эффект от специализированного обучения также оказался наиболее выраженным у маленьких моделей. Для версии с 2 миллиардами параметров дообучение повысило результат в среднем на 7,03 балла, тогда как у модели с 27 миллиардами параметров показатель после аналогичного обучения оказался на 0,91 балла ниже исходного. Такое направление результата повторилось во всех проведённых авторами запусках.
Исследователи дополнительно сравнили нейросети с обычной системой, работающей по заранее заданным правилам. Такой алгоритм получил 84,6 балла. Преимущество языковых моделей особенно проявлялось в сложных составных сценариях, адаптации поведения, обработке требований доступности и задачах, связанных со временем.
Однако маленькая Qwen не стала абсолютным победителем всего исследования. MetroLLM-Bench включает не только детерминированные проверки правильности действий, но и отдельные оценки качества ответа. В объединённом рейтинге лидером стала модель Muse Glimmer 30B. Авторы также обнаружили, что одна только конфигурация запуска модели способна изменить результат на 2,7 балла, поэтому небольшие различия между отдельными системами следует интерпретировать осторожно.
Работа показывает более общий принцип развития прикладного ИИ: для некоторых строго определённых задач небольшая специализированная модель может конкурировать с гораздо более мощными универсальными системами. Вместо постоянного увеличения числа параметров разработчики могут получать сопоставимый результат за счёт качественного дообучения, правильного набора инструментов и точной адаптации модели под конкретную задачу.
Это особенно важно для систем, которые должны работать локально — в терминалах, автомобилях, роботах, промышленном оборудовании и других устройствах с ограниченными вычислительными ресурсами. Однако результаты MetroLLM-Bench пока нельзя переносить на общие способности моделей к программированию, математике, научным рассуждениям или работе с текстом: исследование проверяет узкий класс задач транспортного терминала.
Исследование в виде препринта на arXiv.