ИИ начал работать вместе с врачами в китайской глазной клинике от приёма пациента до постановки диагноза
Исследователи Университета Цинхуа внедрили в реальную офтальмологическую клинику в Пекине систему AI-TEC, в которой искусственный интеллект участвует почти во всём маршруте пациента — от предварительного опроса и сортировки до анализа снимков, поддержки врачебных решений и последующего наблюдения. Однако первые месяцы работы показали, что качество такой системы определяется не только точностью алгоритмов: решающими оказались качество медицинских данных, удобство интерфейса и постоянная обратная связь от врачей. Важно, что AI-TEC не заменяет офтальмологов и не работает как полностью автономная клиника — окончательные клинические решения остаются за врачами.
Проект AI-Agent Augmented Tsinghua Eye Clinic, или AI-TEC, разработала междисциплинарная команда Университета Цинхуа, Пекинского института визуальных наук и трансляционных исследований глаза (BERI) и Пекинской больницы Tsinghua Changgung. Прототип начали использовать в этой больнице в ноябре 2025 года. В отличие от обычного подхода, при котором отдельный алгоритм подключают, например, только для анализа медицинских изображений, разработчики попытались встроить несколько специализированных ИИ-агентов непосредственно в последовательность работы клиники.
Один агент собирает жалобы и историю болезни перед консультацией, другой помогает определить уровень риска и назначить необходимые обследования, третий анализирует мультимодальные офтальмологические данные, ещё один предоставляет врачу информацию для принятия решения. Отдельный агент предназначен для обучения пациентов, последующего наблюдения и длительного ведения. Данные, полученные на одном этапе, могут передаваться дальше по этой цепочке вместо того, чтобы оставаться в нескольких изолированных системах.
Одна из наиболее показательных проблем обнаружилась при анализе изображений глазного дна. Первоначально система сравнительно плохо распознавала некоторые заболевания, включая глаукому и возрастную макулярную дегенерацию. Затем офтальмологи подготовили 1426 тщательно проверенных и правильно размеченных изображений. Несмотря на то что этот набор был намного меньше исходного массива почти из 27 тысяч снимков более низкого качества и с менее полной разметкой, после его использования показатели модели заметно улучшились.
Для оценки применяли AUROC — площадь под ROC-кривой, показывающую способность модели различать диагностические классы. После обучения на более качественных данных значение AUROC превысило 0,93. Это не означает «93-процентную точность» в буквальном смысле: AUROC является другим статистическим показателем. Сам результат показывает, что относительно небольшой, но тщательно проверенный специалистами набор медицинских данных может оказаться полезнее гораздо более крупной выборки с менее надёжной разметкой. В основной публикации авторы отдельно подчёркивают улучшение AI-TEC после использования экспертно проверенных данных высокого качества.
Дополнительные материалы показывают, что ошибки системы были связаны не только с недостатками самого алгоритма. Например, тяжёлая диабетическая ретинопатия могла быть принята за окклюзию вен сетчатки, если системе не была доступна информация о диабете. Отражение света в области диска зрительного нерва мешало распознаванию глаукомы. В некоторых случаях расхождение между ответом ИИ и эталонным диагнозом вообще нельзя было однозначно считать полной ошибкой, поскольку у пациента могли одновременно присутствовать несколько заболеваний или вторичные изменения.
Не менее важный результат появился не при проверке диагностической точности, а при наблюдении за врачами. Сначала сотрудники активно пользовались AI-TEC, однако через пять месяцев доля обследований с использованием предусмотренных системой ИИ-процессов упала до 41 из 1113 за месяц, то есть до 3,8%. Это произошло несмотря на доступность самих алгоритмов.
Разработчики ускорили систему, сократили число необходимых действий и уменьшили объём информации, которую персоналу приходилось вводить вручную. Уже в следующем месяце AI-TEC использовали при 259 из 1126 обследований — примерно в 23% случаев. Для авторов это стало практическим подтверждением того, что даже достаточно точный медицинский ИИ мало полезен, если он замедляет работу врача или требует слишком много дополнительных действий.
Третьей проблемой оказалась скорость обратной связи. Разработчики пришли к выводу, что замечания врачей необходимо получать непосредственно в ходе эксплуатации, а не собирать и передавать команде ИИ спустя недели. Такой цикл позволяет быстрее выявлять ошибки, проблемы интерфейса и ситуации, в которых алгоритмическая постановка задачи не совпадает с реальной клинической практикой.
Это расхождение особенно заметно в диагностике. Алгоритм обычно решает заранее заданную задачу — например, определяет, присутствует ли на изображении конкретное заболевание. Пациент же приходит к врачу не с готовым диагностическим классом, а с жалобой вроде ухудшения или затуманивания зрения. Одни и те же симптомы могут иметь разные причины, поэтому высокая точность классификации снимков сама по себе ещё не показывает, насколько система помогает конкретному пациенту.
В пилотной схеме AI-TEC врачи сначала ставили предварительный диагноз, не видя ответа искусственного интеллекта. Затем им показывали вывод модели и предлагали указать, повлияла ли эта информация на решение, после чего врач фиксировал окончательный диагноз. Такой дизайн позволяет исследовать потенциальное влияние ИИ на действия специалиста, но ещё не доказывает улучшения исходов лечения.
Именно здесь находится главное ограничение проекта. Публикация описывает раннее внедрение AI-TEC в реальной больнице, а не результат крупного рандомизированного клинического испытания. Пока не показано, что использование всей системы снижает частоту диагностических ошибок, улучшает зрение пациентов, сокращает время до лечения или даёт другие измеримые преимущества для здоровья. Авторы также отмечают, что «тихое» тестирование ИИ, при котором его результаты не влияют непосредственно на решения врача, подходит для проверки работы системы в реальной среде, но не позволяет непосредственно определить её влияние на эффективность лечения и исходы для пациентов.
Поэтому исследователи предлагают оценивать медицинский ИИ не только по AUROC, чувствительности или специфичности. Для полноценной проверки необходимо выяснить, ускоряет ли он диагностику, уменьшает ли нагрузку на врачей, помогает ли правильно направлять пациентов на дальнейшее обследование и лечение и в конечном счёте улучшает ли состояние людей. Опыт AI-TEC пока показывает прежде всего другое: перенести хороший алгоритм из лабораторного теста в больницу значительно сложнее, чем добиться высокой оценки на диагностическом наборе данных.
Исследование в журнале Nature Medicine.