Гарвардская медицинская школа и клиника Beth Israel Deaconess Medical Center в Бостоне поделились исследованием, которое моментально стало поводом для споров в медицинском сообществе. Ученые взяли 76 реальных случаев приема пациентов в неотложном отделении больницы и сравнили диагнозы двух опытных врачей-терапевтов с ответами нейросетей OpenAI o1 и GPT-4o. Оценку проводили независимые эксперты вслепую: они не знали, где диагноз и план лечения человека, а где — алгоритма.
Модель o1 при первичном триаже (осмотр пациентов — момент, когда информации минимум, а решение нужно немедленно) дала точный или близкий к точному диагноз в 67% случаев. Врачи — в 55% и 50% соответственно. Когда обеим сторонам добавили больше данных из медицинских карт, точность ИИ выросла до 82%, врачей — до 70–79%. Разрыв сохранился, но стал статистически менее выраженным.
Модель o1 работает по принципу так называемой цепочки рассуждений (chain-of-thought): перед ответом нейросеть перебирает гипотезы, проверяет их, отсеивает слабые и выбирает наиболее вероятный диагноз. Обучена она через метод подкрепляющего обучения (reinforcement learning — когда система получает «награду» за правильные ответы и учится на ошибках). o1 помнит паттерны из миллионов описаний случаев, рассматривает даже редкие случаи, которые уставший врач вполне мог бы упустить, и не обращает внимания на стрессовую ситуацию наплыва пациентов. Но нейросеть работает исключительно с результатами первичного осмотра, сама она провести диагностику не в состоянии. Врач в реальности воспринимает десятки сигналов, которых в электронной карте просто нет. Врач-реаниматолог Кристен Пантагани справедливо указала ещё на одну методологическую загвоздку: сравнение проводилось с терапевтами, а не со специалистами экстренной медицины.
Тем не менее цифры не перестают быть цифрами. Особенно показательна разница в планах лечения. В некоторых случаях ИИ предлагал клинически корректные шаги значительно чаще, чем врачи.
Один из авторов исследования, врач Адам Родман, описывает будущее как «треугольник»: врач, пациент и ИИ работают вместе. Это вполне конкретная операционная модель, которую уже тестируют в ряде американских и европейских клиник. В России Botkin.AI анализирует КТ и рентген в более чем 1800 учреждениях. В США FDA одобрила несколько алгоритмов для скрининга онкологии. Следующий шаг — интеграция прямо в электронные медкарты, чтобы ИИ выдавал дифференциальный диагноз (список наиболее вероятных болезней) одновременно с приёмом пациента.
Но полностью автономный ИИ-врач без участия человека в ближайшее время в больницах точно невозможен. Сейчас не существует никакой системы ответственности за ошибку алгоритма. Если живой специалист ставит неверный диагноз — есть медицинское право, страховка, лицензионная комиссия. Если ошибается модель — юридически это пока серая зона. Законы пока не говорят, что делать в таких случаях.
