ИИ ставит диагнозы по рентгену — и уверенно ошибается

Представьте: вы загружаете снимок КТ в чат-бот, получаете уверенный ответ — и идёте домой с ложным чувством спокойствия. Или, что ещё хуже, с неверным диагнозом. Это не антиутопическая фантастика — это то, что происходит прямо сейчас. Люди массово загружают рентгеновские снимки и МРТ в ChatGPT, Claude и Gemini, а модели отвечают с видом профессора медицины. Проблема в том, что уверенность и точность — совершенно разные вещи.
Что такое RadLE 2.0 и зачем он нужен
Исследовательская лаборатория CRASH Lab при университете Ашока в Индии выпустила вторую версию бенчмарка RadLE — «Radiology's Last Exam». Первая версия вышла в сентябре 2025 года и уже тогда показала пропасть между людьми и машинами: радиологи давали правильный ответ в 83% случаев, лучшая модель — лишь около 30%. За прошедшие месяцы точность ИИ резко выросла, но появилась новая, куда более коварная проблема.
RadLE 2.0 тестирует не просто точность, а связку точность + честность. Модель должна не только поставить диагноз, но и оценить свою уверенность по шкале от 0 до 4. При этом ей явно разрешено сказать «я не знаю». Система баллов работает как страховой полис от самонадеянности: правильный ответ с высокой уверенностью — полные очки, неправильный ответ с высокой уверенностью — такое же количество очков вычитается, «не знаю» — ноль, но без штрафа.
Это принципиально умная конструкция. Классические бенчмарки награждают за угадывание — и модели научились угадывать. В медицине уверенная ошибка несравнимо опаснее честного незнания.
Результаты: люди впереди, но разрыв сокращается
В тестировании участвовали 200 клинических случаев и 16 моделей. Панель врачей-радиологов набрала 988,7 балла из 2000 возможных. Лучший ИИ — 758 баллов. Разрыв значительный, но уже не пятикратный, как год назад.
По чистой точности диагнозов картина интереснее: Google Gemini 3 Pro показал наивысший процент правильных ответов и почти догнал человеческий уровень по этому показателю. Но как только в расчёт входит уверенность — позиции меняются. Claude Fable 5 от Anthropic лидирует по комбинированному показателю надёжности и безопасности. А Meta Muse Spark 1.1 оказался чемпионом по умению вовремя сказать «это не моё» и передать случай человеку.
Интересный момент с Muse Spark 1.1: Meta недавно специально работала над снижением галлюцинаций, и модель стала чаще отказываться отвечать вместо того, чтобы придумывать. Это ровно то поведение, которое нужно в медицине. Grok 4.5, напротив, показал рост галлюцинаций по сравнению с предшественником — знает больше, но и ошибается увереннее. Это опасная комбинация.
Открытые модели — отдельная история
Если коммерческие флагманы хотя бы иногда признают неопределённость, то открытые веса и специализированные медицинские модели ведут себя принципиально иначе. Они пытаются ответить почти на каждый случай. Звучит как достоинство — на деле это катастрофа. Потому что «отвечают почти всегда» вовсе не означает «отвечают правильно». Они ошибаются часто, и делают это со средней или высокой уверенностью.
Это парадокс специализации: модели, дообученные на медицинских данных, думают, что знают больше, чем знают на самом деле. Их уверенность растёт быстрее компетентности. Это не баг конкретной архитектуры — это системная проблема любого дообучения на узкой доменной выборке.
Что реально происходит с пользователями
Исследователи зафиксировали тревожный тренд: пациенты уже сейчас загружают свои рентгены и МРТ в чат-боты и доверяют полученным ответам. Это не гипотетический сценарий будущего. Модели при этом не говорят: «Я языковая модель, не врач, обратитесь к специалисту» — они дают конкретные интерпретации с видом уверенного рентгенолога.
Для российской аудитории: большинство протестированных моделей доступны через веб-интерфейсы или API, часть требует VPN. Загрузить снимок технически несложно — Claude, Gemini и другие принимают изображения. Но «технически несложно» не означает «безопасно». Именно здесь и кроется главная опасность: доступность создаёт иллюзию медицинской консультации там, где её нет.
Что нужно изменить
Радиология — это не просто распознавание паттернов на картинке. Это интерпретация в контексте: история болезни, симптомы, возраст, сопутствующие патологии. Модели видят пиксели. Хороший радиолог видит пациента.
RadLE 2.0 ставит правильный вопрос: прежде чем ИИ научится ставить диагнозы самостоятельно, он должен научиться понимать границы своей компетентности. Модель, которая честно говорит «я не уверен, нужен специалист» — ценнее модели с высокой точностью, но нулевым самоосознанием.
По моей оценке, следующий год в медицинском ИИ пройдёт под знаком именно этой метрики — calibration, или калибровки уверенности. Компании, которые научат свои модели молчать в нужный момент, получат реальное преимущество в клинических применениях. А те, кто гонится только за accuracy на бенчмарках — создают продукты, которые опасны именно тогда, когда кажутся наиболее полезными.
Источники
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.