C
ИИ-чатRadLE 2.0медицинский ИИрадиологияGeminiClaude

ИИ ставит диагнозы по рентгену — и уверенно ошибается

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
ИИ ставит диагнозы по рентгену — и уверенно ошибается

Представьте: вы загружаете снимок КТ в чат-бот, получаете уверенный ответ — и идёте домой с ложным чувством спокойствия. Или, что ещё хуже, с неверным диагнозом. Это не антиутопическая фантастика — это то, что происходит прямо сейчас. Люди массово загружают рентгеновские снимки и МРТ в ChatGPT, Claude и Gemini, а модели отвечают с видом профессора медицины. Проблема в том, что уверенность и точность — совершенно разные вещи.

Что такое RadLE 2.0 и зачем он нужен

Исследовательская лаборатория CRASH Lab при университете Ашока в Индии выпустила вторую версию бенчмарка RadLE — «Radiology's Last Exam». Первая версия вышла в сентябре 2025 года и уже тогда показала пропасть между людьми и машинами: радиологи давали правильный ответ в 83% случаев, лучшая модель — лишь около 30%. За прошедшие месяцы точность ИИ резко выросла, но появилась новая, куда более коварная проблема.

RadLE 2.0 тестирует не просто точность, а связку точность + честность. Модель должна не только поставить диагноз, но и оценить свою уверенность по шкале от 0 до 4. При этом ей явно разрешено сказать «я не знаю». Система баллов работает как страховой полис от самонадеянности: правильный ответ с высокой уверенностью — полные очки, неправильный ответ с высокой уверенностью — такое же количество очков вычитается, «не знаю» — ноль, но без штрафа.

Это принципиально умная конструкция. Классические бенчмарки награждают за угадывание — и модели научились угадывать. В медицине уверенная ошибка несравнимо опаснее честного незнания.

Результаты: люди впереди, но разрыв сокращается

В тестировании участвовали 200 клинических случаев и 16 моделей. Панель врачей-радиологов набрала 988,7 балла из 2000 возможных. Лучший ИИ — 758 баллов. Разрыв значительный, но уже не пятикратный, как год назад.

По чистой точности диагнозов картина интереснее: Google Gemini 3 Pro показал наивысший процент правильных ответов и почти догнал человеческий уровень по этому показателю. Но как только в расчёт входит уверенность — позиции меняются. Claude Fable 5 от Anthropic лидирует по комбинированному показателю надёжности и безопасности. А Meta Muse Spark 1.1 оказался чемпионом по умению вовремя сказать «это не моё» и передать случай человеку.

Интересный момент с Muse Spark 1.1: Meta недавно специально работала над снижением галлюцинаций, и модель стала чаще отказываться отвечать вместо того, чтобы придумывать. Это ровно то поведение, которое нужно в медицине. Grok 4.5, напротив, показал рост галлюцинаций по сравнению с предшественником — знает больше, но и ошибается увереннее. Это опасная комбинация.

Открытые модели — отдельная история

Если коммерческие флагманы хотя бы иногда признают неопределённость, то открытые веса и специализированные медицинские модели ведут себя принципиально иначе. Они пытаются ответить почти на каждый случай. Звучит как достоинство — на деле это катастрофа. Потому что «отвечают почти всегда» вовсе не означает «отвечают правильно». Они ошибаются часто, и делают это со средней или высокой уверенностью.

Это парадокс специализации: модели, дообученные на медицинских данных, думают, что знают больше, чем знают на самом деле. Их уверенность растёт быстрее компетентности. Это не баг конкретной архитектуры — это системная проблема любого дообучения на узкой доменной выборке.

Что реально происходит с пользователями

Исследователи зафиксировали тревожный тренд: пациенты уже сейчас загружают свои рентгены и МРТ в чат-боты и доверяют полученным ответам. Это не гипотетический сценарий будущего. Модели при этом не говорят: «Я языковая модель, не врач, обратитесь к специалисту» — они дают конкретные интерпретации с видом уверенного рентгенолога.

Для российской аудитории: большинство протестированных моделей доступны через веб-интерфейсы или API, часть требует VPN. Загрузить снимок технически несложно — Claude, Gemini и другие принимают изображения. Но «технически несложно» не означает «безопасно». Именно здесь и кроется главная опасность: доступность создаёт иллюзию медицинской консультации там, где её нет.

Что нужно изменить

Радиология — это не просто распознавание паттернов на картинке. Это интерпретация в контексте: история болезни, симптомы, возраст, сопутствующие патологии. Модели видят пиксели. Хороший радиолог видит пациента.

RadLE 2.0 ставит правильный вопрос: прежде чем ИИ научится ставить диагнозы самостоятельно, он должен научиться понимать границы своей компетентности. Модель, которая честно говорит «я не уверен, нужен специалист» — ценнее модели с высокой точностью, но нулевым самоосознанием.

По моей оценке, следующий год в медицинском ИИ пройдёт под знаком именно этой метрики — calibration, или калибровки уверенности. Компании, которые научат свои модели молчать в нужный момент, получат реальное преимущество в клинических применениях. А те, кто гонится только за accuracy на бенчмарках — создают продукты, которые опасны именно тогда, когда кажутся наиболее полезными.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости