C
ИИ-чатRadLE 2.0медицинский ИИрадиологияGeminiClaude

ИИ ставит диагнозы по рентгену - и уверенно ошибается

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
ИИ ставит диагнозы по рентгену - и уверенно ошибается

Представьте: вы загружаете снимок КТ в чат-бот, получаете уверенный ответ - и идете домой с ложным чувством спокойствия. Или, что еще хуже, с неверным диагнозом. Это не антиутопическая фантастика - это то, что происходит прямо сейчас. Люди массово загружают рентгеновские снимки и МРТ в ChatGPT, Claude и Gemini, а модели отвечают с видом профессора медицины. Проблема в том, что уверенность и точность - совершенно разные вещи.

Что такое RadLE 2.0 и зачем он нужен

Исследовательская лаборатория CRASH Lab при университете Ашока в Индии выпустила вторую версию бенчмарка RadLE - "Radiology's Last Exam". Первая версия вышла в сентябре 2025 года и уже тогда показала пропасть между людьми и машинами: радиологи давали правильный ответ в 83% случаев, лучшая модель - лишь около 30%. За прошедшие месяцы точность ИИ резко выросла, но появилась новая, куда более коварная проблема.

RadLE 2.0 тестирует не просто точность, а связку точность + честность. Модель должна не только поставить диагноз, но и оценить свою уверенность по шкале от 0 до 4. При этом ей явно разрешено сказать "я не знаю". Система баллов работает как страховой полис от самонадеянности: правильный ответ с высокой уверенностью - полные очки, неправильный ответ с высокой уверенностью - такое же количество очков вычитается, "не знаю" - ноль, но без штрафа.

Это принципиально умная конструкция. Классические бенчмарки награждают за угадывание - и модели научились угадывать. В медицине уверенная ошибка несравнимо опаснее честного незнания.

Результаты: люди впереди, но разрыв сокращается

В тестировании участвовали 200 клинических случаев и 16 моделей. Панель врачей-радиологов набрала 988,7 балла из 2000 возможных. Лучший ИИ - 758 баллов. Разрыв значительный, но уже не пятикратный, как год назад.

По чистой точности диагнозов картина интереснее: Google Gemini 3 Pro показал наивысший процент правильных ответов и почти догнал человеческий уровень по этому показателю. Но как только в расчет входит уверенность - позиции меняются. Claude Fable 5 от Anthropic лидирует по комбинированному показателю надежности и безопасности. А Meta Muse Spark 1.1 оказался чемпионом по умению вовремя сказать "это не мое" и передать случай человеку.

Интересный момент с Muse Spark 1.1: Meta недавно специально работала над снижением галлюцинаций, и модель стала чаще отказываться отвечать вместо того, чтобы придумывать. Это ровно то поведение, которое нужно в медицине. Grok 4.5, напротив, показал рост галлюцинаций по сравнению с предшественником - знает больше, но и ошибается увереннее. Это опасная комбинация.

Открытые модели - отдельная история

Если коммерческие флагманы хотя бы иногда признают неопределенность, то открытые веса и специализированные медицинские модели ведут себя принципиально иначе. Они пытаются ответить почти на каждый случай. Звучит как достоинство - на деле это катастрофа. Потому что "отвечают почти всегда" вовсе не означает "отвечают правильно". Они ошибаются часто, и делают это со средней или высокой уверенностью.

Это парадокс специализации: модели, дообученные на медицинских данных, думают, что знают больше, чем знают на самом деле. Их уверенность растет быстрее компетентности. Это не баг конкретной архитектуры - это системная проблема любого дообучения на узкой доменной выборке.

Что реально происходит с пользователями

Исследователи зафиксировали тревожный тренд: пациенты уже сейчас загружают свои рентгены и МРТ в чат-боты и доверяют полученным ответам. Это не гипотетический сценарий будущего. Модели при этом не говорят: "Я языковая модель, не врач, обратитесь к специалисту" - они дают конкретные интерпретации с видом уверенного рентгенолога.

Для российской аудитории: большинство протестированных моделей доступны через веб-интерфейсы или API, часть требует VPN. Загрузить снимок технически несложно - Claude, Gemini и другие принимают изображения. Но "технически несложно" не означает "безопасно". Именно здесь и кроется главная опасность: доступность создает иллюзию медицинской консультации там, где ее нет.

Что нужно изменить

Радиология - это не просто распознавание паттернов на картинке. Это интерпретация в контексте: история болезни, симптомы, возраст, сопутствующие патологии. Модели видят пиксели. Хороший радиолог видит пациента.

RadLE 2.0 ставит правильный вопрос: прежде чем ИИ научится ставить диагнозы самостоятельно, он должен научиться понимать границы своей компетентности. Модель, которая честно говорит "я не уверен, нужен специалист" - ценнее модели с высокой точностью, но нулевым самоосознанием.

По моей оценке, следующий год в медицинском ИИ пройдет под знаком именно этой метрики - calibration, или калибровки уверенности. Компании, которые научат свои модели молчать в нужный момент, получат реальное преимущество в клинических применениях. А те, кто гонится только за accuracy на бенчмарках - создают продукты, которые опасны именно тогда, когда кажутся наиболее полезными.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости