ИИ ставит диагнозы по рентгену - и уверенно ошибается

Представьте: вы загружаете снимок КТ в чат-бот, получаете уверенный ответ - и идете домой с ложным чувством спокойствия. Или, что еще хуже, с неверным диагнозом. Это не антиутопическая фантастика - это то, что происходит прямо сейчас. Люди массово загружают рентгеновские снимки и МРТ в ChatGPT, Claude и Gemini, а модели отвечают с видом профессора медицины. Проблема в том, что уверенность и точность - совершенно разные вещи.
Что такое RadLE 2.0 и зачем он нужен
Исследовательская лаборатория CRASH Lab при университете Ашока в Индии выпустила вторую версию бенчмарка RadLE - "Radiology's Last Exam". Первая версия вышла в сентябре 2025 года и уже тогда показала пропасть между людьми и машинами: радиологи давали правильный ответ в 83% случаев, лучшая модель - лишь около 30%. За прошедшие месяцы точность ИИ резко выросла, но появилась новая, куда более коварная проблема.
RadLE 2.0 тестирует не просто точность, а связку точность + честность. Модель должна не только поставить диагноз, но и оценить свою уверенность по шкале от 0 до 4. При этом ей явно разрешено сказать "я не знаю". Система баллов работает как страховой полис от самонадеянности: правильный ответ с высокой уверенностью - полные очки, неправильный ответ с высокой уверенностью - такое же количество очков вычитается, "не знаю" - ноль, но без штрафа.
Это принципиально умная конструкция. Классические бенчмарки награждают за угадывание - и модели научились угадывать. В медицине уверенная ошибка несравнимо опаснее честного незнания.
Результаты: люди впереди, но разрыв сокращается
В тестировании участвовали 200 клинических случаев и 16 моделей. Панель врачей-радиологов набрала 988,7 балла из 2000 возможных. Лучший ИИ - 758 баллов. Разрыв значительный, но уже не пятикратный, как год назад.
По чистой точности диагнозов картина интереснее: Google Gemini 3 Pro показал наивысший процент правильных ответов и почти догнал человеческий уровень по этому показателю. Но как только в расчет входит уверенность - позиции меняются. Claude Fable 5 от Anthropic лидирует по комбинированному показателю надежности и безопасности. А Meta Muse Spark 1.1 оказался чемпионом по умению вовремя сказать "это не мое" и передать случай человеку.
Интересный момент с Muse Spark 1.1: Meta недавно специально работала над снижением галлюцинаций, и модель стала чаще отказываться отвечать вместо того, чтобы придумывать. Это ровно то поведение, которое нужно в медицине. Grok 4.5, напротив, показал рост галлюцинаций по сравнению с предшественником - знает больше, но и ошибается увереннее. Это опасная комбинация.
Открытые модели - отдельная история
Если коммерческие флагманы хотя бы иногда признают неопределенность, то открытые веса и специализированные медицинские модели ведут себя принципиально иначе. Они пытаются ответить почти на каждый случай. Звучит как достоинство - на деле это катастрофа. Потому что "отвечают почти всегда" вовсе не означает "отвечают правильно". Они ошибаются часто, и делают это со средней или высокой уверенностью.
Это парадокс специализации: модели, дообученные на медицинских данных, думают, что знают больше, чем знают на самом деле. Их уверенность растет быстрее компетентности. Это не баг конкретной архитектуры - это системная проблема любого дообучения на узкой доменной выборке.
Что реально происходит с пользователями
Исследователи зафиксировали тревожный тренд: пациенты уже сейчас загружают свои рентгены и МРТ в чат-боты и доверяют полученным ответам. Это не гипотетический сценарий будущего. Модели при этом не говорят: "Я языковая модель, не врач, обратитесь к специалисту" - они дают конкретные интерпретации с видом уверенного рентгенолога.
Для российской аудитории: большинство протестированных моделей доступны через веб-интерфейсы или API, часть требует VPN. Загрузить снимок технически несложно - Claude, Gemini и другие принимают изображения. Но "технически несложно" не означает "безопасно". Именно здесь и кроется главная опасность: доступность создает иллюзию медицинской консультации там, где ее нет.
Что нужно изменить
Радиология - это не просто распознавание паттернов на картинке. Это интерпретация в контексте: история болезни, симптомы, возраст, сопутствующие патологии. Модели видят пиксели. Хороший радиолог видит пациента.
RadLE 2.0 ставит правильный вопрос: прежде чем ИИ научится ставить диагнозы самостоятельно, он должен научиться понимать границы своей компетентности. Модель, которая честно говорит "я не уверен, нужен специалист" - ценнее модели с высокой точностью, но нулевым самоосознанием.
По моей оценке, следующий год в медицинском ИИ пройдет под знаком именно этой метрики - calibration, или калибровки уверенности. Компании, которые научат свои модели молчать в нужный момент, получат реальное преимущество в клинических применениях. А те, кто гонится только за accuracy на бенчмарках - создают продукты, которые опасны именно тогда, когда кажутся наиболее полезными.
Источники
Похожие новости
OpenAI DevDay 2026: Dots, GPT-6.1 Sol и 1,2 млрд пользователей в неделю
OpenAI провела DevDay 2026: автономные агенты Dots, модель GPT-6.1 Sol за пятую часть цены Astra и новый рекорд аудитории ChatGPT.
GPT-6.1 Sol: почти Astra за пятую часть цены
OpenAI представила GPT-6.1 Sol - модель, которая почти догоняет GPT-6 Astra по качеству, но стоит в пять раз дешевле. Кешированный ввод - $0.10 за миллион токенов.
OpenAI DevDay 2026: GPT-6 Astra, агент Dots и 20+ анонсов за один день
OpenAI провела крупнейший DevDay в своей истории - более 20 анонсов за один день: агент Dots, скоростной режим Ultrafast, новый тариф Pro 500 и плагины-приложения внутри ChatGPT.