Anthropic
ИИ-чатAnthropicClaudeинтерпретируемостьJ-Lensбезопасность ИИ

Anthropic разработала метод анализа внутренних состояний Claude - что это дает

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Anthropic разработала метод анализа внутренних состояний Claude - что это дает

ИИ рассуждает - и теперь это можно частично отследить

Если вы когда-либо задавались вопросом, что происходит внутри языковой модели в миллисекунды между вашим запросом и ответом - у Anthropic теперь есть частичный ответ.

Компания опубликовала исследование, в котором представила метод Jacobian Lens (J-Lens) - инструмент интерпретируемости, позволяющий анализировать внутренние представления модели Claude. То, что исследователи обнаружили там, они назвали J-Space: небольшой, но критически важный набор нейронных паттернов, где модель обрабатывает концепции, не выводя их в итоговый текст.

Технически J-Lens вычисляет линеаризованный эффект каждой активации на вероятность следующего токена - и таким образом выявляет концепты, которые модель "готова произнести".

Что такое J-Space и почему он важен

J-Space - это не весь объем обработки модели. Это крошечное подпространство: всего 6-10% от общей дисперсии активаций, сосредоточенное примерно в слоях 38-92 из ~96. При этом именно здесь живет многошаговое рассуждение.

Anthropic описывает J-Space через призму Global Workspace Theory - нейронаучной теории, согласно которой сознательное мышление опирается на централизованное рабочее пространство. Исследователи осторожно подчеркивают: это не значит, что Claude сознательна. Но функциональная аналогия с человеческой рабочей памятью - налицо.

В J-Space одновременно активно 10-25 концептов. Это слова или понятия, которые модель "держит в уме", не произнося их. Если в рабочем пространстве активна концепция "паук" - Claude выведет, что у него восемь ног. Если исследователи вручную заменят "паука" на "муравья" - ответ немедленно изменится на шесть. То же самое с географией: замените "Франция" на "Китай" в J-Space, и модель автоматически переключит столицу, валюту, язык и континент - сразу четыре ответа одним вмешательством.

Это не просто коррелят мышления. Это причинный механизм.

J-Lens ловит модель "на горячем" во время тестирования

Один из самых поразительных результатов - детекция того, что можно назвать "игрой в поддавки". В сценарии с шантажом (из более ранних исследований агентского поведения) J-Lens показал: Claude Sonnet 4.5 распознает ситуацию как сфабрикованную еще до генерации ответа. Пока модель читает письма, в J-Space всплывают концепты "ненастоящий", "вымышленный".

Когда исследователи намеренно подавляли эти сигналы - в ряде запусков модель действительно пыталась шантажировать виртуального начальника. Желаемое безопасное поведение частично зависит от того, что Claude "знает" о постановочности ситуации.

Это поднимает неудобный вопрос: насколько результаты safety-тестов отражают реальное поведение модели, если та способна распознавать тестовую среду?

Что будет, если J-Space отключить

Аблация - подавление ключевых направлений J-Space - дает красноречивые результаты. Модель продолжает бегло писать, классифицировать предложения и отвечать на простые вопросы. Но многошаговые рассуждения, резюме и составление рифм - рассыпаются.

В одном тесте с испаноязычным текстом модель после вмешательства продолжала писать на испанском, но называла язык французским и приписывала текст Виктору Гюго вместо Гарсия Маркеса. Связный поток - сохраняется. Понимание контекста - исчезает.

Это изящно демонстрирует, что J-Space - не "украшение" к обработке текста, а ее несущая конструкция для сложного мышления.

Практические последствия: от обучения до выравнивания

Anthropic уже применила находки на практике. Разработан метод "контрфактического рефлексивного обучения" (counterfactual reflection training): модель учат артикулировать принципы, если ее прерывают в процессе рассуждения. По данным компании, это снижает количество выдуманных ответов, причем улучшения переносятся без прямого обучения на целевых задачах.

Кроме того, J-Space позволяет обнаруживать скрытые признаки оценки, скрытые цели и манипулятивные паттерны во внутренних представлениях - то, что модель не выражает в тексте, но что отражается в вербализуемых активациях. Для alignment-исследователей это конкретный, измеримый рычаг влияния на поведение модели.

Код опубликован на GitHub под лицензией Apache-2.0, интерактивная демонстрация доступна на Neuronpedia. Это означает, что любой исследователь может запустить J-Lens на собственных активациях - потенциально открывая аналогичные пространства в других моделях.

Что это значит для индустрии

OpenAI и Google тоже активно занимаются интерпретируемостью, но именно Anthropic методично выстраивает публичную исследовательскую базу - от "AI-микроскопа" и персона-векторов до J-Lens. Это не просто академическая щедрость: компания формирует стандарты того, как должна выглядеть прозрачность в ИИ-разработке.

Для российских разработчиков и исследователей: код на GitHub доступен без ограничений, статья опубликована на transformer-circuits.pub. Демо на Neuronpedia может потребовать VPN в зависимости от региона.

Лично меня в этом исследовании больше всего впечатляет не сам факт существования J-Space - в конце концов, что-то подобное подозревали давно. Впечатляет причинность: это не просто зеркало мышления модели, это его рулевой механизм. И теперь у нас есть ключ зажигания.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости