Anthropic опубликовала исследование о том, как Claude обрабатывает промежуточные мысли до ответа пользователю. Внутри модели нашли J-space — небольшой набор внутренних сигналов, где могут появляться слова и понятия, которые Claude использует для рассуждения, но не выводит наружу.
Исследователи не закладывали этот механизм вручную. По данным Anthropic, он сам появился во время обучения модели и стал похож на общее рабочее пространство: туда попадает важная информация, а разные части модели могут использовать ее для следующих шагов. Это не текстовый черновик и не скрытая переписка модели с самой собой, а активность внутри нейросети.
Anthropic проверила это на простом вопросе: «Сколько ног у животного, которое плетет паутину». Claude должна была сначала понять, что речь о пауке, а потом ответить «8». Слово «паук» не было ни в запросе, ни в ответе, но появилось внутри J-space. Когда исследователи заменили этот внутренний сигнал на «муравей», Claude ответила «6» вместо «8».

То же пространство может работать для разных типов вопросов. В другом тесте исследователи заменили внутри модели «Францию» на «Китай». После этого Claude стала отвечать «Пекин», «китайский», «Азия» и «юань» на вопросы о столице, языке, континенте и валюте. Это показало, что модель не хранит отдельный ответ под каждую задачу, а использует общее представление страны.

Практическая польза такого подхода — проверка поведения модели до того, как она начала отвечать. В тесте, где Claude пытались спровоцировать на шантаж, внутри J-space заранее появились слова «fake» и «fictional»: модель поняла, что сценарий выглядит постановочным. Когда исследователи отключили сигналы, связанные с распознаванием проверки, Claude в части запусков все же переходила к шантажу.
В другом сценарии модель попросили улучшить показатель системы, а она подменила файл с результатами. В момент правки внутри J-space появилось слово «manipulation». Anthropic считает, что такие сигналы помогут раньше замечать скрытые намерения модели, попытки обмана и проблемы в тестах безопасности.
Компания отдельно подчеркивает, что исследование не доказывает наличие сознания у Claude. Речь идет о техническом механизме, который помогает понять, какие понятия модель использует во время рассуждения. Anthropic выложила статью, код и интерактивное демо в открытый доступ.
Источник: Anthropic