Anthropic опубликовала необычное исследование — могут ли ИИ-модели замечать собственные внутренние состояния, как люди? У человека саморефлексия — это когда ты осознаешь свои чувства и мысли (например, “я злюсь” или “я думаю об этом”). Но делают ли что-то подобное современные языковые модели? В обычных диалогах отличить реальное самоосмысление у ИИ невозможно. Модели часто вставляют в ответы “я думаю” или “мне кажется” только потому, что они обучены на человеческих текстах. Это называется конфабуляцией — внешне похоже на то, когда внутри ничего не происходит. Anthropic решила копнуть глубже и узнать - могут ли модели реально осознавать свои состояния? Для этого придумали интересный эксперимент — в модель внедряли специальные векторы в скрытые активации модели, которые соответствуют определенным мыслям или концепциям (например, крик — если текст написан КАПСОМ). Исследование проводилось на модели Opus 4 и 4.1 После такого вмешательства исследователи спрашивали у модели, замечает ли она что-то необычное. Оказалось, что в 20% случаев Opus 4/4.1 действительно чувствовала навязанную мысль и довольно корректно описывала суть измененного состояния. Причём, модель могла отличить, это её собственное состояние или навязанное извне — и делала это ещё до того, как концепция проявлялась в сгенерированном тексте. Кроме того, авторы показали: модель способна разделять свои внутренние “мысли” и текст, который она пишет — как человек различает “что думаю” и “что говорю”. Вдобавок, если попросить пофантазировать о какой-то теме (“думай о хлебе, а расскажи про львов”), соответствующие паттерны действительно фиксируются в отдельных слоях скрытых состояний. У современных ИИ есть зачатки саморефлексии — хотя это проявляется нестабильно и не всегда предсказуемо. Но уже сам факт того, что модель способна хоть как-то анализировать себя, может со временем привести к более прозрачным и управляемым алгоритмам.