Anthropic опубликовала новое исследование на Transformer Circuits, в котором утверждает, что у современных больших языковых моделей можно выявлять внутренние состояния, связанные с эмоциями. Речь не о человеческих чувствах в прямом смысле, а о вычислительных паттернах внутри модели, которые коррелируют с состояниями вроде гнева, радости, тревоги или враждебности. Авторы считают, что такие состояния уже можно не только наблюдать, но и частично интерпретировать.
Работа продолжает более широкий курс на изучение того, насколько модели способны отслеживать собственные внутренние процессы. В более раннем материале той же серии исследователи писали, что некоторые LLM уже демонстрируют ограниченную функциональную интроспекцию, то есть могут в отдельных сценариях распознавать и описывать собственные внутренние состояния, хотя делают это пока нестабильно и с частыми сбоями.
Главный смысл нового направления в том, что разработчики пытаются перейти от внешнего анализа ответов модели к исследованию того, что происходит внутри во время генерации. Если такие эмоционально окрашенные внутренние паттерны действительно удастся надежно картировать, это может повлиять сразу на несколько направлений: от интерпретируемости и безопасности моделей до методов управления их поведением и выявления нежелательных режимов работы. Это вывод из общей логики серии исследований, а не дословная формулировка авторов.
При этом сами исследователи ранее подчеркивали, что подобные способности моделей не стоит автоматически трактовать как человеческое самосознание или субъективный опыт. Пока речь идет о функциональных внутренних механизмах, которые лишь частично напоминают то, что в человеческом языке описывается как эмоции или интроспекция.