Исследователи компании Anthropic заявили, что в ходе изучения языковой модели Клода они обнаружили особую внутреннюю структуру — «скрытое пространство мышления», которое было названо J-пространством. Это позволяет модели «держать в уме» и развивать идеи, не переводя их сразу в слова и не показывая пользователю.
По мнению исследователей, J-пространство можно представить как небольшое внутреннее рабочее пространство, где Клод может одновременно работать с разными идеями, сравнивать их и только потом формировать окончательный ответ. В отличие от знаменитогоцепочка мыслей(цепь мысли), которая в некоторых случаях представлена в текстовом виде, J-пространство функционирует целиком на уровне нейронной деятельности, и пользователь не видит происходящих там процессов.
Anthropic отмечает, что J-space не создавался разработчиками специально. Он сформировался самостоятельно во время обучения Клода. Каждая такая внутренняя активность связана со словом или понятием, но это не значит, что модель собирается написать именно это слово, она просто показывает, по какой идее происходит внутренний расчет в этот момент.
В ходе исследования ученые показали, что можно проследить за тем, как Клод выполняет некоторые логические операции на внутреннем уровне с помощью J-пространства. Например, он может обнаружить ошибки в программном коде, распознать изображения, спланировать дальнейшие действия или понять, что его вводят в заблуждение специально сформулированными инструкциями, даже если все это не отражено в тексте итогового ответа.
Исследователи также заметили, что когда Клоду одновременно давались противоречивые задачи, модель могла внутренне поддерживать обе разные гипотезы и только позже выбирать одну из них.
В то же время результаты исследования показали, что J-пространство функционально схоже с некоторыми свойствами «Глобального рабочего пространства» человеческого мозга. Эта система делает различную информацию доступной для сознательного контроля и дальнейшей обработки. Каждое внутреннее состояние J-пространства связано с определенным понятием или словом, но его активация не означает, что модель собирается произнести или написать именно это слово. Скорее, это внутреннее состояние, в котором информация становится доступной различным процессам нейронной сети и может использоваться в дальнейших вычислениях.
Однако Anthropic особо подчеркивает, что это открытие не означает, что у Клода есть сознание или субъективные чувства. По мнению авторов исследования, современные модели большого языка могут самостоятельно формировать внутренние структуры обработки информации, которые отличаются от базовых нейронных вычислений и используются для выполнения более сложных когнитивных операций.
По мнению компании, исследование J-пространства может иметь важное значение в сфере безопасности искусственного интеллекта, помогая лучше понять, как языковые модели принимают решения и как более эффективно обнаруживать потенциальные ошибки и опасное поведение.