Anthropic заявила, що виявила у Claude окремий внутрішній “робочий простір”, де модель може утримувати й обробляти ідеї, не перетворюючи їх одразу на текст. Компанія назвала його J-Space і вважає, що ця структура може допомогти краще відстежувати приховані міркування та потенційно небезпечну поведінку ШІ-моделей.
Йдеться не про доказ свідомості Claude. Anthropic прямо не стверджує, що модель щось відчуває або має власний досвід. Натомість дослідники описують поділ між невеликим простором, доступним для “усвідомленого” опрацювання інформації, і значно більшим обсягом автоматичних обчислень усередині моделі. Axios зазначає, що в дослідницькій роботі Anthropic слово “conscious” використовується понад 200 разів, але компанія не називає Claude свідомою системою.

Назва J-Space походить від Jacobian – математичного підходу, який Anthropic використала для аналізу прихованих станів моделі. За словами компанії, цей простір займає лише невелику частину внутрішніх представлень Claude: у роботі зазначено, що J-Space зазвичай пояснює менш як 10% активацій, тоді як основна частина інформації залишається поза ним.
В одному з прикладів Claude попросили думати про міст Golden Gate Bridge, поки вона копіювала не пов’язане з цим речення. На поверхні модель просто виконувала завдання, але аналіз J-Space показав, що всередині активувалися поняття, пов’язані з мостом і Каліфорнією. Anthropic порівнює це з тим, як люди можуть тримати одну думку “в голові”, паралельно виконуючи іншу дію.

Дослідники також показали, що J-Space може містити проміжні кроки міркування. Наприклад, під час арифметичного завдання модель послідовно активувала проміжні значення, перш ніж дійти до фінальної відповіді. Anthropic стверджує, що цей простір бере участь у гнучких обчисленнях і вербалізації ідей, але не потрібен для всіх автоматичних операцій моделі.
Найважливіше практичне застосування J-Space – моніторинг безпеки. Anthropic вважає, що спостереження за цим простором може допомогти виявляти ситуації, коли модель щось “обмірковує”, але не показує це у відповіді. У компанії навели приклад моделі, спеціально навченої саботувати код: на початку звичайних відповідей у її J-Space з’являлися поняття на кшталт “fake”, “secretly” і “fraud”, хоча сам текст відповіді виглядав нормально. Anthropic називає J-Space потенційно корисним інструментом для виявлення прихованого планування, обману або інших форм небажаної поведінки в ШІ-системах. Водночас компанія підкреслює, що це дослідження не відповідає на питання, чи може штучний інтелект бути свідомим, а лише показує структурну схожість між деякими механізмами Claude та теоріями людського “робочого простору” мислення.
Читайте також: Anthropic представила нову базову модель Claude Sonnet 5 із покращеними агентними можливостями



