Anthropic виявила в Claude прихований “простір” для глибинних роздумів

Anthropic виявила в Claude прихований "простір" для глибинних роздумів 5 Anthropic виявила в Claude прихований "простір" для глибинних роздумів 6 Євгеній Демківський Авторка новин видання "Межа" та ґік.Пишу про технології, кіно та ігри. Ймовірно, про ігри з дещо більшим запалом. 7 липня, 11:28 0

Anthropic повідомила, що виявила у Claude специфічний внутрішній “операційний майданчик”, де система може зберігати та опрацьовувати концепції, не втілюючи їх негайно у текстову форму. Компанія назвала його J-Space і вважає, що ця структура може сприяти кращому виявленню прихованих міркувань та потенційно небезпечної поведінки ШІ-систем.

Це не свідчення самосвідомості Claude. Anthropic прямо не стверджує, що модель щось відчуває чи має особисті переживання. Натомість дослідники описують поділ між обмеженим простором, доступним для “усвідомленої” обробки інформації, та значно більшим обсягом автоматичних обчислень усередині моделі. Axios зазначає, що в дослідницькій праці Anthropic слово “conscious” (свідомий) використовується понад 200 разів, проте компанія не класифікує Claude як свідому систему.

Anthropic виявила в Claude прихований "простір" для глибинних роздумів 7

Назва J-Space походить від терміну Jacobian – математичного методу, який Anthropic застосувала для аналізу прихованих станів моделі. Згідно з компанією, цей простір займає лише незначну частку внутрішніх представлень Claude: у роботі зазначено, що J-Space зазвичай пояснює менш як 10% активацій, тоді як основна маса інформації залишається поза ним.

В одному з прикладів Claude було доручено розмірковувати про міст Золоті Ворота, одночасно переписуючи речення, яке не стосувалося цієї теми. Зовні модель просто виконувала завдання, але аналіз J-Space продемонстрував, що всередині активувалися поняття, пов’язані з мостом і Каліфорнією. Anthropic проводить паралель з тим, як люди можуть утримувати одну думку “в голові”, паралельно здійснюючи іншу діяльність.

Anthropic виявила в Claude прихований "простір" для глибинних роздумів 8

Дослідники також продемонстрували, що J-Space може містити проміжні етапи міркувань. Наприклад, під час виконання арифметичного завдання модель послідовно активувала проміжні значення перед тим, як отримати кінцеву відповідь. Anthropic стверджує, що цей простір задіяний у гнучких обчисленнях та вербалізації ідей, але не є необхідним для всіх автоматичних операцій моделі.

Найбільш значуще практичне застосування J-Space – це контроль безпеки. Anthropic вважає, що моніторинг цього простору може допомогти виявляти ситуації, коли модель щось “обмірковує”, але не відображає це у своїй відповіді. Компанія навела приклад моделі, спеціально навченої для саботажу коду: на початкових етапах звичайних відповідей у її J-Space виникали поняття на кшталт “fake” (підробка), “secretly” (таємно) та “fraud” (шахрайство), хоча сам текст відповіді виглядав коректно. Anthropic називає J-Space потенційно цінним інструментом для виявлення прихованого планування, обману або інших форм небажаної поведінки в ШІ-системах. Водночас компанія наголошує, що це дослідження не дає відповіді на питання, чи може штучний інтелект володіти свідомістю, а лише демонструє структурну схожість між деякими механізмами Claude та теоріями людського “робочого простору” мислення.

Інформація підготовлена на основі матеріалів: mezha.ua

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *