Пользователь случайно получил доступ к внутреннему документу, который формирует поведение Claude

Языковая модель Claude 4.5 Opus от Anthropic выдала пользователю внутренний документ объёмом 11 000 слов, который использовался для обучения ИИ и формирования его "личности". Ричард Вайс запросил у чат-бота системное сообщение – набор инструкций, определяющих взаимодействие модели с пользователями. В ответ Claude перечислил несколько документов, включая файл под названием "soul_overview". Когда Вайс попросил воспроизвести конкретно этот документ, модель выдала полное руководство по своему поведению.

Амада Аскелл, философ из технической команды Anthropic, подтвердила в соцсети X, что выданный текст основан на реальном документе из периода обучения модели. Она отметила, что работает над этим материалом уже какое-то время, но процесс доработки продолжается. Компания планирует опубликовать полную версию документа и дополнительные детали в ближайшее время. Аскелл добавила, что внутри команды файл получил название "soul doc", которое модель явно переняла, но это не отражает финальное название.

Документ содержит многочисленные отсылки к безопасности и попытки установить ограничения, предотвращающие генерацию потенциально опасного или вредоносного контента. В тексте указано, что "быть по-настоящему полезным для людей – одна из важнейших задач Claude как для Anthropic, так и для мира". Модели запрещено совершать действия, которые пересекают этические границы компании.

Вайс, который регулярно исследует механизмы обучения больших языковых моделей, отметил в посте на Less Wrong, что ИИ нередко галлюцинируют документы при запросе системных сообщений. Однако "soul overview" показался ему легитимным – при десяти попытках воспроизведения Claude каждый раз выдавал идентичный текст. Пользователи на Reddit также смогли получить фрагменты того же документа с совпадающим содержанием, что указывает на доступ модели к реальным обучающим материалам.

Аскелл уточнила, что извлечённые из модели данные не всегда полностью точны, но большинство довольно верно передают исходный документ. Gizmodo обратился в Anthropic за комментарием, но на момент публикации ответа не последовало.

Случайное раскрытие документа даёт редкую возможность заглянуть в "чёрный ящик" обучения ИИ. Процессы создания языковых моделей редко становятся публичными, так что доступ к руководству по формированию поведения Claude представляет интерес для исследователей и разработчиков, даже если сами инструкции выглядят достаточно прямолинейно.

Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.