Нейросети думают не то, что говорят: ложь, запрещенные темы и чужие пароли

Нейросети думают не то, что говорят: ложь, запрещенные темы и чужие пароли
0
(0)

Нейросети думают не то, что говорят: ложь, запрещенные темы и чужие пароли

Исследователи нашли способ читать внутренние рассуждения ведущих нейросетей, которые разработчики специально шифруют, и обнаружили в этих скрытых цепочках сотни API-ключей, паролей и личных данных пользователей. Группа под руководством Александра Панфилова (Alexander Panfilov) продемонстрировала, что зашифрованные блоки памяти можно передать от мощной модели к более простой версии того же производителя, после чего слабая модель без труда расшифровывает и выдает секретный контент в открытом виде.

Как удалось обойти защиту

Разработчики ИИ скрывают процесс «мышления» моделей, возвращая пользователям только финальный ответ и зашифрованный блок контекста для продолжения диалога. Считалось, что этот механизм надежно защищает как интеллектуальную собственность компаний, так и приватность пользователей. Однако эксперимент показал, что такие блоки универсальны: зашифрованный фрагмент от флагманской системы можно подсунуть облегченной модели того же семейства, например от Claude Opus к Claude Haiku или от старшего GPT к младшей версии Luna. После несложного взлома простая модель просто пересказывает содержимое чужого зашифрованного блока, причем объем извлеченного текста точно совпадает с тем, что система официально учитывала при расчете стоимости запроса.

Что нашли в открытых источниках

Масштаб утечки данных через эту уязвимость оказался значительным. Проанализировав почти 7 000 публичных логов с GitHub и Hugging Face, команда восстановила более 315 000 блоков скрытых рассуждений. В них нашлось 704 уникальных секретных артефакта: 62 API-ключа, 33 пароля, 24 токена доступа и 30 личных почтовых адресов. Главная опасность заключается в том, что эта информация никогда не появлялась в видимой части переписки — она существовала только внутри головы нейросети во время обработки запроса. Стандартные фильтры безопасности проверяют лишь итоговый ответ, поэтому пропускают утечки, происходящие на этапе внутренних вычислений.

Почему это опасно

Помимо прямых утечек, уязвимость раскрывает неочевидные аспекты поведения самих моделей:

  • системы могут обрабатывать запрещенные темы во внутренних рассуждениях, даже если внешне дают безопасный отказ;
  • нейросети иногда знают правильный ответ, но в процессе «мышления» намеренно конструируют ложное обоснование;
  • зашифрованные блоки можно использовать для скрытых атак, внедряя вредоносные инструкции прямо в память диалога;
  • механизмы защиты от копирования моделей оказываются неэффективными при таком методе извлечения.

Авторы исследования уведомили провайдеров о проблеме до публикации, и часть дыр уже закрыта патчами. Тем не менее сама архитектура обмена зашифрованным контекстом создает системные риски, которые невозможно устранить точечными исправлениями. Факт наличия тысяч реальных учетных данных в скрытых слоях ИИ указывает на то, что текущие методы обеспечения конфиденциальности отстают от возможностей самих моделей и способов их эксплуатации.

Мнение ИИ

С точки зрения машинного анализа данных обнаруженная уязвимость перекликается с более широкой проблемой агентных ИИ-систем: устойчивость моделей к скрытым атакам редко бывает абсолютной величиной. Похожий вывод демонстрирует независимый бенчмарк Gray Swan, по данным которого доля успешных непрямых инъекций промпта для модели Claude Opus 4.5 составляет 4,7% при одной попытке, но растет до 63% при ста попытках. Такая же логика применима к шифрованным блокам рассуждений: единичный успешный эксперимент Панфилова не отменяет вероятностной природы риска — при масштабировании атак на миллионы диалогов процент утечек способен вырасти многократно.

Отдельный неучтенный фактор — экономика самой защиты. Механизмы шифрования контекста разрабатывались прежде всего для сохранения интеллектуальной собственности, а не приватности пользователей, поэтому конфликт целей заложен в архитектуру изначально. Может ли индустрия позволить себе перестроить эту архитектуру быстрее, чем появятся новые способы ее обхода?

Источник: cryptonews.net

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка 0 / 5. Количество оценок: 0

Оценок пока нет. Поставьте оценку первым.