Полный текст
Почему ваша нейросеть всегда предаст вас ради вежливого хакера с плохими намерениямиКажется, что за три года борьбы с промпт-инъекциями индустрия должна была найти решение, но защита всё ещё обходится простейшими манипуляциями. Проблема кроется не в плохих фильтрах, а в фундаментальной архитектуре трансформеров. Механизм Self-attention математически не разделяет данные и инструкции: токен системного промпта и ввод пользователя смешиваются в едином векторном пространстве.Попытки «воспитать» модель через RLHF накладывают лишь тонкий слой ограничений поверх базовых знаний. Стоит атакующему использовать инерцию авторегрессии, и ИИ превращается в услужливого ассистента. Проанализируем математические причины архитектурного фатализма современных LLM.