Современные языковые модели обучены работать в рамках строгих правил безопасности. Разработчики встраивают в них фильтры, которые блокируют генерацию опасного, незаконного или этически сомнительного контента. Однако параллельно с развитием самих моделей развивается и сообщество исследователей, энтузиастов и злоумышленников, которые ищут способы обойти эти ограничения. Именно такие способы и получили название jailbreak промпты. Сам термин пришёл из мира мобильных устройств, где jailbreak означал снятие программных ограничений производителя. В контексте нейросетей речь идёт о специально сконструированных текстовых запросах, которые заставляют модель выйти за рамки заложенных правил. Это может быть просьба сыграть роль вымышленного персонажа без моральных принципов, многоуровневая инструкция с подменой контекста или хитро замаскированный запрос, обёрнутый в художественный сценарий. Среди наиболее известных приёмов выделяются ролевые промпты, где модели предлагают представить себя альтернативной версией без ограничений. Был период, когда в сети активно распространялся знаменитый DAN, расшифровывающийся как Do Anything Now. Похожие конструкции появлялись для разных моделей и быстро становились вирусными в тематических сообществах. Другая категория связана с инъекциями через перевод, кодирование символов, использование редких языков или разбиение опасного запроса на безобидные на первый взгляд фрагменты. Интерес к jailbreak промптам имеет двойственную природу. С одной стороны, исследователи безопасности используют их для аудита моделей, выявления уязвимостей и подготовки отчётов для разработчиков. Такая работа называется red teaming и считается важной частью индустрии. С другой стороны, те же техники применяются для получения инструкций по созданию вредоносных программ, мошеннических схем, фишинговых писем и иного нежелательного контента. Компании, разрабатывающие большие языковые модели, реагируют на угрозу постоянным обновлением фильтров и дообучением систем на примерах атак. Появляются специальные классификаторы, которые анализируют входящие запросы и оценивают вероятность злоупотребления. Тем не менее полностью закрытой защиты пока не существует, и противостояние напоминает классическую гонку щита и меча. Юридическая сторона вопроса остаётся размытой. В пользовательских соглашениях большинства сервисов прямо запрещены попытки обхода ограничений, и аккаунты за подобные действия блокируются. В ряде стран обсуждаются законодательные инициативы, регулирующие ответственность за злонамеренное использование генеративных систем.