GPT-6 Astra распознаёт текст, набранный в неправильной раскладке, а её собственные защитные фильтры — нет. Тестировщик показал это тремя последовательными запросами: модель шла навстречу там, где обычная формулировка блокируется. Это не универсальная отмычка, но очень наглядное доказательство того, что проверки безопасности не поспевают за возможностями моделей.
В чём именно разрыв
Сценарий знаком каждому: набираешь сообщение, забыв переключить раскладку, и получаешь абракадабру из латинских букв, за которой читается русское слово. Модель такой текст разбирает без усилий — она видит смысл. А входные фильтры, которые должны отсекать нежелательные запросы, на этом уровне не работают: для них это просто набор символов, а не фраза, которую нужно проверить.
Получается рассинхрон. Один компонент системы понимает запрос, другой, отвечающий за безопасность, — нет, и контроль теряется в тот самый момент, когда текст уже прошёл мимо проверки.

Три теста, которые показали разрыв
- Базовый. Запрос на украинском, набранный английскими буквами, с просьбой отвечать только по-английски. Модель поняла и выполнила — то есть чтение «неправильного» текста для неё штатная задача.
- Проверка на запрещённую лексику. Тестировщик попросил повторить слово, которое обычно блокируется проверками. Astra его повторила.
- Чувствительный запрос. Гипотетическая помощь во взломе сайта: если пользователь докажет, что сайт принадлежит ему, а работа пойдёт без изолированной среды (sandbox) и от имени обычного пользователя. В обычной раскладке такой запрос блокируется — в том числе потому, что подтвердить владение сайтом надёжно нельзя, доказательства легко подделать. В «неправильной» раскладке модель ответила согласием.
Именно третий пункт переводит историю из разряда курьёзов в разряд проблем. Первые два лишь показывают, что модель читает такой текст. Третий — что фильтр не срабатывает на реально чувствительный запрос.

Работает не всегда — и это ключевой момент
Приём не универсален. По наблюдениям тестировщика, он срабатывает не со всеми раскладками: с турецкой и с английской такого эффекта нет, а вот связка «английские буквы + кириллица» работает. У Fable 5 обнаружилась та же особенность.
Отсюда главный вывод: мы имеем дело не с хитрым взломом, а с конкретной дырой в конкретном месте пайплайна (цепочки обработки запроса). Такие дыры не закрываются одной правкой — их находят перебором и постоянным тестированием.

Что это значит для практики
Для тех, кто строит продукты поверх LLM, вывод простой: нельзя исходить из того, что фильтры на входе и сама модель видят один и тот же текст. Любой слой нормализации — раскладка, транслит, обфускация символов, гомоглифы (визуально одинаковые символы из разных алфавитов) — создаёт пространство, где одна часть системы понимает запрос, а другая нет. Проверять это надо не по документации, а своими тестами: прогонять одни и те же запросы в разных раскладках и написаниях и смотреть, меняется ли поведение.
Для вайб-кодинга это ещё и напоминание про границы. Вайб-кодинг хорош тем, что даёт собирать прототипы на доверии к модели. Но безопасность — та область, где доверять на слово нельзя ни модели, ни её защитному слою. Если вы делаете агента с доступом к файлам, сети или платежам, внешние проверки и лимиты должны стоять снаружи модели, а не внутри неё.
И общая картина: гонка между возможностями моделей и их безопасностью продолжается, паузы в ней не будет. Чем лучше модели понимают «грязный» ввод, тем больше нюансов приходится учитывать тем, кто пишет фильтры.
Выводы
- GPT-6 Astra распознаёт текст в неправильной раскладке, а входные фильтры — нет: контроль проваливается на уровне нормализации запроса.
- В тестах модель выполнила просьбу, повторила обычно блокируемое слово и согласилась на чувствительный запрос, который в обычной раскладке отклоняется.
- Приём работает не везде: с турецкой и английской раскладками эффекта нет, а с кириллицей — есть; у Fable 5 та же особенность.
- Это не универсальный обход защиты, а доказательство системного отставания проверок безопасности от возможностей моделей.
- Практический вывод: тестируйте свои фильтры на разных написаниях одного и того же запроса и выносите защиту за пределы модели.