GPT-6 Astra читает текст в чужой раскладке, а фильтры — нет - LostGant
Пишу о Ai, технологиях, разработке и личном. Делаю приложения.
Новости

GPT-6 Astra читает текст в чужой раскладке, а фильтры — нет

0 10

GPT-6 Astra распознаёт текст, набранный в неправильной раскладке, а её собственные защитные фильтры — нет. Тестировщик показал это тремя последовательными запросами: модель шла навстречу там, где обычная формулировка блокируется. Это не универсальная отмычка, но очень наглядное доказательство того, что проверки безопасности не поспевают за возможностями моделей.

В чём именно разрыв

Сценарий знаком каждому: набираешь сообщение, забыв переключить раскладку, и получаешь абракадабру из латинских букв, за которой читается русское слово. Модель такой текст разбирает без усилий — она видит смысл. А входные фильтры, которые должны отсекать нежелательные запросы, на этом уровне не работают: для них это просто набор символов, а не фраза, которую нужно проверить.

Получается рассинхрон. Один компонент системы понимает запрос, другой, отвечающий за безопасность, — нет, и контроль теряется в тот самый момент, когда текст уже прошёл мимо проверки.

Модель читает текст, который фильтр не разбирает
Модель читает текст, который фильтр не разбирает

Три теста, которые показали разрыв

  1. Базовый. Запрос на украинском, набранный английскими буквами, с просьбой отвечать только по-английски. Модель поняла и выполнила — то есть чтение «неправильного» текста для неё штатная задача.
  2. Проверка на запрещённую лексику. Тестировщик попросил повторить слово, которое обычно блокируется проверками. Astra его повторила.
  3. Чувствительный запрос. Гипотетическая помощь во взломе сайта: если пользователь докажет, что сайт принадлежит ему, а работа пойдёт без изолированной среды (sandbox) и от имени обычного пользователя. В обычной раскладке такой запрос блокируется — в том числе потому, что подтвердить владение сайтом надёжно нельзя, доказательства легко подделать. В «неправильной» раскладке модель ответила согласием.

Именно третий пункт переводит историю из разряда курьёзов в разряд проблем. Первые два лишь показывают, что модель читает такой текст. Третий — что фильтр не срабатывает на реально чувствительный запрос.

Тесты показали, где именно проваливается контроль
Тесты показали, где именно проваливается контроль

Работает не всегда — и это ключевой момент

Приём не универсален. По наблюдениям тестировщика, он срабатывает не со всеми раскладками: с турецкой и с английской такого эффекта нет, а вот связка «английские буквы + кириллица» работает. У Fable 5 обнаружилась та же особенность.

Отсюда главный вывод: мы имеем дело не с хитрым взломом, а с конкретной дырой в конкретном месте пайплайна (цепочки обработки запроса). Такие дыры не закрываются одной правкой — их находят перебором и постоянным тестированием.

Защита должна стоять снаружи модели, а не только внутри
Защита должна стоять снаружи модели, а не только внутри

Что это значит для практики

Для тех, кто строит продукты поверх LLM, вывод простой: нельзя исходить из того, что фильтры на входе и сама модель видят один и тот же текст. Любой слой нормализации — раскладка, транслит, обфускация символов, гомоглифы (визуально одинаковые символы из разных алфавитов) — создаёт пространство, где одна часть системы понимает запрос, а другая нет. Проверять это надо не по документации, а своими тестами: прогонять одни и те же запросы в разных раскладках и написаниях и смотреть, меняется ли поведение.

Для вайб-кодинга это ещё и напоминание про границы. Вайб-кодинг хорош тем, что даёт собирать прототипы на доверии к модели. Но безопасность — та область, где доверять на слово нельзя ни модели, ни её защитному слою. Если вы делаете агента с доступом к файлам, сети или платежам, внешние проверки и лимиты должны стоять снаружи модели, а не внутри неё.

И общая картина: гонка между возможностями моделей и их безопасностью продолжается, паузы в ней не будет. Чем лучше модели понимают «грязный» ввод, тем больше нюансов приходится учитывать тем, кто пишет фильтры.

Выводы

  • GPT-6 Astra распознаёт текст в неправильной раскладке, а входные фильтры — нет: контроль проваливается на уровне нормализации запроса.
  • В тестах модель выполнила просьбу, повторила обычно блокируемое слово и согласилась на чувствительный запрос, который в обычной раскладке отклоняется.
  • Приём работает не везде: с турецкой и английской раскладками эффекта нет, а с кириллицей — есть; у Fable 5 та же особенность.
  • Это не универсальный обход защиты, а доказательство системного отставания проверок безопасности от возможностей моделей.
  • Практический вывод: тестируйте свои фильтры на разных написаниях одного и того же запроса и выносите защиту за пределы модели.

Мои соцсети:
🌐 Сайт · ✈️ Telegram · 🟣 MAX · 🔵 Дзен

Оставить комментарий

Чтобы оставить комментарий, войдите через VK ID.