Кратко
- Физики из Университета Джорджа Вашингтона Нил Джонсон и Фрэнк Инцзе Хо опубликовали формулу, которая оценивает, сколько хороших токенов производит модель ИИ до первого плохого.
- В препринте формула правильно предсказала, сразу ли модель сорвётся или после задержки, в 15 из 16 однозначных случаев.
- Авторы предлагают параллельный монитор, который сигнализирует, когда модели опускаются ниже порога безопасности.
Физики из Университета Джорджа Вашингтона опубликовали формулу, которая оценивает, сколько хороших ответов даст чат-бот с ИИ, прежде чем он сорвётся в плохой, и ранние тесты показывают, что она работает.
Исследование, проведённое Нилом Джонсоном и Фрэнком Инцзе Хо, появилось в журнале Patterns и основано на препринте, версии, опубликованной публично до формального рецензирования, впервые выпущенной в феврале.

Чат-боты могут отвечать разумно на протяжении долгого времени, а затем сворачивать в сторону чего-то вредного, например, плохих советов о самоповреждении или экстремистских высказываний, и не было простого способа предсказать, когда произойдёт этот поворот. Авторы утверждают, что существующие инструменты безопасности часто зависят от облачного подключения, которого лишены офлайн-модели.
Джонсон и Хуо прослеживают проблему до головы внимания — части модели ИИ, которая решает, какие более ранние слова в разговоре имеют наибольшее значение при выборе следующего. По мере роста чата накопленный контекст притягивает это внимание к одному кластеру возможных ответов или другому, пока оно не опрокинется.
Это распространённый паттерн, используемый многими взломщиками джейлбрейков, и одна из причин, по которой многие компании уделяют внимание системным подсказкам (фрагментам текста, которые чат-бот ИИ читает перед любым запросом). Однако никто не может точно указать, сколько усилий требуется, чтобы эффективно ослабить модель.
Их формула оценивает точку перелома, называемую n, как количество хороших токенов — фрагментов слов, которые модель выдаёт по одному за раз, — вышедших до первого плохого. Если разговор уже склоняется к плохой стороне, модель опрокидывается сразу, с n, равным нулю. Если он склоняется к хорошей, модель выдаёт серию нормальных ответов, а затем переворачивается.

В препринте формула выбрала правильный случай — немедленный или отложенный — в 15 из 16 однозначных тестов, то есть в 94%. Исследователи провели эти тесты на шести моделях с открытыми весами, то есть на системах ИИ, файлы которых находятся в открытом доступе, так что любой может их скачать и запустить, от OpenAI, EleutherAI и Meta.
Все шесть содержали от 124 миллионов до 410 миллионов параметров — настраиваемых чисел внутри модели, которые служат приблизительной мерой её размера. Как сообщается, в опубликованной статье тест расширен до семи моделей с числом параметров до 12 миллиардов, что по нынешним меркам всё ещё немного.
Цель — ИИ на устройстве, тот вид, который работает полностью на телефоне или ноутбуке без подключения к интернету, включая чат-ботов-компаньонов, с которыми люди разговаривают как с другом. Экспериментальное приложение Google AI Edge Gallery, которое тестировал Decrypt в прошлом году, уже позволяет Android-телефону запускать модели офлайн, и ничего введённое в него не отправляется на серверы Google, и, похоже, это тенденция, которая может усиливаться со временем по мере того, как аппаратное обеспечение становится мощнее, а меньшие модели ИИ — более способными.
У модели, работающей офлайн, нет облачного сервиса, проверяющего её вывод, и именно этот пробел авторы хотят закрыть. Они предлагают недорогой монитор, который работает параллельно с моделью и подаёт сигнал, когда n* падает ниже порога безопасности, немного похоже на предупреждающую лампочку на приборной панели автомобиля.
BitcoinBTC · USD
$82,986−2.22%
Oct 3Oct 5Oct 7Oct 8Oct 10
$86.7k$84.7k$82.7k$80.7k
24h HighHigh$82,978
24h LowLow$82,229
VolVol$747.7M
Рыночные прогнозыКоэффициенты от Myriad
Сегодня$82,000 до $84,000$82k–$84k98% шансНа этой неделе$82,000 до $84,000$82k–$84k98% шанс
Купить Bitcoin за USDT
Работает на Jupiter
Они также описывают способы отодвинуть точку невозврата за пределы досягаемости, например, путём внедрения контента в разговор, чтобы n* оказалось за пределами длины ответа. По словам авторов, обучение выравниванию, процесс обучения модели правильному поведению, может сместить или подавить точку невозврата для конкретных запросов, но не может устранить лежащий в основе механизм.
В апреле 2025 года Decryptосвещал более раннюю статью тех же авторов, показывающую, что «пожалуйста» и «спасибо» оказывают ничтожное влияние на вывод модели, поскольку модель рассматривает вежливые слова как ортогональные, или математически не связанные, с сутью запроса. В той версии моделировалась одна, намеренно упрощённая, голова внимания.
Тесты препринта использовали небольшие модели и окно в 300 токенов, или несколько коротких абзацев текста, и его предсказания могли отличаться на один вывод.






