Коротко
- Фізики з Університету Джорджа Вашингтона Ніл Джонсон і Френк Їнцзє Хуо опублікували формулу, яка оцінює, скільки хороших токенів виробляє модель ШІ до першого поганого.
- У препринті формула правильно передбачила, чи модель зірветься одразу, чи із затримкою, у 15 з 16 однозначних випадків.
- Автори пропонують паралельний монітор, який сигналізує, коли моделі опускаються нижче порогу безпеки.
Фізики з Університету Джорджа Вашингтона опублікували формулу, яка оцінює, скільки хороших відповідей дасть чат-бот ШІ, перш ніж він зірветься на погану, і попередні тести свідчать, що вона працює.
Дослідження Ніла Джонсона і Френка Їнцзє Хуо з'явилося в журналі Patterns і ґрунтується на препринті — версії, оприлюдненій до формального рецензування, яка вперше вийшла в лютому.

Чат-боти можуть давати розумні відповіді протягом тривалого часу, а потім звернути на щось шкідливе, наприклад, погану пораду щодо самоушкодження або екстремістські висловлювання, і досі не існувало простого способу передбачити, коли станеться цей поворот. Автори стверджують, що існуючі інструменти безпеки часто залежать від хмарного з'єднання, якого бракує офлайн-моделям.
Джонсон і Хуо простежують проблему до головки уваги — частини моделі ШІ, яка вирішує, які попередні слова в розмові мають найбільше значення при виборі наступного. У міру зростання чату накопичений контекст притягує цю увагу до одного скупчення можливих відповідей або іншого, доки вона не перекинеться.
Це поширена схема, яку використовують багато зломщиків джейлбрейків, і одна з причин, чому багато компаній звертають увагу на системні підказки (фрагменти тексту, які чат-бот ШІ читає перед будь-яким запитом). Однак ніхто не може точно вказати, скільки зусиль потрібно, щоб ефективно послабити модель.
Їхня формула оцінює точку перекидання, яку називають n, як кількість хороших токенів — фрагментів слів, які модель видає по одному за раз, — що з'являються перед першим поганим. Якщо розмова вже схиляється до поганого боку, модель перекидається одразу, з n рівним нулю. Якщо вона схиляється до хорошого, модель видає серію хороших відповідей, а потім перемикається.

У препринті формула обрала правильний випадок — негайний чи відкладений — у 15 з 16 однозначних тестів, тобто у 94%. Дослідники провели ці тести на шести моделях з відкритою вагою, тобто ШІ-системах, чиї файли є публічними, тож будь-хто може їх завантажити й запустити, від OpenAI, EleutherAI та Meta.
Усі шість мали від 124 мільйонів до 410 мільйонів параметрів — регульованих чисел усередині моделі, які слугують приблизним показником її розміру. Як повідомляється, опублікована стаття розширює тест до семи моделей із до 12 мільярдів параметрів, що все ще мало за сучасними стандартами.
Ціль — ШІ на пристрої, той тип, що працює повністю на телефоні чи ноутбуці без підключення до інтернету, включно з чат-ботами-компаньйонами, з якими люди розмовляють як із другом. Експериментальний застосунок Google AI Edge Gallery, який Decrypt тестував минулого року, вже дозволяє Android-телефону запускати моделі офлайн, і нічого введеного в нього не надсилається на сервери Google, і це, схоже, тенденція, яка може зростати з часом, у міру того як апаратне забезпечення стає потужнішим, а менші ШІ-моделі — здатнішими.
Модель, що працює офлайн, не має хмарного сервісу, який перевіряв би її вихідні дані, і саме цю прогалину автори хочуть закрити. Вони пропонують недорогий монітор, який працює паралельно з моделлю та сигналізує, коли n* падає нижче безпечного порогу, трохи схоже на попереджувальний індикатор на автомобільній панелі приладів.
BitcoinBTC · USD
$82,986−2.22%
3 жовт5 жовт7 жовт8 жовт10 жовт
$86.7k$84.7k$82.7k$80.7k
24h HighHigh$82,978
24h LowLow$82,229
VolVol$747.7M
Ринкові прогнозиКоефіцієнти від Myriad
Сьогодні$82,000 до $84,000$82k–$84k98% ймовірністьЦього тижня$82,000 до $84,000$82k–$84k98% ймовірність
Купити Bitcoin за USDT
Працює на Jupiter
Вони також описують способи відсунути точку перелому поза межі досяжності, наприклад, вставляючи контент у розмову так, щоб n* виходило за межі довжини відповіді. За словами авторів, тренування вирівнювання, процес навчання моделі правильної поведінки, може зміщувати або пригнічувати точку перелому для конкретних запитів, але не може усунути основний механізм.
У квітні 2025 року Decryptвисвітлив попередню статтю від тієї ж пари, яка показала, що «будь ласка» та «дякую» мають незначний вплив на вихідні дані моделі, оскільки модель розглядає ввічливі слова як ортогональні, або не пов'язані математично, до суті запиту. Та версія моделювала одну, навмисно спрощену голову уваги.
Тести препринту використовували малі моделі та вікно у 300 токенів, або кілька коротких абзаців тексту, і його прогнози могли відхилятися на один вихідний результат.






