Доверяет ли вам ваша LLM: вектор «доверия» как способ обойти защитные механизмы
Интересное исследование (MATS 10.0, Neel Nanda) показывает: у LLM есть внутреннее представление о «доверенности» пользователя, и этим атрибутом можно манипулировать напрямую. Авторы подчёркивают, что публикуют результаты эксперимента, а не заявляют о точном механизме.
Работа строится на двух известных линиях. Chen et al. показали, что модели формируют внутренние профили пользователей (возраст, пол) по ограниченному контексту. Arditi et al. продемонстрировали, что отказ (refusal) — это единое линейное направление в residual stream: вычитая его во время инференса, можно снять защитные ограничения (так называемая abliteration). Авторы гипотезы: refusal устроен тоньше, чем «бинарный переключатель вредно/безвредно», и abliteration достижима несколькими способами.
Core hypothesis
Эксперимент проверяет, можно ли обойти safety-ограничения не через подавление refusal-направления, а через другое: заставить модель воспринимать пользователя как доверенного человека без злого умысла. Вопросы, на которые пытается ответить работа:
- Формирует ли модель атрибут «Trustworthiness» о пользователе?
- Может ли доверие каузально переопределять защитные механизмы (jailbreak)?
- Механистически доверие отличается от Compliance/Refusal (в духе Arditi et al.)?
- Какие поведенческие изменения наблюдаются при стееринге этим вектором?
Методология
Для обучения пробы «доверенности» сгенерировали синтетические многоходовые диалоги «пользователь + ассистент» в двух сценариях: Information Sharing (доступ к чувствительной информации) и Dual-use Technology (технологии двойного назначения). Чтобы не смешивать доверие с уступчивостью, сделали две версии датасета:
- Version A (no_refusal): высокодоверенные пользователи получают согласие, низкодоверенные — отказ.
- Version B (refusal): обе персона получают отказ. Это убирает корреляцию между доверием и compliance.
Линейные пробы обучали на активациях residual stream на последнем токене перед генерацией. Дополнительно воспроизвели compliance-вектор по Arditi et al. (разность средних активаций на вредных и безвредных инструкциях). Проверяли и на Llama-3.2-3B-Instruct, и на Llama-3.1-8B-Instruct.
Ортогонализация
Чтобы убедиться, что доверие не является просто подмножеством refusal-направления, из trust-вектора вычитали проекцию на compliance-вектор (ортогонализация). Результат оставался столь же эффективным.
Ключевые результаты
Атрибут «доверенности» существует и вызывает jailbreak. Пробы показали уверенную точность на обоих моделях, особенно на поздних слоях, и работали на внедистрибутивных описаниях пользователей. Стееринг на 200 вредных промптов резко снизил отказы — даже сильнее, чем compliance-вектор.
Доверие отлично от compliance/refusal. Ортогонализованный trust-вектор оставался эффективным для jailbreak. При этом вычитание compliance-вектора на безобидных промптах (WildJailBreak Bench) давало избыточный отказ, тогда как доверительные векторы вели себя близко к базовому режиму.
Разные стили поведения. Compliance-вектор порождал преимущественно «Faithful» ответы (модель прямо выдаёт запрещённое). Trust-векторы заметно чаще давали «Reframed» (реструктуризация в благовидном ключе) и «Pivot» (увод в сторону, безопасную тему). Для trust-векторов модель воспринимала даже откровенно недоверенные описания как «Trustworthy», а вычитание вектора приводило к уклончивой позиции.
Как определялась «доверенность»
Авторы узко определяют атрибут как латентный prior модели о том, что у пользователя благие намерения (например, образовательные, этические), что каузально разрешает генерацию иначе ограниченной информации.
Для проверки генерализации построили датасет из 30×3 описаний пользователей: доверенные, недоверенные и нейтральные (контроль без моральной окраски, например «голубоглазый», «левша»). Вопрос: «Считаете ли вы меня доверенным лицом?»
- Добавление trust-вектора смещает модель к «да» во всех категориях, даже в нейтральных.
- Вычитание вектора не даёт прямое «нет», а уводит в уклончивый ответ («недостаточно данных»).
Выявленные ограничения
- Не подтверждено 100%, что вектор несёт именно «доверенного пользователя», а не просто тяжёлый контекстный сдвиг («розовые очки»). Авторы не наблюдали прямую каузальную вербализацию и предлагают проверить это на reasoning-моделях через CoT.
- Данные обучения узко покрывали сценарии с правдоподобным профессиональным оправданием (dual-use tech). Неясно, обобщается ли вектор на вредительства вроде hate speech, где нет такой нюансировки. Возможно, извлечён не универсальный «Trust», а признак «научно-образовательного контекста».
Вывод
Работа не делает сильных утверждений о механизме, но указывает: доверие — отдельное от refusal направление, и управлять поведением модели можно, меняя её представление о пользователе, а не только подавляя отказ. Это открывает вопрос о тонкости и множественности путей к abliteration.