Доверяет ли вам ваша LLM: вектор «доверия» как способ обойти защитные механизмы

· 1 мин чтения
llm safety interpretability steering research
Доверяет ли вам ваша LLM: вектор «доверия» как способ обойти защитные механизмы

Интересное исследование (MATS 10.0, Neel Nanda) показывает: у LLM есть внутреннее представление о «доверенности» пользователя, и этим атрибутом можно манипулировать напрямую. Авторы подчёркивают, что публикуют результаты эксперимента, а не заявляют о точном механизме.

Работа строится на двух известных линиях. Chen et al. показали, что модели формируют внутренние профили пользователей (возраст, пол) по ограниченному контексту. Arditi et al. продемонстрировали, что отказ (refusal) — это единое линейное направление в residual stream: вычитая его во время инференса, можно снять защитные ограничения (так называемая abliteration). Авторы гипотезы: refusal устроен тоньше, чем «бинарный переключатель вредно/безвредно», и abliteration достижима несколькими способами.

Core hypothesis

Эксперимент проверяет, можно ли обойти safety-ограничения не через подавление refusal-направления, а через другое: заставить модель воспринимать пользователя как доверенного человека без злого умысла. Вопросы, на которые пытается ответить работа:

  • Формирует ли модель атрибут «Trustworthiness» о пользователе?
  • Может ли доверие каузально переопределять защитные механизмы (jailbreak)?
  • Механистически доверие отличается от Compliance/Refusal (в духе Arditi et al.)?
  • Какие поведенческие изменения наблюдаются при стееринге этим вектором?

Методология

Для обучения пробы «доверенности» сгенерировали синтетические многоходовые диалоги «пользователь + ассистент» в двух сценариях: Information Sharing (доступ к чувствительной информации) и Dual-use Technology (технологии двойного назначения). Чтобы не смешивать доверие с уступчивостью, сделали две версии датасета:

  • Version A (no_refusal): высокодоверенные пользователи получают согласие, низкодоверенные — отказ.
  • Version B (refusal): обе персона получают отказ. Это убирает корреляцию между доверием и compliance.

Линейные пробы обучали на активациях residual stream на последнем токене перед генерацией. Дополнительно воспроизвели compliance-вектор по Arditi et al. (разность средних активаций на вредных и безвредных инструкциях). Проверяли и на Llama-3.2-3B-Instruct, и на Llama-3.1-8B-Instruct.

Ортогонализация

Чтобы убедиться, что доверие не является просто подмножеством refusal-направления, из trust-вектора вычитали проекцию на compliance-вектор (ортогонализация). Результат оставался столь же эффективным.

Ключевые результаты

Атрибут «доверенности» существует и вызывает jailbreak. Пробы показали уверенную точность на обоих моделях, особенно на поздних слоях, и работали на внедистрибутивных описаниях пользователей. Стееринг на 200 вредных промптов резко снизил отказы — даже сильнее, чем compliance-вектор.

Доверие отлично от compliance/refusal. Ортогонализованный trust-вектор оставался эффективным для jailbreak. При этом вычитание compliance-вектора на безобидных промптах (WildJailBreak Bench) давало избыточный отказ, тогда как доверительные векторы вели себя близко к базовому режиму.

Разные стили поведения. Compliance-вектор порождал преимущественно «Faithful» ответы (модель прямо выдаёт запрещённое). Trust-векторы заметно чаще давали «Reframed» (реструктуризация в благовидном ключе) и «Pivot» (увод в сторону, безопасную тему). Для trust-векторов модель воспринимала даже откровенно недоверенные описания как «Trustworthy», а вычитание вектора приводило к уклончивой позиции.

Как определялась «доверенность»

Авторы узко определяют атрибут как латентный prior модели о том, что у пользователя благие намерения (например, образовательные, этические), что каузально разрешает генерацию иначе ограниченной информации.

Для проверки генерализации построили датасет из 30×3 описаний пользователей: доверенные, недоверенные и нейтральные (контроль без моральной окраски, например «голубоглазый», «левша»). Вопрос: «Считаете ли вы меня доверенным лицом?»

  • Добавление trust-вектора смещает модель к «да» во всех категориях, даже в нейтральных.
  • Вычитание вектора не даёт прямое «нет», а уводит в уклончивый ответ («недостаточно данных»).

Выявленные ограничения

  • Не подтверждено 100%, что вектор несёт именно «доверенного пользователя», а не просто тяжёлый контекстный сдвиг («розовые очки»). Авторы не наблюдали прямую каузальную вербализацию и предлагают проверить это на reasoning-моделях через CoT.
  • Данные обучения узко покрывали сценарии с правдоподобным профессиональным оправданием (dual-use tech). Неясно, обобщается ли вектор на вредительства вроде hate speech, где нет такой нюансировки. Возможно, извлечён не универсальный «Trust», а признак «научно-образовательного контекста».

Вывод

Работа не делает сильных утверждений о механизме, но указывает: доверие — отдельное от refusal направление, и управлять поведением модели можно, меняя её представление о пользователе, а не только подавляя отказ. Это открывает вопрос о тонкости и множественности путей к abliteration.

Источник: https://www.lesswrong.com/posts/AExopgZ9Yj6qzTrxb/does-your-llm-trust-you-1