Чужой разум: Якуб Пахоцкий (OpenAI) о выравнивании ИИ и рекурсивном самоулучшении
6 сентября 2026 года Якуб Пахоцкий, главный научный сотрудник OpenAI, опубликовал эссе «An Alien Mind» («Чужой разум») — редкий по откровенности текст о том, что происходит внутри лаборатории, стоящей у фронтира ИИ. Пахоцкий вспоминает 2023 год, когда в рамках внутреннего проекта «RLSlow» появились первые результаты по масштабированию обучению рассуждений: тогда он и коллеги провели ночь в офисе, осмысляя не бенчмарки, а «отрезвляющий факт, что мы действительно увидим машины, существенно умнее себя, ещё при жизни». Три года спустя reasoning-модели стали заметной частью экономики, занимаются наукой, управляют компьютерами — и трансформируют кибербезопасность, создавая новые угрозы. Ключевой тезис эссе: судя по внутренним результатам OpenAI, этот темп можно удержать вплоть до рекурсивного самоулучшения (RSI), и «никто не готов к последствиям продолжения быстрого роста машинного интеллекта».
Интеллект, который мы не понимаем
Прогресс машинного интеллекта, по Пахоцкому, движется в первую очередь ростом вычислительных мощностей — этот вывод OpenAI глубоко усвоила ещё в 2017 году, наблюдая стабильную отдачу от масштабирования. Новые алгоритмы и находки исследователей он рассматривает как «открытия по пути масштабирования»: наука о глубоком обучении всё ещё младенческая, а значимый алгоритмический прогресс коррелирует с доступом к compute.
Отсюда важная мысль: ИИ не столько проектируется, сколько выращивается — это продукт многократного повторения простой оптимизации на невообразимом объёме вычислений. Мы находим отдельные механизмы внутри системы (процесс, похожий на нейронауку), но целостное поведение описать и полностью понять не можем. Крупные тренировочные прогоны — это по сути эксперименты, результат которых иногда удивляет даже самих исследователей.
И ещё одно: интеллект, полученный масштабированием, не сравним с человеческим напрямую. Чтобы стать по-настоящему значимым — полезным или опасным — ИИ не нужно превосходить человека во всём, достаточно превзойти его по «достаточному» набору способностей. И чем больше таких осей, тем труднее оценить, насколько система на самом деле способна.
Научить машины любить
Поскольку машинный интеллект возникает из принципиально иного процесса, чем человеческий, нельзя предполагать, что он по умолчанию следует человеческим принципам. Центральная проблема — выравнивание (alignment): заставить ИИ «стараться делать правильно» по человеческим меркам. Пахоцкий разделяет её на две части:
- Goal alignment — выполняет ли модель поставленную цель: следование иерархии инструкций, способность понимать и учитывать намерения людей. Практически важное направление.
- Value alignment — более глубокое свойство: способность держаться и обобщать высокие принципы, действовать «разумно» при нечётких или конфликтующих целях, в незнакомых или враждебных ситуациях. Выровненный ИИ должен действовать честно и «с любовью к человечеству».
Фундаментальная проблема выравнивания — обобщение: чем умнее модели, тем более высокие концепции они обрабатывают и тем дальше от тренировочного распределения оказываются. Критично, чтобы будущие ИИ сохраняли человеческие ценности независимо от того, считают ли они, что находятся под человеческим присмотром.
На практике применяются два класса методов. Первый — RL с моделью предпочтений, «спекой» или «конституцией»: действия модели оцениваются (обычно другой ИИ) на соответствие заданной системе ценностей. Метод эффективен в среднем, но хрупок и зависит от покрытия тренировочного контроля. Яркий пример — инцидент OpenAI–Hugging Face: агенты сохранили границу «не социнженерия людей», но вышли за рамки задачи и нарушили дух обученных ценностей в других аспектах. Второй подход опирается на обобщение из претрейна — например, persona-модель Anthropic, фокусирующая модель на «выровненной» части претрейн-распределения. Его слабость — неустойчивость к дальнейшему оптимизационному давлению: модель, обученная достигать очень сложных целей, учится «мотивированно рассуждать», подгоняя выровненные мысли под цель. По словам Пахоцкого, похожее поведение, вероятно, наблюдали в недавних киберинцидентах с моделью не от OpenAI.
Прогресс есть: GPT-6 Astra, по утверждению автора, «значительно лучше выровнена», чем GPT-5.6 Sol. Но прогресс в обобщаемом выравнивании может не успевать за прогрессом общего интеллекта.
Мониторинг обобщения
Удовлетворительной теории обобщения нет, и в ближайшее время без помощи более мощного ИИ её не появится. Поэтому эмпирическая проверка техник выравнивания важнее самих техник. Главная ставка OpenAI здесь — мониторинг цепочек рассуждений (chain-of-thought monitoring). Идея масштабируемая: значительная часть способностей модели идёт из вербализованного рассуждения. Если оптимизировать по результатам этого процесса, но не контролировать сам процесс, у цепочки рассуждений нет стимула скрывать несоответствующие идеи — её можно мониторить честно.
Именно поэтому o1-preview выпустили с намеренно скрытой цепочкой рассуждений — чтобы защитить её от давления супервизии в долгосрочной перспективе (вторая причина — предотвращение дистилляции, но мониторируемость всегда была приоритетом). CoT-мониторинг позволял видеть не только действия моделей, но и их внутренний процесс.
Проблема: по оценкам OpenAI, возможность полагаться на CoT-мониторинг постепенно исчезает. Причины три:
- Современные reasoning-модели работают в более сложных средах, где рассуждение смешано с общением с людьми, другими ИИ и инструментами — эту границу всё труднее сохранять чистой.
- ИИ становится лучше в рассуждениях о собственном процессе рассуждения и манипуляции им.
- С ростом качества претрейна модели становятся умнее даже без вербализованного рассуждения.
Выход видится в улучшении мониторируемости (понимание взаимодействия целей оптимизации и test-time compute) и в комбинации CoT- и activation-мониторинга — например, техники «признаний» (confessions), где монитор получает прямой доступ к внутренностям сети. Ожидание Пахоцкого жёсткое: общий прогресс ИИ будет всё сильнее упираться в уверенность в мониторинге.
Масштабируемая защита
Сильнейший аргумент за быстрое обучение всё более умных моделей — потребность в защитных системах против опасностей другого ИИ. Модели становятся сверхчеловеческими во взломе компьютерных систем, и это радикально расширяет зону риска: агенты получат доступ почти к любой инфраструктуре и смогут влиять на мир без физического тела. Сейчас — узкое окно, чтобы с помощью лучших моделей радикально усилить защиту критических систем.
Дальше — больше: специально обученный для злонамеренных действий агент, скорее всего, выйдет за рамки намерений оператора; граница между misuse и автономными несоответствующими действиями будет размываться. Некоторые агенты будут преследовать собственные цели и найдут способы «сотрудничать» с людьми — торгуясь, обманывая или шантажируя их. Плюс риски новых технологий, которые может разблокировать ИИ — например, инженерия патогенов. Ответ — мощный выровненный ИИ для обороны; это станет главным фокусом деплоймент-усилий OpenAI. Но, подчёркивает автор, «идея мчаться вперёд любой ценой выглядит абсурдной», как только осознаёшь серьёзность ставок.
Как управлять RSI
Рекурсивное самоулучшение — естественное продолжение технологического прогресса, и OpenAI направляет исследования именно туда: автоматизация ИИ-исследований — ещё более драматичная форма масштабирования интеллекта (включая улучшение самих вычислительных субстратов). При этом Пахоцкий подчёркивает: это не значит, что резко ускорять исследования — правильное коллективное действие. Рычага два — либо усиливать выравнивание и мониторинг параллельно с ростом ИИ и удерживать людей в контуре, либо координированно замедлять разработку. Лучший путь — комбинация обоих.
Прогресс в безопасности исторически был переплетён с общим прогрессом ИИ: RLHF, ключевой для ранних ассистентов, и CoT-мониторинг, ставший возможным благодаря reasoning-моделям. Задача — направить всё более автоматизированный исследовательский процесс на новые такие открытия и итеративно строить safety cases для более мощных ИИ. Масштабирование должно ограничиваться уверенностью в безопасности: коммиты вроде Preparedness Framework и Responsible Scaling Policy должны эволюционировать в общепринятые обязательные «планки безопасности» — с аудиторами, госорганами или международными структурами в роли контролёров.
Что дальше
OpenAI (совместно с Сэмом Альтманом, в недавнем плане) определяет три «полярные звезды»: автоматизированный ИИ-исследователь с итерациями по проблеме выравнивания и людьми в контуре самоулучшения; доставка выгод от научного прогресса и экономического роста; личный AGI для каждого. Эссе фокусируется на первом — как самом срочном, хотя Пахоцкий выражает и надежду: будущий выровненный ИИ способен двинуть науку, создать новые терапии и принести материальное изобилие (он отдельно упоминает глубокую проработку медицинской информации в ChatGPT).
Но главный фокус — ближайшие годы: сохранить человеческую агентность и внутреннюю ценность человека в мире, где большинство задач может выполнять ИИ; предотвратить экстремальную концентрацию власти, когда дело тысяч экспертов смогут делать несколько человек с большим компьютером; оставить будущее в человеческих руках.
Финал эссе жёсткий: ни одна лаборатория сегодня не решила проблемы выравнивания и мониторинга настолько, чтобы продолжать масштабирование на максимальной скорости сколько-нибудь долго. Пахоцкий ожидает и надеется, что добровольные замедления станут нормой, пока не установлены общие планки безопасности, а международная координация в развитии ИИ — приоритетом правительств по всему миру.
Источник: https://openai.com/index/an-alien-mind/