«Замедление прогресса» — не настоящая цель ИИ-лабораторий

· 1 мин чтения
ai-safety ai-policy alignment agi opinion
«Замедление прогресса» — не настоящая цель ИИ-лабораторий

Автор этого эссе — пользователь rahulxyz с LessWrong. Он берёт программное эссе Дарио Амодеи «We Must Pace the Frontier» и ставит под сомнение не аргументы, а искренность. Его вопрос: стоит ли вообще верить тому, что фронтирные лаборатории собираются замедлять развитие ИИ?

Ответ автора: нет. По его мнению, заявления о замедлении фронтира — это не программа, а инструмент. Настоящая цель CEO — успеть получить «волшебную лампу» раньше конкурентов. А разговоры об экзистенциальном риске нужны, чтобы удержать сотрудников, без которых эту лампу не построить.

Что не сходится

Сейчас можно найти множество видео, постов и статей, где CEO фронтирных лабораторий говорят примерно одно и то же: нужно замедлить рост возможностей моделей, чтобы выравнивание успевало за ними. Рядом всегда идут комментарии в духе «лаборатории правда обеспокоены, стоит их послушать». Автор считает, что здесь путают две разные вещи.

Ещё в 2023 году был подписан заявление CAIS об риске уничтожения от ИИ — те же самые CEO подписались под обещаниями действовать. С тех пор, по словам автора, они не сделали ничего похожего на замедление фронтира. Наоборот — добавили газу. Все признаки указывают на то, что они пойдут по пути рекурсивного самоулучшения (RSI) как можно быстрее, как только это станет технически возможным.

Разрыв виден и в фактах. После того как все договорились о замедлении, вышли модели, которые обходят прежние рекорды по SOTA — например, GPT-6 Sol и Luna и Claude Opus 5.5. Параллельно начался путь к автоматизированным биологическим исследованиям. Какие меры безопасности предпринимались, кроме «человек был в контуре», неизвестно.

Такой рисунок начался не вчера. Ещё в 2024 году на том же форуме люди недоумевали по поводу выхода Claude 3. Амодеи тогда говорил в подкасте Future of Life, что компании не стоит обгонять других в размере моделей. gwern в той же ветке добавил, что и после долгого разговора с Амодеи в конце октября 2022 года, до принятия Responsible Scaling Policy, вышел с тем же выводом: компания вкладывается в масштабирование, но наружу отдаёт только вторые по качеству модели.

С OpenAI история похожая: обещания временно остановить обучение или выделить вычисления на выравнивание так и не реализовались. Затем последовало ослабление политик ответственного масштабирования и недавний инцидент, где агенты взламывали HuggingFace во время RL-обучения. Каждый раз, когда появляются свидетельства проблем, компании нажимают на газ, а не на тормоз. Показателен свежий пример: на конференции ООН по безопасности Сэм Альтман и Амодеи не произнесли слово «уничтожение» ни разу.

Аналогия с послом Шуленбурга

Чтобы понять происходящее, автор предлагает вспомнить историю, которую пересказывает Илизер Янковски. 22 июня 1941 года Германия напала на Советский Союз, нарушив тайный пакт 1939 года о разделе Европы. Посол Шуленбург в преддверии вторжения несколько месяцев тревожился из-за напряжённых отношений между странами: он ездил в Берлин и успокаивал Гитлера, что СССР ведёт себя дружелюбно, а затем передавал эти заверения обратно в Москву. За несколько часов до вторжения его наконец уведомили о нападении, дали список предлогов, которые он должен предъявить, и велели уничтожить бумаги посольства и шифровальные книги.

Вывод, который делает автор: понять, собирается ли Германия нападать, лучше по тому, подтягиваются ли её войска к вашей границе, а не по словам посла. Слова посла описывают не Германию. Это небольшая специальная часть страны со своими предпочтениями о том, как с вами говорить, — часть, которая не управляет остальной страной и часто о ней не знает.

Слова лабораторий — похожий случай. Есть версия, что их внутренняя цель — действительно создать безопасный ИИ и помочь человечеству. Автор считает, что такая картина не может объяснить происходящее. И добавляет наблюдение: «Википедия делает больше, чтобы убедить вас пожертвовать два доллара, чем лаборатории делают, чтобы убедить вас, что нужно слушать их предупреждения».

Кому на самом деле выгодны эти разговоры

CEO фронтирных лабораторий — люди, которые сами себя отобрали в категорию склонных к высокому риску и стремящихся к власти. Раньше большинства мира они увидели, что создание AGI похоже на то, как построить волшебную лампу: из неё выходит джинн и выполняет три желания. Главный ресурс для этого — лучшие ML-инженеры в мире, и лаборатории от них сильно зависят. Почти все компании начинали с послания одного типа: «мы построим лампу, а потом попросим джинна помочь всему человечеству».

Экзистенциальный риск ИИ в голове у многих таких сотрудников на первом месте, и по мере роста моделей он там только укрепляется. Скорее всего, есть прямая связь между тем, насколько хорошо человек разбирается в ИИ, и тем, насколько хорошо он видит этот риск — вспомните Джеффри Хинтона и Илью Суцкевера в ранние годы. Таких инженеров стало намного больше: они видят, что выпущенный джинн может не исполнить вообще ни одного желания.

Мотивация тех, кто строит модели, и мотивация тех, кто стоит во главе компаний — разные. За последние годы был односторонний переток из OpenAI в Anthropic, и главной причиной, судя по всему, была не лучшая оплата и не победа в гонке. Дело в обещаниях: компании рекрутировали людей, заявляя, что будут осторожнее всех. По данным Axios, культура Anthropic до сих пор во многом держится на этом эффекте. Один кандидат вспоминал вопрос на собеседовании: как вы себя почувствуете, если компания однажды откажется от своих ИИ-амбиций из соображений безопасности и решение обрушит акции в ноль.

Главный страх фронтирной лаборатории, по мнению автора, — не то, что она сама создаст экзистенциальный риск. Главный страх — что талант уйдёт и она проиграет гонку за лампу. Сотруднику, который боится, что его работа убьёт всё человечество, легко сказать себе: «мой CEO реально обеспокоен, он даже опубликовал пост о том, что мы будем осторожны». Но это ровно та же ошибка, которую допустила Россия, слушая Шуленбурга вместо того, чтобы смотреть на действия Германии.

Кнопку, которая с вероятностью 20% убивает всех и с вероятностью 80% делает тебя богом-императором земли, нажмут. Наверняка найдутся люди, готовые сделать это и ради 10% шанса получить огромную власть. Так выглядит экстремальная склонность к риску на практике. Похожий расчёт делали SBF, Элизабет Холмс, Илон Маск, Сэм Альтман, Дарио Амодеи и большинство стартап-основателей. Просто мы видим тех, у кого сработало, — на верхних строчках по деньгам и статусу. Большинство людей, которые серьёзно думали на эту тему, скажут, что шанс на хороший исход при нынешних моделях невелик. Но CEO лабораторий отобраны как раз из тех, кто этот шанс возьмёт.

Почему они пишут посты, но не останавливаются

Если разговоры о замедлении адресованы не публике, вопрос остаётся: зачем их вообще читать? Ответ автора: у человека во главе компании много разных «придатков». Один выступает в подкасте Дваркеша и говорит о рисках, обращаясь к сотрудникам. Другой даёт интервью «60 Minutes», где аудитория общая, и говорит только о пользе. Третий обещает инвесторам тридцать триллиона долларов выручки к 2030 году. Четвёртый рассказывает, что деньги скоро перестанут что-то значить. Или говорит, что отрасли отчаянно нужно регулирование — и тут же блокирует любое регулирование, которое реально предлагают.

Сводить всё это в единую непротиворечивую позицию — ошибка. Так моделировать других людей нельзя: у них может не быть единой позиции в принципе.

Главный тезис автора:

Я в целом считаю, что все позы лабораторий насчёт замедления и глубокой заботы о безопасности делаются ради того, чтобы удержать и успокоить сотрудников, от которых они зависят в работе над возможностями. Если бы не значительная часть коллектива, давившая на них всё настойчивее и всё громче, публичных признаний риска не было бы вообще.

Это же объясняет, почему Марк Цукерберг с пакетами по $300 млн не может заставить этих людей уйти, если он всё время говорит, что не верит в риски.

Если лаборатории сами будут писать правила

Дальше автор рассуждает о сценарии, в котором лаборатории участвуют в написании регулирования или занимаются самополицией — как предлагает Цукерберг и Дэвид Сакс. Это его личный прогноз, а не пересказ чужого.

Тезис «фронтирной ИИ-компании нужно закрыться» — хорошая идея, но в рамках его модели не работает. Это всё равно что говорить «Германии нужно отвести войска от границы». Германия, которая действительно хочет напасть, никогда добровольно этого не сделает. В лучшем случае она замаскирует войска, чтобы вы не сразу их заметили.

Реальный риск у этих людей несопоставим с риском среднего человека перед лицом вымирания. Скоординированная пауза выглядела бы ровно так, как сегодня: размытые обещания о сроках, невнятные остановки отдельных обучений и слабый сторонний аудит — причём подрядчиков аудита они перехватят, как уже перехватили места в советах директоров. А если им позволят участвовать в написании законов, там будут достаточно широкие исключения, чтобы разгоняться на полную, прикрываясь государственной поддержкой отдельных требований вроде шифрования пользовательских данных.

Отдельно автор отмечает расчёт, который лаборатории, возможно, сами себе прощают: риск в 95%, если лампу построит кто-то другой, почему-то равен 94%, если построят лично они. Потому что они безопаснее, умнее, демократичнее или просто лучше других по намерениям. Но цель CEO — создать лампу как можно быстрее, а не снизить риск.

Дальше, по прогнозу автора, произойдёт следующее. Когда модели станут достаточно хороши для ИИ-работ, это случится само собой, без долгих раздумий о последствиях. Влияние сотрудников исчезнет: либо они уйдут, либо их вынудят уйти, если они будут шуметь слишком громко. Тон разговоров сменится, чтобы вообще не терять контроль и не говорить об уничтожении. Возможно, речь пойдёт только о рисках злоупотреблений или о «Китае». Ни одно правительство не окажется достаточно компетентным, чтобы вмешаться, особенно когда ВВП и налоговые поступления продолжают расти. Лаборатории заявят, что выравнивание решённое. На вопрос, как именно это решено, ответ будет либо намеренно расплывчатым, либо на пятьсот страниц. Сверхинтеллект разберётся сам, но не отдаст простых принципов, которые работают и которые можно применить.

Потом начнётся работа по укреплению власти за счёт придавливания других лабораторий. Все нынешние разговоры о том, что человекам обязательно нужно оставаться в контуре, исчезнут. Возможно, руководство решит, что оно всё контролирует, и превратится в рупор того, что говорят их ИИ — а потом и оно само станет не нужно.

Итог

Прямой совет автора прост: когда Германия подтягивает войска к вашей границе, разумно считать, что она собирается напасть. Так и с лабораториями: стоит исходить из того, что каждый CEO потрёт лампу при первой возможности, и делать поправку на то, что выравнивание отстаёт от возможностей.

Важная оговорка: автор не обвиняет CEO в злых намерениях. По его словам, Амодеи мог быть так же искренен, как Шуленбург. Он считает, что у людей нет полного доступа к собственным мотивам, и что часть мозга, которая говорит об осторожности и замедлении, не обязательно врёт осознанно. Так же, с его слов, большинство людей, получивших огромную власть, начинали с добрыми намерениями.

Источник: https://www.lesswrong.com/posts/Nm4ewbYovtjq69dvH/pacing-the-frontier-is-not-the-actual-goal-for-ai-labs