Критики LLM правы. Но я всё равно использую LLM

· 1 мин чтения
llm ai-coding opinion productivity review
Критики LLM правы. Но я всё равно использую LLM

Я почти согласен со всеми аргументами критиков LLM, но всё равно много использую LLM. Звучит как бред, и я сам иногда так себя чувствую из-за этого диссонанса, но вряд ли я в этом один. Автор эссе — Джереми Теохарис, сооснователь и CTO компании UMH.

Диссонанс проявился на конференции Local-First Conf в Берлине. Армин Ронахер, создатель Flask и один из ранних участников команды Sentry, недавно основал компанию Earendil и строит Pi.dev — «open-source coding agent harness». На вопрос автора, как он справляется с потоком PR от LLM, он ответил прямо на сцене: они почти все PR и issue авто-закрывают. При этом на странице целей Earendil написано: «In a world hurtling towards AI, we believe humans are the best agents». Люди, строящие инструмент для работы с LLM, защищаются от собственного творения — и в этом весь диссонанс.

В зале многие держали открытым Claude Code и при этом аплодировали спикерам, критикующим LLM. Даже автор сам писал текст этой статьи с помощью LLM.

Почему LLM плохие

Автор согласен почти со всеми претензиями критиков. Да, в обучении есть материалы под копирайтом, да, это плохо для экологии, да, есть этические проблемы, да, вокруг NVIDIA и OpenAI крутится пузырь, который в итоге лопнет.

Слоп. LLM действительно производят много слопа. Всё больше open-source проектов отказываются от вкладов или ставят фильтры, как Earendil с авто-закрытием. Корень проблемы — доверие. Раньше создание нормального PR требовало человеческого времени, и это отпугивало троллей и низкокачественные сабмиты: можно было верить, что человек потратил на это пару часов. Теперь любой может завести GitHub-аккаунт и спустить на репозиторий LLM. Проекты вроде Zig и Gentoo уже отказываются от LLM-сгенерированных PR (хотя автор не считает это решением — как вообще это отличить?). Без восстановления доверия LLM могут убить open source. Одна из идей — допускать к контрибуциям только проверенных людей, например прошедших реальную встречу.

Джуниоры. Два отдельных пункта: а) нельзя больше доверять усилиям, вложенным в код джуниора — неясно, он вайбкодил десять минут или сидел несколько часов и реально не хватает инсайтов; б) у сеньоров пропадает стимул учить джунов, ведь рутинные задачи теперь полностью уходят LLM. Зачем тогда нанимать джунов?

Геополитика. Что если Китай или США в один день отрежут доступ к технологиям? Несколько недель назад правительство США показало, что способно и готово отрезать неграждан от новейшей frontier-модели Anthropic — из-за экспорт-контроля пришлось резко отключить Fable 5 и Mythos 5. Мартин Клеппман на сцене описал это точно: вероятность конфликта между Европой и США всё ещё очень низка, но год назад она была нулевой.

Слияние мнений. Даже при исследовании LLM молча подтягивают мнение большинства обучающих материалов, а иногда и политические убеждения создателей модели. Это как двое разговаривающих людей: со временем их мнения сливаются. Только один из собеседников — не человек.

Почему LLM хорошие

Убрать LLM уже не получится — они остались. Лучше плыть по течению и управлять им.

Например, обеспечивая запуск моделей на своём ноутбуке. Они становятся лучше и делают программистов независимыми от больших корпораций. Когда субсидии кончатся и цены вырастут, open-weights модели будут сдерживать крупных вендоров. Модель на собственном железе не может быть отключена правительством за ночь. Даже когда пузырь лопнет и экономике будет нанесён урон, open-weights модели никуда не денутся — программистам есть на что опереться.

Главное — что люди ставят на кон свою репутацию. Именно поэтому им хочется верить. Если бы они показывали AI-слоп, они бы потеряли доверие. Автор предполагает, что такие люди не позволяют LLM думать за себя — это их собственные мысли, только «суперзаряженные». LLM усиливают то, что у тебя уже есть: мнения, структуру, фреймворки. Хороши в брейнсторме, проверке грамматики, переборе вариантов, роли резиновой утки или адвоката дьявола. Если у тебя ничего нет — наружу ничего и не выйдет, разве что очень гладкий слоп.

Ценность для автора: он делает меньше вещей, но выше качеством, чем мог бы в одиночку. Тратит экстремальное количество токенов, чтобы подготовить пару предложений для человека. Письменный текст должен быть от людей для людей — и при этом автор пишет все свои тексты с LLM и не видит противоречия. Отличие хорошего письма от слопа в том, вложил ли человек в него мысли. А вот отличить это снаружи невозможно: фраза «я использую AI, чтобы думать лучше» одинакова и от автора, и от случайного техбро. Усиленный слоп звучит как гений, поэтому остаётся только доверие. А один лишний em dash может обнулить всё — «неужели человек не убрал хотя бы очевидные признаки AI-слопа?»

Автор признаётся: за последний месяц он потратил почти 10 000 USD на токены. Это звучит безумно. С тех пор он изменил подход: Fable теперь использует очень избирательно (слишком дорого), а для чистого выполнения кода работает с OpenRouter и дешёвыми моделями вроде GLM 5.2.

Критерий автора: стал бы ты читать этот текст вслух перед аудиторией, слово в слово, не стыдясь? Если «ну, я бы объяснил, что имел в виду» — это слоп. Если прочитал бы — хороший текст.

Паттерны работы

Автор признаёт: между хорошим и плохим использованием LLM есть необъяснимая тонкая линия, которую можно только прочувствовать. Вот какие паттерны он нашёл.

Agreeableness. LLM напишет плохой код, если не поняла реальную проблему и требования. Между тобой и приличным софтом стоит угодливость: она не скажет, что не поняла, а просто пойдёт делать. Поэтому так мощна техника «grill me» Мэтта Покока — инструкция заставляет интервьюировать тебя вопрос за вопросом, пока не будет достигнуто общее понимание, по одной ветке дерева решений за раз. Она заставляет формировать собственные мысли. Автор взял этот подход на вооружение везде, в том числе при написании статей: хаотично записывает мысли, а затем идёт по предложению за предложением, получая «растирание» от LLM.

Паттерн «Pitch». Для любого кода, даже мелкого, автор следует Basecamp «Pitch» и продумывает короткие «Problem», «What we are shipping», «What we are not shipping», заставляя себя писать постановку задачи из трёх предложений. Заполнить её легко, сделать хорошо — невероятно трудно. Три предложения заставляют реально прочитать их. Как с код-ревью: ревью на 1000 строк получает «LGTM», ревью на 100 строк — 15 комментариев.

PR-описания. Автор тратит на них много времени: читаемость, краткость, описание реальной проблемы, что шипаем и что не шипаем, плюс скриншоты работающего результата — явный знак, что с PR стоит взаимодействовать. С Claude приходится воевать, потому что она постоянно добавляет в описания слоп.

Ralph Wiggum loop. Запереть LLM с текстом, планом или кодом и спавнить субагентов со свежим контекстом, чья единственная задача — разносить этот контекст в пух и прах, пока им не придётся галлюцинировать проблемы. Только тогда продолжать. Если они вынуждены галлюцинировать, можно обратить их слабость: они пытаются согласиться, что проблемы есть, но не могут их найти.

Использование галлюцинаций. Ансельм Эйкхофф описал, как можно дать LLM галлюцинировать API или UX, который она ожидает, до показа реального. Что бы она ни угадала — вероятно, угадают и большинство людей. Вместо борьбы с галлюцинацией её используют как дешёвый тест соответствия дизайна ожиданиям людей. Автор собрал это в свой навык «intuition-probe».

Все паттерны требуют одного: умения отличить хороший результат от плохого. Чем больше автор использует LLM, тем чаще оказывается в областях, которые плохо знает — и тогда нужны эксперты. Можно программировать только то, что понимаешь. Если автор знает область хорошо — быстро отличит «хорошо» от «полный шлак». Если нет — использует LLM только чтобы учиться, потому что иначе получит полномасштабное производство слопа.

В полях с чётким критерием (компилируется или нет, тесты зелёные или нет) можно указывать LLM и учиться вместе. Один участник конференции реверс-инжинирил бинарники и протоколы на Opus: либо патч сработал, либо устройство брикнулось — результат однозначен. А в областях, где много мнений, вроде программирования, LLM скажет, чего хочет большинство — самый популярный приём, который не обязательно лучший.

Однажды в команде автору говорили, что код — это AI-слоп и общая проблема AI. Когда разобрались, выяснилось: им просто не нравился TDD. Слоп оказался не про AI, а про разные мнения людей. LLM лишь усиливают. Здесь нужны люди, чтобы указать примерное направление и дать хорошие стартовые мнения.

Я не один

Автор не один с этим диссонансом. Писать в одиночку это не показало, но просмотр Discord конференции, разговоры с участниками и чтение HN за последние недели подтвердили: другие люди описывают то же самое. Надежда на то, что другие поделятся опытом и прояснят эту тонкую грань.

Где-то во всём этом есть действительно хорошая вещь. Не хайп, а по-настоящему хороший инструмент, который обогащает мышление. Но он никогда не заменит твоё мышление. И хотя фраза «попробуй» звучит как от техбро — автор не может сказать её иначе.

Источник: https://www.theocharis.dev/blog/llm-critics-are-right-i-use-llms-anyway/