System One Models и Jev: TypeSafe AI выпустила модели для быстрых структурных решений

· 1 мин чтения
llm inference automation benchmarks
System One Models и Jev: TypeSafe AI выпустила модели для быстрых структурных решений

Компания TypeSafe AI вышла из двухлетнего стелс-режима с необычным продуктом: первый System One Model — класс frontier-моделей, заточенных не под общение с человеком, а под быстрые структурные решения, которые программный код может использовать напрямую. Основатель компании Диогу Алмейда (Diogo Almeida) ранее работал в OpenAI над методами, сделавшими языковые модели полезными для следования инструкциям, — это исследование легло в основу ChatGPT. По его словам, ещё тогда стало очевидно: чат-модели сами по себе автоматизации не дают.

Первая модель нового класса называется Jev и доступна в early access. Формула простая: это «frontier-функция» — на вход неструктурированное состояние программы, на выходе типизированные вероятностные решения. Jev вообще не генерирует строки, зато не может галлюцинировать и всегда сообщает калиброванную уверенность в каждом ответе.

Под капотом — новый стек, целиком построенный под автоматизацию: новая архитектура модели, параллельный сэмплер для максимальной эффективности и собственный метод обучения RLCD (Reinforcement Learning for Calibrated Decisions).

Почему «System One»

Название отсылает к книге Даниэля Канемана (Daniel Kahneman) «Думай медленно… решай быстро»: быстрое интуитивное мышление Системы 1 против медленного и осознанного Системы 2. LLM в этой терминологии — «Система 2»: последовательная генерация текста, токен за токеном. System One Models — попытка выделить именно быстрые интуитивные решения, которые в обычном коде записаны как if-else и конечные автоматы.

Слово Jev — отсылка к Уильяму Стэнли Джевонсу (William Stanley Jevons) и его парадоксу: когда паровые двигатели стали эффективнее, потребление угля не упало, а выросло. Команда TypeSafe ожидает того же от стоимости машинного интеллекта: каждый порядок снижения цены открывает на порядок больше сценариев применения.

LLM против Jev

Обычные LLM System One (Jev)
Обучение RLHF / RLVR RLCD
Оптимизация Предпочтения людей, проверяемые награды Калиброванные решения с честными вероятностями
Вход Текст, последовательные сообщения Текст, упор на структурированное состояние программы
Выход Строки: нужен парсинг и валидация, риск «уехать» Типобезопасные структуры, заданные заранее, с вероятностями
Сэмплинг Последовательный, токен за токеном Параллельный: все выходы за один запрос
Цена Вход $0.20–$10 / MTok, выход примерно в 5 раз дороже Вход $0.042 / MTok, выход бесплатный
Скорость 3–329 секунд end-to-end 70–500 мс (в 40–200 раз быстрее)
Уверенность Overconfidence и непоследовательность Всегда калибрована: выше уверенность — выше точность

Ключевой аргумент про уверенность: если модель решает задачу в 95% случаев, но не говорит, когда наступают те самые 5%, — автоматизировать такую задачу нельзя. Человек всё равно будет проверять каждый ответ.

Зачем это в коде

Авторы описывают четыре основных сценария:

  • Умные if-ы и AI-workflow — классификация, маршрутизация, скоринг и извлечение данных там, где рукописная логика слишком хрупкая
  • Map-reduce по большим данным — превращение петабайтов в признаки и инсайты
  • Real-time приложения — отклик порядка 100 мс позволяет использовать ИИ там, где критичен UX
  • Верификация LLM — скоринг, judge, guardrails и детект джейлбрейков для промптов, цепочек рассуждений и выводов моделей

Откуда цифры

Команда называет себя скептиками и публикует доказательства, попутно честно перечисляя ограничения.

Workflow-бенчмарки

TypeSafe создала новый тип оценки: берётся «правильный вычислительный граф» — workflow в виде кода, — и ответы моделей сравниваются со средним от самых крупных и дорогих внешних моделей (GPT-6 Astra и Fable 5.1). По данным компании, Jev держит Pareto frontier почти на два порядка: 193.6x быстрее и 444.6x дешевле в этих тестах. Сами авторы признают, что это верхняя граница реальных выгод.

Нюансы, которые перечисляет сама команда: воркфлоу готовили сотрудники компании (возможен bias), эталон смещён в сторону моделей OpenAI и Anthropic, а LLM-конкуренты запускались через их обёртку system-one-adapter-python, которая заставляет LLM выдавать решения в формате, совместимом с API TypeSafe. Полные данные — на сайте workflow-бенчмарков: примеры, разногласия и каждый workflow целиком.

Типобезопасность вместо галлюцинаций

Галлюцинации и типобезопасность связаны напрямую. Галлюцинированный tool call в чат-боте — неудобство; в системе с гарантированной задержкой или в глубине цепочки зависимостей — провал всей автоматизации. Схема выхода Jev определена заранее, ошибка типов математически невозможна — в отличие от LLM, где гарантий нет вовсе.

Демки: Doom и Wikiracing

  • Doom: бот играет в Doom, читая структурированное состояние игры (пока не изображения) и делая 10 запросов в секунду — примерно $7 в час. Команда обещает подробный разбор и хакатоны по этой теме.
  • Wikiracing: гонки по Wikipedia, где на каждом шаге нужно выбирать из сотен и тысяч ссылок. Jev держит кардинальность до 255 вариантов; для больших списков используется двухступенчатая схема — независимый скоринг, затем явный выбор.

Что с этим не так

Авторы сами признают слабые места. Цены «слишком хорошие, чтобы быть правдой»: субсидирование возможно, устойчивость тарифов покажет только время. Опубликованные eval-ы прогонялись с ноутбуков на западном побережье США, воркфлоу могли неосознанно подобрать в пользу своей модели. А «ноль галлюцинаций» — не эмпирическое наблюдение, а следствие математической гарантии схемы: опровергнуть его можно одним контрпримером, которого пока нет.

Что дальше

Early access открыт, разработок из листа ожидания приглашают по мере возможностей. Команда просит рассказывать, какие решения вы хотите автоматизировать, где Jev работает, а где спотыкается. Подробные ответы на вопросы о методе обучения, обучающих данных и публичных бенчмарках обещаны в следующих материалах.

Источник: https://typesafe.ai/blog/introducing-system-one-models-and-jev