Перейти к содержимому
madaev

ИИ в бизнесе

Jev: модель, которая принимает решения вместо того, чтобы писать текст

За неделю новая модель обошла отраслевые издания, соцсети и русскоязычные СМИ. Разбираю, что в ней действительно новое, а что обычная волна ожиданий.

Главное

  • Jev не пишет текст, а возвращает выбор из списка, оценку или ответ да/нет с вероятностью, поэтому работает быстрее и дешевле обычных моделей
  • Экономия появляется там, где в процессе много мелких повторяющихся решений: сортировка обращений, отбор перед дорогой моделью, проверка действий агента
  • Цифры ускорения пока заявлены компанией, модель в раннем доступе, а пороги доверия нужно проверять на собственных данных

Что это такое

15 сентября компания TypeSafe AI выпустила модель Jev. Её основатель Диогу Алмейда раньше работал в OpenAI и участвовал в создании ChatGPT. Компания называет Jev моделью класса System One: она не генерирует текст, а принимает решения.

На вход подаются текст или состояние программы и вопрос. На выходе один из трёх типов ответа: да или нет, выбор из заданного списка, оценка по шкале. К каждому ответу прилагается вероятность. Модель не умеет писать письма, код и объяснения и не пытается: она выбирает только из того, что ей разрешили выбирать.

Тип вопроса Что возвращает Пример
Да или нет Вероятность утверждения Это обращение — жалоба?
Выбор из списка Один из заданных вариантов Какому отделу передать заявку?
Оценка по шкале Позицию на шкале Насколько срочно это обращение?

По данным компании, ответ приходит за 70–500 миллисекунд и стоит 0,042 доллара за миллион входных токенов, выходные бесплатны. Заявлено ускорение от 40 до 200 раз и удешевление до 400 раз по сравнению с обычными языковыми моделями на задачах классификации.

Почему это заметили

Большая часть работы, которую компании поручают языковым моделям, на самом деле не требует текста. Нужно решить: это письмо жалоба или запрос? Этот счёт срочный? Это действие агента безопасно? Какому специалисту передать обращение?

До сих пор такие вопросы задавали большой модели, которая писала абзац рассуждений, а программа выдёргивала из него слово «да». Это медленно, дорого и ненадёжно: модель может ответить не в том формате, добавить оговорку или придумать вариант, которого нет в списке.

Jev делает наоборот. Формат ответа задан заранее, поэтому ошибиться в формате невозможно. Скорость и цена позволяют задавать тысячи вопросов там, где раньше экономили на каждом обращении.

Дешёвое решение меняет не качество ответа, а количество мест, где вы можете себе позволить спросить.

Где это экономит деньги

Польза появляется не в одном большом сценарии, а во множестве мелких. Типичные места:

  • Сортировка входящего потока. Обращения клиентов, письма, заявки, счета. Куда направить, насколько срочно, нужен ли человек.
  • Фильтр перед дорогой моделью. Простые случаи закрываются дешёвым решением, к большой модели уходят только сложные. Расход на дорогую модель падает без потери качества там, где оно важно.
  • Проверка действий ИИ-агентов. Прежде чем агент отправит письмо, изменит запись или нажмёт кнопку, отдельная модель оценивает, безопасно ли это. Этот сценарий разбирают как один из основных.
  • Приёмка результата. Соответствует ли ответ критериям, можно ли показывать клиенту, нужно ли повторить попытку.
  • Оценка риска в реальном времени. Подозрительная операция, нетипичный запрос, сигнал безопасности.

Общий признак: решение повторяется тысячи раз, у него ограниченный набор ответов, а цена одной ошибки невелика или её быстро видно.

Что стоит проверить, прежде чем верить цифрам

Модели неделя. Всё, что известно о её скорости и цене, известно от компании и первых интеграторов. Несколько вещей я бы проверил до того, как закладывать её в процесс:

  1. Вероятности на своих данных. Модель возвращает уверенность, но порог, после которого решению можно доверять, у каждой задачи свой. Разработчикам прямо советуют подбирать его на собственных примерах.
  2. Поведение под нагрузкой. Как модель ведёт себя при тысячах одновременных запросов и сохранится ли цена, об этом пишут как об открытых вопросах даже первые обзоры. Показательно и другое: в первых сторонних прогонах задержка держится у верхней границы заявленного диапазона, а в эксперименте LangChain выходит за него — около 0,44 секунды на вызов.
  3. Качество на ваших формулировках. В тестах компании эталоном служили усреднённые ответы больших языковых моделей. Это не то же самое, что разметка вашими специалистами.
  4. Зависимость от поставщика. Модель пока в раннем доступе. Вскоре после выхода появились сторонние переносы, и это хорошая новость: подход воспроизводим, привязка к одному поставщику не обязательна.

Что это меняет для руководителя

Три вывода, которые не зависят от судьбы конкретной модели.

Первый: разделяйте задачи на те, где нужен текст, и те, где нужно решение. Вторых в любом процессе больше, и они дешевле, чем кажется.

Второй: цена проверки падает быстрее цены генерации. Это меняет экономику пилотов, о которых я писал раньше: контроль, который был дороже ручной работы, становится возможным.

Третий: быстрое и дешёвое решение не отменяет ответственности. Вероятность 0,93 это не «да», это «скорее да, и семь раз из ста будет иначе». Кто-то в компании должен решить, что делать с этими семью случаями, и это решение не автоматизируется.

Jev может не стать стандартом. Но класс задач, который она обнажила, никуда не денется: решений в бизнесе больше, чем текстов, и теперь на них можно ставить дешёвый счётчик.

Источники

  1. TypeSafe launches Jev for AI decisions inside software — The Rundown AI. Дата выпуска, типы вопросов, цена и диапазон задержки, открытые вопросы о поведении под нагрузкой.
  2. What Is Jev? A Guide to TypeSafe AI's System One Model — блог LangChain. Класс System One, сценарии маршрутизации и проверки опасных вызовов, заявленные ускорение и удешевление, ограничения модели.
  3. Why Is Jev Viral? — 36Kr. Первые сторонние прогоны и упоминание переносов модели.
← Все статьи