ИИ в бизнесе
Jev: модель, которая принимает решения вместо того, чтобы писать текст
За неделю новая модель обошла отраслевые издания, соцсети и русскоязычные СМИ. Разбираю, что в ней действительно новое, а что обычная волна ожиданий.
Главное
- Jev не пишет текст, а возвращает выбор из списка, оценку или ответ да/нет с вероятностью, поэтому работает быстрее и дешевле обычных моделей
- Экономия появляется там, где в процессе много мелких повторяющихся решений: сортировка обращений, отбор перед дорогой моделью, проверка действий агента
- Цифры ускорения пока заявлены компанией, модель в раннем доступе, а пороги доверия нужно проверять на собственных данных
Что это такое
15 сентября компания TypeSafe AI выпустила модель Jev. Её основатель Диогу Алмейда раньше работал в OpenAI и участвовал в создании ChatGPT. Компания называет Jev моделью класса System One: она не генерирует текст, а принимает решения.
На вход подаются текст или состояние программы и вопрос. На выходе один из трёх типов ответа: да или нет, выбор из заданного списка, оценка по шкале. К каждому ответу прилагается вероятность. Модель не умеет писать письма, код и объяснения и не пытается: она выбирает только из того, что ей разрешили выбирать.
| Тип вопроса | Что возвращает | Пример |
|---|---|---|
| Да или нет | Вероятность утверждения | Это обращение — жалоба? |
| Выбор из списка | Один из заданных вариантов | Какому отделу передать заявку? |
| Оценка по шкале | Позицию на шкале | Насколько срочно это обращение? |
По данным компании, ответ приходит за 70–500 миллисекунд и стоит 0,042 доллара за миллион входных токенов, выходные бесплатны. Заявлено ускорение от 40 до 200 раз и удешевление до 400 раз по сравнению с обычными языковыми моделями на задачах классификации.
Почему это заметили
Большая часть работы, которую компании поручают языковым моделям, на самом деле не требует текста. Нужно решить: это письмо жалоба или запрос? Этот счёт срочный? Это действие агента безопасно? Какому специалисту передать обращение?
До сих пор такие вопросы задавали большой модели, которая писала абзац рассуждений, а программа выдёргивала из него слово «да». Это медленно, дорого и ненадёжно: модель может ответить не в том формате, добавить оговорку или придумать вариант, которого нет в списке.
Jev делает наоборот. Формат ответа задан заранее, поэтому ошибиться в формате невозможно. Скорость и цена позволяют задавать тысячи вопросов там, где раньше экономили на каждом обращении.
Дешёвое решение меняет не качество ответа, а количество мест, где вы можете себе позволить спросить.
Где это экономит деньги
Польза появляется не в одном большом сценарии, а во множестве мелких. Типичные места:
- Сортировка входящего потока. Обращения клиентов, письма, заявки, счета. Куда направить, насколько срочно, нужен ли человек.
- Фильтр перед дорогой моделью. Простые случаи закрываются дешёвым решением, к большой модели уходят только сложные. Расход на дорогую модель падает без потери качества там, где оно важно.
- Проверка действий ИИ-агентов. Прежде чем агент отправит письмо, изменит запись или нажмёт кнопку, отдельная модель оценивает, безопасно ли это. Этот сценарий разбирают как один из основных.
- Приёмка результата. Соответствует ли ответ критериям, можно ли показывать клиенту, нужно ли повторить попытку.
- Оценка риска в реальном времени. Подозрительная операция, нетипичный запрос, сигнал безопасности.
Общий признак: решение повторяется тысячи раз, у него ограниченный набор ответов, а цена одной ошибки невелика или её быстро видно.
Что стоит проверить, прежде чем верить цифрам
Модели неделя. Всё, что известно о её скорости и цене, известно от компании и первых интеграторов. Несколько вещей я бы проверил до того, как закладывать её в процесс:
- Вероятности на своих данных. Модель возвращает уверенность, но порог, после которого решению можно доверять, у каждой задачи свой. Разработчикам прямо советуют подбирать его на собственных примерах.
- Поведение под нагрузкой. Как модель ведёт себя при тысячах одновременных запросов и сохранится ли цена, об этом пишут как об открытых вопросах даже первые обзоры. Показательно и другое: в первых сторонних прогонах задержка держится у верхней границы заявленного диапазона, а в эксперименте LangChain выходит за него — около 0,44 секунды на вызов.
- Качество на ваших формулировках. В тестах компании эталоном служили усреднённые ответы больших языковых моделей. Это не то же самое, что разметка вашими специалистами.
- Зависимость от поставщика. Модель пока в раннем доступе. Вскоре после выхода появились сторонние переносы, и это хорошая новость: подход воспроизводим, привязка к одному поставщику не обязательна.
Что это меняет для руководителя
Три вывода, которые не зависят от судьбы конкретной модели.
Первый: разделяйте задачи на те, где нужен текст, и те, где нужно решение. Вторых в любом процессе больше, и они дешевле, чем кажется.
Второй: цена проверки падает быстрее цены генерации. Это меняет экономику пилотов, о которых я писал раньше: контроль, который был дороже ручной работы, становится возможным.
Третий: быстрое и дешёвое решение не отменяет ответственности. Вероятность 0,93 это не «да», это «скорее да, и семь раз из ста будет иначе». Кто-то в компании должен решить, что делать с этими семью случаями, и это решение не автоматизируется.
Jev может не стать стандартом. Но класс задач, который она обнажила, никуда не денется: решений в бизнесе больше, чем текстов, и теперь на них можно ставить дешёвый счётчик.
Источники
- TypeSafe launches Jev for AI decisions inside software — The Rundown AI. Дата выпуска, типы вопросов, цена и диапазон задержки, открытые вопросы о поведении под нагрузкой.
- What Is Jev? A Guide to TypeSafe AI's System One Model — блог LangChain. Класс System One, сценарии маршрутизации и проверки опасных вызовов, заявленные ускорение и удешевление, ограничения модели.
- Why Is Jev Viral? — 36Kr. Первые сторонние прогоны и упоминание переносов модели.