Jev 模型实测:用于 RAG 重排、内容审核与实时事件响应
Original title: Юзкейсы Jev: улучшение RAG, Browser Use, ...Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно).В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.Я уже успел провести эксперименты с Jev в одном из своих продуктов:1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это прям крутая возможность быстро выцепить релевантные ТОП 10 результатов и отдать их агенту как есть без лишни
The title and summary in the selected language are awaiting translation.
作者在自家产品中实测了 Jev 模型,它通过 Choice 选择答案、Noul 二选一作答并给出各选项概率,特点是并行生成、速度快且便宜。
The full text in the selected language is awaiting translation. The original is shown for now.
Юзкейсы Jev: улучшение RAG, Browser Use, ...
Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно).
В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.
Я уже успел провести эксперименты с Jev в одном из своих продуктов:
1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это прям крутая возможность быстро выцепить релевантные ТОП 10 результатов и отдать их агенту как есть без лишних шагов на progressive disclosure.
2. Внутри чатбота в качестве модератора: против gpt-oss-120b (быстрой версии) получилось примерно в 5 раз быстрее и в 5 раз дешевле при том же качестве.
Что я понял пока ее настраивал? То, что ее надо настраивать, промптить. Вот так с ходу трудно сразу получить хороший результат. Например, в моем кейсе с реранкингом лучше всего себя показал вариант с Choice на каждый результат (запросы отлично параллеляться) + отточенный промпт.
Причем эксперименты, надо сказать, проходят очень быстро, в отличие от стандартных LLM.
Что еще интересного делают с Jev? Browser Use уже запили скилл для очень быстрых оптимизаций в браузере - супер полезная штука для всех вайб кодеров и агентных инженеров: ускорение feedback loop на финальном этапе это отлично.
Классный кейс Jev - применение в около real-time сценариях, когда нужна реакция на какое-либо событие: например, на встречах AI-помощник с live транскрибацией, которая каждую секунду отправляется в Jev и тот определяет какой tool call сделать. Т. е. это кейс с продвинутыми голосовыми агентами, которые просто слушают и как-то реагируют когда сочтут нужным (Jev ответит true). То есть, можно надежно и дешево собирать что-то типа ElevenLabs Agent.
За сущие копейки можно делать сервисы типа trigify.io, которые отслеживают определенные события/сообщения в чатах и сообщают вам если появилось что-то релевантное.
Еще, у нас в чатике канала обсуждали кейс с выбором оптимальной модели для оркестрации - в целом, если достаточно подробно формализовать критерии, то должно неплохо работать.
Если вы уже попробовали Jev - расскажите про свои кейсы и результаты. Кстати, Jev уже появился в Vercel AI Gateway - что очень удобно.
Upd: Моделька появилась в OpenRouter - https://openrouter.ai/typesafe/jev-1.13
@ai_driven
Source: AI-Driven Development · Родион Мостовой · t.me