System One · Jev · Artificial Intelligence · Model Testing · LLM · Classification · OpenAI1 октября в 16:34 · 4 мин

Точность, калибровка и цена: реальные данные о модели Jev от System One

В сентябре 2026 года было проведено масштабное тестирование модели классификации Jev-1.13.0, охватившее более 160 тысяч запросов. Результаты показывают, что System One достигает точности, сопоставимой с лучшими небольшими моделями OpenAI (gpt-4.1-mini), но работает в 2,4 раза быстрее и в пять раз дешевле. Ключевое преимущество системы кроется не в абсолютной точности, а в качественной калибровке уверенности: пороговые значения confidence у Jev позволяют надежно отсеивать ошибки, в то время как у генеративных аналогов этот механизм часто оказывается неработоспособным.

# Точность, калибровка и цена: реальные данные о модели Jev от System One

Эффективное использование искусственного интеллекта требует понимания не только заявленных метрик, но и реальных границ доверия к системе. В конце сентября 2026 года сообщество получило подробный отчет о результатах комплексного тестирования модели jev-1.13.0 от вендора System One. Исследование, проведенное в период с 19 по 30 сентября, включало серию из 22 экспериментов и обработку порядка 160 тысяч запросов. Тесты сравнили производительность Jev с контрольными моделями OpenAI (gpt-4.1-nano, gpt-4.1-mini и gpt-5-mini) в условиях раннего доступа к API.

Сравнение эффективности и стоимости

Основной вывод исследования однозначен: Jev предлагает баланс, который для задач классификации является наиболее экономически обоснованным. На тестовом наборе из 10 банковских классов модель показала точность 97,8%, став лучшей среди протестированных систем. Если сравнивать с ближайшим конкурентом gpt-4.1-mini (точность 93,5%), Jev демонстрирует статистически значимое превосходство.

Однако главная ценность системы раскрывается при увеличении сложности задачи. В эксперименте с расширенным набором данных MASSIVE, содержащим 30 классов и более 2400 примеров, различия в точности между моделями сгладилось до минимальных величин, которые сложно отличить от случайных колебаний (разница составила всего +0,2 п.п.). Тем не менее, операционные метрики оставались на уровне Jev:

* Скорость: Jev отвечает примерно в 2,4 раза быстрее, чем аналогичные модели от OpenAI. * Стоимость: Стоимость обработки через Jev в 5 раз ниже.

Важно отметить архитектуру затрат модели: плата взимается только за входные токены ($0,042 за миллион), обработка выхода бесплатна. Несмотря на то, что Jev потребляет вдвое больше токенов на запрос из-за необходимости пересылки описаний классов, общая стоимость остается минимальной. Также стоит учитывать особенность подсчета токенов: система чувствительна к языку входных данных, где русский текст оценивается примерно втрое дороже английского.

Калибровка уверенности: ключевое отличие от LLM

Самый важный технический вывод исследования касается индикатора уверенности (confidence). Для систем классификации критично понимать, когда модель ошибается, чтобы перенаправлять такие запросы на дополнительную проверку или в работу с оператором.

При сравнении с gpt-4.1-mini стало очевидно: у генеративных моделей уверенность часто не коррелирует с фактической точностью. В эксперименте с порогом 0,9 (где ответы выше этого значения отправляются в «автопоток» без проверки), ошибки гpt-4.1-mini совершались в 83% случаев с высокой уверенностью. То есть, автоматический роутинг на основе значений confidence практически не работал для отсеивания ошибок.

Напротив, модель Jev демонстрирует отличную калькуляцию рисков. Тот же порог в 0,9 позволял Jev отсечь 71% ошибок, отправив их на ручной разбор. Хотя сам коэффициент confidence не является прямой вероятностью (его формула зависит от количества классов), практическая калибровка системы позволяет строить надежные автоматические роутинговые правила.

Однако исследователи предупредили о важном нюансе: абсолютная величина порога универсальна не является. Порог, сработавший хорошо на одной схеме с 10 классами, может быть бесполезен на схеме с 30 или более классами. Добавление новых категорий увеличивает неопределенность и заставляет модель чаще ошибаться на добавленных классах, что искусственно повышает confidence на пропущенных вариантах. Поэтому настройку порогов необходимо проводить отдельно для каждой конкретной схемы классов.

Особенности работы и ограничения

Исследование выявило ряд специфических характеристик, которые стоит учитывать при интеграции Jev в продукты:

1. Влияние описаний классов: Качество естественного языка, описывающего каждый класс, влияет на результат сильнее, чем выбор конкретной метки. Система эффективно использует семантическое содержание инструкций. 2. Чистота ввода: Модель крайне чувствительна к посторонним текстам и «грязи» во входных данных. В отличие от генеративных моделей, которые могут терять контекст в середине длинного текста (lost in the middle), Jev реагирует на посторонние элементы в самом начале запроса. Наличие явного класса "other" (другое) значительно повышает точность фильтрации. 3. Масштабирование: Загрузка 40 вопросов вместо одного существенно не увеличивает время ответа, делая обработку сложного контекста эффективной. При этом добавление новых классов требует пересмотра порогов уверенности. 4. Типы задач: Jev предназначен исключительно для структурированных ответов (классификация, оценка, да/нет) и не подходит для генерации текста, обоснования решений или рассуждений.

Как отметил автор исследования, данные по точности привязаны к конкретной версии и дате замеров, однако выявленные закономерности относительно калибровки и чувствительности к входным данным являются наиболее ценными выводами для разработчиков. Система доказала свою способность стать надежным фундаментом для автоматизации рутиных задач классификации, при этом предлагая инструменты контроля качества, недоступные стандартным LLM.

*Материал подготовлен на основе данных тестирования, проведенного в период 19–30 сентября 2026 года. Все финансовые показатели и метрики производительности относятся к условиям раннего доступа API.*

Первоисточники

Habr AI ↗
← Вернуться в эфир