Тестирование Jev в задачах классификации товаров
В сфере классификации товаров по обширным справочникам, таким как ОКТРУ, стадия реранкинга является одной из наиболее ресурсоемких. После первоначального отбора 30 кандидатов поисковой системой, традиционно используется большая языковая модель (LLM) для выбора финального, наиболее релевантного элемента. Недавние исследования PROSTO24 с участием модели TypeSafe Jev показывают, что этот критически важный этап может быть оптимизирован без ущерба для точности.
Jev, отличающаяся тем, что не генерирует текст, а возвращает вероятности на основе входного состояния и типизированных вопросов, была протестирована как альтернатива LLM-реранкерам. Измерения проводились на наборе из 928 позиций технических спецификаций государственных закупок, используя один и тот же пул кандидатов для сравнения. В качестве конкурентов выступали различные LLM, включая gpt-oss-120b (с рассуждениями и без), Gemma-4-31B, Gemini 3.5 Flash Lite, 3.8 Flash и 3.1 Pro, а также классический кросс-энкодер Qwen3-Reranker-8B.
Результаты производительности и стоимости
Тестирование показало, что Jev демонстрирует отличную точность, сопоставимую с показателями крупных языковых моделей. При этом ее стоимость и задержка (латенси) находятся на уровне небольших 8B-моделей, что делает ее крайне привлекательным решением для оптимизации пайплайнов классификации.
Дополнительные проверки и применение Jev
Модель Jev также прошла проверку на открытых и внутренних данных, включая 16 000 вызовов. Сравнение с gpt-5.4-mini и gpt-5.6-luna на четырех открытых датасетах, а затем на тысячах реальных решений в рабочих процессах, подтвердило ее эффективность. Jev, отвечающая только «да/нет» или выбирающая один из предложенных вариантов, оказалась особенно полезной в задачах, требующих бинарных или многовариантных классификаций. Эти результаты подчеркивают потенциал Jev как мощного инструмента для повышения эффективности и снижения затрат в системах, где требуется точная и быстрая классификация без генерации текста.
Использование Jev для реранкинга в задачах классификации товаров по ОКТРУ представляет собой значительный прорыв. Сопоставимая точность с крупными LLM, такими как gpt-oss-120b, при стоимости и задержке на уровне 8B-моделей, кардинально меняет экономику пайплайнов. Отсутствие генерации текста и фокус на вероятностных оценках делают ее идеальной для бинарных и многовариантных классификаций, минимизируя галлюцинации и повышая предсказуемость.