Тестирование моделей ИИ на одной карте: Ornith-1.5 и Qwen3.8

Специалисты PROSTO24 провели серию интенсивных тестов, направленных на оценку производительности различных квантованных моделей искусственного интеллекта на одной видеокарте. Основной целью исследования было определение оптимальных конфигураций для локального развертывания языковых моделей и оценка целесообразности приобретения будущих высокопроизводительных карт, таких как RTX 5090, для домашних пользователей.

Методология и результаты тестирования 18 конфигураций

В рамках первого этапа исследования было протестировано 18 различных конфигураций. Этот процесс включал оценку трех различных моделей ИИ, для каждой из которых применялось от пяти до шести вариантов квантования (Q5/Q6). Все конфигурации были подвергнуты одному и тому же набору из 22 реальных практических задач. Предварительные результаты показывают, что модели с квантованием 9B и Q5/Q6 демонстрируют достаточную производительность для большинства повседневных задач, что ставит под вопрос немедленную потребность в таких флагманских решениях, как RTX 5090, для рядовых пользователей.

Сравнение DeepSeek V4 Flash с Ornith1.5-35B и Qwen3.8-27B

Дальнейшее изучение производительности локально размещенных моделей продолжилось сравнением DeepSeek V4 Flash с Ornith1.5-35B и Qwen3.8-27B. В предыдущих тестах Qwen3.8-27B сравнивался с DeepSeek V4 Flash через API. Актуальный этап исследования сосредоточился на оценке DeepSeek, запущенного на той же карте, но с урезанием до 2 бит квантования.

  • DeepSeek V4 Flash (2-бит): 0.697 балла
  • DeepSeek V4 Flash (полная точность): 0.731 балла

Разница в 0.034 балла между 2-битной версией и версией с полной точностью вызывает вопросы о реальной «цене» квантования и возможной роли шума в полученных данных. Эти результаты подчеркивают важность тщательной оценки компромиссов между производительностью и эффективностью при выборе квантованных моделей для локального использования.