MWS AI Vision Bench: Обновление Бенчмарка Мультимодальных Моделей
Портал PROSTO24 сообщает об значительных изменениях в MWS AI Vision Bench, бенчмарке, предназначенном для оценки мультимодальных моделей на русскоязычных документах. С момента его запуска год назад, наблюдается существенный прогресс в развитии мультимодальных моделей, что привело к необходимости обновления и расширения бенчмарка.
Эволюция MWS AI Vision Bench и Внедрение Антифрода
За прошедший год мультимодальные модели продемонстрировали значительное улучшение своих возможностей. Это привело к тому, что метрики в задачах VQA (Visual Question Answering) начали достигать своего предела, что указывает на высокую эффективность текущих моделей в данном направлении. В ответ на эти изменения и растущие потребности индустрии, разработчики MWS AI Vision Bench приняли решение о добавлении новой, критически важной задачи — Anti-fraud (антифрод).
Включение задачи антифрода в бенчмарк обусловлено её возрастающей актуальностью в различных сферах. Однако, как отмечают создатели, реализация и оценка моделей в этом направлении оказалась более сложной, чем предполагалось изначально. Это подчеркивает комплексность задачи и её значимость для дальнейшего развития и тестирования мультимодальных систем.
Обновленный MWS AI Vision Bench теперь предлагает более широкий спектр задач для всесторонней оценки современных мультимодальных моделей, уделяя особое внимание их применимости в реальных условиях, в частности, для борьбы с мошенничеством.
Интересно, насколько реалистичны эти метрики при оценке моделей в условиях реального антифрода. Часто лабораторные условия сильно отличаются от практических, где постоянно появляются новые изощренные схемы мошенничества. Не станет ли добавление антифрода лишь очередным набором данных, который модели быстро «выучат», не решая проблему по существу, а лишь адаптируясь к заданному датасету? Хотелось бы увидеть больше деталей о методологии оценки именно в динамике.