Новые подходы к оценке LLM: создание бенчмарков с участием ИИ
В условиях постоянно растущего выбора больших языковых моделей (LLM) традиционные рейтинги часто не предоставляют достаточной информации о том, как конкретная модель справится с уникальными задачами пользователя и какова будет стоимость её эксплуатации. Это подталкивает исследователей и компании к разработке собственных, более релевантных бенчмарков.
OenoBench: глубокая оценка знаний LLM о вине
Один из таких проектов, OenoBench, был разработан для измерения глубины знаний LLM о вине. Этот масштабный бенчмарк включает 38 104 факта из открытых источников и 3 266 вопросов с вариантами ответов, по которым были протестированы шестнадцать различных моделей. Уникальность подхода заключается в активном использовании ИИ-агентов на каждом этапе создания бенчмарка:
- Генерация кода: Проект использовал Claude Code для написания необходимого программного обеспечения.
- Генерация вопросов: Пять языковых моделей отвечали за создание вопросов.
- Аудит и проверка: Десять агентов аудита проверяли сгенерированные вопросы на корректность.
Человеческое участие в этом процессе было минимальным, сосредоточенным на экспертизе в области вина. Общие затраты на API составили около 800 долларов США. В ходе проекта были выявлены интересные проблемы, такие как «гарантированный fallback» из памяти модели для 17 из 35 скраперов, а также неточности в оценках, когда три LLM-судьи из разных компаний пришли к единому, но ошибочному выводу. Исследование также показало, что самые сложные вопросы, сгенерированные моделями, часто оказывались наиболее некорректными.
Корпоративные бенчмарки: адаптация LLM под внутренние задачи
Помимо специализированных бенчмарков, таких как OenoBench, компании также разрабатывают внутренние системы оценки для выбора оптимальной LLM для своих нужд. В одном из случаев лаборатория столкнулась с необходимостью выбрать модель для ИИ-ассистента, работающего с их электронной лабораторной базой данных. Поскольку публичные рейтинги не могли дать ответ на специфические вопросы, был создан собственный бенчмарк из двадцати четырёх вопросов, основанных на реальных рабочих процессах. Этот тест прогонялся на моделях DeepSeek, ChatGPT и Claude, оценивая девятнадцать комбинаций моделей и уровней усилий при рассуждении в примерно 450 прогонах. Такой подход позволяет точно определить, какая модель наилучшим образом соответствует конкретным корпоративным задачам и требованиям к производительности.
Очень интересно, как LLM сами участвуют в создании бенчмарков. Меня особенно заинтриговал OenoBench и проблемы с «гарантированным fallback» и неточностями от LLM-судей. Хотелось бы понять, как именно можно было бы улучшить процесс аудита, чтобы избежать таких коллективных ошибок ИИ. И как, по вашему мнению, можно применить этот опыт при создании бенчмарков для более сложных, менее структурированных данных, чем факты о вине?