Сравнение ведущих ИИ-моделей сентября

В последние недели три ключевые лаборатории – xAI, Anthropic и DeepSeek – представили обновленные версии своих моделей искусственного интеллекта. В то же время, OpenAI выпустила GPT-6 Astra, а Anthropic обновила Claude Fable 5.1, при этом указывая на Claude Opus 5 как на основную модель для большинства задач.

Анализ производительности и стоимости

Сравнение этих новых моделей, включая Grok 4.7, Claude Opus 5.5 и DeepSeek V4.1 Flash, проводится на основе независимых замеров, анализа стоимости выполнения идентичных задач и доступности для пользователей из России. Важно отметить, что китайские лаборатории, такие как Qwen3.8 Max и Kimi K3, теперь конкурируют с ведущими западными моделями. Например, Qwen3.8 Max стоит аналогично Grok – $2 и $6 за миллион токенов, отставая лишь на один балл по общему индексу. Kimi K3 демонстрирует сопоставимую производительность с новым Grok в повседневных инженерных задачах.

Независимый анализ производительности, проведенный Artificial Analysis, выявляет значительные расхождения с данными, заявленными лабораториями, в частности, на Terminal-Bench, где разница может достигать полутора раз. Это подчеркивает необходимость полагаться на объективные метрики при оценке эффективности моделей в таких областях, как длинный код, работа с терминалом, схемы, юридические документы и расчеты.