ByteDance укрепляет позиции в сфере ИИ-разработок
Китайский технологический гигант ByteDance, широко известный как создатель социальной сети TikTok, активно инвестирует в разработку собственных передовых моделей искусственного интеллекта. Компания демонстрирует амбициозные планы, создавая ИИ-модели, которые могут соперничать с лидерами отрасли.
Собственные разработки и масштабы
По информации издания Financial Times, специалисты ByteDance работают над созданием ИИ-моделей, обладающих впечатляющим объемом в 10 триллионов параметров. Этот показатель приближает разработки ByteDance к уровню передовых моделей, таких как Anthropic Mythos, подчеркивая серьезность подхода компании к собственным исследованиям в области ИИ. В отличие от многих конкурентов, ByteDance делает ставку на оригинальные разработки, избегая практики дистилляции или адаптации уже существующих моделей.
Запрет на дистилляцию моделей конкурентов
Основатель ByteDance ввел строгий запрет для своих исследователей на использование методов дистилляции моделей, разработанных конкурирующими зарубежными компаниями. Это решение обусловлено, в частности, нарастающей геополитической напряженностью между Вашингтоном и Пекином. Примечательно, что ByteDance не фигурирует в числе компаний, которых американские ИИ-лидеры, такие как Anthropic и OpenAI, обвиняют в несанкционированном использовании своих технологий – практика, которая уже вызвала угрозы новых санкций со стороны США.
Такая стратегия позволяет ByteDance не только развивать уникальные технологии, но и минимизировать потенциальные правовые и политические риски, одновременно укрепляя свой суверенитет в области ИИ-технологий.
Интересно, что ByteDance пошли по пути создания своих моделей с нуля. Я сам сейчас активно экспериментирую с локальными моделями, и могу сказать, что дистилляция часто дает довольно посредственные результаты, особенно если исходная модель была заточена под другие задачи. Запрет на дистилляцию, конечно, усложняет жизнь разработчикам, но зато конечный продукт будет более оригинальным и, возможно, эффективным. Из минусов – это огромные ресурсы и время. Мой совет: если работаете с небольшими датасетами, лучше сфокусироваться на fine-tuning, а не на попытках дистиллировать гигантов.