Amazon и парадокс обучения ИИ: ценность редких книг и их уничтожение
Интернет-гигант Amazon, начинавший свой путь как онлайн-книжный магазин, теперь оказался в центре внимания из-за своей практики использования редких печатных изданий для обучения своих моделей искусственного интеллекта. Недавний эксперимент подтвердил, что компания активно закупает редкие книги, которые затем, по всей видимости, подвергаются деструктивному процессу сканирования.
Деструктивный подход к ценным ресурсам
Сообщения о том, что разработчики ИИ-моделей прибегают к сканированию бумажных книг, появились в конце прошлого месяца. Эти отчеты указывали на весьма бесцеремонное обращение с изданиями, которые буквально раздираются на отдельные страницы для облегчения процесса оцифровки. Данная методика, по всей видимости, применяется и Amazon. Учитывая, что современные большие языковые модели (LLM) уже обучены на всех общедоступных онлайн-данных, редкие книги представляют собой чрезвычайно ценный и уникальный источник информации для дальнейшего совершенствования их способностей.
Поиск уникальных данных для продвинутого ИИ
Ценность редких изданий для обучения LLM заключается в их уникальности и недоступности в цифровом формате. Они содержат информацию, которая еще не была обработана существующими моделями, что позволяет значительно расширить их знания и улучшить понимание нюансов языка и контекста. Однако метод, при котором физические копии книг уничтожаются ради их цифрового двойника, вызывает вопросы о сохранении культурного наследия в эпоху стремительного развития технологий.
Очень интересно, как Amazon решает этические дилеммы, связанные с уничтожением редких книг ради обучения ИИ. Неужели нет других, менее деструктивных способов оцифровки таких ценных изданий, чтобы сохранить их для будущих поколений? Или мы должны смириться с тем, что ради прогресса приходится жертвовать материальным наследием? Хотелось бы узнать, как другие компании подходят к этой проблеме.