Темы

воскресенье, 27 сентября 2026 г.

Оксфорд предоставил OpenAI доступ к текстам Бодлианской библиотеки для обучения ИИ

Оксфорд предоставил OpenAI доступ к текстам Бодлианской библиотеки для обучения ИИ

Оксфордский университет предоставил OpenAI доступ к историческим материалам из фондов Бодлианской библиотеки для обучения моделей искусственного интеллекта, лежащих в основе ChatGPT. О сотрудничестве публично объявили в марте 2025 года, однако первоначальные сообщения сторон не уточняли, что оцифрованные материалы предполагается использовать не только для расширения доступа к редким источникам, но и для пополнения обучающих наборов данных OpenAI.

Информация об этом стала известна из внутренних документов Оксфорда, полученных газетой The Guardian  по запросу о свободе информации. В протоколах встреч среди целей проекта прямо упоминалось «пополнение обучающего набора OpenAI знаниями, использующими данные, недостаточно представленные в открытом интернете».

Партнёрство с нераскрытым элементом

В марте 2025 года Оксфорд объявил  о сотрудничестве с OpenAI как о программе по оцифровке редких исторических текстов и расширению доступа к ним для студентов и исследователей. Публично проект подавался прежде всего как инициатива по сохранению и цифровому распространению библиотечных коллекций.

Однако в официальных заявлениях того времени не говорилось, что часть оцифрованного массива будет использоваться для обучения ИИ-моделей OpenAI. Именно этот аспект стал предметом вопросов со стороны сотрудников университета и наблюдателей: для библиотеки оцифровка означает сохранение и публикацию культурного наследия, тогда как для разработчика генеративного ИИ это также означает получение качественного, структурированного и сравнительно редкого текстового корпуса.

Согласно внутренним материалам, к июню 2025 года Бодлианская библиотека передала OpenAI около 125 000 отсканированных изображений исторических диссертаций. В их числе — докторские работы европейских и американских университетов XIX и XX веков.

Помимо диссертаций, в рамках программы оцифровывались и другие коллекции:

- около 10 000 «броадсайд-баллад» XVI века — печатных листов с текстами песен и музыкальными записями, которые в тюдоровской Англии распространялись среди широкой публики;
- материалы, связанные с возможной оцифровкой рабочих записных книжек Дороти Ходжкин, нобелевского лауреата по химии, сыгравшей ключевую роль в определении структуры пенициллина;
- ирландские государственные документы XVIII века.

Такие архивы особенно ценны для обучения языковых моделей, поскольку в открытом интернете исторические, региональные и специализированные источники представлены значительно хуже, чем современный англоязычный контент. Они могут содержать редкую лексику, старые формы написания слов, научную и административную терминологию, сведения о культурной и интеллектуальной истории разных эпох.

Опасения сотрудников

Внутренние протоколы Оксфорда показывают, что сотрудничество с OpenAI вызывало опасения у части сотрудников, включая членов управляющего комитета Бодлианской библиотеки.

Среди поднятых вопросов назывались:

- возможный репутационный ущерб университету из-за сотрудничества с крупной ИИ-компанией;
- экологическая цена развития генеративного ИИ, поскольку обучение и эксплуатация крупных моделей требуют значительных вычислительных мощностей и электроэнергии;
- риски, связанные с использованием ChatGPT в университетской работе;
- возможность непреднамеренной передачи в ИИ-сервисы конфиденциальной или чувствительной информации.

Во внутреннем аудиторском отчёте Оксфордского университета отдельно отмечалось, что использование аккаунтов ChatGPT в рабочих целях может случайно раскрыть чувствительные данные. Авторы документа характеризовали это как потенциальный юридический и репутационный риск.

Эти вопросы выходят за рамки одного соглашения между университетом и технологической компанией. Университеты, библиотеки и архивы всё чаще сталкиваются с двойственной природой ИИ-партнёрств: цифровизация может сделать редкие фонды доступными для миллионов людей, но одновременно она создаёт новые вопросы о прозрачности, контроле над данными, экологической нагрузке и коммерческом использовании культурного наследия.

Позиция Оксфорда

Представитель Оксфорда отверг утверждения о том, что использование материалов в обучении моделей скрывали от сотрудников. По его словам, сотрудники открыто говорили о двойной цели программы — оцифровке коллекций и использовании материалов для развития ИИ.

Оксфорд также подчеркнул несколько условий сотрудничества:

- объём передаваемого материала назван сравнительно небольшим;
- все оцифрованные источники находятся в общественном достоянии и не защищены авторским правом;
- OpenAI не получает эксклюзивных прав на использование этих материалов;
- Бодлианская библиотека сохраняет права на созданные цифровые сканы;
- библиотека планирует опубликовать материалы в интернете в ближайшие месяцы.

Последний пункт важен: если сканы действительно будут открыто размещены, общественность, исследователи и другие организации смогут использовать те же источники, а не только OpenAI. Тем не менее доступ к исходным цифровым копиям и использование этих копий для обучения коммерческой ИИ-системы — не одно и то же. Возможность свободно читать или скачивать исторические документы не обязательно отвечает на вопрос, на каких условиях их можно включать в закрытые обучающие наборы данных.

Часть более широкого тренда

Оксфорд является единственным британским участником NextGenAI — поддерживаемого OpenAI консорциума из 15 организаций. В него входят, в частности, Массачусетский технологический институт, Калифорнийский технологический институт и Бостонская публичная библиотека.

Инициативу NextGenAI запустили в марте 2025 года. Она предусматривает 50 миллионов долларов в виде исследовательских грантов, вычислительных ресурсов и других форм поддержки для академических и культурных институций.

Соглашение с Бодлианской библиотекой отражает более широкий процесс, происходящий в индустрии генеративного ИИ. Разработчики крупных языковых моделей стремятся находить новые массивы качественного текста, особенно созданного людьми и не представленного в достаточном объёме в интернете. Это становится всё важнее по мере того, как сеть заполняется автоматически сгенерированным контентом: обучение новых моделей на материалах, уже созданных другими ИИ, может ухудшать качество данных и усиливать ошибки, повторы и искажения.

Конкуренты OpenAI также ищут доступ к физическим и архивным источникам. Anthropic, один из основных соперников компании, по данным СМИ, потратил десятки миллионов долларов на приобретение и разрушительное сканирование бумажных книг — страницы отделялись от переплёта, чтобы их можно было быстро обработать на высокопроизводительном оборудовании и использовать для обучения моделей.

Аргументы OpenAI

Представитель OpenAI заявил, что компания «гордится» участием в проектах, которые помогают сохранить историческое знание для будущего. По его словам, при аудитории более одного миллиарда пользователей особенно важно, чтобы ИИ-модели отражали разные культуры, исторические периоды и точки зрения.

Этот аргумент указывает на реальную проблему современных языковых моделей: их знания нередко непропорционально основаны на современном, англоязычном и широко доступном интернет-контенте. Добавление исторических документов, редких библиотечных коллекций и материалов из разных культурных контекстов потенциально может сделать ответы ИИ более разнообразными и менее зависимыми от ограниченного набора цифровых источников.

Однако критики подобных соглашений считают, что культурные и академические институции должны максимально ясно объяснять обществу, когда цифровизация коллекций одновременно служит целям сохранения наследия и коммерческого обучения ИИ. Для университетов здесь возникает баланс между открытым доступом к знаниям, научным сотрудничеством, финансовыми и технологическими возможностями партнёров, а также ответственностью перед сотрудниками, исследователями и обществом.

Случай Оксфорда показывает, что вопрос об обучающих данных для ИИ постепенно выходит за пределы споров об авторском праве. Теперь он касается и архивов, библиотек, музейных коллекций, научных записей и других источников, которые формально могут находиться в общественном достоянии, но обладают высокой исторической, научной и культурной ценностью.


Комментариев нет:

Отправить комментарий

Избранные

Наночастицы с «троянским конём» из морских водорослей помогают снять фиброзный барьер опухолей и усилить иммунотерапию

Наночастицы с «троянским конём» из морских водорослей помогают снять фиброзный барьер опухолей и усилить иммунотерапию Наноч...

Часто просматриваемве