Новая компания в области искусственного интеллекта, Thinking Machines Lab, основанная бывшим техническим директором OpenAI Мирой Муратти, во вторник опубликовала свой первый исследовательский блог-пост, ознаменовав публичный дебют стартапа с конкретной технической работой после привлечения $2 млрд стартового финансирования в начале этого года.
Исследование, автором которого является учёный Thinking Machines Lab Хорас Хэ и которое было опубликовано в новом блоге компании «Connectionism», посвящено одной из распространённых проблем современных систем ИИ: неспособности крупных языковых моделей давать стабильные ответы на идентичные вопросы.
Определение корня непоследовательности искусственного интеллекта
Пост под названием «Побеждая недетерминизм в выводе LLM» бросает вызов распространённому мнению о том, что случайность ИИ возникает из-за параллельной обработки на графических процессорах. Он утверждает, что истинная причина заключается в том, как происходят оркестрация GPU-ядр — небольших программ, которые выполняются внутри чипов NVIDIA — во время вывода ИИ.
Согласно исследованиям автора, ИИ-системы выдают разные ответы на идентичные запросы не столько из-за особенностей выборки или параллельных потоков, сколько из-за отличий в порядке выполнения операций с плавающей запятой при различных размерах пакетов. Когда сервер вывода ИИ обрабатывает запросы, количество одновременных обращений влияет на последовательность базовых математических операций, что приводит к различным, но корректным с численной точки зрения результатам.
Исследователь продемонстрировал это явление, используя модель Qwen с 235 миллиардами параметров. Он сгенерировал 1 000 завершений при одинаковых настройках температуры и получил 80 уникальных ответов, причем расхождения начали появляться на 103-м токене. Большинство завершений содержали «Куинс, Нью-Йорк», в то время как восемь раз модель сгенерировала «Нью-Йорк», описывая место рождения физика Ричарда Фейнмана.
Предлагаемые решения для корпоративного ИИ
В своей работе Хе предлагает сделать AI-ядра «инвариантными к пакетной обработке», поддерживая единый порядок редукции вне зависимости от количества одновременно обрабатываемых запросов. Такой подход требует изменений в трех ключевых операциях трансформеров: RMSNorm, матричное умножение и механизм внимания.
Лаборатория опубликовала демонстрационный код, показывающий детерминированный вывод, работающий поверх vLLM — открытой платформы для инференса. Первоначальные тесты производительности показали, что детерминированный подход работает примерно на 60% медленнее стандартных конфигураций, хотя исследователи отмечают, что их реализация не оптимизирована по скорости. Помимо корпоративных приложений, требующих воспроизводимых ответов, Хе полагает, что исследования могут улучшить обучение с подкреплением, устранив числовые различия между фазами сэмплирования и обучения, что потенциально может сделать обучение AI-моделей более эффективным.
Новейшая исследовательская лаборатория ИИ в Кремниевой долине
Лаборатория Thinking Machines вышла из режима секретности в июле, когда Мурати объявила о рекордном инвестиционном раунде на 2 миллиарда долларов, возглавленном Andreessen Horowitz. В этом раунде, который оценивает компанию в 12 миллиардов долларов, участвовали также крупнейшие технологические компании, включая NVIDIA, AMD, Cisco и ServiceNow.
Команда компании в основном состоит из бывших исследователей OpenAI, среди которых Джон Шульман, участвовавший в создании ChatGPT, и Барретт Зоф, бывший глава отдела исследований OpenAI. Почти две трети первоначального коллектива пришли из предыдущего места работы Мурати.
Мурати, которая короткое время занимала должность временного генерального директора OpenAI во время кризиса руководства в ноябре 2023 года, а затем покинула компанию в сентябре 2024 года, позиционирует Thinking Machines Lab как компанию, создающую «мультимодальный ИИ, взаимодействующий с миром так, как это делают люди естественным образом». В ближайшие месяцы компания планирует выпустить свой первый продукт со значительным компонентом с открытым исходным кодом, рассчитанным на исследователей и стартапы, разрабатывающие собственные модели.
«Мы считаем, что наука становится лучше, когда делится», — говорится на сайте компании, где она обещает регулярно публиковать технические блоги, статьи и исходный код. Это резко отличается от всё более закрытого подхода OpenAI к обмену результатами исследований по мере роста компании и её коммерциализации.
Комментариев нет:
Отправить комментарий