Архитектурные улучшения обеспечивают прирост производительности
Скачок производительности обусловлен сочетанием аппаратных достижений и непрерывной программной оптимизации. Согласно блогу разработчиков Nvidia, ядра Ultra Tensor архитектуры Blackwell обеспечивают в 1,5 раза более высокую вычислительную производительность по сравнению со стандартными GPU Blackwell, в то время как обработка слоёв внимания была удвоена благодаря ускоренному выполнению функции softmax. Эти архитектурные улучшения напрямую устраняют узкие места в слоях внимания трансформеров, от которых зависят модели рассуждений с большими контекстными окнами.
Библиотека вывода TensorRT-LLM компании демонстрирует стабильный рост производительности за последние месяцы: по данным тестов SemiAnalysis, пропускная способность на GPU удвоилась на некоторых уровнях интерактивности с октября 2025 года. Сочетание аппаратных и программных усовершенствований обеспечило то, что Nvidia описывает как 10-кратное увеличение количества токенов в секунду на пользователя и 5-кратное улучшение показателя токенов в секунду на мегаватт по сравнению с Hopper, что в совокупности даёт 50-кратный рост производительности ИИ-фабрик.
«По мере того как вывод становится центральным элементом производства ИИ, производительность при работе с длинным контекстом и эффективность обработки токенов приобретают критическое значение», — заявил Чен Голдберг, старший вице-президент по инжинирингу в CoreWeave. «Grace Blackwell NVL72 напрямую решает эту задачу».
Масштабирование развертываний облачными провайдерами
Крупные облачные провайдеры оперативно развернули инфраструктуру GB300 NVL72. В 2025 году CoreWeave объявила, что стала первым облачным провайдером для ИИ, развернувшим эти системы в промышленной эксплуатации, интегрировав их со своим облачным стеком на базе Kubernetes. Microsoft развернула то, что компания назвала первым в мире крупномасштабным суперкомпьютерным кластером GB300 NVL72, достигнув производительности более 1,1 миллиона токенов в секунду на одной стойке в ходе тестирования, подтвержденного Signal65.
Платформа OCI компании Oracle также развертывает системы GB300 NVL72 с планами масштабирования своих Superclusters до более чем 100 000 графических процессоров Blackwell для удовлетворения растущего спроса на рабочие нагрузки вывода.
Токен-экономика меняет бизнес-модели ИИ
Снижение затрат может кардинально изменить экономику развертывания ИИ. Ведущие провайдеры инференса, включая Baseten, DeepInfra, Fireworks AI и Together AI, сообщили о сокращении расходов до 10 раз при использовании стандартной платформы Blackwell. Платформа Blackwell Ultra усиливает эти преимущества для задач, требующих низкой задержки, а снижение стоимости на 35 раз за миллион токенов делает экономически оправданным массовое развертывание ИИ-агентов и ассистентов для программирования.
Nvidia уже представила предварительную информацию о дальнейших улучшениях со своей платформой следующего поколения Rubin, которая, по заявлению компании, обеспечит еще одно 10-кратное повышение производительности по сравнению с Blackwell.
Комментариев нет:
Отправить комментарий