Темы

пятница, 12 сентября 2025 г.

Компания Alibaba недавно представила два значимых продукта в области ИИ

Компания Alibaba недавно представила два значимых продукта в области искусственного интеллекта — новые модели из своей серии Qwen, которые знаменуют собой значительный прогресс в производительности и эффективности.


Во-первых, была анонсирована и открыта для широкого доступа модель Qwen3-Next-80B-A3B. Эта модель обладает 80 миллиардами параметров, однако использует архитектуру "Mixture of Experts" (смесь экспертов), где во время обработки запроса активируется лишь около 3 миллиардов параметров, что значительно снижает издержки на обучение и ускоряет работу. Alibaba утверждает, что новая модель работает примерно в десять раз быстрее предыдущей Qwen3-32B и при этом её обучение стоило в десять раз меньше. Производительность Qwen3-Next-80B-A3B сравнима с флагманской моделью Alibaba Qwen3-235B, но при этом она оптимизирована для работы даже на потребительском оборудовании. Новая архитектура включает гибридный механизм внимания, объединяющий Gated DeltaNet и Gated Attention, что повысило эффективность обработки контекстов длиной более 32 тысяч токенов. Дополнительной инновацией стала стратегия многотокенного прогнозирования, ускоряющая генерацию ответов. Версия с функцией рассуждения, Qwen3-Next-80B-A3B-Thinking, показала улучшенные результаты по сравнению с Google Gemini-2.5-Flash-Thinking и предшественницей в ряде сложных тестов.


Во-вторых, компанией представлен гигант модели Qwen3-Max-Preview с более чем одним триллионом параметров. Эта модель является крупнейшей в линейке Alibaba и предназначена для сложных задач, включая рассуждения, кодирование и креативное создание текстов. Контекстное окно у Qwen3-Max достигает 262 144 токенов, что позволяет обрабатывать очень большие объемы информации за один раз. Несмотря на масштаб, модель обладает высокой скоростью отклика и эффективностью. Qwen3-Max уже доступна через API Alibaba Cloud, чатбот Qwen Chat и платформу OpenRouter, но пока не открыта для свободного скачивания. Стоимость использования оценивается примерно в $0.9 за миллион входных токенов и $3.4 за миллион выходных токенов, что существенно ниже некоторых западных конкурентов. В ближайшем будущем планируется выпустить и "думающую" версию Qwen3-Max, ориентированную на глубокие рассуждения.


Обе модели отражают стратегию Alibaba по развитию ИИ: создание мощных, но одновременно эффективных и доступных инструментов. Эти инициативы поддерживаются масштабными инвестициями в ИИ-инфраструктуру компании (около 52 миллиардов долларов на три года) и уже достигли коммерческого успеха с устойчивым ростом использования продуктов, основанных на серии Qwen.


Qwen3-Next с её открытым кодом и высокой эффективностью предназначена для широкого круга разработчиков и исследователей, а Qwen3-Max выступает флагманским коммерческим продуктом для корпоративных клиентов и сложных интеллектуальных задач. Открытый доступ к Qwen3-Next доступен через Alibaba Cloud, Hugging Face и ModelScope, тогда как Qwen3-Max предоставляется по API.


Таким образом, Alibaba демонстрирует значительный прогресс в области ИИ, предлагая инновационные архитектуры и модели, которые напрямую конкурируют с лидерами рынка, включая Google и OpenAI, и усиливают глобальную конкуренцию в сфере искусственного интеллекта. 


1. Примечание редакции блога: 


Что интересно: модель, которая имеет меньше токенов, в районе 80 млрд, способна к более глубоким рассуждениям /(по заявлению как я понял),по сравнению с моделью у которой больше триллиона токенов. 


Модель Qwen3-Next-80B-A3B при меньшем числе параметров (80 миллиардов с активными 3 миллиардами во время вычислений) использует особую архитектуру Mixture of Experts и усовершенствованные механизмы внимания, что позволяет ей эффективно фокусироваться именно на нужных частях контекста и выполнять глубокие рассуждения. Также у неё есть специальная версия "Thinking", ориентированная именно на задачи с рассуждениями.


В то время как модель Qwen3-Max с более чем триллионом параметров является огромной по объему и предназначена для обработки очень больших объемов информации, масштаб не всегда означает лучшее "понимание" или способность к комплексному мышлению. Глубокие рассуждения зависят не только от количества параметров, но и от архитектуры модели, алгоритмов её обучения, методов оптимизации и способности эффективно использовать длинные контексты.


Таким образом, архитектурные инновации и оптимизация Qwen3-Next-80B-A3B позволяют ей быть более эффективной в рассуждениях по сравнению с более массивной, но менее специализированной Qwen3-Max .


2. Однако существует некоторая путаница, так как в некоторых аналитических отчётах резюмируется информация о том что более массивная модель способна глубоким рассуждениям и это идёт как козырь. Тут явное противоречие. 

Так как один и тот же показатель в обеих моделях противопоставляется к другой модели, как наилучший. 


Попытка разжевать: 

источники часто сравнивают обе модели — Qwen3-Next-80B-A3B и Qwen3-Max-Preview — по качеству рассуждений и эффективности, но дают немного разные акценты. Это создаёт впечатление, что обе модели претендуют на роль "лучшей" с точки зрения глубокого мышления, хотя их архитектуры и назначение отличаются.


Модель Qwen3-Next-80B-A3B подчеркивается как революционная в плане сочетания высокой скорости, эффективности и способности к рассуждениям, достигаемым благодаря ультраразреженной архитектуре Mixture of Experts и гибридному вниманию (Gated DeltaNet + Gated Attention). Её преимущество — меньшие затраты, высокая пропускная способность и возможность глубоко "думать" в режиме Thinking, при этом быстро обрабатывая длинные контексты.


В то же время Qwen3-Max-Preview — это самый масштабный и мощный представитель линейки с более чем триллионом параметров, с расширенными возможностями для понимания огромных объемов данных (контекст до 262 тысяч токенов) и поддержкой режима рассуждений, который пока готов не во всех версиях, но присутствует. Она выделяется на задачах, где важна максимальная глубина, объем знаний и сложное понимание, особенно в программировании и математике.


Разница в оценках связана с тем, что:


Qwen3-Next-80B-A3B позиционируется как прорыв в эффективности и ценовой доступности ИИ с сохранением или даже улучшением качеств рассуждения, что делает её привлекательной в широком спектре задач и для более оперативной работы.


Qwen3-Max-Preview — это более классический "тяжеловес", ориентированный на самые крупные и комплексные задачи, где нужен максимальный масштаб и самый широкий контекст.


Говоря иначе, у обеих моделей есть режимы "глубокого мышления", но они используют разные технические подходы: одна — через разреженность и оптимизацию (Next-80B-A3B), другая — через масштаб и максимальный объем информации (Max-Preview).


Это не противоречие, а отражение разных инженерных решений и фокусов внутри одной линейки, где обе модели раскрывают потенциал глубокого рассуждения с разных сторон. В конечном итоге, их сравнение оценивает не только качество мышления, но и сопутствующие параметры — скорость, стоимость, масштаб и применимость к разным задачам.


Таким образом, однозначного «лучше» между ними нет — есть разные сильные стороны и сценарии использования, что и обусловливает смешанные, иногда противоположные оценки в обзорах и бенчмарках.


Вы только не смейтесь но у меня есть ещё другая публикация по этой же теме и там тоже попытка разжевать Так что жуйте за обе щеки, Вот ссылка:  https://dominatingcosmicniches.blogspot.com/2025/09/10-10.html






Комментариев нет:

Отправить комментарий

Избранные

Квантовый компьютер на захваченных ионах моделирует физику частиц с помощью кубитов и фононов

Учёные из Университета Мэриленда впервые использовали колебательные фононные моды захваченных ионов как нативный бозонный регист...

Часто просматриваемве