Темы

среда, 11 февраля 2026 г.

DeepSeek начал развёртывание обновления своей флагманской модели

Китайский ИИ-стартап DeepSeek начал развёртывание обновления своей флагманской модели в среду, оно расширяет контекстное окно со 128 000 токенов до более одного миллиона токенов, что знаменует почти десятикратное увеличение объёма текста, который система может обработать в рамках одного взаимодействия. Обновление, доставленное через версию приложения 1.7.4, также обновляет базу знаний модели до мая 2025 года.

Обновление, похоже, является предшественником долгожданной модели DeepSeek V4. Авторские тесты показали, что модель идентифицирует себя как «финальную эволюционную форму серии V3» или «финальную тестовую версию перед официальным выходом V4», сообщает Futunn News. Отраслевые аналитики ожидают запуска V4 около 17 февраля, что совпадает с празднованием Лунного Нового года.

Технические улучшения свидетельствуют о готовности V4

Согласно отчету Nomura Securities, опубликованному 10 февраля, возможности новой версии теперь соответствуют ведущим проприетарным моделям, включая Gemini 3 Pro и Kimi K2.5. Инвестиционная компания отметила, что в V4 ожидается внедрение двух инновационных архитектур: mHC (Manifold Constrained Hyper-Connection) и Engram, которые оптимизируют стабильность обучения и эффективность использования памяти.

По данным внутренних тестов, производительность V4 в написании кода превосходит как модели Claude от Anthropic, так и серию GPT от OpenAI. Расширенное контекстное окно позволяет разработчикам обрабатывать целые кодовые базы в одном запросе — возможность, которая называется ключевым преимуществом для корпоративного использования.

Zhipu AI представила GLM-5 с архитектурой DeepSeek

В параллельном развитии событий пекинская компания Zhipu AI выпустила свою модель GLM-5 в среду, усилив конкуренцию накануне праздничного периода. Компания, оцениваемая примерно в $18 миллиардов и ставшая первым крупным мировым разработчиком больших языковых моделей, вышедшим на биржу, заявила, что GLM-5 приближается по результатам тестов программирования к Claude Opus от Anthropic.

GLM-5 использует архитектуру V3 от DeepSeek, включая механизм разреженного внимания (Sparse Attention) и технологию предсказания нескольких токенов, согласно технической документации, обнаруженной в коммитах кода на GitHub. Модель содержит 745 миллиардов параметров в конфигурации Mixture of Experts с 44 миллиардами активных параметров на один вывод.

«DeepSeek стал для нас тревожным звонком», — написал сооснователь и главный научный специалист по ИИ Тан Цзе во внутренней записке после IPO Zhipu в Гонконге в прошлом месяце, сообщает Bloomberg.

Гонка ИИ-вооружений к Празднику весны

Одновременные релизы подчеркивают ускоряющиеся темпы развития ИИ в Китае, где множество компаний соперничают за доминирование. Модель генерации видео Seedance 2.0 от ByteDance была запущена на прошлой неделе, а Kimi K2.5 от Moonshot AI теперь лидирует в рейтингах открытых моделей. Ожидается, что Alibaba также выпустит Qwen 3.5 во время праздничного периода.

Акции Zhipu выросли более чем на 50 процентов на этой неделе после того, как JPMorgan начал их освещение, а GLM-5 был впервые выпущен в выходные.


Комментариев нет:

Отправить комментарий

Избранные

Квантовый компьютер на захваченных ионах моделирует физику частиц с помощью кубитов и фононов

Учёные из Университета Мэриленда впервые использовали колебательные фононные моды захваченных ионов как нативный бозонный регист...

Часто просматриваемве