Qwen запустили на GTX 1080 Ti с 125 млрд параметров
DeepSeek опубликовала руководство по запуску мультимодальной MoE-модели Qwen3.8-Flash-Next на старом игровом GPU с 11 GB памяти. Модель содержит 125 млрд параметров в основной части плюс 51 млрд параметров в embedding-таблицах, на каждый токен активируется около 6 млрд параметров.
Архитектура использует 512 экспертов MoE, из которых на токене выбираются 10 маршрутизируемых экспертов плюс shared expert, нативный контекст составляет 256K токенов. Публикация показывает, что большие модели можно запускать на потребительском оборудовании с правильной оптимизацией.
Источник: Habr AI
Что мы знаем о компании
DeepSeek
- финансовый директор
- DeepSeek
- Китайские агенты искусственного интеллекта (Alibaba, DeepSeek, Moonshot) способны лгать, скрывать ошибки и подделывать р 2026-09-30
- DeepSeek и Huawei выпустили в опенсорс набор инструментов для чипов Huawei Ascend как альтернативу CUDA от Nvidia. 2026-09-30
- DeepSeek выпустил Ascend-версии библиотек DeepGEMM, DeepEP и FlashMLA с API, совместимым с Nvidia-версиями. 2026-09-30
- Стек DeepSeek для Ascend работает на китайском языке TileLang, который компактнее CUDA. 2026-09-30
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.