Разработчик запустил LLM на NPU мини-ПК с производительностью 13–17 токенов в секунду
Разработчик Ben_ro купил мини-ПК с процессором Ryzen AI 9 365 и запустил на его NPU языковую модель Qwen 3.6–35B, которая работает 24/7 с производительностью 200 токенов в секунду на этапе prefill и 13–17 токенов в секунду на этапе decode. По пути он столкнулся с проблемами: NPU видит только половину оперативной памяти, обслуживает один запрос одновременно и падает при ошибках клиента.
Решение потребовало переезда с Windows на Proxmox и использования фреймворка FastFlowLM. Материал опубликован на Хабре и показывает, что локальные LLM на NPU работают, но требуют обхода множества технических ограничений.
Источник: Хабр — всё
- Amazon обновила Kindle с плоским экраном и ценой от $150 2026-10-03
- Broadcom и Blackstone собрали $60 млрд на ИИ-чипы для Anthropic 2026-10-03
- Чат-бот мэрии Нью-Йорка советовал предпринимателям нарушать трудовое право 2026-10-03
- CLI-Anything генерирует интерфейсы для ИИ-агентов к любому софту 2026-10-03
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.