GTX 1080 Ti запустила MoE-модель на 24 токена в секунду
Разработчик SkalolazOther запустил большую языковую модель на видеокарте GTX 1080 Ti и получил скорость обработки 24 токена в секунду. Эксперимент основан на гибридной архитектуре DeltaNet + attention, которая позволяет эффективнее работать с длинным контекстом.
Результаты сопоставимы с показателями на более новых RTX 5060 Ti, где модель Qwen 3.8-27B в квантизации Q4_K_M выдавала аналогичную производительность. Материал опубликован на Хабре и получил оценку 7 баллов от системы анализа.
Источник: Habr AI
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.