2026-09-06 · Perplexity · ИТ и разработка

Perplexity оптимизировала embedding-модели на GPU для поиска

Perplexity оптимизировала embedding-модели на GPU для поиска

Perplexity опубликовала техническое описание инфраструктуры pplx-embed — системы, которая обрабатывает векторные представления текста для поиска и ранжирования. Команда инженеров решила не строить отдельный движок для embedding, а переиспользовала ядра из своего LLM-стека: prefill-ядра для массовой индексации и decode-ядра для запросов в реальном времени.

Оптимизация включила управление CUDA-графами, асинхронное отслеживание результатов и путь обработки запросов на Rust. Решение позволяет балансировать между пропускной способностью при переиндексации и скоростью ответа на поисковые запросы.

Источник: MarkTechPost

Что мы знаем о компании Perplexity
создатель Perplexity
Аравинд Шринивас

Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.

Все новости