Perplexity оптимизировала embedding-модели на GPU для поиска
Perplexity опубликовала техническое описание инфраструктуры pplx-embed — системы, которая обрабатывает векторные представления текста для поиска и ранжирования. Команда инженеров решила не строить отдельный движок для embedding, а переиспользовала ядра из своего LLM-стека: prefill-ядра для массовой индексации и decode-ядра для запросов в реальном времени.
Оптимизация включила управление CUDA-графами, асинхронное отслеживание результатов и путь обработки запросов на Rust. Решение позволяет балансировать между пропускной способностью при переиндексации и скоростью ответа на поисковые запросы.
Источник: MarkTechPost
Что мы знаем о компании
Perplexity
- создатель Perplexity
- Аравинд Шринивас
- Perplexity выпустила модель для RAG, которая учит ИИ искать ответ с контекстом 2026-10-01
- Perplexity имеет ИИ-агента Comet, который заходил в аккаунты пользователей с их разрешения 2026-09-30
- Perplexity представила Photon — поисковый и ранжирующий движок на Rust, доступный как hosted API. 2026-09-30
- Perplexity сообщает о снижении p99 задержки Photon с 800 мс до 65 мс. 2026-09-30
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.