@perplexity_ai
Perplexity опубликовала исследование о своей инфраструктуре для быстрого обслуживания моделей эмбеддингов и ранжирования на GPU. Система состоит из трёх компонентов: HTTP-шлюз Ivy, сервер вывода Tulip (с CUDA-графами и асинхронной обработкой) и движок моделей ROSE (с переиспользованием ядер для LLM и эмбеддингов). Также объявлено о доступности GPT-6 Astra в Perplexity Computer для подписчиков Pro и Max.