@perplexity_ai

Выпуск

6 твитов

Perplexity опубликовала исследование о своей инфраструктуре для быстрого обслуживания моделей эмбеддингов и ранжирования на GPU. Система состоит из трёх компонентов: HTTP-шлюз Ivy, сервер вывода Tulip (с CUDA-графами и асинхронной обработкой) и движок моделей ROSE (с переиспользованием ядер для LLM и эмбеддингов). Также объявлено о доступности GPT-6 Astra в Perplexity Computer для подписчиков Pro и Max.

Темы: Инфраструктура инференса · Эмбеддинги на GPU · CUDA-оптимизации · GPT-6 Astra

Ключевые твиты