← назад

perplexity_ai — 13-05-2026

3 твитов за сутки. Perplexity опубликовала исследование о развертывании моделей Qwen3 235B на инфраструктуре NVIDIA GB200 NVL72, подтвердив её превосходство над Hopper для высокопроизводительного инференса.

Инфраструктура GB200 — команда поделилась деталями обслуживания пост-тренированных моделей Qwen3 235B на стойках NVIDIA GB200 NVL72 Blackwell, отмечая, что это не только платформа для обучения, но и значительный шаг вперёд для инференса больших MoE-моделей.

Бенчмарки и производительность — замеры показывают существенное снижение задержек: NVLS all-reduce latency падает с 586.1µs на H200 до 313.3µs на GB200, а время combine в MoE prefill при EP=4 сокращается с 730.1µs до 438.5µs 2054204425833726353.

Экономическая эффективностьGB200 остаётся сильнейшей платформой для масштабного инференса благодаря дисагрегации prefill/decode, Blackwell-native quantization, кастомным ядрам и rack-scale NVLink, что в итоге даёт более быстрые ответы и снижает стоимость обслуживания 2054204437535834369.

Источники

qwen3-235b