← назад

perplexity_ai — 23-04-2026

3 твитов за сутки. Компания опубликовала исследование о пост-обучении моделей для точных ответов с поиском, демонстрируя преимущества пайплайна SFT + RL на базе Qwen.

Пост-обучение и сравнение с GPT — опубликована новая исследовательская статья, описывающая пайплайн SFT + RL, который улучшает поиск, качество цитирования, следование инструкциям и эффективность; на моделях Qwen Perplexity достигает или превосходит GPT-модели по фактологической точности при более низкой стоимости tweet.

Дизайн функции вознаграждения — система вознаграждения объединяет корректность, предпочтения и эффективность, при этом предпочтения учитываются только при правильном ответе, что предотвращает оптимизацию модели на более звучные, но неверные ответы tweet.

Внутренние улучшения — именно этот пайплайн обеспечивает более точные, лучше процитированные и эффективные ответы внутри Perplexity по сравнению с базовой моделью вне платформы tweet.

Источники