In-House LLM Serving at Netflix
この記事で分かること
Netflixが自社のLLMを本番環境で運用するためのアーキテクチャと運用ノウハウを共有している。具体的には、レイテンシ要件を満たすための推論最適化手法や、トラフィック変動に対応するスケーリング戦略が実践的に解説されている。
詳細要約
Netflixは、ホスト型APIではなく自社の本番環境でLLMのデプロイから推論まで全スタックを内製運用している。この判断は明白ではなく、本番負荷下でのトレードオフが明らかになった点もある。実際に使う際の具体点として、モデルランタイムチームと推論チームが連携し、既存のプロダクション環境内で動作させることで、別途MLサイロを構築する必要がなくなる。ただし、本番負荷で顕在化するトレードオフを事前に評価し、運用設計に反映することが重要となる。