大規模言語モデルの超高速推論サービング基盤「SGLang」の開発チームは、最新アップデートとなる「SGLang v0.5.19」を正式リリースしました。
本バージョンでは214名の開発者による786件のプルリクエストが集約され、Qwen3.8(2.4T-A95Bおよび27B)、dots3.note、Ling-3.0-flashなど最新オープン重みモデルへの対応が一挙に追加されました。
性能面では、ビームサーチ機能(beam_width)が標準導入されたほか、MoE(混合エキスパート)のFP8通信を劇的に効率化する「DeepEP v2 ElasticBuffer」エンジンが新たに組み込まれました。
さらにPrefill時の正規化計算を分散化するLayerNormシーケンス並列や、NVIDIA Blackwell世代におけるデコードコンテキスト並列(DCP)をサポート。
投機的デコーディング機能として局所畳み込みと候補セレクターを備えた「DFlash2」が統合されたほか、すべてのモデルを対象に統合ラディックスツリー(RadixTree)キャッシュがデフォルトで有効化され、本番推論環境におけるスループットとメモリ効率が大幅に引き上げられています(一次ソース:SGLang GitHub Releases / 公式リポジトリ)。
