配信日: 2026-09-05 AIツール重要度: ★★★★★ 読了目安: 約2分

SGLang v0.5.19公開、推論を大幅高速化

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
SGLang v0.5.19公開、推論を大幅高速化

この記事の要点(3行ダイジェスト)

  • SGLangがv0.5.19へ更新され786件のPR統合と新モデル対応を追加。
  • DeepEP v2によるMoE FP8通信最適化やBlackwell MLA並列を導入。
  • RadixTreeキャッシュの全標準化やDFlash2投機的デコードで推論を加速。

の超高速サービング基盤「SGLang」の開発チームは、最新アップデートとなる「SGLang v0.5.19」を正式リリースしました。

本バージョンでは214名の開発者による786件のプルリクエストが集約され、(2.4T-A95Bおよび27B)、dots3.note、Ling-3.0-flashなど最新オープン重みモデルへの対応が一挙に追加されました。

性能面では、ビームサーチ機能(beam_width)が標準導入されたほか、MoE(混合エキスパート)のFP8通信を劇的に効率化する「DeepEP v2 ElasticBuffer」エンジンが新たに組み込まれました。

さらにPrefill時の正規化計算を分散化するLayerNormシーケンス並列や、NVIDIA Blackwell世代におけるデコードコンテキスト並列(DCP)をサポート。

投機的デコーディング機能として局所畳み込みと候補セレクターを備えた「DFlash2」が統合されたほか、すべてのモデルを対象に統合ラディックスツリー(RadixTree)キャッシュがデフォルトで有効化され、本番推論環境におけるスループットとメモリ効率が大幅に引き上げられています(一次ソース:SGLang GitHub Releases / 公式リポジトリ)。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ