軽量かつ高速なLLM推論基盤として世界中のローカルAI環境を支える「llama.cpp」が、大きな節目となるメジャーバージョン「v0.4.0」を正式リリースしました。
本バージョンではモデル起動時にテンソルをオンデマンドで読み出す遅延読み込みオプション(--lazy-mode)が導入され、大容量モデルの起動待機時間と初期メモリフットプリントが劇的に改善されました。
モデル対応としては、Qwen3.8-Flash-NextやNVIDIA Nemotron-3-Puzzle-75B-A9Bのアーキテクチャが初期サポートされたほか、マルチモーダル拡張として動画入力を処理する専用ヘルパーが追加されています。
さらに内部推論エンジンであるggmlが「0.23.0」へとアップデート。
DeepSeek-V4やGLM向けのスパースFlash Attention、Appleシリコン環境でのRPC分散推論を高速化するApple RDMA対応、層ごとのエキスパート動的ルーティングなど、先端オープンモデルの推論を支える最適化が網羅されています(一次ソース:llama.cpp GitHub Releases / 公式リポジトリ)。
