配信日: 2026-09-05 AIツール重要度: ★★★★★ 読了目安: 約2分

llama.cpp v0.4.0公開、機能大幅刷新

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
llama.cpp v0.4.0公開、機能大幅刷新

この記事の要点(3行ダイジェスト)

  • llama.cppがメジャー版v0.4.0へ刷新、テンソル遅延読み込みを標準装備。
  • Qwen3.8やNemotron-3-Puzzleに対応し動画入力ヘルパーを追加。
  • ggml 0.23.0更新によりApple RDMAやスパースFlash Attentionを統合。

軽量かつ高速な基盤として世界中のローカルAI環境を支える「llama.cpp」が、大きな節目となるメジャーバージョン「v0.4.0」を正式リリースしました。

本バージョンではモデル起動時にテンソルをオンデマンドで読み出す遅延読み込みオプション(--lazy-mode)が導入され、大容量モデルの起動待機時間と初期メモリフットプリントが劇的に改善されました。

モデル対応としては、-Flash-NextやNVIDIA Nemotron-3-Puzzle-75B-A9Bのアーキテクチャが初期サポートされたほか、マルチモーダル拡張として動画入力を処理する専用ヘルパーが追加されています。

さらに内部推論エンジンであるggmlが「0.23.0」へとアップデート。

やGLM向けのスパースFlash Attention、Appleシリコン環境でのRPC分散推論を高速化するApple RDMA対応、層ごとのエキスパート動的ルーティングなど、先端オープンモデルの推論を支える最適化が網羅されています(一次ソース:llama.cpp GitHub Releases / 公式リポジトリ)。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ