配信日: 2026-07-18 LLM・モデル重要度: ★★★★★ 読了目安: 約2分

Kimi K3がWEBarenaでFable 5を抜き世界首位

REPORTED BY BNF AI NEWS EDITORIAL DESKSPECIAL DISPATCH
Kimi K3がWEBarenaでFable 5を抜き世界首位

この記事の要点(3行ダイジェスト)

  • 中国Moonshot AIの「Kimi K3」が自律Web操作評価「WEBarena」で1679をマーク。
  • Claude Fable 5(1631)やGPT-5.6 Sol(1618)を大きく引き離して世界首位を獲得。
  • 前世代のKimi K2からWeb操作エージェントの推論ループを3倍高速化し精度向上。

中国のAIスタートアップ Moonshot AIは、同社の次世代マルチモーダル」が、Webブラウザを介したの操作能力を評価する難関「WEBarena」において、スコア1679を記録し世界首位を獲得したと発表しました(一次ソース:Moonshot AI公式リサーチ発表)。

WEBarenaは、AIがオンラインの買い物、フライト予約、フォーラム投稿、社内管理ツールなどの複雑なWeb画面を実際に人間の代わりに自律操作し、タスクを完結できるかを測る高度な実務テストです。今回の検証により、これまで首位を守っていた Anthropicの (スコア1631)および の GPT-5.6 Sol(スコア1618)の記録が塗り替えられ、中国製AIモデルが性能でトップに躍り出た形となります。

リサーチレポートによれば、Kimi K3はWeb操作に最適化されたマルチステップの思考ルーチンを内蔵しており、前世代の Kimi K2 と比較して画面認識とアクション選択のループを3倍以上高速化。さらに、ページ遷移やポップアップの誤検出に対する自動バックトラック(やり直し)ロジックが強化され、成功率を大きく引き上げたとのことです。ビジネスシーンにおいて、社内システムやWebサービスをAIに完全自律操作させて業務をする「コンピュータ・ユース」の実用化が大きく加速します。

DAILY AI NEWSLETTER — 朝刊ダイジェスト

毎朝8時、業界の最重要AIニュースを5分でキャッチアップ。

主要モデルの最新発表、現場で即使える実務プロンプト、法規制の動向を専門編集局が毎朝要約してお届けします。

✓ 完全無料✓ 毎朝8:00配信✓ いつでもワンクリック解除✓ スパムゼロ