中国アリババ傘下のQwenチームは、音声、画像、映像、テキストをネイティブかつ統合的に処理する次世代オムニモーダル基盤モデル「Qwen3.8-Omni-Flash」を正式発表しました。
従来のマルチモーダルAIが主に「メディア入力の理解や要約」にとどまっていたのに対し、本モデルは自律的なタスク分解、外部ツールの連鎖呼び出し、動画編集や音楽生成などのクリエイティブ作業を主体的に遂行するエージェント機能を中核に据えて再設計されています。
文脈長は最大100万トークン(1M)を標準サポートし、長時間にわたる講義映像や会議録音、多段ドキュメントを欠落なく保持しながら、ユーザーとリアルタイムで双方向対話を行えます。
自律エージェントの性能を測るマルチモーダルベンチマーク「WildClawBench-MM」において従来比+36.5ポイント、「AgenticVBench」で+22.3ポイントと突出したスコアを記録しました。
さらにAlibaba Cloud Model Studioを通じて提供されるAPIの価格体系が抜本的に改定され、音声入力コストが98%以上、映像入力コストが93%以上削減され、企業の現場でマルチモーダルエージェントを大規模運用するための経済的ハードルが一気に引き下げられました(一次ソース:Qwen公式ブログ / Alibaba Cloud Model Studio発表)。
