用語集一覧に戻る
技術よみ: えーじぇんとひょうか

エージェント評価(Agentic Evaluation)

自律AIエージェントが実務現場において、複数工程にわたる長期タスクを自律完結できるかや自己回復力を備えているかを、動的な実環境で総合測定する評価手法です。

エージェント評価Agentic Evaluation)とは、が実務の現場において、複数ステップにわたる長期的なタスク(Long-Horizon Tasks)を自律的にやり切る能力や、環境の変化に適応できるかを動的に検証する評価手法のことです。

従来のAI(MMLUやGSM8Kなど)は、静的な選択式問題や知識確認が中心であり、最新モデル群において満点近くまでスコアが飽和したため、実際の業務現場における遂行力を正しく測れなくなっていました。

エージェント評価では、実際にコードを実行させたり、Webブラウザを操作させたり、外部と対話させたりする実践的な環境を用意し、ゴール達成までのTrajectory)や、予期せぬツールの不具合から自力で復帰できる自己回復力を測定します。

代表的な指標として、ソフトウェア開発現場の課題解決力を測るSWE-benchや、実務での有効性を包括評価するAEIAgent Effectiveness Index)などがあり、業界標準としての策定が急速に進んでいます。

企業が自社の業務に向けてやモデルを選定する際、単なるモデルの知名度や机上のスコアではなく、実運用時の投資対効果(ROI)を客観的に判断するための必須指標として位置づけられています。

AI用語の理解から、実務での定着へ。

用語の意味を理解した次のステップは、自社の業務にどう活かすかです。BNFのAI顧問が、貴社の現場に合わせたAI活用の設計から定着までを伴走支援します。