エージェント評価(Agentic Evaluation)
自律AIエージェントが実務現場において、複数工程にわたる長期タスクを自律完結できるかや自己回復力を備えているかを、動的な実環境で総合測定する評価手法です。
エージェント評価(Agentic Evaluation)とは、自律型AIエージェントが実務の現場において、複数ステップにわたる長期的なタスク(Long-Horizon Tasks)を自律的にやり切る能力や、環境の変化に適応できるかを動的に検証する評価手法のことです。
従来のAIベンチマーク(MMLUやGSM8Kなど)は、静的な選択式問題や知識確認が中心であり、最新モデル群において満点近くまでスコアが飽和したため、実際の業務現場における遂行力を正しく測れなくなっていました。
エージェント評価では、実際にコードを実行させたり、Webブラウザを操作させたり、外部APIと対話させたりする実践的な環境を用意し、ゴール達成までの行動軌跡(Trajectory)や、予期せぬツールの不具合から自力で復帰できる自己回復力を測定します。
代表的な指標として、ソフトウェア開発現場の課題解決力を測るSWE-benchや、実務での有効性を包括評価するAEI(Agent Effectiveness Index)などがあり、業界標準としての策定が急速に進んでいます。
企業が自社の業務自動化に向けてAIエージェントやモデルを選定する際、単なるモデルの知名度や机上のスコアではなく、実運用時の投資対効果(ROI)を客観的に判断するための必須指標として位置づけられています。