AIエージェント
AIエージェントとは、大規模言語モデル(LLM)が目標に向けて自ら手順を計画し、ツールを呼び出し、環境からのフィードバックを用いながら、次に何をすべきかを反復的に判断する自律システムです。あらかじめ定義されたコードパスに従うワークフローとは異なり、エージェントではタスクの進め方をLLMが直接制御します。
AIエージェントとは、LLMが自律的に計画を立て、ツールを使用し、反復しながら目標に到達するシステムです。
Anthropicは、workflowsと、agentsを明確に区別しています。 workflowsでは、LLMとツールがあらかじめ定義されたコードパスに沿ってオーケストレーションされますが、 agentsでは、LLMが自らのプロセスとtool useを制御します。
エージェントの中核となる構成要素は、計画、記憶、ツールです。これらを備えたLLMは、しばしば拡張LLM(augmented LLM)と呼ばれます。
エージェントはフィードバックループとして動作し、各ステップで環境から返されるグラウンドトゥルースを受け取り、進捗を評価して次のアクションを選択します。
この項目はエージェントシステムそのものに焦点を当てており、agentic webやagentic searchといった応用概念とは異なります。
AIエージェントとは
AIエージェントとは、大規模言語モデル(LLM)が推論を行い、人がすべての手順を細かく指示しなくても、自ら判断して目標に向かって進むシステムです。ユーザーが目標を示すと、エージェントは必要な手順を計画し、検索、コード実行、API呼び出しなど、どのツールを使うかを選択し、各ステップの結果に基づいて次に何をするかを繰り返し判断します。Googleはエージェントを、推論、計画、記憶を用いてユーザーの代わりに行動できるインテリジェントなシステムと説明しており、複数のシステムをまたいで作業を実行し、数手先まで見通せる能力を強調しています。
なお、この用語はagentic webやagentic searchの近くに位置しますが、同じものではありません。これらは、エージェントがウェブを閲覧したり検索を実行したりする応用領域を指しますが、ここで扱うAIエージェントは、そうしたアプリケーションを可能にするエージェントシステムそのものの構造と動作原理に焦点を当てています。
workflowsとagentsの違い
Building Effective Agentsにおいて、AnthropicはLLMベースのシステムを2つのカテゴリに分けています。どちらもagentic systemsとしてまとめられますが、その動作は明確に異なります。この区別は、あるタスクに実際にどれだけの自律性が必要かを判断するための実用的な指標になります。
側面 | ワークフロー | エージェント |
|---|---|---|
制御モデル | LLMとツールは、人間が作成したコードパスに沿ってオーケストレーションされる | LLMが自らのプロセスとツール使用を制御する |
パスの決定 | 固定的で予測可能 | 実行時に決定される動的なもの |
最適な用途 | 明確で反復可能な手順を持つタスク | 事前にパスを定義しにくく、判断が必要なタスク |
例 | プロンプトチェーニング、ルーティング、並列化 | 目標だけを与えられ、解決策を自律的なループに任せる |
Anthropicの中心的な提言は、最もシンプルな解決策から始め、複雑さは明確に必要になった場合にのみ追加することです。多くのタスクでは、完全なエージェントよりもよく設計されたワークフローが適しており、より高い自律性は、それに伴ってより大きなコスト、レイテンシー、予測不可能性をもたらします。
構成要素: 計画、メモリ、ツール
エージェントの基盤は拡張LLMです。これは、検索、ツール、メモリで強化されたLLMです。単にテキストを生成するだけでなく、このようなモデルは自ら検索クエリを書き、適切なツールを選択し、何を記憶するかを判断できます。Wangらの広く引用されている調査論文『A Survey on Large Language Model based Autonomous Agents』(arXiv:2308.11432、2023)は、先行研究の広範な成果を包含する統一フレームワークを提案し、自律エージェントをプロファイル、メモリ、計画、行動モジュールで整理しています。
計画
計画は、複雑な目標を実行可能なサブステップに分解し、順序付けし、中間結果が入るたびに計画を修正します。これは、一度で正しく解決できない問題に取り組むエージェントの能力の中核です。
メモリ
メモリは、会話履歴と過去のステップの結果を保存し、マルチターンの対話と推論に活用できるようにします。Googleも同様に、メモリが履歴を保持し、マルチターンの会話を可能にし、エージェントの推論を支えると説明しています。
ツール
ツールは、web search、code execution、外部APIへの呼び出しなど、LLM単体では持ち得ない機能をもたらします。ツールの出力は次のアクションを左右する現実世界の情報になるため、明確なドキュメント整備とテストを備えてツールを設計することは、エージェントのパフォーマンスに非常に大きな影響を与えます。
仕組み: フィードバックループ
エージェントの本質は、単一の応答ではなく、反復的なループにあります。Anthropicが説明するように、エージェントは独立して計画を立て、各ステップで環境から得られるground truthに基づいてツールを使用し、自身の進捗を評価し、必要に応じて途中のチェックポイントで人間のフィードバックを得るために一時停止します。この自律的な振る舞いを確実に機能させるには、明確な評価基準と、エージェントの意思決定に対する信頼が不可欠です。
Google Vertex AIも同じ基本構造を説明しています。オーケストレーション層が推論ループを管理し、モデル出力とツールを組み合わせ、マルチステップのワークフローを処理し、より正確な応答を生み出すためにいつツールを呼び出すかを判断します。
SEOとGEOへの示唆
AIエージェントの台頭は、検索とコンテンツ戦略を支える前提を変えます。人がページをクリックして自分で読む代わりに、エージェントが代わりに情報を収集し、比較し、要約するケースが増えています。運営者の視点では、いくつかの重要な点が挙げられます。
ツールが返す出力—検索結果やAPIレスポンス—がエージェントの判断の基盤になるため、機械が確実に解析できる構造化コンテンツと、明確な事実記述の重要性が高まります。
エージェントは断片的なスニペットではなく、環境から得た実際の結果を評価しながら動くため、権威あるソース、一貫したデータ、検証可能な情報を提供するページのほうが、引用され、利用される可能性が高くなります。
これはGEOに直接つながります。GEOは生成検索で引用されることを目的にコンテンツを最適化するものであり、AIエージェントはそれらのアプリケーションを支える基盤技術です。