AIエージェントオブザーバビリティが必要とされるのは、AIエージェントが通常のWebサービスのようには振る舞わないためです。単一のユーザーリクエストが、意図分類、権限チェック、スキルディスパッチ、モデル推論、ツール実行、サブエージェントへの委任、結果の統合といった一連の内部的な判断を、1つのセッション内で連鎖的に引き起こすことがあります。従来のAPMが可視化できるのは外側のリクエストのみで、その間に何が起きたかを示すことはほとんどありません。
このギャップを解消するために構築されたのが、TrueWatch Toby AIエージェントオブザーバビリティです。セッション、トレース、スパン、モデル呼び出し、ツール実行、トークン使用量、リスクイベント、そしてそれらを取り巻くシステムコンテキストまで、フレームワークを横断したエージェント動作の視点をチームに提供します。
従来のAPMがエージェントに向いていない理由
エージェントの実行単位の核心は、HTTPリクエストではなく、推論とアクションの連鎖です。単一のタスクには、意図分析、権限チェック、スキルディスパッチ、モデル推論、検索拡張コンテキスト、ツール実行、サブエージェントへの委任が含まれることがあります。
標準的なAPMは、周辺のサービス呼び出し、レイテンシ、エラーを取得することはできますが、エージェントチームが実際に知りたい以下の質問には答えられません。
- 推論チェーンの各ステップで何が起きたのか?
- どのツールが呼び出され、それは成功したのか?
- どのステップでどのモデルが実行され、トークンをいくつ使用したのか?
- ワークフローはリスクポリシーを発動させたか?
- 親エージェントはサブエージェントにどのように作業を委任したのか?
この可視性がなければ、コスト、リスク、信頼性はすべて推測に頼るしかなくなります。
TrueWatchのAIエージェントオブザーバビリティプラットフォーム:OpenTelemetryを基盤に
TrueWatchのAIエージェントオブザーバビリティプラットフォームは、OpenTelemetryベースのアーキテクチャ上で動作するため、コアのビジネスロジックに手を加えることなくエージェントの動作をレポートできます。OpenClawベースのエージェントの場合、レポートの経路は次のようになります。
openclaw-otel-plugin → DataKit → TrueWatchエージェントフレームワークは今も急速に進化しており、それこそが共通のテレメトリ標準が重要である理由です。OpenTelemetryにより、TrueWatchはエージェントの動作を、チームが既に活用しているのと同じインフラトレース、サービストレース、ログ、メトリクス、イベントに結び付けることができます。新しいフレームワークごとに専用のアダプターを構築する必要はありません。
AIエージェントオブザーバビリティダッシュボード:セッションビューとトレースビュー
TrueWatchのAIエージェントオブザーバビリティダッシュボードは、2つのレベルで機能します。
セッションビュー。 各セッションは、1回のユーザーインタラクション全体を集約します。開始時刻と終了時刻、最新の意図、トレース数、合計トークン使用量、リスクイベント数、アラートレベルです。タイムラインには、異常に活発な期間、繰り返されるリトライ、実行パターンの急激な変化がハイライト表示されます。
トレースビュー。 セッション内では、トレースのウォーターフォールが実行チェーンをステップごとに展開します。意図分類、プロンプトのフォーマット、モデルリクエスト、検索、ツール呼び出し、出力生成です。各スパンには、ポリシーが許可する範囲で、所要時間、トークン数、ステータス、入出力の詳細が記録されます。これが実践におけるAIエージェントトレーシングの姿です。単一のリクエスト/レスポンスのペアではなく、その間のすべての判断ポイントが可視化され、検索可能になります。

トレースリストのレベルでは、エンジニアはトレースID、エージェント名、リスクレベル、トークン範囲、ステータスでフィルタリングし、リスクの高い実行や異常な実行を素早く特定できます。

コストのためのAIエージェントモニタリング:モデルとツールをまたぐアトリビューション
エージェントのコストは、一般的なサービスのリソース使用量よりもはるかに大きく変動します。同じユーザー向け機能であっても、プロンプト、検索結果、選択されたモデル、リトライの挙動、関与するツールチェーンによって、消費されるトークン量は大きく異なります。
TrueWatchのAIエージェントモニタリングビューは、セッション内でのモデル呼び出しとツール実行の内訳を分解し、チームが次のような質問に答えられるようにします。
- どのモデルが最もトークンを消費しているか?
- リランキングが必要以上に頻繁に発生していないか?
- ファイル読み取りツールがレイテンシを増加させていないか?
- 実際のボトルネックは外部APIなのか?
- どのセッションまたはトレースが異常なコストを引き起こしているのか?

ここでエージェントオブザーバビリティはFinOpsの一部となります。目的は請求書が届いた後にトークンを数えることではなく、コストをエージェントの動作、モデルの選択、ツールの使用、それを引き起こしたプロダクトのワークフローに直接結び付けることです。
AIエージェントガバナンス:エージェントのアクションに対するリスク監査
エージェントが本番データや本番ツールに触れるようになると、オブザーバビリティはガバナンス機能となります。
TrueWatchのトレース詳細ビューは、コンテンツポリシーチェック、機密用語のフィルタリング、権限境界チェックなどのポリシー信号を含むリスクイベントを表示し、それぞれがスパンID、深刻度、ルール、実行コンテキストに紐付けられます。ツール実行の記録も同じ精度でログに記録されます。タイムスタンプ、スパンID、ツール名、ツールタイプ、対象またはコマンド、所要時間、ステータス、リスクレベルです。

これにより、チームは証拠の記録を得られます。エージェントが予期しない動作をした場合、どのツールが実行されたか、どのコンテキストが使用されたか、どのポリシーが発動したか、そしてどこに人間による承認ステップを置くべきかを正確に追跡できます。
TrueWatchでAIエージェントモニタリングを設定する
TrueWatchコンソールには、エージェントモニタリングとLLMモニタリング専用のアプリケーションパスが用意されています。OpenClawエージェントの場合、セットアップは3つのステップです。
- プラグインをインストールする。
- 設定ファイルを更新する。
- 再起動してレポートを確認する。
セットアップフォームは、アプリケーション名、アプリケーションID、サービスアドレス、クライアントトークンを生成します。

フレームワークを横断するAIエージェントオブザーバビリティツール
エージェントのエコシステムは断片化しています。OpenClaw、Hermes、LangChain、CrewAI、コーディングエージェント、社内エンタープライズエージェントは、それぞれ異なる実行モデルで動作します。TrueWatchはOpenTelemetryを共通の基盤として使用し、フレームワークごとに個別のアダプターを構築する代わりに、チームに1つのテレメトリモデルを提供します。
OpenClaw。 ゲートウェイアーキテクチャとプラグインモデルは、OpenTelemetryによるレポートに自然に適合し、シングルインスタンスまたはマルチワーカーのデプロイメント全体でセッションコンテキストと分散トレースを保持します。
Claude CodeとCodex。 ここでの方向性は、コーディングエージェントの動作を従来のサービストレースに結び付けることです。これにより、チームは以下のようなパスを追跡できます。
agent decision → API call → service trace → database queryコーディングエージェントは、それが変更または調査するシステムから切り離されたブラックボックスであるべきではありません。サービス、ログ、メトリクス、トレースと同じ本番コンテキストに接続されるテレメトリを残すべきです。
結論
エージェントの能力は急速に向上していますが、信頼の獲得はより難しい課題です。TrueWatch AIエージェントオブザーバビリティは、LLMオブザーバビリティ、セッション、トレース、モデルおよびツールのコストアトリビューション、リスク監査、フレームワークを横断したテレメトリを1つの運用ビューにまとめます。これにより、エージェントの動作をレビュー可能、統制可能にし、それが関わる本番システムと結び付けます。
FAQ
Q: AIエージェントオブザーバビリティとは何ですか? A: AIエージェントオブザーバビリティとは、従来のAPMが取得する外側のAPIリクエストだけでなく、意図分類、モデル呼び出し、ツール実行、サブエージェントへの委任など、AIエージェントの推論とアクションの全連鎖を追跡する手法です。
Q: AIエージェントのコストを監視する最良の方法は何ですか? A: 効果的なAIエージェントモニタリングは、コストをアプリケーションレベルで集計するのではなく、セッション内の特定のモデル、ツール、ワークフローのステップにトークン使用量と費用を割り当てます。これにより、コスト追跡は月末の驚きではなく、実行可能なFinOpsの入力情報になります。
Q: フレームワークを横断したサポートに最適なAIエージェントオブザーバビリティツールは何ですか? A: OpenTelemetryのようなオープンスタンダードを基盤に構築されたAIエージェントオブザーバビリティツールを探してください。エージェントフレームワーク(OpenClaw、LangChain、CrewAI、コーディングエージェント)は今も進化を続けており、共通のテレメトリモデルであれば、それぞれに個別の統合を構築する必要がなくなります。
Q: オブザーバビリティプラットフォームにおけるAIエージェントガバナンスはどのように機能しますか? A: AIエージェントガバナンスは、各リスクイベント(ポリシーチェック、権限の境界、機密コンテンツのフィルターなど)を、それを引き起こしたスパン、深刻度、実行コンテキストと組み合わせ、エージェントがどのように、そしてなぜ行動したのかを示す監査証跡を作成します。
Q: AIエージェントオブザーバビリティはマルチエージェントシステムに対応できますか? A: はい。マルチエージェントオブザーバビリティでは、トップレベルのリクエストだけでなく、親エージェントがサブエージェントにどのように作業を委任するかを追跡し、委任チェーン全体にわたってそのセッションコンテキストを保持する必要があります。
Q: AIエージェントトレーシングとは何ですか? A: AIエージェントトレーシングとは、単一のリクエスト/レスポンスログではなく、スパンのウォーターフォールとして記録される、意図分類、モデル呼び出し、ツール実行、サブエージェントへの委任といったエージェントの実行チェーンのステップごとの記録です。これにより、エージェントの推論はブラックボックスではなく、レビュー可能なものになります。

