AI 에이전트 관찰 가능성: 프로덕션 환경에서 LLM 관찰 가능성 격차 해소하기

2026년 9월 21일

AI 에이전트 관찰 가능성이 필요한 이유는 AI 에이전트가 일반적인 웹 서비스처럼 동작하지 않기 때문입니다. 하나의 사용자 요청이 의도 분류, 권한 확인, 스킬 디스패치, 모델 추론, 툴 실행, 하위 에이전트 위임, 결과 합성 등 하나의 세션 안에서 일련의 내부 의사결정 체인을 촉발할 수 있습니다. 기존 APM은 외부 요청만 보여줄 뿐, 그 사이에 무슨 일이 일어났는지는 거의 보여주지 못합니다.

TrueWatch Toby AI Agent Observability는 바로 이 격차를 해소하기 위해 만들어졌습니다. 세션, 트레이스, 스팬, 모델 호출, 툴 실행, 토큰 사용량, 위험 이벤트, 그리고 이를 둘러싼 시스템 컨텍스트까지, 프레임워크를 넘나드는 에이전트 동작 뷰를 팀에게 제공합니다.

기존 APM이 에이전트에 맞지 않는 이유

에이전트의 핵심 실행 단위는 HTTP 요청이 아니라 추론 및 행동 체인입니다. 하나의 작업에는 의도 분석, 권한 확인, 스킬 디스패치, 모델 추론, 검색 증강 컨텍스트, 툴 실행, 하위 에이전트 위임이 포함될 수 있습니다.

기존 APM은 여전히 주변 서비스 호출, 지연 시간, 오류를 포착합니다. 하지만 에이전트 팀이 실제로 필요로 하는 질문에는 답할 수 없습니다.

  • 추론 체인의 각 단계에서 무슨 일이 일어났는가?
  • 어떤 툴이 호출되었고, 성공했는가?
  • 어떤 단계에서 어떤 모델이 실행되었고, 토큰을 얼마나 사용했는가?
  • 워크플로가 위험 정책을 트리거했는가?
  • 상위 에이전트가 하위 에이전트에 작업을 어떻게 위임했는가?

이러한 가시성이 없으면 비용, 위험, 안정성 모두 추측에 의존하게 됩니다.

TrueWatch의 AI 에이전트 관찰 가능성 플랫폼: OpenTelemetry 기반

TrueWatch의 AI 에이전트 관찰 가능성 플랫폼은 OpenTelemetry 기반 아키텍처에서 동작하므로 핵심 비즈니스 로직을 건드리지 않고 에이전트 동작을 리포팅합니다. OpenClaw 기반 에이전트의 경우 리포팅 경로는 다음과 같습니다.

openclaw-otel-plugin → DataKit → TrueWatch

에이전트 프레임워크는 여전히 빠르게 진화하고 있으며, 바로 이 때문에 공통 텔레메트리 표준이 중요합니다. OpenTelemetry를 통해 TrueWatch는 새로운 프레임워크마다 별도의 어댑터를 구축하는 대신, 팀이 이미 사용 중인 동일한 인프라 트레이스, 서비스 트레이스, 로그, 메트릭, 이벤트와 에이전트 동작을 연결할 수 있습니다.

AI 에이전트 관찰 가능성 대시보드: 세션 및 트레이스 뷰

TrueWatch의 AI 에이전트 관찰 가능성 대시보드는 두 가지 레벨에서 동작합니다.

세션 뷰. 각 세션은 전체 사용자 상호작용을 집계합니다 — 시작 및 종료 시간, 최근 의도, 트레이스 수, 총 토큰 사용량, 위험 이벤트 수, 알림 수준. 타임라인은 비정상적으로 활동이 많은 구간, 반복적인 재시도, 실행 패턴의 급격한 변화를 강조해서 보여줍니다.

1-revised-12aug.PNG

트레이스 뷰. 세션 내부에서 트레이스 워터폴은 실행 체인을 단계별로 펼쳐 보여줍니다 — 의도 분류, 프롬프트 포맷팅, 모델 요청, 검색, 툴 호출, 출력 생성. 각 스팬에는 소요 시간, 토큰 수, 상태, 그리고 정책상 허용되는 범위 내에서 입출력 세부 정보가 담겨 있습니다. 이것이 바로 AI 에이전트 트레이싱이 실제로 작동하는 방식입니다 — 단순한 요청/응답 쌍이 아니라, 그 사이의 모든 의사결정 지점을 가시화하고 검색 가능하게 만듭니다.

2-revised-12Aug.png

트레이스 목록 레벨에서 엔지니어는 트레이스 ID, 에이전트 이름, 위험 수준, 토큰 범위, 상태로 필터링하여 고위험 또는 비정상 실행을 빠르게 식별할 수 있습니다.

3-revised-12aug.png

비용을 위한 AI 에이전트 모니터링: 모델과 툴 전체에 걸친 귀속

에이전트 비용은 일반적인 서비스 리소스 사용량보다 훨씬 큰 폭으로 변동합니다. 동일한 사용자 대상 기능이라도 프롬프트, 검색 결과, 선택된 모델, 재시도 동작, 관련된 툴 체인에 따라 토큰 사용량이 크게 달라질 수 있습니다.

TrueWatch의 AI 에이전트 모니터링 뷰는 세션 내부에서 모델 호출과 툴 실행 간의 비용 분할을 세분화하여 보여주므로 팀은 다음과 같은 질문에 답할 수 있습니다.

  • 어떤 모델이 가장 많은 토큰을 사용하는가?
  • 재순위화(reranking)가 필요 이상으로 자주 실행되고 있는가?
  • 파일 읽기 툴이 지연 시간을 늘리고 있는가?
  • 외부 API가 실제 병목인가?
  • 어떤 세션 또는 트레이스가 비정상적인 비용을 유발하고 있는가?

4-revised-12aug.png

바로 이 지점에서 에이전트 관찰 가능성이 FinOps의 일부가 됩니다. 목표는 청구서가 나온 후 토큰 수를 세는 것이 아니라, 비용을 에이전트 동작, 모델 선택, 툴 사용, 그리고 이를 촉발한 제품 워크플로에 직접 연결하는 것입니다.

AI 에이전트 거버넌스: 에이전트 행동에 대한 위험 감사

에이전트가 프로덕션 데이터나 프로덕션 툴에 접근하는 순간부터 관찰 가능성은 거버넌스 기능이 됩니다.

TrueWatch의 트레이스 상세 뷰는 위험 이벤트를 표면화합니다 — 콘텐츠 정책 확인, 민감 용어 필터링, 권한 경계 확인, 기타 정책 신호 — 각각 스팬 ID, 심각도, 규칙, 실행 컨텍스트와 연결됩니다. 툴 실행 기록도 동일한 정밀도로 로깅됩니다: 타임스탬프, 스팬 ID, 툴 이름, 툴 유형, 대상 또는 명령, 소요 시간, 상태, 위험 수준.

5-revised-12aug.png

이를 통해 팀은 증거 추적 경로를 확보하게 됩니다. 에이전트가 예상치 못하게 동작할 경우, 정확히 어떤 툴이 실행되었는지, 어떤 컨텍스트를 사용했는지, 어떤 정책이 발동했는지, 그리고 사람의 승인 단계가 어디에 있어야 하는지를 추적할 수 있습니다.

TrueWatch에서 AI 에이전트 모니터링 설정하기

TrueWatch 콘솔은 에이전트 모니터링 및 LLM 모니터링을 위한 전용 애플리케이션 경로를 제공합니다. OpenClaw 에이전트의 경우 설정은 세 단계로 이루어집니다.

  1. 플러그인을 설치합니다.
  2. 설정 파일을 업데이트합니다.
  3. 재시작 후 리포팅을 확인합니다.

설정 양식은 애플리케이션 이름, 애플리케이션 ID, 서비스 주소, 클라이언트 토큰을 생성합니다.

6-revised-12aug.png

프레임워크 전반의 AI 에이전트 관찰 가능성 툴

에이전트 생태계는 분산되어 있습니다 — OpenClaw, Hermes, LangChain, CrewAI, 코딩 에이전트, 그리고 내부 엔터프라이즈 에이전트까지 모두 서로 다른 실행 모델로 동작합니다. TrueWatch는 OpenTelemetry를 공통 기반으로 사용하여, 프레임워크마다 별도의 어댑터를 만드는 대신 팀에게 하나의 텔레메트리 모델을 제공합니다.

OpenClaw. 게이트웨이 아키텍처와 플러그인 모델은 OpenTelemetry 리포팅에 자연스럽게 적합하며, 단일 인스턴스든 멀티 워커 배포든 세션 컨텍스트와 분산 트레이스를 그대로 유지합니다.

Claude Code 및 Codex. 이 영역의 방향성은 코딩 에이전트의 동작을 기존 서비스 트레이스와 연결하는 것으로, 팀은 다음과 같은 경로를 추적할 수 있습니다.

agent decision → API call → service trace → database query

코딩 에이전트는 자신이 변경하거나 조사하는 시스템과 분리된 블랙박스여서는 안 됩니다 — 서비스, 로그, 메트릭, 트레이스와 동일한 프로덕션 컨텍스트에 연결되는 텔레메트리를 남겨야 합니다.

결론

에이전트의 역량은 빠르게 향상되고 있습니다. 더 어려운 문제는 신뢰입니다. TrueWatch AI Agent Observability는 LLM 관찰 가능성, 세션, 트레이스, 모델 및 툴 비용 귀속, 위험 감사, 프레임워크 전반의 텔레메트리를 하나의 운영 뷰로 통합합니다 — 이를 통해 에이전트의 동작을 검토하고 거버넌스를 적용할 수 있으며, 에이전트가 접하는 프로덕션 시스템과도 연결됩니다.

FAQ

Q: AI 에이전트 관찰 가능성이란 무엇인가요? A: AI 에이전트 관찰 가능성은 기존 APM이 포착하는 외부 API 요청만이 아니라, 의도 분류, 모델 호출, 툴 실행, 하위 에이전트 위임 등 AI 에이전트의 전체 추론 및 행동 체인을 추적하는 방법입니다.

Q: AI 에이전트 비용을 모니터링하는 가장 좋은 방법은 무엇인가요? A: 효과적인 AI 에이전트 모니터링은 비용을 애플리케이션 수준에서 집계하는 대신, 세션 내의 특정 모델, 툴, 워크플로 단계에 토큰 사용량과 지출을 귀속시킵니다. 이렇게 하면 비용 추적이 월말의 예상치 못한 청구서가 아니라 실행 가능한 FinOps 입력값이 됩니다.

Q: 프레임워크 간 지원에 가장 적합한 AI 에이전트 관찰 가능성 툴은 무엇인가요? A: OpenTelemetry와 같은 개방형 표준을 기반으로 구축된 AI 에이전트 관찰 가능성 툴을 찾으세요. 에이전트 프레임워크(OpenClaw, LangChain, CrewAI, 코딩 에이전트)는 여전히 진화하고 있으며, 공통 텔레메트리 모델을 사용하면 프레임워크마다 별도의 통합 작업을 피할 수 있습니다.

Q: 관찰 가능성 플랫폼에서 AI 에이전트 거버넌스는 어떻게 동작하나요? A: AI 에이전트 거버넌스는 각 위험 이벤트 — 정책 확인, 권한 경계, 민감 콘텐츠 필터 — 를 이를 유발한 스팬, 심각도, 실행 컨텍스트와 짝지어, 에이전트가 어떻게 그리고 왜 행동했는지에 대한 감사 추적을 생성합니다.

Q: AI 에이전트 관찰 가능성이 멀티 에이전트 시스템도 다룰 수 있나요? A: 네. 멀티 에이전트 관찰 가능성은 상위 에이전트가 하위 에이전트에 작업을 위임하는 과정을 추적하고, 최상위 요청뿐 아니라 전체 위임 체인에 걸쳐 세션 컨텍스트를 유지해야 합니다.

Q: AI 에이전트 트레이싱이란 무엇인가요? A: AI 에이전트 트레이싱은 단일 요청/응답 로그가 아니라 스팬의 워터폴 형태로 기록되는, 에이전트 실행 체인의 단계별 기록입니다 — 의도 분류, 모델 호출, 툴 실행, 하위 에이전트 위임을 포함합니다. 이는 에이전트의 추론을 블랙박스가 아니라 검토 가능한 대상으로 만들어 줍니다.

Get in touch background

TrueWatch AI Agent Observability 살펴보기