Skip to content

[Observability] Server Workflow·AI Runtime 경계 추적 구현 #26

Description

@hywznn

한 줄 목표

Server API → Task Workflow → AiRun → AI Runtime 경계를 같은 trace로 연결하고, 개인정보 없이 Server 운영 지표를 확인합니다.

책임 경계

구간 소유
Client → Server, Server module, Server → AI Runtime span server
AI Runtime → LLM Provider span과 Provider metric ai
Collector, 장기 보관, dashboard/alert infra Infra roadmap

Server가 Provider를 직접 호출하거나 Provider API Key/model label을 metric에 넣지 않습니다.

구현 범위

  • Micrometer metric naming/unit/tag allow-list
  • OpenTelemetry Server span과 W3C traceparent propagation
  • requestId/traceId를 오류 envelope·AiRun·safe log에 연결
  • Server API, Task, AiRun, Runtime HTTP latency/error/retry metric
  • local collector 또는 no-op exporter 구성과 장애 격리
  • dashboard/alert 요구사항을 Infra issue로 전달
  • metric/span/log 개인정보 자동 검사

최소 Server 지표

  • API request/error/p50/p95
  • Task 생성·승인·완료율과 상태 체류시간
  • AiRun queue depth·대기·전체 지연·status/outcome 비율
  • Runtime HTTP timeout·circuit open·contract validation failure
  • Event backlog·retry·permanent failure
  • Worker Link 만료·응답·거부 수

companyId, workerId, 이름, token, 자유 입력, Prompt를 metric tag로 사용하지 않습니다.

완료 조건

  • 한 requestId/traceId로 Server부터 AI Runtime 호출과 후속 event를 찾습니다.
  • Runtime→Provider 상세는 AI trace link로 이어지고 Server가 중복 계측하지 않습니다.
  • 관측 도구 장애가 업무 transaction을 실패시키지 않습니다.
  • metric/tag/span에 개인정보와 고카디널리티 값이 없습니다.
  • local과 demo 확인 절차가 Wiki에 있습니다.

관계

Metadata

Metadata

Assignees

No one assigned

    Labels

    area:ai-integrationServer ↔ AI Runtime 내부 계약·Client·검증·trace 연동 영역; Prompt·모델·Provider 구현은 ai 저장소 소유area:infraServer Dockerfile·DB 설정·CI hook·배포 가능성 영역; 통합 인프라 운영은 infra 저장소와 조율priority:P1핵심 작업 다음으로 처리할 중요 작업status:blocked선행 작업이나 외부 조건 때문에 현재 진행할 수 없는 작업type:tooling테스트·검증·CI·개발 편의 도구 작업

    Type

    No type

    Projects

    No projects

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions