Mixed observability для GenAI
OTel substrate + GenAI layer
OTel substrate + GenAI layer
OTel substrate + GenAI layer
От схемы к SOTA-стеку
Части 1-2: схема и референс-архитектура.
Части 3-4: GenAI-трейсы, OTel/Langfuse.
Части 5-6: рынок и зрелость.
Часть 7: SOTA-стек и verdict.
OTel как нервная система + специализированный GenAI-слой поверх
SOTA — двухслойная схема
OpenTelemetry — substrate
Единый стандарт для сервисной telemetry.
Collector: redaction, sampling, fan-out.
GenAI-слой поверх
Langfuse, MLflow, Phoenix, Datadog.
Prompts, cost, evals, feedback, datasets.
Как выглядит цепочка от user request до AI backend
Mixed prod chain
User/API → app; agent → RAG/model/tool.
Logs, metrics, трейсы идут с контекстом трейса.
Collector: redaction, sampling, fan-out.
APM/infra backend + GenAI backend.
Development: ещё стабилизируется
Model, agent spans; GenAI events/metrics.
gen_ai.operation.name покрывает chat, retrieval, tools.
gen_ai.agent/tool идентифицируют actors.
gen_ai.usage.* даёт token metrics.
Decision episode: от пользовательского запроса до финального ответа
Не вокруг model call, а вокруг бизнес-решения
Span hierarchy
Root span = business operation.
Child spans = services + GenAI.
Signals
Events/scores: quality, eval, feedback, safety flags.
Metrics: latency, tokens, errors, cost.
OTel-first, Langfuse-as-AI-backend — самый зрелый паттерн
Langfuse используют внутри OTel-модели
Langfuse как OTel backend
OTLP endpoint: напрямую или через Collector.
Fan-out: Langfuse + обычный APM.
Langfuse SDK v3 over OTel
OTel client с AI-удобствами.
Tokens, prompts, scoring, observations.
OTel transport; Langfuse AI UX
Трейсы, sessions, observations как AI data.
Token/cost tracking с prompt-aware агрегацией.
Scores: feedback, judge, programmatic evals.
Prompt management, datasets, experiments, self-hosting.
OTel-first, APM-first, AI-platform-first, Auto-instrumentation
Trade-offs
OTel-first + AI backend: tracing, neutrality, fan-out.
APM-first: единый экран, слабее prompts/evals.
AI-platform-first: AI lifecycle + OTel protocol.
Auto-instrumentation: быстрый старт, семантика ещё расходится.
Честная оценка — что закрыто, что частично, что ещё болит
Сквозная корреляция и стандартизация
HTTP → agent → model/tool в трейсе.
Логи коррелируются по ID трейса/спана.
AI трассируют тем же механизмом.
OTel GenAI semconv покрывает spans/tools/evals.
Неплохо, не идеально
Tokens/latency first-class в OTel/Langfuse/Datadog.
Inferred pricing расходится с реальным биллингом.
Quality: scores, judges, eval result.
Regressions = деградация usefulness, а не exception.
Privacy, масштаб и совместная жизнь тулов
Privacy: prompts/outputs требуют allowlist/redaction.
Масштаб: GenAI-трейсы тяжелее, sampling сложнее.
Фильтрация спанов ломает целостность трейса.
TracerProvider conflicts между OTel-tools.
Пять принципов правильного стека для mixed prod system
Mixed prod design
OTel везде: трейсы, metrics, logs.
Collector: redaction, routing, fan-out.
AI-aware backend: Langfuse/MLflow/Datadog.
Корневой трейс = operation; evals рядом.
Отрасль повзрослела, но зрелость ещё не полная
SOTA = OTel protocol/context + AI interpretation/evals.
Сквозная mixed observability стала намного стандартнее.
Quality и privacy/governance остаются открытыми зонами.
tellmeabout.tech · ai4sdlc-research.space
OTel, GenAI telemetry, evals
OpenTelemetry documentation and GenAI semantic conventions.
Langfuse, MLflow, Phoenix and OpenInference tracing/evaluation docs.
Datadog LLM Observability; Azure AI Foundry.
Mixed Observability for GenAI
Материалы и ссылки — в канале "Книжный куб"
Александр Поломодов, Technical Director & Fellow, Т-Технологии
@Book_Cube