Зачем AI-агенту отдельная observability
Обычных HTTP-метрик недостаточно: один пользовательский запрос может запустить несколько model calls, tools, retries и background steps. Нужно видеть весь trajectory как одну операцию.
Trace на один пользовательский intent
Создавайте один root trace на задачу пользователя. Внутри него — spans для model call, retrieval, tool execution, validation, retry и final response. Так видно, где ушли latency и budget.
Логируйте tool calls как структурированные события
Для каждого tool call сохраняйте tool name, schema/version, sanitized arguments, status, duration, retry count и размер результата. Секреты и чувствительные данные должны редактироваться до записи.
Model calls тоже должны быть измеримыми
Фиксируйте provider/model version, prompt/template version, input/output tokens, latency, finish reason, cache hit и estimated cost. Полный raw prompt храните только там, где это допустимо по privacy policy.
Отделяйте agent latency от model latency
Пользователь видит end-to-end время. Поэтому отдельно измеряйте model latency, tool latency, queue time, orchestration overhead и time-to-first-token.
Ошибки и retries
Retry без telemetry скрывает проблемы. Записывайте причину retry: timeout, invalid structured output, tool error, safety rejection или failed validation. Следите за retry rate по model/tool/version.
Связывайте observability с evals
Trace должен позволять понять не только почему запрос был медленным, но и почему ответ оказался плохим. Сохраняйте eval result, task success, tool accuracy и regression labels рядом с trace ID.
Cost observability
Считайте cost на request, session, tenant и feature. Полезны p50/p95 cost, tokens per successful task и стоимость retries. Это помогает находить дорогие agent loops.
Privacy и redaction
Не отправляйте в telemetry passwords, API keys, payment data или лишние персональные данные. Используйте allowlist полей, hashing IDs и отдельные retention policies для debug payloads.
Полезные dashboards
Минимальный набор: success rate, p50/p95 latency, tool error rate, retry rate, token usage, cost per successful task, cache hit rate и top failing trajectories.
Alerting
Алерты должны реагировать не только на 5xx. Важны резкий рост tool failures, structured-output retries, cost per task, token usage, latency или падение eval score.
Production checklist
Root trace на пользовательскую задачу.
Spans для model, retrieval и tools.
Versioning prompts, schemas и models.
Token/cost metrics.
Retry/error reasons.
Privacy-safe redaction.
Evals linked to trace ID.
Dashboards по latency, quality и cost.
Alerts на regressions.
Ограниченный retention для debug payloads.
Вывод
Observability AI-агента должна показывать полный путь решения задачи. Когда traces, tool calls, model metrics, cost и evals связаны одним trace ID, команду перестают удивлять медленные, дорогие и нестабильные agent workflows.