Зачем AI-агенту отдельная observability

Обычных HTTP-метрик недостаточно: один пользовательский запрос может запустить несколько model calls, tools, retries и background steps. Нужно видеть весь trajectory как одну операцию.

Trace на один пользовательский intent

Создавайте один root trace на задачу пользователя. Внутри него — spans для model call, retrieval, tool execution, validation, retry и final response. Так видно, где ушли latency и budget.

Логируйте tool calls как структурированные события

Для каждого tool call сохраняйте tool name, schema/version, sanitized arguments, status, duration, retry count и размер результата. Секреты и чувствительные данные должны редактироваться до записи.

Model calls тоже должны быть измеримыми

Фиксируйте provider/model version, prompt/template version, input/output tokens, latency, finish reason, cache hit и estimated cost. Полный raw prompt храните только там, где это допустимо по privacy policy.

Отделяйте agent latency от model latency

Пользователь видит end-to-end время. Поэтому отдельно измеряйте model latency, tool latency, queue time, orchestration overhead и time-to-first-token.

Ошибки и retries

Retry без telemetry скрывает проблемы. Записывайте причину retry: timeout, invalid structured output, tool error, safety rejection или failed validation. Следите за retry rate по model/tool/version.

Связывайте observability с evals

Trace должен позволять понять не только почему запрос был медленным, но и почему ответ оказался плохим. Сохраняйте eval result, task success, tool accuracy и regression labels рядом с trace ID.

Cost observability

Считайте cost на request, session, tenant и feature. Полезны p50/p95 cost, tokens per successful task и стоимость retries. Это помогает находить дорогие agent loops.

Privacy и redaction

Не отправляйте в telemetry passwords, API keys, payment data или лишние персональные данные. Используйте allowlist полей, hashing IDs и отдельные retention policies для debug payloads.

Полезные dashboards

Минимальный набор: success rate, p50/p95 latency, tool error rate, retry rate, token usage, cost per successful task, cache hit rate и top failing trajectories.

Alerting

Алерты должны реагировать не только на 5xx. Важны резкий рост tool failures, structured-output retries, cost per task, token usage, latency или падение eval score.

Production checklist

  • Root trace на пользовательскую задачу.

  • Spans для model, retrieval и tools.

  • Versioning prompts, schemas и models.

  • Token/cost metrics.

  • Retry/error reasons.

  • Privacy-safe redaction.

  • Evals linked to trace ID.

  • Dashboards по latency, quality и cost.

  • Alerts на regressions.

  • Ограниченный retention для debug payloads.

Вывод

Observability AI-агента должна показывать полный путь решения задачи. Когда traces, tool calls, model metrics, cost и evals связаны одним trace ID, команду перестают удивлять медленные, дорогие и нестабильные agent workflows.