Зачем разбираться в теме
Token budget для LLM: как управлять context window — это не отдельный трюк, а часть production-архитектуры LLM-приложения. Ниже — практический способ внедрить подход так, чтобы качество можно было измерить, а изменения безопасно откатить.
Context — ограниченный ресурс
Даже при большом context window лишние токены увеличивают cost и latency. Заранее распределите бюджет между system instructions, history, retrieved evidence и output.
Резерв под output
Не заполняйте вход до максимума. Оставляйте запас под reasoning/output и tool results, иначе система начнёт аварийно truncate.
History policy
Старые turns можно compact или summarise, но важные user constraints и unresolved state должны оставаться структурированно доступными.
RAG budget
Выбирайте не просто top-k, а максимальный token budget для evidence. Reranking помогает заполнить его наиболее полезными chunks.
Tool outputs
API часто возвращают огромный JSON. Нормализуйте и обрезайте поля до передачи модели, сохраняя полный payload вне context для аудита.
Metrics
Логируйте input/output/cached tokens, truncation events, context composition и task success. Так видно, какой слой расходует бюджет без пользы.
Production checklist
Зафиксируйте исходный baseline и dataset.
Версионируйте конфигурацию и данные.
Логируйте ключевые входы, решения и ошибки.
Измеряйте качество вместе с latency и cost.
Не передавайте модели права, которые можно проверить детерминированно.
Запускайте изменения через feature flag или контролируемый cutover.
Держите rollback path до завершения наблюдаемого периода.
Вывод
Хорошая реализация отличается не количеством компонентов, а управляемостью: понятный контракт, измеримые метрики, безопасные границы и возможность воспроизвести результат. Начинайте с простого baseline и усложняйте систему только там, где evals показывают реальный выигрыш.