Две трети токенов Claude Code уходят на рост контекста, а не на код: как оптимизировать расход
Разработчик, использовавший Claude Code для создания веб-приложения, обнаружил, что основная часть токенов тратится не на генерацию кода, а на накопление контекста в длинных сессиях. Анализ показал, что 22 длинные сессии съели две трети всего расхода, в то время как ответы модели составили лишь полпроцента.
Разработчики, использующие AI-ассистенты для написания кода, часто сталкиваются с быстрым исчерпанием лимитов токенов. Принято винить генерацию кода, но корень проблемы - неэффективное управление контекстом диалога.
Автор статьи на Habr (ID 1077658) полгода разрабатывал веб-лист для D&D 5e с помощью Claude Code. Его подписка заканчивалась к обеду. Анализ транскриптов показал: ответы модели составляли всего 5% от общего расхода токенов. Две трети токенов ушли на 22 длинные сессии, где контекст неуклонно рос. За полгода работы было потрачено 5,75 миллиарда токенов.
Длинная сессия дороже нескольких коротких, решающих те же задачи. Языковая модель получает весь предыдущий диалог с каждым запросом. В процессе разработки история диалога может разрастись до огромных размеров, и вы платите за многократную пересылку одной и той же информации. Простой скрипт для замера расхода, занимающий 9 строк кода, четко показывает эту динамику.
Осознав проблему, разработчик внедрил несколько приемов для оптимизации.
Жесткий лимит на длину сессии через механизм Stop-хуков, принудительно завершающий диалог после достижения порога. Вместо просьбы к модели "разведать" код проекта - ручное предоставление структурированной "карты проекта": краткого описания ключевых файлов и их назначения. Запрет на повторное чтение одних и тех же файлов в рамках сессии, чтобы избежать дублирования информации в контексте. Вынос рутинных задач (проверка кода в браузере) в отдельного "сабагента". Поручение простых шаблонных операций более дешевым моделям, чтобы разгрузить дорогой Claude Code для сложных архитектурных задач.
Эта история демонстрирует важный принцип. Стоимость использования мощных моделей зависит не только от их возможностей, но и от грамотного управления процессом. Разработчикам нужна осознанная работа с контекстом: проектирование сессий, сегментация задач и выбор подходящего инструмента для каждой работы. Реальные расходы сильно зависят от сценариев использования и требуют планирования.
ИИ-ассистент - не универсальный собеседник, а набор специализированных инструментов. Эффективность работы с языковыми моделями зависит от инженерных практик, которые превращают сырую технологию в управляемый ресурс. Контроль над размером контекста, как показал пример с 22 длинными сессиями, является ключевым фактором экономии. Без таких практик значительная часть бюджета, как те 5,75 миллиарда токенов, уходит на оплату избыточных данных, а не на решение задач.


