LLM

Две трети токенов Claude Code уходят на рост контекста, а не на код: как оптимизировать расход

Разработчик, использовавший Claude Code для создания веб-приложения, обнаружил, что основная часть токенов тратится не на генерацию кода, а на накопление контекста в длинных сессиях. Анализ показал, что 22 длинные сессии съели две трети всего расхода, в то время как ответы модели составили лишь полпроцента.

Иллюстрация к новости: Две трети токенов Claude Code уходят на рост контекста, а не на код: как оптимизировать расход

Разработчики, использующие AI-ассистенты для написания кода, часто сталкиваются с быстрым исчерпанием лимитов токенов. Принято винить генерацию кода, но корень проблемы - неэффективное управление контекстом диалога.

Автор статьи на Habr (ID 1077658) полгода разрабатывал веб-лист для D&D 5e с помощью Claude Code. Его подписка заканчивалась к обеду. Анализ транскриптов показал: ответы модели составляли всего 5% от общего расхода токенов. Две трети токенов ушли на 22 длинные сессии, где контекст неуклонно рос. За полгода работы было потрачено 5,75 миллиарда токенов.

Длинная сессия дороже нескольких коротких, решающих те же задачи. Языковая модель получает весь предыдущий диалог с каждым запросом. В процессе разработки история диалога может разрастись до огромных размеров, и вы платите за многократную пересылку одной и той же информации. Простой скрипт для замера расхода, занимающий 9 строк кода, четко показывает эту динамику.

Осознав проблему, разработчик внедрил несколько приемов для оптимизации.

Жесткий лимит на длину сессии через механизм Stop-хуков, принудительно завершающий диалог после достижения порога. Вместо просьбы к модели "разведать" код проекта - ручное предоставление структурированной "карты проекта": краткого описания ключевых файлов и их назначения. Запрет на повторное чтение одних и тех же файлов в рамках сессии, чтобы избежать дублирования информации в контексте. Вынос рутинных задач (проверка кода в браузере) в отдельного "сабагента". Поручение простых шаблонных операций более дешевым моделям, чтобы разгрузить дорогой Claude Code для сложных архитектурных задач.

Эта история демонстрирует важный принцип. Стоимость использования мощных моделей зависит не только от их возможностей, но и от грамотного управления процессом. Разработчикам нужна осознанная работа с контекстом: проектирование сессий, сегментация задач и выбор подходящего инструмента для каждой работы. Реальные расходы сильно зависят от сценариев использования и требуют планирования.

ИИ-ассистент - не универсальный собеседник, а набор специализированных инструментов. Эффективность работы с языковыми моделями зависит от инженерных практик, которые превращают сырую технологию в управляемый ресурс. Контроль над размером контекста, как показал пример с 22 длинными сессиями, является ключевым фактором экономии. Без таких практик значительная часть бюджета, как те 5,75 миллиарда токенов, уходит на оплату избыточных данных, а не на решение задач.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…