ИИ-ассистенты для кода не чувствуют времени и завышают оценки
Исследование выявило, что популярные ИИ-инструменты для разработки, такие как Claude Code и Codex, систематически и в разы переоценивают время выполнения задач, а также завышают оценку качества собственной работы, что ставит под сомнение их автономное использование.
ИИ-ассистенты для кода не чувствуют времени
Исследование выявило фундаментальную проблему у ИИ-ассистентов для написания кода: они лишены чувства времени. Эти системы систематически переоценивают, сколько времени займет выполнение задачи. Одна из моделей ошибается в прогнозах до десяти раз по сравнению с фактической длительностью.
Модели также переоценивают качество собственной работы, завышая его примерно на 20 процентных пунктов. Эта двойная ошибка в планировании и самооценке создает препятствие для их использования в длительных автономных рабочих процессах, где важны точное планирование и объективный контроль.
Проблема не сводится к простой погрешности. Отсутствие внутреннего понимания времени означает, что ИИ-агенты не могут корректно оценивать последовательность действий, их длительность и взаимозависимости. Они генерируют временные оценки как текстовый прогноз на основе паттернов в обучающих данных, без осознания временных промежутков. Это фундаментальное ограничение архитектуры современных языковых моделей, которые являются статическими предсказателями следующего токена, лишенными внутренних часов. В программировании, где оценка усилий и сроков - ключевая часть процесса, такая слепота становится критическим недостатком.
Эксперименты показывают, что агенты, которым давали задачи, требующие понимания временных интервалов, демонстрировали низкую точность. Например, в одном тесте, где нужно было оценить время выполнения определенного числа операций, результаты были далеки от реальности. Это подтверждает, что проблема носит системный характер и связана с базовой архитектурой, а не с конкретной реализацией.
Для отрасли автоматизации разработки это исследование указывает на важный рубеж. Пока ИИ-агенты не научатся адекватно оценивать время и объективно судить о результатах своей работы, их автономное развертывание будет сопряжено с рисками. Разработчики, рассчитывающие на полностью самостоятельных ИИ-помощников для управления проектами, могут столкнуться с срывами сроков и необъективной обратной связью. Человеческий надзор и промежуточный контроль остаются незаменимыми, особенно для длительных операций.
Пользователям - разработчикам и командам - нельзя полагаться на временные оценки, сгенерированные подобными ассистентами, без их проверки и калибровки человеком. Автономный запуск агента на выполнение задачи с дедлайном, основанным на его собственной оценке, с высокой вероятностью приведет к провалу. Более безопасный подход - использовать ИИ для генерации кода или решения конкретных подзадач, оставляя планирование, распределение времени и итоговую оценку качества за человеком.
В долгосрочной перспективе работа указывает на необходимость новых архитектурных решений. Следующее поколение ИИ-агентов для автоматизации будет нуждаться в специализированных модулях для восприятия и оценки времени, возможно, через интеграцию с симуляциями или механизмами, отслеживающими прогресс выполнения в реальном времени. Без такого прорыва агенты останутся мощными, но слепыми к времени инструментами, чьи прогнозы требуют обязательной человеческой проверки.


