MarathonMemBench: новый бенчмарк для тестирования долговременной памяти AI-агентов
Разработчик представил бенчмарк MarathonMemBench, который проверяет способность языковых моделей запоминать детали из многочасовых диалогов, когда начальные факты уже вытеснены из контекста.
В развитии AI-агентов есть проблема: как оценить их долговременную память. Нужно понять, запоминает ли модель детали из начала долгого диалога, когда они уже вышли за пределы её контекстного окна. Существующие методы часто требуют специальной адаптации агента под конкретный тест, что искажает оценку его реальных возможностей. MarathonMemBench - это платформа нового типа. Она тестирует память любого чат-бота без дополнительных доработок.
Платформа устроена так: LLM-персонаж ведет многочасовую беседу с тестируемым агентом. В диалоге персонаж рассказывает факты о жизни, меняет решения, путается и поправляется. Это создает сложный и реалистичный сценарий. Ключевой момент - в конце, когда начало разговора уже забыто моделью. Персонаж устраивает экзамен по всему сказанному ранее. Такой подход проверяет, насколько хорошо агент сохранил информацию из начала сессии.
Главный недостаток других бенчмарков памяти - они требуют дорабатывать агента под себя. MarathonMemBench решает эту проблему. К платформе можно подключить любого агента с чат-интерфейсом. Это дает реалистичную оценку способности модели хранить и использовать информацию в длительных диалогах. Такая оценка критически важна для создания полноценных AI-агентов, способных на продолжительное взаимодействие.
Для индустрии ИИ этот инструмент - шаг к стандартизации оценки долговременной памяти. Разработчики получают объективный инструмент для сравнения разных моделей в условиях, близких к реальным. Пользователи в перспективе выиграют от более надежных ассистентов, способных вести длительные диалоги без потери контекста. Платформа также позволяет проводить 'вскрытие' памяти агентов после тестов. Это дает ценную информацию исследователям, работающим над архитектурами хранения данных в LLM.
Результаты тестирования open-source-агентов на платформе оказались неожиданно сильными. Это указывает на значительный прогресс даже у публично доступных моделей. MarathonMemBench задает новый стандарт для оценки способности моделей сохранять связность в диалогах, длящихся часами и содержащих сотни сообщений.


