LLM

LLM-судья для hh.ru: почему оценка ИИ-моделей оказалась сложнее, чем кажется

Опыт hh.ru по созданию системы автоматической оценки качества нейроразбора резюме показал, что построение надежного LLM-судьи - это самостоятельная и ресурсоемкая инженерная задача, а не быстрый хак.

Иллюстрация к новости: LLM-судья для hh.ru: почему оценка ИИ-моделей оказалась сложнее, чем кажется

Разработчики hh.ru создавали ИИ-помощник для работы с резюме. Ключевая задача - оценка качества нейроразбора, который извлекает данные из текста. Идея использовать для этого другую большую языковую модель (LLM) в роли судьи казалась простой. Но на практике стало ясно: создать такого судью легко, а вот заставить его оценки быть надежными - сложно. Этот процесс превратился в разработку отдельного продукта.

Проблема простого подхода, когда LLM просто просят "оценить качество", - в субъективности и дороговизне. Модель-судья может выдавать противоречивые вердикты, а каждый запрос стоит денег. Команда hh.ru отказалась от общей оценки в пользу конкретных измеримых аспектов. Например, полнота извлечения сущностей и их корректность. Для каждой рубрики пришлось создавать специализированные промпты и эталонные датасеты, чтобы калибровать судью.

Ключевой инженерной задачей стала воспроизводимость оценок. LLM-судья не должен быть черным ящиком. Разработчики внедрили регулярную валидацию его вердиктов на эталонных данных, чтобы отслеживать дрейф модели. Также потребовалась инфраструктура для массовых оценочных экспериментов и анализа. Это позволило не только оценивать основную модель нейроразбора, но и проводить A/B-тестирование разных промптов и самих моделей-судей, выбирая эффективные конфигурации. Оценка превратилась из разовой операции в непрерывный процесс.

Этот опыт важен для всей отрасли разработки LLM-приложений. Он показывает распространенную ошибку - недооценку ресурсов на создание надежного инструмента оценки. Многие думают, что можно быстро отправить выводы своей модели в GPT и получить метрику качества. На деле без продуманной системы валидации такие оценки ненадежны и могут привести к ложным выводам. Для пользователей это означает, что за простым интерфейсом стоит сложная работа по обеспечению точности алгоритмов.

Отрасль движется к стандартизации практик MLOps для LLM, где оценка и мониторинг моделей становятся неотъемлемой частью цикла разработки. Успешные проекты будут вынуждены инвестировать в создание собственных оценочных фреймворков, эталонных датасетов и автоматизированных пайплайнов валидации. Это повышает порог входа для создания качественных коммерческих LLM-решений.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…