Когда в LMSYS начали тестировать собственного ИИ-агента поддержки, выяснилось, что десяток выбранных метрик не дают ответа на главный вопрос: сколько из обращений бот действительно решает. В то время как текстовые оценки показывали 18 баллов из 20, реальная работоспособность падала до 8. Проблема заключалась в том, что судья опирался только на текст диалога, игнорируя вызовы инструментов и конечный результат. Простая проверка показала, что даже правдоподобные ответы часто оказывались фейковыми решениями, а метрики измеряли не то, что нужно, а то, насколько текст бота согласован с его внутренними флагами.
Попытки исправить ситуацию зашли в тупик: каждая метрика что-то измеряла, но ни одна не приближала к пониманию реальной эффективности. Тогда разработчики приняли радикальное решение — вынести оценку качества в отдельный сервис, который должен был опираться на «источник истины». Это означало переход от поверхностного анализа текста к комплексному подходу, учитывающему реальные действия бота и последствия его решений.
Первая версия нового судьи тоже оказалась неудачной. Она опиралась на эталонные наборы данных, но система продолжала доверять неправильным ошибкам. Только после второго переписывания формулы вердикта и добавления новых слоёв контроля удалось приблизиться к объективной оценке. В процессе тестирования команда поймала слепые зоны, которые раньше ускользали от внимания, и поняла, насколько сложно объективно оценивать ИИ, не имея чётких критериев успеха.
Теперь LMSYS использует обновлённую систему, которая учитывает не только текстовые ответы, но и реальные последствия действий бота. Это означает не только более точную оценку качества, но и возможность сравнивать разные модели между собой. Для пользователей это важно, так как теперь можно выбирать ИИ-ассистентов, которые действительно решают задачи, а не просто выглядят убедительно. Для разработчиков же это шаг к созданию более надёжных и прозрачных систем.



