Вы поменяли модель эмбеддингов, подправили параметры чанкинга или добавили реранкер — и теперь нужно понять, стало лучше или хуже. Открывать 50 диалогов руками и читать каждый ответ можно один раз, но не после каждого коммита в пайплайн. Дальше расскажу, как разложить оценку RAG на три отдельные измеримые метрики и прогонять их автоматически на небольшом наборе тестовых вопросов — без человека в цикле на каждой итерации.
Подробнее →