Собрали RAG по внутренним документам — и через неделю эксплуатации система начала уверенно нести чушь. Не «не знаю», а именно неверные ответы на вопросы, где нужный абзац лежал в базе прямым текстом. Первая реакция была предсказуемой: «модель слабая, надо менять на другую». Оказалось — дело не в модели, а в том, как документы порезали на куски перед индексацией. Разберём инцидент по шагам: с чего началось, куда смотрели зря, что нашли на самом деле и как починили.
Подробнее →