| masha_spb |
| Junior |
Сообщения: 66 |
Репутация: 50 |
| Дата регистрации: |
| 11.08.2026 |
АВТОР ТЕМЫ21 сент. 2026 г., 21:40 (GMT+3)
Накипело за месяц консультаций, соберу в одном месте, потому что спрашивают по кругу. Симптом всегда один: «поставил rag по своим документам, а он выдаёт неправильную цифру/срок/пункт, причём уверенно». Люди грешат на модель и бегут за 32b. Модель почти никогда не виновата.
Где на самом деле ломается, по частоте:
1. Нарезка. Порезали pdf слепо по 2000 символов — таблица разъехалась, цифра оторвалась от подписи. Модель честно взяла что дали. Режьте по смыслу: пункты, разделы, приложения.
2. Поиск достал не тот кусок. Дали в контекст соседний абзац, где похожие слова, но другая цифра. Проверьте, что реально попадает в контекст, а не «наверное нужное».
3. Модель дополнила пробел. Если в найденном куске ответа нет, слабая модель не скажет «не нашла», а сочинит правдоподобное. Лечится промптом «отвечай только из контекста, если нет — так и скажи» и показом источника.
4. И только потом — размер модели.
Как ловить: включите показ источника (AnythingLLM/Open WebUI умеют), и на каждый подозрительный ответ смотрите не на ответ, а на то, какой фрагмент модель процитировала. В 8 из 10 случаев видно, что фрагмент не тот, и проблема в поиске/нарезке, а не в «глупой модели».
Кто уже собрал rag на живых документах — на чём чаще горели, на нарезке или на выдумках? Интересно, совпадает ли моя статистика с вашей.
Где на самом деле ломается, по частоте:
1. Нарезка. Порезали pdf слепо по 2000 символов — таблица разъехалась, цифра оторвалась от подписи. Модель честно взяла что дали. Режьте по смыслу: пункты, разделы, приложения.
2. Поиск достал не тот кусок. Дали в контекст соседний абзац, где похожие слова, но другая цифра. Проверьте, что реально попадает в контекст, а не «наверное нужное».
3. Модель дополнила пробел. Если в найденном куске ответа нет, слабая модель не скажет «не нашла», а сочинит правдоподобное. Лечится промптом «отвечай только из контекста, если нет — так и скажи» и показом источника.
4. И только потом — размер модели.
Как ловить: включите показ источника (AnythingLLM/Open WebUI умеют), и на каждый подозрительный ответ смотрите не на ответ, а на то, какой фрагмент модель процитировала. В 8 из 10 случаев видно, что фрагмент не тот, и проблема в поиске/нарезке, а не в «глупой модели».
Кто уже собрал rag на живых документах — на чём чаще горели, на нарезке или на выдумках? Интересно, совпадает ли моя статистика с вашей.
0