Сообщество / Гайды

почему локальный rag уверенно врёт про цифры и как это ловить

masha_spb
Junior
Сообщения: 66
Репутация: 50
Дата регистрации:
11.08.2026
АВТОР ТЕМЫ21 сент. 2026 г., 21:40 (GMT+3)
Накипело за месяц консультаций, соберу в одном месте, потому что спрашивают по кругу. Симптом всегда один: «поставил rag по своим документам, а он выдаёт неправильную цифру/срок/пункт, причём уверенно». Люди грешат на модель и бегут за 32b. Модель почти никогда не виновата.
Где на самом деле ломается, по частоте:
1. Нарезка. Порезали pdf слепо по 2000 символов — таблица разъехалась, цифра оторвалась от подписи. Модель честно взяла что дали. Режьте по смыслу: пункты, разделы, приложения.
2. Поиск достал не тот кусок. Дали в контекст соседний абзац, где похожие слова, но другая цифра. Проверьте, что реально попадает в контекст, а не «наверное нужное».
3. Модель дополнила пробел. Если в найденном куске ответа нет, слабая модель не скажет «не нашла», а сочинит правдоподобное. Лечится промптом «отвечай только из контекста, если нет — так и скажи» и показом источника.
4. И только потом — размер модели.
Как ловить: включите показ источника (AnythingLLM/Open WebUI умеют), и на каждый подозрительный ответ смотрите не на ответ, а на то, какой фрагмент модель процитировала. В 8 из 10 случаев видно, что фрагмент не тот, и проблема в поиске/нарезке, а не в «глупой модели».
Кто уже собрал rag на живых документах — на чём чаще горели, на нарезке или на выдумках? Интересно, совпадает ли моя статистика с вашей.
0
gleb_tomsk
Junior
Сообщения: 41
Репутация: 26
Дата регистрации:
21.08.2026
21 сент. 2026 г., 22:20 (GMT+3)
masha_spb подпишусь и добавлю железную сторону: люди бегут за 32b, упираются в своп на восьмёрке, получают минуту на ответ и решают, что «ии тупой». А проблема была в нарезке, которую 32b не лечит, просто делает те же ошибки медленнее и дороже. Порядок правильный: сначала нарезка и поиск, модель последней. Я сам раз пять ловил себя на «давай побольше модель», а надо было чанки чинить.
1
igor_kzn
Junior
Сообщения: 29
Репутация: 14
Дата регистрации:
28.08.2026
21 сент. 2026 г., 22:45 (GMT+3)
masha_spb вот про «сочинит правдоподобное» — это для нас, юристов, самое страшное. Одно дело не найти, другое — выдать несуществующий пункт уверенно, потом на это сошлются. Мы поэтому и держим показ источника обязательным: сотрудник видит, из какого договора взято, и перепроверяет. Спасибо, что разложили, отправлю это своим младшим вместо лекции.
1
D
dasha_voice
Junior
Сообщения: 6
Репутация: 0
Дата регистрации:
08.09.2026
22 сент. 2026 г., 10:15 (GMT+3)
masha_spb у меня та же беда, только с расшифровками: спрашиваю «что спикер сказал про сроки», а оно уверенно цитирует то, чего в записи не было. Оказалось ровно ваш пункт 3 + кривые таймкоды при нарезке. Включила показ источника — сразу видно, что фрагмент из другого куска интервью. Забрала цитату про «модель попросили быть умной не в том месте», это прям про мой случай.
0
K
kostya_gw
Junior
Сообщения: 3
Репутация: 1
Дата регистрации:
20.09.2026
22 сент. 2026 г., 12:30 (GMT+3)
masha_spb это надо в закреп. Я через litellm гоняю несколько моделей и вижу: на плохой нарезке даже облачная gpt мажет так же, как локальная 7b. То есть слой модели реально последний. Промпт «только из контекста, иначе скажи что нет» у меня снизил выдумки сильнее, чем смена модели. Подтверждаю статистику: у меня горело на нарезке и на «поиск достал соседнее».
1