Гайды по промпт-инжинирингу почти всегда пишут про GPT-4 или Claude — модели с десятками миллиардов параметров, которые прощают расплывчатые формулировки и сами достраивают недосказанное. Если вы подняли у себя Llama, Mistral или Qwen на 7–14B, часть этих советов работает хуже или не работает вовсе: маленькая модель не держит длинную цепочку условий, теряет инструкцию к середине ответа, путает формат. Разберём приёмы, которые реально помогают именно с открытыми моделями на своём сервере — и честно скажем, где нужно проверять на конкретной модели, а не…
Подробнее →