Базовые компоненты
- Модель формирует решение или следующий шаг.
- Системная инструкция задаёт роль, цель и запреты.
- Контекст содержит текущую задачу и необходимые данные.
- Инструменты выполняют строго определённые действия вне модели.
- Agent loop повторяет цикл «решение → инструмент → результат» до завершения или лимита.
- Память хранит только нужное состояние между шагами или сессиями.
- Guardrails проверяют вход, выход, разрешения и лимиты.
- Evaluation показывает, насколько система решает реальные задачи.
Как выбирать модель
Проверяем не рейтинг в интернете, а собственный набор задач:
- качество на нужном языке и в нужной предметной области;
- корректность structured output и tool calling;
- скорость и требования к памяти/GPU;
- стоимость запроса;
- допустимость передачи клиентских данных;
- лицензия модели и условия провайдера.
Локальные модели удобно запускать через Ollama. Облачные модели подключаются через официальный API или OpenAI-compatible провайдер. Секретные и персональные данные нельзя отправлять в облако без согласованного основания.
Когда нужен RAG
RAG подходит, если ответы должны опираться на документы клиента, которые часто меняются. Документы разбиваются на фрагменты, для них считаются embeddings, затем к запросу подбираются релевантные фрагменты. Модель получает только найденный контекст и должна ссылаться на источник.
Когда нужен fine-tuning
Fine-tuning рассматривается, если нужно устойчиво изменить стиль, формат или повторяющееся поведение и это не удаётся получить инструкциями и примерами. Для фактов, инструкций и обновляемой базы знаний обычно лучше RAG.
Перед fine-tuning необходимы:
- очищенный и законно полученный датасет;
- разделение train/validation/test;
- исходный benchmark;
- понятная метрика улучшения;
- оценка стоимости обучения и дальнейшего inference.