Настройка LLM и AI-агентов под задачу/aka-gst

Раздел · 3 мин

Архитектура сервиса

Содержание раздела
  1. Базовые компоненты
  2. Как выбирать модель
  3. Когда нужен RAG
  4. Когда нужен fine-tuning

Базовые компоненты

  • Модель формирует решение или следующий шаг.
  • Системная инструкция задаёт роль, цель и запреты.
  • Контекст содержит текущую задачу и необходимые данные.
  • Инструменты выполняют строго определённые действия вне модели.
  • Agent loop повторяет цикл «решение → инструмент → результат» до завершения или лимита.
  • Память хранит только нужное состояние между шагами или сессиями.
  • Guardrails проверяют вход, выход, разрешения и лимиты.
  • Evaluation показывает, насколько система решает реальные задачи.

Как выбирать модель

Проверяем не рейтинг в интернете, а собственный набор задач:

  1. качество на нужном языке и в нужной предметной области;
  2. корректность structured output и tool calling;
  3. скорость и требования к памяти/GPU;
  4. стоимость запроса;
  5. допустимость передачи клиентских данных;
  6. лицензия модели и условия провайдера.

Локальные модели удобно запускать через Ollama. Облачные модели подключаются через официальный API или OpenAI-compatible провайдер. Секретные и персональные данные нельзя отправлять в облако без согласованного основания.

Когда нужен RAG

RAG подходит, если ответы должны опираться на документы клиента, которые часто меняются. Документы разбиваются на фрагменты, для них считаются embeddings, затем к запросу подбираются релевантные фрагменты. Модель получает только найденный контекст и должна ссылаться на источник.

Когда нужен fine-tuning

Fine-tuning рассматривается, если нужно устойчиво изменить стиль, формат или повторяющееся поведение и это не удаётся получить инструкциями и примерами. Для фактов, инструкций и обновляемой базы знаний обычно лучше RAG.

Перед fine-tuning необходимы:

  • очищенный и законно полученный датасет;
  • разделение train/validation/test;
  • исходный benchmark;
  • понятная метрика улучшения;
  • оценка стоимости обучения и дальнейшего inference.