LangGraph Server автоматически поднимает REST API для локальной LLM на 16 ГБ VRAM
Selectel опубликовал вторую часть гайда по запуску облачной LLM на 16 ГБ VRAM. В этот раз — построение графовой инфраструктуры LangGraph с автоматическим созданием REST API, трейсингом в LangSmith и SDK для разработки.
Что
Практическое руководство по интеграции локальной LLM (на 16 ГБ VRAM) в продуктивную среду с использованием стека LangGraph Server, LangSmith и LangGraph SDK. Код и конфигурации приводятся для OpenAI-совместимого протокола.
Как
Архитектура строится вокруг графа состояний (state graph) в LangGraph. Ключевая идея: вы описываете логику агента в виде графа с узлами и переходами, а LangGraph Server автоматически генерирует для него REST API-эндпоинты. Это избавляет от необходимости писать обвязку (FastAPI/Flask) вручную.
Для локальной модели используется прокси-адаптер, который транслирует запросы в формат, понятный локальному инференс-серверу (например, vLLM или Ollama). LangSmith обеспечивает трейсинг каждого вызова графа: видны промпты, ответы, токены и задержки.
Цифры
- VRAM: 16 ГБ (ограничение, определяющее выбор модели — например, 7B-модели в квантизации).
- Автоматический API: LangGraph Server поднимает REST API для каждого скомпилированного графа без дополнительного кода.
- Трейсинг: LangSmith фиксирует полный вызов графа, включая промежуточные шаги, использование токенов и latency.
Что перенять
Паттерн «граф состояний как единица логики + автоматический API» позволяет быстро превратить прототип агента в микросервис. Если ваша логика укладывается в DAG (например, классификация → извлечение → генерация), LangGraph избавит от написания boilerplate-кода для API и мониторинга.
LangGraph компилирует логику агента в граф состояний и автоматически поднимает для него REST API — это убирает boilerplate-код обвязки и даёт встроенный трейсинг вызовов.