8 сентября 2026 · 6 минут

Локальные модели: когда это имеет смысл

Hermes спокойно говорит с Ollama, vLLM и любым OpenAI-совместимым endpoint. Это не отменяет физику: веса модели должны куда-то поместиться.

Локальная LLM нужна, когда тексты не должны уезжать во внешний API или когда счёт за токены уже больше, чем аренда железа. Для личного ассистента «поболтать и напомнить про счёт» облачная модель на дешёвом VPS обычно выгоднее и умнее.

Почему минимальный VPS не подходит

Типичный старт под Hermes — 2 ГБ. Этого хватает агенту, шлюзу и SSH. 7B-модель в квантизации занимает больше. Система начинает свопить, gateway перестаёт успевать, вы вините «кривой Hermes».

Ориентир: 8B q4 — думайте про 16 ГБ. Больше контекста и параллельных вызовов инструментов — ещё запас. GPU имеет смысл, только если вы сознательно строите локальный инференс, а не «попробовать ollama run» на том же тарифе, где крутится бот.

Две рабочие схемы

Всё на одной машине. Толстый VPS или домашняя коробка. Проще сеть, сложнее изоляция: модель и агент делят RAM.

Тонкий VPS + Ollama рядом. Hermes на дешёвом сервере, веса — дома или на GPU-хосте за VPN. В hermes model указываете свой base URL. Endpoint не публикуйте в открытый интернет без ключа.

Порядок внедрения

  1. Сначала добейтесь ответа облачной модели — так вы отделяете поломки агента от поломок инференса.
  2. Поднимите Ollama и проверьте curl на /v1/chat/completions.
  3. Переключите Hermes на endpoint.
  4. Оставьте облако как запасной маршрут, если локальная модель не тянет tool-calling.

Настройка провайдеров — в документации по моделям. Железо — в требованиях на странице установка Hermes на VPS.