Локальная LLM нужна, когда тексты не должны уезжать во внешний API или когда счёт за токены уже больше, чем аренда железа. Для личного ассистента «поболтать и напомнить про счёт» облачная модель на дешёвом VPS обычно выгоднее и умнее.
Почему минимальный VPS не подходит
Типичный старт под Hermes — 2 ГБ. Этого хватает агенту, шлюзу и SSH. 7B-модель в квантизации занимает больше. Система начинает свопить, gateway перестаёт успевать, вы вините «кривой Hermes».
Ориентир: 8B q4 — думайте про 16 ГБ. Больше контекста и параллельных вызовов инструментов — ещё запас. GPU имеет смысл, только если вы сознательно строите локальный инференс, а не «попробовать ollama run» на том же тарифе, где крутится бот.
Две рабочие схемы
Всё на одной машине. Толстый VPS или домашняя коробка. Проще сеть, сложнее изоляция: модель и агент делят RAM.
Тонкий VPS + Ollama рядом. Hermes на дешёвом сервере, веса — дома или на GPU-хосте за VPN. В hermes model указываете свой base URL. Endpoint не публикуйте в открытый интернет без ключа.
Порядок внедрения
- Сначала добейтесь ответа облачной модели — так вы отделяете поломки агента от поломок инференса.
- Поднимите Ollama и проверьте
curlна/v1/chat/completions. - Переключите Hermes на endpoint.
- Оставьте облако как запасной маршрут, если локальная модель не тянет tool-calling.
Настройка провайдеров — в документации по моделям. Железо — в требованиях на странице установка Hermes на VPS.