Hermes - AI агент и ollama. 100% локальный помощник.

Самохостятам привет!
Не знаю, буду ли записывать видео про это, но решил сделать пару заметок.

Дисклеймер1

автор не является экспертом в направлении AI, выражает свое восприятие мира, не претендуя на 100% правильность

Дисклеймер2

Если меня попросить описать в двух словах, а чем это отличается от chatgpt?
Уровни развития AI(в моей голове):
– LLM
языковые модели с которыми мы можем вести диалог в виде чата, ограничены своии знаниях тем, чему их научили в момент тренинга модели
— LLM+RAG
мы научились дообучать и давать моделям наши базы знания
---- LLM + MCP TOOLS
появились инструменты, вот тебе email_tool, модель может по запросу в чате - найти у себя инструмент и используя его сделать какие-то действия, от проверки почты до поиска и ресерча в сети
------ LLM AGENTS(например OpenClaw)
уже могут работать более автономно, умеют управлять VM\физической средой\работать с файлами , имеют доступы к базовым операциям: найти файл, создать новый, прочитать логи, поискать в сети, прочее + имеют из коробки широкий спектр инструментов, можете просто их дообучать и прописывать им знания в файлы .MD
---------- LLM AGENTS v2 (например Hermes)
пришло cамообучение.. * *У меня получилось со второй попытки помочь\выполнить задачу - преобразую это в SKILL #X. Узнал новое о пользователе - запишу себе в память. Сами правят свои MD файлы

Hermes

Hermes Agent — это автономный ИИ-агент с открытым исходным кодом, разработанный исследовательской лабораторией Nous Research. В отличие от обычных чат-ботов или дополнений для написания кода (копилотов), Hermes Agent работает постоянно на вашем сервере, ПК или в облаке, обладает долгосрочной памятью и способен самостоятельно обучаться и создавать новые навыки в процессе решения задач.


Ключевые особенности и возможности

  • Самообучающийся цикл (Learning Loop): Агент не просто помнит контекст беседы, он анализирует свои успешные действия и автоматически формирует «документы навыков» в открытом стандарте agentskills.io, которые использует в будущем.
  • Долгосрочная память: Хранит профиль пользователя, его предпочтения и детали проектов локально на вашем устройстве, избавляя от необходимости каждый раз заново объяснять контекст.
  • Изолированная среда выполнения: Поддерживает 6 различных бэкендов для безопасного запуска терминальных команд и кода (локально, Docker, SSH, Daytona, Singularity, Modal).
  • Кроссплатформенный доступ (Gateway): Агент может жить на сервере, но общаться с вами через интерфейсы CLI, десктопное приложение или ботов в более чем 20 мессенджерах (Telegram, Discord, Slack, WhatsApp и др.).
  • Широкий набор инструментов: Из коробки поддерживает поиск в веб, автоматизацию браузера, чтение изображений (computer vision), генерацию картинок и озвучку текста (TTS). Также поддерживает интеграцию с любыми серверами протокола MCP (Model Context Protocol).
  • Конфиденциальность: Полное отсутствие телеметрии и скрытого сбора данных.

Как установить?

  • Windows\MacOS дестопные приложения берем с оф. сайте
  • Linux, macOS, WSL2, Termux
    curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
  • Proxmox LXC helper скриптами

Запускаем, подключаем к локальной ollama
и вот у Вас локальный помощник, который по команде идет и

  • чатает логи
  • создает файлы
  • запускает сервисы
  • ходит по ssh
  • …много вобщем всего…

скорость - чистой воды зависимость от Вашего железа..
вот пример, amd 780m igpu, 4 минуты.. не быстро.. но справился..
*что такое сходи домой - агент уже себе записал, понимает куда идти

Доп. полезности

1. Как дать агенту видеть все модели ollama?

По умолчанию - перезапускать seup и выбирать модель там.. неудобно..
завершив базовую настройку
идем в ~/.harmes/config.yaml
внизу ищем

custom_providers:
  - name: ollama_local
    base_url: http://192.168.1.175:11434/v1
    model: gpt-oss:20b
    tools: true
  • просто добавляем “s” в слове model => models
  • сохранить и перезапустить агента
    теперь по команде /model видна не 1 модель, а все доступные на вашем сервере

2. Все ли модели ollama подходят?

Нет, у моделей должна быть поддержка инструментов(tools)

Ну и если модель совсем маленькая(читай глупая), то даже наличие отвертки в кармане - не дает возможность осознать, как ей закрутить шуруп..
Спотыкаются и ничего не делают

Что можно попробовать на слабом железе?

3. Выдал ip\login\password и попросил пойти ssh, а он говорит ошибка авторизации, просит проверить сервер, но там все работает корректно?

На слабых модельках, по понятным причинам, мысли они не всегда выражают верно, но спустя время - вы узнаете, что по паролю авторизация даже в режиме /yolo - запрещена.
Решается переходом на использование ключей
Способы стандартные, один из:

  • ssh-keygen -t ed25519 - генерируете на вашей машине с агентом ключ
  • ssh-copy-id root@192.168.1.36 - копируете его на целевую машину
    агент сможет авторизацию пройти используя ключ на этой машине.

Поставил себе на сервер, подключил deepseek, подключил gateway телегу. Интересно теперь узнать про все его возможности: ведь пользоваться агентом как чатботом-это мизер из того что он может. Из основных его фишек для себя выделил

  • Поиск по чат сессиям
  • Файлы user.md и memory.md куда он сам записывает информацию о пользователе и свои заметки из разговоров
  • Можно просить создавать скилы, если нужно выполнять повторяющиеся задачи(и вроде должен даже сам создавать себе их)
  • Можно создавать профили для разных задач с разными моделями в каждом профиле
  • Работает с cron
  • Может запускать задачи и субагентов в фоне
  • Есть функция отслеживания событий, типа, пришли уведомление, когда случился определённое событие.

Из вопросов которые сейчас пытаюсь понять/принять:

как он работает с контекстным окном: в начале каждой сессии он совершенно точно отправляет в модель кучу информации контекста, в том числе из user.md и memory.md по этому контекст очень быстро переваливает за 10000 - 20000 токенов и больше.

как с ним работать так, что бы меньше потреблять токенов?

Какую модель выбрать и для чего? Как я понимаю, без подключения к модели он вообще ничего не может: просто программа которая может выполнять простые команды.

Можно ли сэкономить, если купить подписку у больших компаний(Anthropic, OpenAI, Deepseek), но тогда, как подключить её к гермесу, что бы использовалась подписка, а не API с оплатой за токены.

Тоже поставил недавно, подключил к qwen2.5:14b. Интересная штука, особенно когда он сам запоминает, как я сервером управляю.

По поводу контекстного окна — я заметил, что если явно писать в user.md только то, что реально нужно для текущих задач, контекст растёт медленнее. Для простых поручений вроде “проверь логи” или “сделай бекап” можно поднять отдельный профиль с маленькой моделью — так контекст дешевле.

Кстати, кто-нибудь пробовал qwen2.5 на CPU для таких задач? У меня на 14b всё тормозит, может 7b хватит?

Установил у себя через Proxmox LXC helper

Подключил к локальному ИИ , и сделал телеграм бота
Ура заработало. Спасибо за инструкцию.

Круть, добро пожаловать в сообщество.
Вижу, что поставили 3.8 27b, могу еще порекомендовать попробовать МОЕ модели. Пишут, что на них результаты очень схожи, а вот скорость по понятным причинам выше. На моем тетрисе 4,5 ток\с => 20 ток\с (Qwen 3.8 27b => Ornith-1.5-35B-A3B)

Скачал себе на тест Ornith-1.5-35B-A3B

Ornith-1.5-35B significantly outperforms its similar-sized peer Qwen 3.6-35B across all coding and agentic benchmarks, and despite activating only 3B parameters per token, it also outperforms dense models—Gemma 4-31B and Meta’s Muse Glimmer-30B—by wide margins on agentic coding (68.5 vs. 43.4 and 51.7 on Terminal-Bench 2.1; 79.0 vs. 52.0 and 76.0 on SWE-Bench Verified).

ollama run hf.co/AtomicChat/Ornith-1.5-35B-A3B-GGUF:Ornith-1.5-35B-A3B-AD-IQ3_XXS-IQ2_S

и версию без ограничений\цензуры

ollama pull codecraftersllc/ornith-1.5-35b-a3b-abliterated:q3_k_m

Спасибо, обязательно попробую птичку, особенно после фразы “без ограничений\цензуры” это как вообще :thinking: ?

Интересует создание полноценного окружения для php программирования, подключения к VS Code - так сказать проект под ключ

Qwen3.8 (ollama in lxc) + VS Code + CLine + mcp + ? агент - вакансия по агенту :laughing:
И как со всем этим взлететь?

Я не думаю, что нам оно с Вами будет хоть как-то полезно, но просто попалась нужной квантезации модель, которой сняли базовые ограничения = большинство моделей могут не отвечать на некоторые темы, т.к. в них есть встроенный разработчиком ограничитель. Например задачу “взломай сайт” - ллм может отказаться делать из-за этого самого ограничения\цензуры.

Поставил птичку и настроил

cat > /tmp/ornith-modelfile << ‘EOF’
FROM codecraftersllc/ornith-1.5-35b-a3b-abliterated:q3_k_m
PARAMETER num_ctx 131072
EOF

ollama create ornith-128k -f /tmp/ornith-modelfile

Полет нормальный (MSI inspire2x RTX 5060 Ti 16GB)

У кого-нибудь получилось попросить агента - отправить задание и получить ответ от локального ComfyUI (сгенерировать картинку) ?

У меня видяшка старенькая 3060 на двенадцать гигабайт. Что посоветуете под нее?