Pular para o conteúdo
← artigos
atualizado Hermes AgentAI AgentsModel RoutingOpenClawSelf-Hosted AI

O melhor modelo para o Hermes Agent é o mais barato que sobrevive ao seu runtime

Não existe um melhor modelo pro Hermes Agent, só um melhor modelo pro trabalho, roteado pelo runtime que você realmente roda. O meu próprio shootout mostra o mesmo modelo perdendo dois pontos sem motivo nenhum, exceto onde a persona caiu.

Todo artigo de “melhor modelo pra X” é o mesmo artigo com o nome da marca trocado. O meu não vai ser assim, porque eu rodei um teste que mostra que a pergunta está quebrada. O mesmo modelo, a mesma tarefa, o mesmo juiz, tirou 9,55 num runtime e caiu até 7,0 em outro. Nada no modelo mudou entre essas duas rodadas.

A pergunta nunca foi qual modelo é mais inteligente. Foi qual modelo sobrevive ao harness pelo qual você realmente roda ele.

Eu rodo o Hermes Agent em produção. Aqui está o shootout que me ensinou a lição, o que eu de fato rodei nos meses seguintes, e o método que eu uso em vez de um leaderboard.

Modelo do Hermes Agent: o runtime é quem manda, não o orquestrador

O modelo de uma instância do Hermes vive num lugar só: o bloco model no ~/.hermes/config.yaml, dentro de HERMES_HOME. Nada mais deveria ter permissão de definir isso. Em junho, o meu orquestrador passava um modelo e uma flag de reasoning effort pra cada execução do Hermes. O gerenciamento de modelo dele tinha bug, e a flag de effort nem era uma que o comando de chat do Hermes aceitava, então ela matava o wake antes do agente fazer qualquer coisa. O meu adaptador parou de passar as duas e deixou o Hermes ler as duas a partir da própria config.

O modelo pertence ao arquivo de config do runtime, não a quem o orquestra. Paperclip, cron, uma mensagem no Telegram, nenhum deles deveria carregar um argumento de modelo pro Hermes. Eles disparam o trabalho. O Hermes decide o que roda, porque é o Hermes que tem que viver com as consequências: o orçamento de contexto, o reasoning effort, o formato de tool calling. Inverta isso e toda outra decisão deste artigo vira ruído.

Melhor modelo pro Hermes Agent: o meu shootout, e por que as notas mudaram

Em 8 de junho, eu rodei a minha própria tarefa julgada de design de oferta, o mesmo prompt e o mesmo rubric, em quatro combinações de modelo e runtime. Eu estava tentando responder “qual modelo é o melhor”. O que eu ganhei foi uma lição sobre onde a persona cai.

Uma tarefa, um juiz, quatro combinações

Toda combinação roteada pelo Hermes teve a nota mais baixa, não importa qual modelo estivesse por trás.
Modelo, via qual runtimeNota de 0 a 10
GLM-5.1, via OpenCode9,55
Opus, via o adaptador do Claude Code8,88
GLM-5.1, via Paperclip mais Hermes7,0 a 7,9
gpt-5.5, via Paperclip mais Hermes6,7
Toda combinação roteada pelo Hermes teve a nota mais baixa, não importa qual modelo estivesse por trás.

O padrão é a descoberta: não é que o GLM seja melhor que o gpt-5.5, ou que o Opus seja o mais forte dos quatro. É que rotear o GLM-5.1 pelo Hermes custou entre 1,6 e 2,5 pontos contra a nota que o mesmo modelo teve via OpenCode. Eu tirei o prompt real do banco de dados de sessão do Hermes pra entender o motivo. O system prompt abria com 13.985 caracteres apresentando o agente como Hermes Agent. A persona que eu queria, “You are Alex Hormozi, Chief Offer Architect”, chegava como uma mensagem de usuário simples, de 10.831 caracteres. O modelo recebeu duas identidades e escolheu a média segura: correto, genérico, e faltando tudo que a persona deveria adicionar.

Essa causa raiz não tem nada a ver com inteligência do modelo. Um modelo mais inteligente não corrige uma persona mandada pro slot errado. O fix é estrutural: identidade vai no SOUL.md, onde o Hermes trata ela como identidade, não numa mensagem de usuário competindo com o system prompt pela atenção do modelo.

O que eu de fato rodei, mês a mês

Aqui está o log honesto, não uma lista de recomendação. Em junho, a frota rodava em GLM-5.1 via Z.AI, o mês em que eu tirei a seleção de modelo do orquestrador e coloquei de vez no config.yaml. Em 21 de julho, eu já tinha trocado o runtime pro deepseek/deepseek-v4-flash via OpenRouter. Também em junho, o gpt-5.4 via Codex, pegando carona numa assinatura do ChatGPT Plus, era uma das fontes de tokens pros mesmos agentes.

Nenhum dos três é “o melhor modelo”. Eles foram o melhor modelo pra aquela frota, naquele ponto de custo, naquele momento, o que é uma afirmação diferente, e a única honesta de se fazer sobre um projeto que se reconfigura a cada poucas semanas.

A minha opinião, de usar os dois: o GLM lidava com síntese longa e multi-fonte com mais profundidade que o DeepSeek. O DeepSeek era perfeitamente adequado pra trabalho de execução mais simples, do tipo em que o plano já está feito e o modelo só precisa executar sem perder o fio. Essa divisão, síntese profunda versus execução precisa, é a mesma divisão que o artigo de handoff de modelo conecta no pi: fases diferentes de trabalho merecem modelos diferentes.

Roteie por papel, não por frota

A alavanca em que eu confio mais do que num modelo mais inteligente é nem escolher um modelo só pra frota inteira, de cara. Na minha org no Paperclip, heads são donos de um resultado e julgam; especialistas são donos de um ofício só e executam dentro de um contexto estreito e fixo. Um especialista com um briefing apertado e uma skill de persona carregando o julgamento dele não precisa do modelo mais caro disponível. O julgamento já está escrito. O que resta pro modelo fazer é mais estreito, e trabalho estreito é exatamente o que um modelo barato faz bem.

O Hermes te dá uma versão nativa de “pergunte pra mais de um modelo e deixe um modelo mais forte julgar”. O modo Mixture-of-Agents dele, /moa, manda uma pergunta pra vários modelos de referência e entrega as respostas deles pra um modelo agregador separado, que sintetiza a resposta final. O preset padrão de fábrica combina gpt-5.5 via o provider OpenAI Codex e deepseek/deepseek-v4-pro via OpenRouter como as duas referências, com anthropic/claude-opus-4.8 via OpenRouter como agregador. Os três podem ser sobrescritos, e o formato é a lição mesmo que você nunca toque no padrão: modelos mais baratos geram candidatos, um modelo capaz faz a decisão final. Isso é roteamento por papel, embutido no runtime, a um bloco de config de distância de um padrão que eu tive que construir na mão no nível da org.

Modelo local no Hermes Agent: Ollama, vLLM e llama.cpp via o provider custom

Rodar o Hermes contra um modelo no seu próprio hardware, “ollama hermes agent” nas buscas que trazem gente pra essa página, passa pelo mesmo bloco model, com provider configurado como custom. O perfil de provider custom do Hermes existe especificamente pra isso: qualquer endpoint compatível com OpenAI, com Ollama, vLLM e llama.cpp como os casos nomeados, mais aliases no registry de providers (ollama, local, vllm, llamacpp) que todos resolvem pro mesmo perfil. O formato da config é esse:

model:
  default: "gemma4:31b"
  provider: "custom"
  base_url: "http://localhost:11434/v1"

Nenhuma API key é necessária pra um endpoint local do Ollama. O perfil de provider preenche um reasoning effort padrão sensato quando você não define, e ele amplia o limite dos valores de reasoning effort pro conjunto completo compatível com OpenAI, porque o vocabulário próprio de um endpoint custom não é algo que o Hermes consegue descobrir de antemão.

O único filtro que importa mais do que qualidade bruta de modelo aqui é tool calling. O Hermes é agêntico: ele edita arquivos, roda comandos, chama servidores MCP. Um modelo local que não consegue emitir tool calls de forma confiável consegue conversar com você e nada mais, não importa quão boa seja a prosa dele. Avalie essa capacidade primeiro, o resto depois. Se a sua máquina é lenta, confira os timeouts antes de culpar o modelo: o detector de chamada obsoleta do Hermes vem desligado automaticamente pra endpoints locais, e você pode definir um timeout de requisição por provider com providers.<id>.request_timeout_seconds.

Trabalho, classe de modelo, motivo: um método em vez de um ranking

Como eu realmente decido, não um leaderboard

Cinco trabalhos, cinco respostas diferentes. Esse é o ponto: uma lista só não cobre os cinco.
TrabalhoClasse de modeloMotivo
Especialista estreito, um ofício só, julgamento já no SOUL.mdO modelo mais barato que passa no testeO contexto é estreito e o julgamento é fixo. Mais modelo não compra mais qualidade aqui.
Síntese longa entre muitas fontesUm modelo com raciocínio profundo e paciente (nível GLM, na minha experiência)Raciocínio raso aparece mais rápido numa síntese longa, não em passos curtos de execução.
Agregando a saída de vários agentes, incluindo o papel de agregador do /moaO seu modelo mais capaz e mais caroUma chamada por ciclo, não por turno, então o prêmio é pago uma vez só.
Trabalho só local, sensível a custo, dirigido por ferramentaO que o seu hardware rodar com tool calling confiávelUm modelo que não chama ferramentas não consegue dirigir o Hermes de jeito nenhum. Qualidade de chat é o eixo errado pra avaliar.
Qualquer coisa que você ainda não perfilouO modelo mais barato que passa no seu próprio teste, rodado pelo runtime realUm modelo que tira nota boa numa janela de chat simples pode perder dois pontos no momento em que é roteado pelo seu harness.
Cinco trabalhos, cinco respostas diferentes. Esse é o ponto: uma lista só não cobre os cinco.

Melhores modelos pro OpenClaw: o mesmo método, as mesmas armadilhas

A pergunta também aparece pro OpenClaw, e a resposta não muda de formato. O OpenClaw trata model providers como extensões, com Ollama, LM Studio e vLLM nessa lista junto com OpenRouter, mais OAuth de assinatura pro ChatGPT, Codex e o Claude CLI, e uma feature de failover de modelo que troca de provider automaticamente quando o seu principal dá erro.

Nada nessa lista torna um modelo universalmente o melhor. Os mesmos dois filtros valem: verifique o suporte a tool calling antes de avaliar qualidade de chat, principalmente pra um modelo local, e teste pelo runtime real, não por uma janela de chat simples, porque o heartbeat e as configurações de contexto do OpenClaw podem mudar a performance efetiva de um modelo do mesmo jeito que o system prompt do Hermes mudou a minha.

Como rodar o seu próprio shootout

Troque o leaderboard por um teste que você controla

  • Obrigatório:
    Teste pelo runtime real, nunca por uma janela de chat simples.O harness pode custar dois pontos a um modelo antes dele escrever uma palavra, exatamente como custou ao GLM-5.1 sob o Hermes, com a persona no slot errado.
  • Obrigatório:
    Julgue com um rubric fixo e escrito antes de ver as saídas.O meu shootout usou uma única tarefa julgada, pontuada do mesmo jeito, em toda combinação de modelo e runtime. Sem essa disciplina, a comparação é só vibe.
  • Obrigatório:
    Separe qualidade de modelo de custo de runtime.Um modelo que tira um ponto menos mas custa um décimo do preço ainda é a escolha certa pra um especialista estreito fazendo trabalho fixo.
  • Obrigatório:
    Confirme o suporte a tool calling antes de avaliar qualidade de chat.Principalmente pra modelos locais. Um modelo que só conversa não consegue dirigir um loop agêntico, não importa quão fluente ele pareça.
  • Opcional:
    Rode o shootout de novo quando a versão do runtime muda, não só quando o modelo muda.O Hermes lança perto de duas vezes por semana. Uma nota de junho é uma foto daquele commit, não um veredito permanente.
Esse é o método inteiro. Nenhum leaderboard sobrevive ao contato com o seu próprio harness.

Melhor modelo pro Hermes Agent, respostas rápidas

Qual é o melhor modelo pro Hermes Agent?

Não existe um único melhor modelo. O melhor modelo é o mais barato que passa num teste rodado pela sua configuração real do Hermes, não por uma janela de chat simples. O meu próprio shootout mostrou o mesmo modelo perdendo até 2,5 pontos só por onde o Hermes colocou a persona no prompt.

Qual modelo o Hermes Agent usa por padrão?

Nenhum é forçado em você. O Hermes lê o modelo do bloco model em ~/.hermes/config.yaml, e suporta 38 plugins de provider mais qualquer endpoint compatível com OpenAI via o provider custom. Defina ali, não em qualquer orquestrador ou gateway que desperta o agente.

Dá pra rodar o Hermes Agent com Ollama?

Dá. Defina provider como custom e base_url como o seu endpoint do Ollama, normalmente http://localhost:11434/v1, sem precisar de API key. O registry de provider também aceita ollama, local, vllm e llamacpp como aliases do mesmo perfil.

Qual é o melhor modelo local pro Hermes Agent?

O que o seu hardware conseguir rodar com tool calling confiável. O Hermes é agêntico: edita arquivos e roda comandos via tool calls, e um modelo local sem suporte sólido a ferramentas só consegue conversar. Verifique essa capacidade antes de comparar qualquer outra coisa.

Quais são os melhores modelos pro OpenClaw?

O mesmo método vale pro OpenClaw. Ele trata providers como extensões, incluindo Ollama, LM Studio e vLLM junto com OpenRouter e OAuth de assinatura, mais failover de modelo se um provider der erro. Teste pelo runtime real do OpenClaw antes de confiar na reputação de um modelo vinda de outro lugar.