O melhor modelo para o Hermes Agent é o mais barato que sobrevive ao seu runtime
Não existe um melhor modelo pro Hermes Agent, só um melhor modelo pro trabalho, roteado pelo runtime que você realmente roda. O meu próprio shootout mostra o mesmo modelo perdendo dois pontos sem motivo nenhum, exceto onde a persona caiu.
Todo artigo de “melhor modelo pra X” é o mesmo artigo com o nome da marca trocado. O meu não vai ser assim, porque eu rodei um teste que mostra que a pergunta está quebrada. O mesmo modelo, a mesma tarefa, o mesmo juiz, tirou 9,55 num runtime e caiu até 7,0 em outro. Nada no modelo mudou entre essas duas rodadas.
A pergunta nunca foi qual modelo é mais inteligente. Foi qual modelo sobrevive ao harness pelo qual você realmente roda ele.
Eu rodo o Hermes Agent em produção. Aqui está o shootout que me ensinou a lição, o que eu de fato rodei nos meses seguintes, e o método que eu uso em vez de um leaderboard.
Modelo do Hermes Agent: o runtime é quem manda, não o orquestrador
O modelo de uma instância do Hermes vive num lugar só: o bloco model no ~/.hermes/config.yaml, dentro de HERMES_HOME. Nada mais deveria ter permissão de definir isso. Em junho, o meu orquestrador passava um modelo e uma flag de reasoning effort pra cada execução do Hermes. O gerenciamento de modelo dele tinha bug, e a flag de effort nem era uma que o comando de chat do Hermes aceitava, então ela matava o wake antes do agente fazer qualquer coisa. O meu adaptador parou de passar as duas e deixou o Hermes ler as duas a partir da própria config.
O modelo pertence ao arquivo de config do runtime, não a quem o orquestra. Paperclip, cron, uma mensagem no Telegram, nenhum deles deveria carregar um argumento de modelo pro Hermes. Eles disparam o trabalho. O Hermes decide o que roda, porque é o Hermes que tem que viver com as consequências: o orçamento de contexto, o reasoning effort, o formato de tool calling. Inverta isso e toda outra decisão deste artigo vira ruído.
Melhor modelo pro Hermes Agent: o meu shootout, e por que as notas mudaram
Em 8 de junho, eu rodei a minha própria tarefa julgada de design de oferta, o mesmo prompt e o mesmo rubric, em quatro combinações de modelo e runtime. Eu estava tentando responder “qual modelo é o melhor”. O que eu ganhei foi uma lição sobre onde a persona cai.
Uma tarefa, um juiz, quatro combinações
| Modelo, via qual runtime | Nota de 0 a 10 |
|---|---|
| GLM-5.1, via OpenCode | 9,55 |
| Opus, via o adaptador do Claude Code | 8,88 |
| GLM-5.1, via Paperclip mais Hermes | 7,0 a 7,9 |
| gpt-5.5, via Paperclip mais Hermes | 6,7 |
O padrão é a descoberta: não é que o GLM seja melhor que o gpt-5.5, ou que o Opus seja o mais forte dos quatro. É que rotear o GLM-5.1 pelo Hermes custou entre 1,6 e 2,5 pontos contra a nota que o mesmo modelo teve via OpenCode. Eu tirei o prompt real do banco de dados de sessão do Hermes pra entender o motivo. O system prompt abria com 13.985 caracteres apresentando o agente como Hermes Agent. A persona que eu queria, “You are Alex Hormozi, Chief Offer Architect”, chegava como uma mensagem de usuário simples, de 10.831 caracteres. O modelo recebeu duas identidades e escolheu a média segura: correto, genérico, e faltando tudo que a persona deveria adicionar.
Essa causa raiz não tem nada a ver com inteligência do modelo. Um modelo mais inteligente não corrige uma persona mandada pro slot errado. O fix é estrutural: identidade vai no SOUL.md, onde o Hermes trata ela como identidade, não numa mensagem de usuário competindo com o system prompt pela atenção do modelo.
O que eu de fato rodei, mês a mês
Aqui está o log honesto, não uma lista de recomendação. Em junho, a frota rodava em GLM-5.1 via Z.AI, o mês em que eu tirei a seleção de modelo do orquestrador e coloquei de vez no config.yaml. Em 21 de julho, eu já tinha trocado o runtime pro deepseek/deepseek-v4-flash via OpenRouter. Também em junho, o gpt-5.4 via Codex, pegando carona numa assinatura do ChatGPT Plus, era uma das fontes de tokens pros mesmos agentes.
Nenhum dos três é “o melhor modelo”. Eles foram o melhor modelo pra aquela frota, naquele ponto de custo, naquele momento, o que é uma afirmação diferente, e a única honesta de se fazer sobre um projeto que se reconfigura a cada poucas semanas.
A minha opinião, de usar os dois: o GLM lidava com síntese longa e multi-fonte com mais profundidade que o DeepSeek. O DeepSeek era perfeitamente adequado pra trabalho de execução mais simples, do tipo em que o plano já está feito e o modelo só precisa executar sem perder o fio. Essa divisão, síntese profunda versus execução precisa, é a mesma divisão que o artigo de handoff de modelo conecta no pi: fases diferentes de trabalho merecem modelos diferentes.
Roteie por papel, não por frota
A alavanca em que eu confio mais do que num modelo mais inteligente é nem escolher um modelo só pra frota inteira, de cara. Na minha org no Paperclip, heads são donos de um resultado e julgam; especialistas são donos de um ofício só e executam dentro de um contexto estreito e fixo. Um especialista com um briefing apertado e uma skill de persona carregando o julgamento dele não precisa do modelo mais caro disponível. O julgamento já está escrito. O que resta pro modelo fazer é mais estreito, e trabalho estreito é exatamente o que um modelo barato faz bem.
O Hermes te dá uma versão nativa de “pergunte pra mais de um modelo e deixe um modelo mais forte julgar”. O modo Mixture-of-Agents dele, /moa, manda uma pergunta pra vários modelos de referência e entrega as respostas deles pra um modelo agregador separado, que sintetiza a resposta final. O preset padrão de fábrica combina gpt-5.5 via o provider OpenAI Codex e deepseek/deepseek-v4-pro via OpenRouter como as duas referências, com anthropic/claude-opus-4.8 via OpenRouter como agregador. Os três podem ser sobrescritos, e o formato é a lição mesmo que você nunca toque no padrão: modelos mais baratos geram candidatos, um modelo capaz faz a decisão final. Isso é roteamento por papel, embutido no runtime, a um bloco de config de distância de um padrão que eu tive que construir na mão no nível da org.
Modelo local no Hermes Agent: Ollama, vLLM e llama.cpp via o provider custom
Rodar o Hermes contra um modelo no seu próprio hardware, “ollama hermes agent” nas buscas que trazem gente pra essa página, passa pelo mesmo bloco model, com provider configurado como custom. O perfil de provider custom do Hermes existe especificamente pra isso: qualquer endpoint compatível com OpenAI, com Ollama, vLLM e llama.cpp como os casos nomeados, mais aliases no registry de providers (ollama, local, vllm, llamacpp) que todos resolvem pro mesmo perfil. O formato da config é esse:
model:
default: "gemma4:31b"
provider: "custom"
base_url: "http://localhost:11434/v1"
Nenhuma API key é necessária pra um endpoint local do Ollama. O perfil de provider preenche um reasoning effort padrão sensato quando você não define, e ele amplia o limite dos valores de reasoning effort pro conjunto completo compatível com OpenAI, porque o vocabulário próprio de um endpoint custom não é algo que o Hermes consegue descobrir de antemão.
O único filtro que importa mais do que qualidade bruta de modelo aqui é tool calling. O Hermes é agêntico: ele edita arquivos, roda comandos, chama servidores MCP. Um modelo local que não consegue emitir tool calls de forma confiável consegue conversar com você e nada mais, não importa quão boa seja a prosa dele. Avalie essa capacidade primeiro, o resto depois. Se a sua máquina é lenta, confira os timeouts antes de culpar o modelo: o detector de chamada obsoleta do Hermes vem desligado automaticamente pra endpoints locais, e você pode definir um timeout de requisição por provider com providers.<id>.request_timeout_seconds.
Trabalho, classe de modelo, motivo: um método em vez de um ranking
Como eu realmente decido, não um leaderboard
| Trabalho | Classe de modelo | Motivo |
|---|---|---|
| Especialista estreito, um ofício só, julgamento já no SOUL.md | O modelo mais barato que passa no teste | O contexto é estreito e o julgamento é fixo. Mais modelo não compra mais qualidade aqui. |
| Síntese longa entre muitas fontes | Um modelo com raciocínio profundo e paciente (nível GLM, na minha experiência) | Raciocínio raso aparece mais rápido numa síntese longa, não em passos curtos de execução. |
| Agregando a saída de vários agentes, incluindo o papel de agregador do /moa | O seu modelo mais capaz e mais caro | Uma chamada por ciclo, não por turno, então o prêmio é pago uma vez só. |
| Trabalho só local, sensível a custo, dirigido por ferramenta | O que o seu hardware rodar com tool calling confiável | Um modelo que não chama ferramentas não consegue dirigir o Hermes de jeito nenhum. Qualidade de chat é o eixo errado pra avaliar. |
| Qualquer coisa que você ainda não perfilou | O modelo mais barato que passa no seu próprio teste, rodado pelo runtime real | Um modelo que tira nota boa numa janela de chat simples pode perder dois pontos no momento em que é roteado pelo seu harness. |
Melhores modelos pro OpenClaw: o mesmo método, as mesmas armadilhas
A pergunta também aparece pro OpenClaw, e a resposta não muda de formato. O OpenClaw trata model providers como extensões, com Ollama, LM Studio e vLLM nessa lista junto com OpenRouter, mais OAuth de assinatura pro ChatGPT, Codex e o Claude CLI, e uma feature de failover de modelo que troca de provider automaticamente quando o seu principal dá erro.
Nada nessa lista torna um modelo universalmente o melhor. Os mesmos dois filtros valem: verifique o suporte a tool calling antes de avaliar qualidade de chat, principalmente pra um modelo local, e teste pelo runtime real, não por uma janela de chat simples, porque o heartbeat e as configurações de contexto do OpenClaw podem mudar a performance efetiva de um modelo do mesmo jeito que o system prompt do Hermes mudou a minha.
Como rodar o seu próprio shootout
Troque o leaderboard por um teste que você controla
- Obrigatório:Teste pelo runtime real, nunca por uma janela de chat simples.O harness pode custar dois pontos a um modelo antes dele escrever uma palavra, exatamente como custou ao GLM-5.1 sob o Hermes, com a persona no slot errado.
- Obrigatório:Julgue com um rubric fixo e escrito antes de ver as saídas.O meu shootout usou uma única tarefa julgada, pontuada do mesmo jeito, em toda combinação de modelo e runtime. Sem essa disciplina, a comparação é só vibe.
- Obrigatório:Separe qualidade de modelo de custo de runtime.Um modelo que tira um ponto menos mas custa um décimo do preço ainda é a escolha certa pra um especialista estreito fazendo trabalho fixo.
- Obrigatório:Confirme o suporte a tool calling antes de avaliar qualidade de chat.Principalmente pra modelos locais. Um modelo que só conversa não consegue dirigir um loop agêntico, não importa quão fluente ele pareça.
- Opcional:Rode o shootout de novo quando a versão do runtime muda, não só quando o modelo muda.O Hermes lança perto de duas vezes por semana. Uma nota de junho é uma foto daquele commit, não um veredito permanente.
Melhor modelo pro Hermes Agent, respostas rápidas
Qual é o melhor modelo pro Hermes Agent?
Não existe um único melhor modelo. O melhor modelo é o mais barato que passa num teste rodado pela sua configuração real do Hermes, não por uma janela de chat simples. O meu próprio shootout mostrou o mesmo modelo perdendo até 2,5 pontos só por onde o Hermes colocou a persona no prompt.
Qual modelo o Hermes Agent usa por padrão?
Nenhum é forçado em você. O Hermes lê o modelo do bloco model em ~/.hermes/config.yaml, e suporta 38 plugins de provider mais qualquer endpoint compatível com OpenAI via o provider custom. Defina ali, não em qualquer orquestrador ou gateway que desperta o agente.
Dá pra rodar o Hermes Agent com Ollama?
Dá. Defina provider como custom e base_url como o seu endpoint do Ollama, normalmente http://localhost:11434/v1, sem precisar de API key. O registry de provider também aceita ollama, local, vllm e llamacpp como aliases do mesmo perfil.
Qual é o melhor modelo local pro Hermes Agent?
O que o seu hardware conseguir rodar com tool calling confiável. O Hermes é agêntico: edita arquivos e roda comandos via tool calls, e um modelo local sem suporte sólido a ferramentas só consegue conversar. Verifique essa capacidade antes de comparar qualquer outra coisa.
Quais são os melhores modelos pro OpenClaw?
O mesmo método vale pro OpenClaw. Ele trata providers como extensões, incluindo Ollama, LM Studio e vLLM junto com OpenRouter e OAuth de assinatura, mais failover de modelo se um provider der erro. Teste pelo runtime real do OpenClaw antes de confiar na reputação de um modelo vinda de outro lugar.
A newsletter
Don’t Code, Specify. Toda semana, agentes de IA em produção de verdade. Sem hype: o que funcionou e o que quebrou.
Assinar no Substack (abre em nova aba)