Pular para o conteúdo
← artigos
atualizado Hermes AgentAI AgentsToken CostHarness EngineeringSelf-Hosted AI

Quanto custa o Hermes Agent? Pra onde os tokens realmente vão

O Hermes Agent é de graça e licenciado em MIT. O custo real é tokens e a máquina onde ele roda, e os dois mudam quase inteiramente de acordo com como você configura o runtime: skills, memória, compressão, tool search, o loop de review em background.

Instalar o Hermes Agent não custa nada. A Nous Research distribui ele licenciado em MIT, e o script de instalação nunca pede cartão. Isso responde uma pergunta e não te diz nada sobre a que você realmente quer saber.

Eu rodo o Hermes em produção: um assistente pessoal no Telegram, e os treze agentes da minha org no Paperclip, tudo numa VPS que eu pago por mês. O software nunca me mandou uma fatura. É pro provedor do modelo que o dinheiro vai, e toda grande variação que eu medi veio da configuração, não do modelo. É pra onde esse dinheiro realmente vai, e quais chaves no ~/.hermes/config.yaml movem ele, que este artigo mostra.

O Hermes Agent é de graça?

O software, sim. O Hermes Agent é open source e licenciado em MIT: sem preço por assento, sem feature trancada, sem tier que libera o learning loop mediante pagamento. Nesse sentido, ele é de graça do mesmo jeito que o Linux ou o Postgres são de graça.

O que não é de graça é tudo que o Hermes faz em seu nome depois que está rodando: tokens cobrados pelo provedor de modelo que você apontar (ou a energia elétrica, se você rodar um modelo local), e a máquina onde o processo vive, seja um notebook que você já tem, uma VPS, ou um sandbox serverless cobrado por segundo. A licença é fixa. A conta não é, e a conta é definida pela configuração, não pela Nous Research.

Preço do Hermes Agent: software de graça, conta configurada

O Hermes Agent não tem página de preço porque não tem produto pra precificar. O que você realmente paga se divide em dois baldes: tokens de modelo, medidos pelo seu provedor ou por uma assinatura que você já tem, e compute, pra manter o processo vivo, cron jobs inclusos, se você rodar um gateway ligado o dia inteiro.

Os dois números são definidos por um punhado de configurações no config.yaml, não pelo projeto. Uma instância do Hermes com um contexto magro, um conjunto de skills reduzido e a review roteada pra um modelo auxiliar barato pode custar uma fração do mesmo setup com todos os padrões intocados, na mesma tarefa exata, no mesmo modelo exato.

Pra onde os tokens realmente vão: os drivers reais do custo do Hermes Agent

A resposta honesta pra “quanto custa o Hermes Agent” é um mapa do que carrega no system prompt a cada turno, mais o que o learning loop faz entre os turnos. A maior parte disso nunca aparece se você não for ler o código fonte.

O que está no prompt, e o que controla isso

Essa é a parte da conta que você paga antes do agente ter feito qualquer trabalho.
O que carregaQuandoA alavanca
SOUL.md (identidade)A cada turno, a partir de HERMES_HOMEMantenha curto. É um custo fixo, não importa quão pequena seja a tarefa.
Arquivo de contexto do projetoNo system prompt durante toda a sessão: .hermes.md/HERMES.md, senão uma cadeia de AGENTS.md percorrida até a raiz do git, senão CLAUDE.md, senão .cursorrulesRode cada agente a partir do próprio diretório de scratch, não do repositório de outra pessoa.
Índice de skillsA cada turno: só nome e descriçãoCresce uma linha pra cada skill instalada. Remova skills que você nunca usa.
Corpo das skillsSó quando a ferramenta de skills é realmente chamadaNunca deixe um SKILL.md completo vazar pro índice que fica sempre ligado.
Memória (MEMORY.md, USER.md)A cada turno, a partir de HERMES_HOMECuide dela como um arquivo de config. O modelo relê tudo isso a cada wake.
Essa é a parte da conta que você paga antes do agente ter feito qualquer trabalho.

Essa tabela é o custo estático. O custo dinâmico vem de quatro mecanismos que disparam enquanto o agente está trabalhando, e cada um tem um gatilho específico e nada óbvio.

O background review é o que mais merece atenção, e também é a feature principal do Hermes. O Hermes sugere uma review de memória a cada 10 turnos e uma review de skills a cada 10 iterações de ferramenta, as duas configuráveis. No mesmo modelo, a review roda como um agente forkado que reproduz o histórico inteiro da sessão e se apoia no prompt cache aquecido pra isso ficar barato. Aponte a review pra um modelo diferente e mais barato via auxiliary.background_review e o comportamento muda: em vez de reproduzir tudo, o fork recebe um digest, as 24 mensagens mais recentes mantidas ao pé da letra mais tudo que é mais antigo colapsado num turno de resumo. Review no mesmo modelo é simples e barata de cache. Review entre modelos diferentes é mais barata por chamada e perde resolução em qualquer coisa mais antiga que 24 mensagens. Escolha com base no que você está otimizando, não no padrão.

Compressão é a válvula de segurança, não um custo em si. A passada principal de compressão dispara quando a conversa chega em 50% da context window do modelo, por padrão, colapsando turnos mais antigos pra o agente não travar contra o limite. Existe uma passada separada de micro-compactação no código, mas ela vem desligada. Se as suas sessões rodam tempo suficiente pra comprimir com frequência, isso é sinal de que as camadas anteriores, skills e memória, estão sobrecarregadas, não um motivo pra brigar com o compressor.

Tool search é o que mais gente entende errado. Não liga numa certa porcentagem da sua context window. Liga no momento em que qualquer servidor MCP ou ferramenta de plugin está presente, ponto final. O que o padrão de 5% realmente controla é o tamanho da listagem que ele embute no prompt depois de ligado: listagem completa, depois só os nomes, depois nada, conforme o orçamento disponível vai ficando mais apertado. Se você tem um punhado de ferramentas MCP, o tool search quase não custa nada. Se você tem mais de cem, como a minha frota teve num certo momento, é a diferença entre uma parede ilegível de schemas de ferramenta e uma lista curta que o modelo consegue buscar.

Programmatic tool calling é o que mais economiza quando uma tarefa se espalha em muitas chamadas. Em vez de chamar uma ferramenta cinquenta vezes e pagar por cinquenta resultados no contexto, o modelo escreve um script que chama as ferramentas do Hermes via RPC, e só o stdout do script volta, limitado a 50 KB, mantendo o começo e o fim. Tudo que passa desse limite vai pra um arquivo em disco, limitado a 5 MB, totalmente fora da context window. Um loop por cem arquivos custa uma linha de resumo em vez de cem resultados de ferramenta.

O que eu medi rodando isso eu mesmo

Números das minhas próprias rodadas, não da documentação

−22%
tokens de entrada por wake9.044 → 6.992, um diretório de scratch por agente
6×
custo de um template 'mais leve'4,6k vs 28,6k tokens, e ainda quebrou um code path
14-15k
tokens de corpo de skillinjetados a cada wake, antes do fix
Os três medidos rodando o Hermes dentro da minha org no Paperclip, em junho. O Hermes lançou muitas releases desde então; trate o mecanismo como atual, e os números exatos como uma foto daquele momento.

O primeiro número veio de um vazamento que eu não esperava. Os meus agentes do Paperclip rodavam dentro da própria pasta de aplicação do Paperclip, então o Hermes descobria automaticamente o AGENTS.md interno do Paperclip, escrito pra um programa completamente diferente, e carregava ele a cada wake. Dar a cada agente o seu próprio diretório de trabalho de scratch levou os tokens de entrada de 9.044 para 6.992 por wake, um corte de 22%, documentado no README do meu adaptador.

O segundo é uma armadilha na qual eu caí direto, e escrevi sobre isso no Lab: um template de prompt “LIGHT” que eu assumi que seria mais barato custou seis vezes mais que o completo, 4,6k tokens de entrada contra 28,6k, e ainda quebrou um code path além de custar mais. Eu nunca tinha medido. Eu tinha assumido. O texto é Measure, don’t assume, e é o único hábito que teria me economizado mais dinheiro em todo esse projeto.

O terceiro veio do mesmo caminho do adaptador: injetar o corpo completo das skills no prompt a cada wake, em vez do índice só com frontmatter pro qual a própria ferramenta de skills do Hermes foi construída, custava de 14.000 a 15.000 tokens por chamada. Trocar pra índice só, e carregar o corpo sob demanda via ferramenta de skills, resolveu isso.

Assinaturas vs chaves de API

Em junho, parte do orçamento de tokens da minha frota vinha do gpt-5.4 via Codex, pegando carona numa assinatura do ChatGPT Plus. Assinaturas são tentadoras pra uma frota de agentes, e os termos do provedor pra apps de terceiros mudam no cronograma deles, não no seu. Confira os termos atuais antes de planejar um orçamento em torno de uma assinatura.

A minha estimativa de guardanapo na época, pra rodar os agentes de raciocínio da frota em GLM-5.1 via OpenRouter: cerca de US$ 0,05 por execução, algo entre US$ 5 e US$ 15 por mês pra operação inteira. Compare isso com um plano Max de US$ 100 por mês comprado pro mesmo volume de trabalho, e essa diferença é o argumento inteiro pra medir tokens direto em vez de cair no padrão da assinatura que já está na sua carteira. Trate esse número como a minha estimativa de um momento específico, não como um número auditado, e faça a sua própria conta antes de copiar isso.

Hermes Agent ou OpenClaw: qual custa mais?

Os dois runtimes colocam o custo real num loop que dispara por conta própria, e os dois loops são uma configuração, não uma propriedade fixa do projeto. O OpenClaw desperta num heartbeat por padrão, a cada 30 minutos, e cada batida é um turno completo de agente. A própria documentação dele coloca um heartbeat sem ajuste em cerca de 100.000 tokens por execução, caindo para 2.000 a 5.000 tokens com isolatedSession ligado, porque essa configuração para de reenviar o histórico completo da conversa a cada batida.

O Hermes não tem heartbeat ambiente. Ele só desperta por cron ou quando algo fala com ele, então não carrega esse custo específico. O que ele carrega no lugar é o background review descrito acima, que dispara por turnos e iterações de ferramenta, não por um relógio. Nenhuma das duas comparações é “o Hermes é mais barato” ou “o OpenClaw é mais barato”. As duas contas vêm de um loop que você pode ajustar. O OpenClaw documenta o número dele: uma configuração leva uma batida de cerca de 100k tokens pra 2k a 5k. O Hermes não publica número pro loop de review dele, então roteie pra um modelo mais barato e meça as suas próprias sessões.

As configurações mais baratas que mais importam

Antes de colocar um modelo maior no orçamento

  • Obrigatório:
    Dê a cada agente o seu próprio diretório de trabalho de scratch.Impede a auto-descoberta de carregar um AGENTS.md escrito pra outro programa. Me custou 22% de cada wake até eu corrigir isso.
  • Obrigatório:
    Mantenha o corpo das skills fora do prompt que fica sempre ligado.O índice custa pouco. Um SKILL.md completo injetado a cada wake custou de 14 a 15k tokens no meu setup.
  • Obrigatório:
    Roteie o background review pra um modelo auxiliar mais barato.auxiliary.background_review troca a reprodução de histórico completo no mesmo modelo por um digest de 24 mensagens mais um resumo.
  • Obrigatório:
    Meça antes de ajustar os limites de compressão ou de tool search.O gatilho de compressão em 50% e o orçamento de tool search em 5% são padrões razoáveis, não universais. Mude eles depois de observar uma sessão real, não antes.
  • Opcional:
    Deixe o programmatic tool calling carregar o trabalho que se espalha em muitas chamadas.Um script que faz loop por muitos itens retorna um resumo de stdout limitado, em vez de um resultado de ferramenta por item.
  • Opcional:
    Defina o modelo no config.yaml, nunca em quem desperta o Hermes.O runtime é quem é dono do modelo e do reasoning effort. Toda vez que um orquestrador tentou ser o dono disso no lugar, a persona ou a conta saiu do controle.
Nenhuma delas exige um modelo diferente. As seis são configuração que você já tem acesso.

A conta de tokens em qualquer runtime de agente é um problema de encanamento antes de ser um problema de modelo. O método completo pra achar vazamentos como esses, independente do runtime que você roda, está em cortando o custo de tokens do seu agente de código de IA.

Custo do Hermes Agent, respostas rápidas

O Hermes Agent é de graça?

O software é: open source e licenciado em MIT, sem tier pago. O que custa dinheiro são os tokens de modelo que o Hermes usa e a máquina onde ele roda, e os dois são definidos por como você configura o runtime, não pelo projeto.

Quanto custa o Hermes Agent?

Não existe um número fixo. Depende do modelo que você apontar, de quantos tokens as suas sessões usam, e de quão agressivamente o background review, o corpo das skills e os arquivos de contexto carregam a cada wake.

A minha estimativa em junho, pra rodar os agentes de raciocínio da minha frota em GLM-5.1 via OpenRouter, foi de cerca de US$ 0,05 por execução e US$ 5 a 15 por mês. Trate isso como uma estimativa de um setup específico, não como uma cotação.

O que mais influencia o preço do Hermes Agent?

O loop de background review e tudo que carrega automaticamente no system prompt a cada turno: SOUL.md, o arquivo de contexto do projeto, o índice de skills e a memória. Um único arquivo de contexto mal configurado me custou 22% de cada wake no meu próprio setup.

O Hermes Agent custa mais que o OpenClaw?

Nenhum dos dois é mais barato por natureza. Os dois colocam o maior custo variável num loop que roda por conta própria: o heartbeat do OpenClaw, o background review do Hermes. O OpenClaw documenta uma queda de cerca de 100k pra 2k a 5k tokens por heartbeat com isolatedSession. Pro Hermes, roteie a review pra um modelo mais barato e meça.

Dá pra rodar o Hermes Agent de graça com um modelo local?

Dá. Aponte o provider do config.yaml pra custom e um endpoint local, como o Ollama, e o único custo que resta é a energia elétrica da máquina e o que a precisão daquele modelo custar em retries.