Cuánto cuesta Hermes Agent: a dónde van los tokens en realidad
Hermes Agent es gratis y tiene licencia MIT. El costo real son los tokens y la máquina donde corre, y los dos se mueven casi por completo según cómo configures el runtime: skills, memoria, compresión, tool search, el loop de revisión en segundo plano.
Hermes Agent no cuesta nada instalarlo. Nous Research lo publica con licencia MIT, y el script de instalación nunca te pide una tarjeta. Eso responde una pregunta y no te dice nada sobre la que en verdad importa.
Corro Hermes en producción: un asistente personal en Telegram, y los trece agentes de mi org de Paperclip, todos en una VPS que pago mes a mes. El software nunca me mandó una factura. El proveedor del modelo es a donde va la plata, y cada salto grande que medí vino de la configuración, no del modelo. Acá es a dónde va esa plata en realidad, y qué claves de ~/.hermes/config.yaml la mueven.
¿Hermes Agent es gratis?
Sí, el software lo es. Hermes Agent es open source y tiene licencia MIT: sin precio por asiento, sin feature detrás de un muro de pago, sin tier que desbloquee el loop de aprendizaje por una cuota. En ese sentido es gratis de la misma forma en que Linux o Postgres son gratis.
Lo que no es gratis es todo lo que Hermes hace en tu nombre una vez que está corriendo: tokens que te cobra el proveedor del modelo al que lo apuntes (o la electricidad, si corres un modelo local), y la máquina donde vive el proceso, ya sea una laptop que ya tienes, una VPS, o un sandbox serverless que te cobran por segundo. La licencia es fija. La cuenta no, y la cuenta la fija la configuración, no Nous Research.
Precio de Hermes Agent: software gratis, cuenta configurada
Hermes Agent no tiene página de precios porque no tiene un producto que poner en precio. Lo que en verdad pagas se divide en dos cosas: tokens del modelo, medidos por tu proveedor o por una suscripción que ya tienes, y cómputo, para lo que sea que mantenga vivo el proceso, cron jobs incluidos, si corres un gateway las 24 horas.
Los dos números los fija un puñado de settings en config.yaml, no el proyecto. Una instancia de Hermes con un contexto liviano, un set de skills recortado y la revisión enrutada a un modelo auxiliar barato puede costar una fracción de esa misma instancia con todos los defaults sin tocar, en la misma tarea exacta, con el mismo modelo exacto.
A dónde van los tokens en realidad: lo que mueve el costo de Hermes Agent
La respuesta honesta a “cuánto cuesta Hermes Agent” es un mapa de lo que se carga en el system prompt en cada turno, más lo que hace el loop de aprendizaje entre turnos. La mayor parte nunca se ve a menos que vayas a leer la fuente.
Qué hay en el prompt, y qué lo controla
| Qué se carga | Cuándo | La palanca |
|---|---|---|
| SOUL.md (identidad) | Cada turno, desde HERMES_HOME | Mantenlo corto. Es un costo fijo sin importar cuán chica sea la tarea. |
| Archivo de contexto del proyecto | En el system prompt de toda la sesión: .hermes.md/HERMES.md, si no AGENTS.md recorriendo la cadena hasta la raíz del git, si no CLAUDE.md, si no .cursorrules | Corre cada agente desde su propio directorio de scratch, no desde el repo de otro. |
| Índice de skills | Cada turno: solo nombre y descripción | Crece una línea por cada skill instalada. Poda las skills que nunca usas. |
| Cuerpo de las skills | Solo cuando se llama en verdad a la herramienta de skills | Nunca dejes que un SKILL.md completo se filtre al índice siempre activo. |
| Memoria (MEMORY.md, USER.md) | Cada turno, desde HERMES_HOME | Cúidala como un archivo de config. El modelo la relee entera en cada activación. |
Esa tabla es el costo estático. El costo dinámico viene de cuatro mecanismos que se disparan mientras el agente trabaja, y cada uno tiene un gatillo específico, nada obvio.
La revisión en segundo plano es la que hay que vigilar, y también es la funcionalidad estrella. Hermes dispara una revisión de memoria cada 10 turnos y una revisión de skills cada 10 iteraciones de herramientas, los dos configurables. Con el mismo modelo, la revisión corre como un agente forkeado que repite toda la historia de la sesión y se apoya en el prompt cache tibio para que eso salga barato. Si apuntas la revisión a un modelo distinto, más barato, con auxiliary.background_review, el comportamiento cambia: en vez de repetir todo, el fork recibe un digest, los 24 mensajes más recientes tal cual más todo lo anterior resumido en un solo turno. La revisión con el mismo modelo es simple y barata gracias al cache. La revisión con otro modelo es más barata por llamada y pierde resolución en cualquier cosa de más de 24 mensajes atrás. Elige según qué estés optimizando, no según el default.
La compresión es la válvula de seguridad, no un costo en sí. La pasada principal de compresión se dispara apenas la conversación llega al 50 por ciento de la ventana de contexto del modelo por defecto, colapsando turnos viejos para que el agente no se trabe contra el límite. Existe una pasada de micro-compactación separada en el código pero viene apagada. Si tus sesiones corren tan largo que comprimen seguido, eso es una señal de que las capas anteriores, skills y memoria, están sobrecargadas, no una razón para peleártelas con el compresor.
Tool search es la que más gente entiende mal. No se activa en algún porcentaje de tu ventana de contexto. Se activa en el momento en que hay presente un solo MCP server o plugin tool, así de simple. Lo que el 5 por ciento por defecto en verdad gobierna es el tamaño del listado que incrusta en el prompt una vez que está activo: un listado completo, después solo nombres, después nada, según se va ajustando el presupuesto disponible. Si tienes un puñado de herramientas de MCP, tool search casi no te cuesta nada. Si tienes más de cien, como mi flota en un momento, es la diferencia entre una pared ilegible de schemas de herramientas y una lista corta que el modelo puede buscar.
El tool calling programático es el que más ahorra cuando una tarea se abre en abanico. En vez de llamar a una herramienta cincuenta veces y pagar por cincuenta resultados en el contexto, el modelo escribe un script que llama a las herramientas de Hermes por RPC, y solo el stdout del script vuelve, con un tope de 50 KB con el principio y el final conservados. Todo lo que pasa ese tope se vuelca a un archivo en disco, con un tope de 5 MB, totalmente afuera de la ventana de contexto. Un loop sobre cien archivos cuesta una línea de resumen en vez de cien resultados de herramienta.
Lo que medí corriéndolo yo mismo
Números de mis propias corridas, no de la documentación
- −22%
- tokens de entrada por activación9.044 → 6.992, un directorio de scratch por agente
- 6×
- costo de un template 'más liviano'4,6k contra 28,6k tokens, y encima rompió un code path
- 14-15k
- tokens de cuerpos de skillsinyectados en cada activación, antes del arreglo
El primer número salió de una fuga que no esperaba. Mis agentes de Paperclip corrían dentro de la propia carpeta de la aplicación de Paperclip, así que Hermes descubría solo el AGENTS.md interno de Paperclip, escrito para un programa totalmente distinto, y lo cargaba en cada activación. Darle a cada agente su propio directorio de trabajo de scratch bajó los tokens de entrada de 9.044 a 6.992 por activación, un recorte del 22 por ciento, documentado en el README de mi adaptador.
El segundo es una trampa en la que caí de lleno y que escribí en el Lab: un template “LIGHT” que asumí que iba a ser más barato costó seis veces más que el completo, 4,6k tokens de entrada contra 28,6k, y encima rompió un code path. Nunca lo había medido. Lo había asumido. El artículo es Mide, no asumas, y es el hábito que más plata me hubiera ahorrado en todo este proyecto.
El tercero salió del mismo camino del adaptador: inyectar cuerpos completos de skills en el prompt en cada activación, en vez del índice de solo frontmatter para el que está hecha la propia herramienta de skills de Hermes, costaba entre 14.000 y 15.000 tokens por llamada. Cambiar a solo índice y cargar los cuerpos a demanda a través de la herramienta de skills lo arregló.
Suscripciones contra API keys
En junio, parte del presupuesto de tokens de mi flota venía de gpt-5.4 a través de Codex, montado sobre una suscripción de ChatGPT Plus. Las suscripciones son tentadoras para una flota de agentes, y los términos de cada proveedor para apps de terceros cambian en su propio calendario. Revisa los términos vigentes antes de planear un presupuesto alrededor de uno.
Mi estimación a ojo en ese momento, para correr los agentes de pensamiento de la flota en GLM-5.1 a través de OpenRouter: cerca de US$ 0,05 por corrida, entre US$ 5 y US$ 15 al mes por toda la operación. Compara eso con un plan Max de US$ 100 al mes comprado para el mismo volumen de trabajo, y la diferencia es todo el argumento para medir los tokens directamente en vez de ir por default a la suscripción que ya tienes en la billetera. Trata ese número como mi estimación de un momento puntual, no como una cifra auditada, y haz tu propia cuenta antes de copiarla.
¿Cuánto cuesta Hermes Agent comparado con OpenClaw?
Los dos runtimes meten el costo real en un loop que se dispara solo, y los dos loops son un setting, no una propiedad fija del proyecto. OpenClaw despierta con un heartbeat por defecto, cada 30 minutos, y cada beat es un turno completo del agente. Su propia documentación pone un heartbeat sin ajustar en unos 100.000 tokens por corrida, bajando a entre 2.000 y 5.000 tokens con isolatedSession activado, porque ese setting deja de reenviar toda la historia de la conversación en cada beat.
Hermes no tiene un heartbeat ambiente. Solo despierta por cron o cuando algo le habla, así que no carga ese costo específico. Lo que carga en su lugar es la revisión en segundo plano descrita arriba, que se dispara por turnos e iteraciones de herramientas en vez de por un reloj. Ninguna comparación es “Hermes es más barato” ni “OpenClaw es más barato”. Las dos cuentas vienen de un loop que puedes ajustar. OpenClaw documenta su número: un setting lleva un beat de unos 100k tokens a entre 2k y 5k. Hermes no publica un número para su loop de revisión, así que enrútalo a un modelo más barato y mide tus propias sesiones.
Los settings más baratos que más importan
Antes de sumar un modelo más grande al presupuesto
- Obligatorio:Dale a cada agente su propio directorio de trabajo de scratch.Frena que el auto-discovery cargue un AGENTS.md escrito para otro programa. Me costó el 22 por ciento de cada activación hasta que lo arreglé.
- Obligatorio:Mantén los cuerpos de las skills fuera del prompt siempre activo.El índice cuesta poco. Un SKILL.md completo inyectado en cada activación me costó entre 14 y 15k tokens en mi setup.
- Obligatorio:Enruta la revisión en segundo plano a un modelo auxiliar más barato.auxiliary.background_review cambia la repetición completa de historia con el mismo modelo por un digest de 24 mensajes más un resumen.
- Obligatorio:Mide antes de ajustar los umbrales de compresión o de tool search.El disparador de compresión al 50 por ciento y el presupuesto de tool search al 5 por ciento son defaults razonables, no universales. Cámbialos después de mirar una sesión real, no antes.
- Opcional:Deja que el tool calling programático cargue el trabajo que se abre en abanico.Un script que recorre muchos items devuelve un solo resumen de stdout con tope, en vez de un resultado de herramienta por item.
- Opcional:Define el modelo en config.yaml, nunca en lo que sea que despierte a Hermes.El runtime es el dueño del modelo y del esfuerzo de razonamiento. Cada vez que un orquestador intentó ser el dueño en su lugar, la persona o la cuenta se descarrilaron.
La cuenta de tokens en cualquier runtime de agente es un problema de plomería antes de ser un problema de modelo. El método completo para encontrar fugas como estas, sin importar qué runtime corras, está en cómo bajar el costo en tokens de tu agente de código con IA.
Costo de Hermes Agent: respuestas rápidas
¿Hermes Agent es gratis?
El software sí: open source y con licencia MIT, sin tier de pago. Lo que cuesta plata son los tokens del modelo que usa Hermes y la máquina donde corre, y los dos los fija cómo configuras el runtime, no el proyecto.
¿Cuánto cuesta Hermes Agent?
No hay un número fijo. Depende del modelo al que lo apuntes, cuántos tokens usan tus sesiones, y qué tan agresivo es lo que carga en cada activación: la revisión en segundo plano, los cuerpos de las skills y los archivos de contexto.
Mi estimación en junio, para correr los agentes de pensamiento de mi flota en GLM-5.1 a través de OpenRouter, fue de unos US$ 0,05 por corrida y entre US$ 5 y US$ 15 al mes. Trátalo como una estimación de un solo setup, no como una cotización.
¿Qué define más el precio de Hermes Agent?
El loop de revisión en segundo plano y todo lo que se carga solo en el system prompt en cada turno: SOUL.md, el único archivo de contexto del proyecto, el índice de skills y la memoria. Un solo archivo de contexto mal configurado me costó el 22 por ciento de cada activación en mi propio setup.
¿Hermes Agent cuesta más que OpenClaw?
Ninguno es más barato por naturaleza. Los dos meten su mayor costo variable en un loop que corre solo: el heartbeat de OpenClaw, la revisión en segundo plano de Hermes. OpenClaw documenta una caída de unos 100k a entre 2k y 5k tokens por heartbeat con isolatedSession. Para Hermes, enruta la revisión a un modelo más barato y mide.
¿Puedo correr Hermes Agent gratis con un modelo local?
Sí. Apunta el provider de config.yaml a custom y a un endpoint local como Ollama, y el único costo que queda es la electricidad de la máquina y lo que te cueste en reintentos la precisión de ese modelo.
La newsletter
Don’t Code, Specify. Cada semana, agentes de IA en producción de verdad. Sin hype: lo que funcionó y lo que se rompió.
Suscríbete en Substack (se abre en una pestaña nueva)