Saltar al contenido
← artículos
actualizado Hermes AgentAI AgentsModel RoutingOpenClawSelf-Hosted AI

Cuál es el mejor modelo para Hermes Agent: el más barato que sobrevive a tu runtime

No existe un mejor modelo para Hermes Agent, solo un mejor modelo para el trabajo, enrutado a través del runtime que en verdad corres. Mi propio shootout muestra al mismo modelo perdiendo dos puntos por nada más que por dónde aterrizó la persona.

Todo artículo de “mejor modelo para X” es el mismo artículo con la marca cambiada. El mío no va a ser eso, porque corrí una prueba que muestra que la pregunta está mal planteada. El mismo modelo, la misma tarea, el mismo juez, sacó 9,55 en un runtime y hasta 7,0 en otro. Nada del modelo cambió entre esas dos corridas.

La pregunta nunca fue cuál modelo es más inteligente. Era cuál modelo sobrevive al harness por el que en verdad lo corres.

Corro Hermes Agent en producción. Esta es la prueba que me enseñó la lección, lo que corrí en los meses siguientes, y el método que uso en vez de un leaderboard.

El modelo de Hermes Agent: lo controla el runtime, no el orquestador

El modelo de una instancia de Hermes vive en un solo lugar: el bloque model en ~/.hermes/config.yaml, bajo HERMES_HOME. Nada más debería poder definirlo. En junio, mi orquestador le pasaba un modelo y una flag de esfuerzo de razonamiento a cada corrida de Hermes. Su manejo de modelos tenía bugs, y la flag de esfuerzo ni siquiera era una que el comando de chat de Hermes aceptara, así que mataba la activación antes de que el agente hiciera nada. Mi adaptador dejó de pasar cualquiera de las dos y deja que Hermes lea las dos desde su propia config.

El modelo le pertenece al archivo de config del runtime, no a lo que sea que lo orqueste. Paperclip, un cron, un mensaje de Telegram, ninguno debería cargar un argumento de modelo dentro de Hermes. Ellos arrancan el trabajo. Hermes decide qué lo corre, porque Hermes es lo que tiene que vivir con las consecuencias: el presupuesto de contexto, el esfuerzo de razonamiento, el formato de tool calling. Si te equivocas en esto, cualquier otra decisión de este artículo es ruido.

Mejor modelo para Hermes Agent: mi shootout, y por qué se movieron los puntajes

El 8 de junio corrí mi propia tarea de diseño de oferta, juzgada, con el mismo prompt y el mismo rubric, en cuatro combinaciones de modelo y runtime. Estaba tratando de responder “cuál modelo es mejor”. Lo que saqué fue una lección sobre dónde aterriza la persona.

Una tarea, un juez, cuatro combinaciones

Cada combinación enrutada a través de Hermes sacó el puntaje más bajo, sin importar qué modelo tuviera detrás.
Modelo, vía qué runtimePuntaje sobre 10
GLM-5.1, vía OpenCode9,55
Opus, vía el adaptador de Claude Code8,88
GLM-5.1, vía Paperclip más Hermes7,0 a 7,9
gpt-5.5, vía Paperclip más Hermes6,7
Cada combinación enrutada a través de Hermes sacó el puntaje más bajo, sin importar qué modelo tuviera detrás.

El patrón es el hallazgo: no es que GLM sea mejor que gpt-5.5, ni que Opus sea el más fuerte de los cuatro. Es que enrutar GLM-5.1 a través de Hermes le costó entre 1,6 y 2,5 puntos contra el puntaje que ese mismo modelo sacó vía OpenCode. Saqué el prompt real de la base de datos de sesiones de Hermes para entender por qué. El system prompt arrancaba con 13.985 caracteres presentando al agente como Hermes Agent. La persona que yo quería, “You are Alex Hormozi, Chief Offer Architect”, llegaba como un mensaje de usuario plano de 10.831 caracteres. El modelo recibió dos identidades y eligió el promedio seguro: correcto, genérico, y sin nada de lo que la persona debía agregar.

Esa causa raíz no tiene nada que ver con la inteligencia del modelo. Un modelo más inteligente no arregla una persona mandada al slot equivocado. El arreglo es estructural: la identidad va en SOUL.md, donde Hermes la trata como identidad, no en un mensaje de usuario peleando con el system prompt por la atención del modelo.

Lo que en verdad corrí, mes a mes

Acá va el registro honesto, no una lista de recomendación. En junio, la flota corría sobre GLM-5.1 a través de Z.AI, el mes en que moví la elección de modelo del orquestador a config.yaml para siempre. Para el 21 de julio, ya había cambiado el runtime a deepseek/deepseek-v4-flash a través de OpenRouter. También en junio, gpt-5.4 a través de Codex, montado sobre una suscripción de ChatGPT Plus, fue una de las fuentes de tokens para los mismos agentes.

Ninguno de esos tres es “el mejor modelo”. Eran el mejor modelo para esa flota, a ese costo, en ese momento, que es una afirmación distinta y la única honesta que se puede hacer sobre un proyecto que se reconfigura cada pocas semanas.

Mi propia opinión, de haber usado los dos: GLM manejaba síntesis larga y de varias fuentes con más profundidad que DeepSeek. DeepSeek andaba perfectamente bien para trabajo de ejecución más simple, del tipo donde el plan ya está hecho y el modelo solo necesita llevarlo a cabo sin perder el hilo. Esa división, síntesis profunda contra ejecución precisa, es la misma división que el artículo de model handoff conecta en pi: distintas fases de trabajo merecen distintos modelos.

Enruta por rol, no por flota

La palanca en la que confío más que en un modelo más inteligente no es elegir un modelo para toda la flota en primer lugar. En mi org de Paperclip, los heads son dueños de un resultado y juzgan; los especialistas son dueños de un oficio y ejecutan dentro de un contexto angosto y fijo. Un especialista con un brief ajustado y una skill de persona que carga su juicio no necesita el modelo más caro disponible. El juicio ya está escrito. Lo que le queda al modelo por hacer es más angosto, y el trabajo angosto es justo lo que un modelo barato hace bien.

Hermes te da una versión integrada de “preguntale a más de un modelo y deja que uno más fuerte juzgue”. Su modo Mixture-of-Agents, /moa, manda una pregunta a varios modelos de referencia y le pasa sus respuestas a un modelo agregador separado que sintetiza la respuesta final. El preset por defecto que viene de fábrica junta a gpt-5.5 a través del provider de OpenAI Codex y a deepseek/deepseek-v4-pro a través de OpenRouter como las dos referencias, con anthropic/claude-opus-4.8 a través de OpenRouter como el agregador. Las tres son reemplazables, y la forma es la lección aunque nunca toques el default: modelos más baratos generan candidatos, un modelo capaz toma la decisión final. Eso es ruteo basado en rol, integrado en el runtime, a un bloque de config de distancia de un patrón que tuve que construir a mano a nivel de la organización.

Modelo local para Hermes Agent: Ollama, vLLM y llama.cpp a través del provider custom

Correr Hermes contra un modelo en tu propio hardware, “ollama hermes agent” en las búsquedas que traen gente a esta página, pasa por el mismo bloque model, con provider en custom. El perfil de provider custom de Hermes existe específicamente para esto: cualquier endpoint compatible con OpenAI, con Ollama, vLLM y llama.cpp como los casos nombrados, más alias en el registro de providers (ollama, local, vllm, llamacpp) que todos resuelven al mismo perfil. La forma de la config es esta:

model:
  default: "gemma4:31b"
  provider: "custom"
  base_url: "http://localhost:11434/v1"

No se necesita API key para un endpoint local de Ollama. El perfil de provider completa un esfuerzo de razonamiento razonable por defecto cuando lo dejas sin definir, y amplía el clamp de valores de esfuerzo de razonamiento al set completo compatible con OpenAI, porque el propio vocabulario de un endpoint custom no es algo que Hermes pueda descubrir de antemano.

El único filtro que importa más que la calidad bruta del modelo acá es el tool calling. Hermes es agéntico: edita archivos, corre comandos, llama a MCP servers. Un modelo local que no puede emitir tool calls de forma confiable puede chatear contigo y no hacer nada más, sin importar cuán buena sea su prosa. Compra por esa capacidad primero, y por todo lo demás después. Si tu máquina es lenta, revisa los timeouts antes de culpar al modelo: el detector de llamadas obsoletas de Hermes se desactiva solo para endpoints locales, y puedes configurar un timeout de request por provider con providers.<id>.request_timeout_seconds.

Trabajo, clase de modelo, por qué: un método en vez de un ranking

Cómo decido en realidad, no un leaderboard

Cinco trabajos, cinco respuestas distintas. Ese es el punto: una sola lista no puede cubrir las cinco.
TrabajoClase de modeloPor qué
Especialista angosto, un oficio, el juicio ya está en SOUL.mdEl modelo más barato que pasa la pruebaEl contexto es angosto y el juicio está fijo. Más modelo no compra más calidad acá.
Síntesis larga a través de muchas fuentesUn modelo con razonamiento paciente y profundo (nivel GLM, en mi experiencia)El razonamiento flojo se nota primero en la síntesis larga, no en pasos cortos de ejecución.
Agregar el output de varios agentes, incluyendo el rol de agregador de /moaTu modelo más capaz, el más caroUna llamada por ciclo, no por turno, así que la prima se paga una sola vez.
Trabajo local, sensible al costo, dirigido por herramientasEl que corra tu hardware con tool calling confiableUn modelo que no puede llamar herramientas no puede manejar Hermes para nada. La calidad de chat es el eje equivocado para comprar.
Cualquier cosa que todavía no perfilasteEl modelo más barato que pasa tu propia prueba, corrida a través del runtime realUn modelo que puntúa bien en una ventana de chat simple puede perder dos puntos en el momento en que se enruta a través de tu harness.
Cinco trabajos, cinco respuestas distintas. Ese es el punto: una sola lista no puede cubrir las cinco.

Mejores modelos para OpenClaw: el mismo método, las mismas trampas

La pregunta aparece también para OpenClaw, y la respuesta no cambia de forma. OpenClaw trata a los providers de modelo como extensiones, con Ollama, LM Studio y vLLM en esa lista junto a OpenRouter, más OAuth de suscripción para ChatGPT, Codex y el CLI de Claude, y una función de failover de modelo que cambia de provider sola cuando el principal falla.

Nada de esa lista hace a un modelo universalmente mejor. Aplican los mismos dos filtros: verifica el soporte de tool calling antes de comprar por calidad de chat, sobre todo para un modelo local, y prueba a través del runtime real, no de una ventana de chat simple, porque el heartbeat y los settings de contexto de OpenClaw pueden mover el rendimiento efectivo de un modelo igual que el system prompt de Hermes movió el mío.

Cómo correr tu propio shootout

Reemplaza el leaderboard con una prueba que controlas

  • Obligatorio:
    Prueba a través del runtime real, nunca de una ventana de chat simple.El harness le puede costar dos puntos a un modelo antes de que escriba una palabra, exactamente como le pasó a GLM-5.1 bajo Hermes con la persona en el slot equivocado.
  • Obligatorio:
    Juzga con un rubric fijo y escrito antes de ver los outputs.Mi shootout usó una sola tarea juzgada, puntuada de la misma forma, en cada combinación de modelo y runtime. Sin esa disciplina la comparación es solo onda.
  • Obligatorio:
    Separa la calidad del modelo del costo del runtime.Un modelo que puntúa un punto menos pero cuesta una décima parte sigue siendo la decisión correcta para un especialista angosto con trabajo fijo.
  • Obligatorio:
    Confirma el soporte de tool calling antes de comprar por calidad de chat.Sobre todo en modelos locales. Un modelo que solo puede chatear no puede manejar un loop agéntico, sin importar cuán fluido se lea.
  • Opcional:
    Vuelve a correr el shootout cuando cambia la versión del runtime, no solo cuando cambia el modelo.Hermes publica releases casi dos veces por semana. Un puntaje de junio es una foto de ese commit, no un veredicto permanente.
Este es todo el método. Ningún leaderboard sobrevive el contacto con tu propio harness.

Mejor modelo para Hermes Agent: respuestas rápidas

¿Cuál es el mejor modelo para Hermes Agent?

No hay un único mejor modelo. El mejor modelo es el más barato que pasa una prueba corrida a través de tu config real de Hermes, no de una ventana de chat simple. Mi propio shootout mostró al mismo modelo perdiendo hasta 2,5 puntos solo por dónde Hermes puso la persona en el prompt.

¿Qué modelo usa Hermes Agent por defecto?

Ninguno viene forzado. Hermes lee el modelo del bloque model en ~/.hermes/config.yaml, y soporta 38 plugins de provider más cualquier endpoint compatible con OpenAI a través del provider custom. Defínelo ahí, no en lo que sea que orqueste o despierte al agente.

¿Puedo correr Hermes Agent con Ollama?

Sí. Configura provider en custom y base_url apuntando a tu endpoint de Ollama, típicamente http://localhost:11434/v1, sin necesidad de API key. El registro de providers también acepta ollama, local, vllm y llamacpp como alias del mismo perfil.

¿Cuál es el mejor modelo local para Hermes Agent?

El que tu hardware pueda correr con tool calling confiable. Hermes es agéntico: edita archivos y corre comandos a través de tool calls, y un modelo local sin buen soporte de tool calling solo puede chatear. Verifica esa capacidad antes de comparar cualquier otra cosa.

¿Cuáles son los mejores modelos para OpenClaw?

Aplica el mismo método que para Hermes. OpenClaw trata a los providers como extensiones, incluyendo Ollama, LM Studio y vLLM junto a OpenRouter y OAuth de suscripción, más failover de modelo si un provider falla. Prueba a través del runtime real de OpenClaw antes de confiar en la reputación de un modelo de otro lado.