Seedance 2.5 ya está disponible — Primero en Atlas Cloud

DeepSeek Harness vs Hermes: ¿Cuál quema más tokens?

DeepSeek Harness vs Hermes: ¿Cuál quema más tokens?

Ayer ejecutaste una tarea en Hermes. Hoy ejecutaste lo que sentiste como la misma tarea en dsh. Mismo modelo, misma clave API, mismo portátil. Los números de uso salieron diferentes de todas formas.

Tus ojos están bien. Nada se re-preció de la noche a la mañana.

Esto es lo que casi toda comparación entre DeepSeek Harness y Hermes pasa por alto: el harness es la cáscara que envuelve al modelo, y esa cáscara decide cuánto contexto se envía por paso, cuántas herramientas anuncia, con qué frecuencia reintenta, y si reenvía toda la conversación en cada llamada. Cambia la cáscara, cambia la factura.

Así que fijé la variable del modelo y lo medí. Dos harnesses, un endpoint, un deepseek-ai/deepseek-v4-pro, un prompt, una máquina, una tarde. Misma tarea, ambos la completaron, y uno de ellos movió 8,4 veces más tokens de prompt que el otro.

Conclusiones clave

  • Mismo modelo, misma tarea, ambos aprobaron: dsh tardó 121 segundos, Hermes tardó 780 segundos.
  • Hermes movió 1.111.573 tokens de prompt frente a los 132.600 de dsh. Eso es 8,4 veces, en una sola tarea.
  • Antes de que cualquiera de los dos agentes haga algo, su prompt de sistema ya cuesta tokens: dsh 10.898 vs Hermes 13.892 solo para responder "OK".
  • dsh te limita silenciosamente a 262.144 de contexto a menos que sobrescribas defaultContextWindow, desechando el 75% de la ventana de V4.
  • Elige dsh para codificación, Hermes para memoria, cron y superficies de chat. O ejecuta ambos.

Taller de ingeniería dividido con un bloque de motor desnudo sujeto en un banco de pruebas de acero a la izquierda y un autómata de latón a la derecha, ambos alimentados por una sola línea de combustible de cobre

Una línea de combustible, dos bancos de pruebas. Eso es todo el experimento. Generado con openai/gpt-image-2.

DeepSeek Harness vs Hermes, Mismo Modelo, Misma Tarea

Ambos harnesses recibieron esto, palabra por palabra: construye un clon de Breakout en un solo archivo con una paleta, 5 filas de ladrillos, un contador de puntuación en vivo, una tecla P para pausar, más un bloque de autocomprobación en línea que verifique tres invariantes de física e imprima PASS o FAIL. Luego ejecútalo sin cabeza y arréglalo hasta que los tres impriman PASS.

Sin librerías. Sin CDN. Sin paso de compilación.

Ambos realmente lo hicieron. Aquí están los dos archivos, renderizados en un navegador real.

Comparación animada lado a lado de las dos construcciones de Breakout ejecutándose: DeepSeek Harness (dsh) a la izquierda, Hermes Agent a la derecha, ambos auto-reproducidos desde el mismo prompt de DeepSeek V4 Pro

Las dos construcciones regrabadas lado a lado y dejadas en auto-reproducción, para que puedas ver cada una ejecutándose. Izquierda: dsh, cuyo juego se inicia automáticamente. Derecha: Hermes, cuyo juego arranca pausado, luego se ejecuta. Mismo prompt de un solo archivo, mismo DeepSeek V4 Pro, dos harnesses.

Ahora los números que realmente deciden esto.

EjecuciónTiempo realLlamadas a herramientasTokens de prompt (nuevos + en caché)Tokens de salidaCosto en V4 Pro
dsh, ronda 1121,2s814.840 + 117.760 = 132.6005.231$0,24
Hermes, ronda 1780s3549.685 + 1.061.888 = 1.111.57319.317$1,93
dsh, ronda 2no completada11 antes del corte44.291 + 132.6082.463no completada
Hermes, ronda 2no completadano ejecutadano completadano completadano completada

Medido el 2026-08-21 en deepseek-ai/deepseek-v4-pro, una máquina, directorio de trabajo vacío por ejecución. Los conteos de tokens son leídos por máquina: los de dsh desde su registro de sesión, los de Hermes desde su JSON --usage-file. Ten en cuenta que los dos conteos de herramientas no se obtienen de la misma manera: los 8 de dsh se contaron desde su registro (afirmó 6), mientras que los 35 de Hermes son su propio informe, con su archivo de uso registrando 38 llamadas API. El método de costo se detalla en la última sección.

¿Por qué las dos filas en blanco? La ronda 2 nunca se ejecutó, y la razón es el mejor punto de datos único de este artículo. Solo la ronda 1 de Hermes impulsó 1,13 millones de tokens a través de la cuenta, y a mitad de la ronda 2 de dsh, el endpoint respondió:

plaintext
1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded",
2"message":"Member day spend limit reached (set by your team admin);
3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}

Un agente, un juego de Breakout, el límite presupuestario de un día. No estoy llenando esas celdas con estimaciones.

Un detalle más que vale la pena señalar. dsh informó "Tool calls used: 6" en su respuesta final. Su propio registro de sesión registra 8. Los agentes son narradores poco fiables sobre su propio gasto, que es exactamente la razón por la que esta prueba lee registros en lugar de resúmenes.

Por qué la mayoría de las comparaciones DeepSeek Harness vs Hermes están rotas

Primero el veredicto: casi todas las páginas que aparecen en este término miden la variable equivocada, y puedes detectarlo en una línea de su configuración.

El modelo, no la cáscara, es lo que midieron esas pruebas

Ve a leer los primeros resultados. El patrón se repite: ejecutan dsh en un modelo DeepSeek, ejecutan Hermes en lo que sea que Hermes ya tuviera apuntado, y luego atribuyen toda la diferencia al harness.

Eso no es una comparación de harnesses. Es una comparación de modelos disfrazada de etiqueta de harness.

Si dsh está en V4 Pro y Hermes está en otra cosa, el delta que mides es principalmente de los dos modelos, y la contribución de la cáscara queda enterrada más allá de la recuperación. Así que esta prueba hace lo aburrido y necesario: ambos harnesses apuntan a la misma URL base, el mismo id de modelo, la misma clave.

La elección del harness mueve los números por sí sola

¿Quieres pruebas de que la cáscara sola es cara? Pídele a cada uno que no haga nada.

Les envié el mismo prompt trivial: Reply with exactly the word: OK. Sin herramientas necesarias, sin archivos, sin pensar.

HarnessTokens de prompt para decir "OK"Tokens de salidaTiempo real
DeepSeek Harness (dsh)10.89825,6s
Hermes Agent13.892 (+1.024 en caché)178,5s

Mismo modelo. Misma pregunta. Una brecha de 2.994 tokens antes de que comience cualquier trabajo real, porque esa brecha es el harness: su prompt de sistema, sus esquemas de herramientas, su archivo de reglas. Hermes trae más superficie, así que Hermes trae más tokens.

Ahora multiplica eso por un bucle de agente de 38 llamadas donde cada llamada reenvía la conversación hasta el momento. Las lecturas en caché fueron el 88,8% de los tokens de prompt de dsh y el 95,5% de los de Hermes. Esa relectura es la factura.

Un Endpoint, Dos Harnesses: La Configuración de DeepSeek V4

Para comparar cáscaras necesitas que el lado del modelo se mantenga perfectamente quieto. No solo el mismo nombre de modelo: el mismo endpoint, el mismo límite de tasa, el mismo precio a las 3am que a las 3pm.

Eso último importa más de lo que parece. Si tu proveedor cobra tarifas pico y fuera de pico, entonces "ronda 1 en Hermes a las 09:00" y "ronda 2 en dsh a las 11:00" no son ejecuciones comparables, y nunca podrás desenredar cuánto del delta fue el harness y cuánto fue el reloj.

Así que ambos harnesses apuntan aquí a un endpoint compatible con OpenAI de tarifa plana en Atlas Cloud: https://api.atlascloud.ai/v1. Mismo precio todo el día, sin ventana pico, sin cola separada por harness, una clave para ambos.

Rol en la pruebaId del modeloContexto / salida máximaPrecio por 1M entrada / salida
Motor principal para ambos harnessesdeepseek-ai/deepseek-v4-pro1.048.576 / 393.216$1,68 / $3,38
Nivel barato, rol de "brazos"deepseek-ai/deepseek-v4-flash1.048.576 / 393.216$0,14 / $0,28
Trabajo cron de larga duracióndeepseek-ai/deepseek-v3.2163.840 / 163.840$0,26 / $0,38

Precios leídos de las páginas de modelos el 2026-08-21. Sin distintivo de descuento en la familia DeepSeek ahora mismo, así que nada aquí es una tarifa promocional que expire la próxima semana.

Pequeño detalle fácil de pasar por alto: /v1/models reporta deepseek-v4-pro y deepseek-v4-flash como fp4, mientras que deepseek-v4-pro-0813 devuelve fp8. ¿Quieres los pesos de mayor precisión? Fija el id con fecha.

Bien. Vamos a construirlo.

Ejecuta la Prueba DeepSeek Harness vs Hermes Tú Mismo

Avance: siete pasos, dos archivos de configuración, un prompt, y terminas con tu propia versión de esa tabla en lugar de confiar en la mía. Prueba de que funciona: cada número anterior salió exactamente de estos pasos en un MacBook estándar, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.

Empecemos.

Paso 1: Consigue un endpoint que se mantenga quieto

Ambos harnesses dependen en gran medida de la llamada a funciones, así que antes de instalar nada, prueba que el endpoint sirve herramientas:

plaintext
1curl -s https://api.atlascloud.ai/v1/models \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'

Salida real de esa llamada:

plaintext
1{
2  "id": "deepseek-ai/deepseek-v4-pro",
3  "context_length": 1048576,
4  "max_output_length": 393216,
5  "supported_features": ["json_mode", "tools", "structured_outputs"]
6}

tools en esa lista es lo que estás verificando. Sin herramientas, no hay bucle de agente, y ambos harnesses fallarán de maneras confusas en lugar de decirlo.

Obtén tu clave de la página del modelo DeepSeek V4 Pro, luego export ATLAS_API_KEY=... antes de cada comando a continuación.

Un problema para el lado de Hermes: la respuesta envuelve el array como {"code":200,"msg":"succeed","data":[...]}. Hermes consulta /v1/models durante la configuración y lo analiza bien, pero si estás escribiendo tus propias herramientas contra él, no esperes una lista simple.

Paso 2: Instala ambos agentes

plaintext
1# DeepSeek Harness
2npm install @deepseek-ai/dsh
3
4# Hermes Agent
5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

Tres notas de instalación que me costaron tiempo:

  • dsh necesita Node ^22.19.0 || >=24.0.0. No soporta 23.x. La mayoría de los tutoriales dicen "Node 20+", lo cual es simplemente incorrecto.
  • Ese npm install descargó 453 paquetes y tardó 8 minutos. No es una dependencia pequeña.
  • Hermes trae su propio Python 3.11 a través de uv, por lo que tu Python del sistema no importa (el mío es 3.9). Si el instalador muere a mitad de la descarga por un contratiempo de PyPI, vuelve a ejecutar la sincronización de dependencias en lugar de todo el script.

Paso 3: Apunta DeepSeek Harness al endpoint

Escribe esto en $DSH_HOME/settings.yaml (por defecto ~/.dsh):

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      displayName: Atlas Cloud
5      apiKeyEnv: ATLAS_API_KEY
6      api: openai-completions
7      baseURL: https://api.atlascloud.ai/v1
8      defaultContextWindow: 1048576
9      defaultMaxTokens: 65536
10      compat:
11        thinkingFormat: deepseek
12      models:
13        - id: deepseek-ai/deepseek-v4-pro
14          name: DeepSeek V4 Pro
15          reasoningEfforts:
16            off:
17            high: high
18        - id: deepseek-ai/deepseek-v4-flash
19          name: DeepSeek V4 Flash
20          reasoningEfforts:
21            off:
22            high: high
23agent-default-model:
24  provider: atlas
25  model: deepseek-ai/deepseek-v4-pro

Tres líneas merecen una oración cada una, porque equivocarse en cualquiera de ellas cambia tu factura:

  1. compat.thinkingFormat: deepseekes la línea que nadie escribe. dsh adivina el dialecto de pensamiento a partir de la URL del endpoint. Su propio README del adaptador es contundente al respecto: la URL de una puerta de enlace privada no dice nada, por lo que un endpoint no reconocido se trata "como si fuera el propio OpenAI". Tu puerta de enlace con dialecto DeepSeek recibe entonces órdenes en dialecto OpenAI. Esta clave solo existe bajo api: openai-completions.
  2. SobrescribedefaultContextWindow. Los valores predeterminados a nivel de ruta son 262.144 de contexto y 32.768 tokens máximos. Declarar modelos V4 manualmente sin tocar esos valores hace que silenciosamente desperdicies el 75% de una ventana de 1.048.576.
  3. agent-default-modeltomaproviderymodelcomo dos claves separadas. Escribir model: atlas/deepseek-ai/deepseek-v4-pro como una sola cadena parece razonable y no hace nada. Obtienes MISSING_CREDENTIAL: no API key for provider route "deepseek-official", y te pones a buscar un problema de clave que no tienes.

Ten en cuenta que apiKeyEnv es una referencia a la credencial, no el secreto. No se coloca ninguna clave en este archivo.

Paso 4: Apunta Hermes al mismo endpoint

La ruta del asistente es hermes model, luego elige "Custom endpoint". La ruta scripteable son cinco comandos:

plaintext
1hermes config set model.provider custom
2hermes config set model.default deepseek-ai/deepseek-v4-pro
3hermes config set model.base_url https://api.atlascloud.ai/v1
4hermes config set model.api_key "$ATLAS_API_KEY"
5hermes config set model.context_length 1048576

Lo que escribe ~/.hermes/config.yaml:

plaintext
1model:
2  provider: custom
3  default: deepseek-ai/deepseek-v4-pro
4  base_url: https://api.atlascloud.ai/v1
5  api_key: apikey-...
6  context_length: 1048576

provider: custom es un proveedor de primera clase aquí, no un alias, y la URL base debe terminar en /v1 porque Hermes añade /chat/completions por sí mismo (documentación de Hermes Agent, Configuring Models, 2026).

No te saltes esa línea api_key. La documentación dice que la clave cae por defecto a OPENAI_API_KEY, y en mi ejecución exportar esa variable no fue suficiente: Hermes envió la solicitud sin autenticación utilizable y Atlas respondió HTTP 401: {"code":401,"msg":"unauthorized"}. Establecer model.api_key explícitamente lo solucionó en el siguiente intento, en 8,5 segundos.

Paso 5: Ejecuta la ronda 1 en ambos

Limpia primero el directorio de habilidades de Hermes (~/.hermes/skills). Una habilidad preexistente hace que la ronda 1 sea injusta, y la ronda 2 es donde quieres ver cómo se crea una habilidad y luego se reutiliza.

Luego dale a ambos harnesses esto, byte por byte:

plaintext
1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks,
2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step.
3Then append an inline <script id="selftest"> block that asserts three physics invariants
4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas)
5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only
6when all three asserts print PASS. Report the number of tool calls you used.

Configuración: un directorio vacío nuevo por harness, razonamiento activado, salida máxima de al menos 32.768, y nada más ejecutándose en la máquina para que los números de tiempo real signifiquen algo.

plaintext
1# dsh, sesión persistida de un solo disparo
2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)"
3
4# Hermes, un solo disparo con informe de uso legible por máquina
5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json

Dos cosas te sorprenderán aquí.

Primero, hermes -z no imprime absolutamente nada hasta que termina. Sin banner, sin spinner, sin vistas previas de herramientas. El mío se quedó en silencio durante 13 minutos y parecía colgado; no lo estaba, estaba procesando 38 llamadas API. Revisa ps para ver un shell hijo si necesitas tranquilidad.

Segundo, Hermes ignoró mi directorio de trabajo y escribió game.html en $HOME en su lugar. Si quieres el archivo donde lanzaste, pasa --no-restore-cwd o --in DIR. Perdí una ronda por eso.

dsh, mientras tanto, terminó en 121 segundos y su interfaz web leerá la misma sesión de vuelta:

Interfaz web de DeepSeek Harness mostrando la sesión de Breakout terminada, tres PASS asserts, 9 pasos y 133K tokens de entrada en DeepSeek V4 Pro

Interfaz web de dsh en 127.0.0.1:3080. Observa la barra de estado: 9 pasos, acierto de caché 89%, entrada 133K tokens, y el selector de modelo leyendo DeepSeek V4 Pro desde la configuración del Paso 3.

--usage-file en el lado de Hermes es realmente útil y está poco documentado: escribe tokens de entrada, tokens de salida, lecturas de caché, tokens de razonamiento, api_calls y un costo estimado en JSON, y escribe ese archivo incluso cuando la ejecución falla.

dsh no tiene un indicador equivalente, pero no lo necesita. Su registro de sesión de solo añadidura lo contiene todo, con una trampa. El registro en $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd es un flujo zstd de múltiples marcos, un marco por vaciado. zlib.zstdDecompressSync(buf) devuelve solo el primer marco, por lo que un registro de 150KB se decodifica a un par de cientos de bytes y parece vacío. Divide los bytes mágicos tú mismo:

plaintext
1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = [];
2for (let i = 0; i < buf.length - 4; i++)
3  if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i);
4const text = offs
5  .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString())
6  .join('');

El uso está en los eventos assistant/chunk donde data.chunk.type === 'usage', un nivel más profundo de lo que pensarías (data.chunk.usage.inputTokens). Las llamadas a herramientas provienen de los bloques de contenido assistant/message de tipo tool-call. Y request/header.data.header.config muestra el modelo y maxTokens que realmente se enviaron por cable, que es cómo demuestras que tu configuración del Paso 3 surtió efecto en lugar de esperar.

Paso 6: Ronda 2, la solicitud de cambio

Mismo directorio, game.html ya está ahí de la ronda 1. Ahora pide a ambos un cambio:

plaintext
1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle
2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up
3timer. Same file, no libraries.

Esta es la ronda que separa los dos diseños. Hermes escribe habilidades después de tareas complejas y mantiene una memoria de tres capas, por lo que la ronda 2 es donde una habilidad de la ronda 1 o bien da frutos o no. dsh no tiene memoria a largo plazo en absoluto, pero tiene un registro de sesión de solo añadidura que puedes bifurcar y reproducir desde la mitad en lugar de reiniciar.

Sé honesto contigo mismo sobre el presupuesto antes de comenzar esta. Mi ronda 2 murió 11 llamadas de herramientas después por un límite de gasto diario, por eso la tabla anterior tiene dos filas vacías en lugar de dos inventadas. El propio panel de Hermes muestra por qué:

Página de sesiones del panel de Hermes Agent que enumera la ejecución de Breakout con 76 mensajes en deepseek-v4-pro

Hermes v0.20.4 leyendo sus propias sesiones. La ejecución de Breakout completada tiene 76 mensajes, todos en deepseek-v4-pro a través del endpoint de Atlas.

Paso 7: Lee la factura

Dos números por ejecución, desde el propio registro del harness, nunca desde el resumen del agente:

plaintext
1# Hermes
2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json
3
4# dsh: agrega el registro de sesión decodificado
5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"

Luego verifica con la página de uso de tu proveedor. Cuando el registro del harness y el proveedor no coinciden, confía en el proveedor: ese es el número que pagas.

Para lo que vale, la propia barra de estado de dsh coincidió con mi analizador de registros hasta el redondeo (133K tokens de entrada, 89% de acierto de caché frente a mis 132.600 calculados y 88,8%). Las herramientas son honestas. Los resúmenes en inglés de los agentes no lo son.

Más Allá de DeepSeek Harness vs Hermes: Ejecuta Ambos como Cerebro y Brazos

Aquí está la respuesta que nadie en el debate de "cuál elegir" ofrece: no tienes que elegir.

Los dos proyectos fallan en direcciones opuestas, lo que los convierte en compañeros de equipo inusualmente buenos.

CapacidadDeepSeek Harness (dsh)Hermes Agent
Ejecuciones de codificaciónFuerte, este es el objetivo de diseñoCompletó la misma tarea en 6,4 veces el tiempo
Memoria a largo plazoNingunaDe tres capas, curada por el agente
Habilidades que se auto-mejoranNingunaSí, compatible con agentskills.io
Bifurcación / reproducción de registro de sesiónSí, JSONL de solo añadiduraBúsqueda de sesiones con resumen LLM
Cron incorporadoNoSí, horarios en lenguaje natural
Superficies de chatNoTelegram, Discord, Slack, WhatsApp, Signal
InterfazWeb UI, TUI, sin cabezaTUI, CLI, panel, puerta de enlace
Entorno de ejecuciónNode 22.19+/24+Python 3.11 (incluido)
MadurezVista previa para desarrolladores 0.1, cambios que rompen compatibilidadLanzado feb 2026, v0.20.4
Licencia / estrellasMIT, 176,5kMIT, 233,6k

Recuentos de estrellas leídos de ambos repositorios el 2026-08-21 (deepseek-ai/deepseek-harness con 176,5k estrellas y 19,2k forks, NousResearch/hermes-agent con 233,6k estrellas y 46,8k forks). Observa la trayectoria, no los totales: dsh estaba en 144.361 estrellas cuando lo revisé el 2026-08-17, por lo que añadió aproximadamente 32.000 en cuatro días.

Tres formas de combinarlos:

  • Cerebro y brazos. Hermes en V4 Pro mantiene la memoria, el horario y el hilo de Telegram. Delega la codificación real a dsh en el nivel barato. Una clave cubre ambos, por lo que no estás gestionando dos relaciones de facturación.
  • Nivel barato para el bucle, nivel caro para la decisión. El trabajo cron recurrente se ejecuta en deepseek-v3.2 o DeepSeek V4 Flash; la llamada difícil escala a Pro.
  • Ambos sin cabeza. dsh --profile headless y Hermes -z ambos toman un prompt e imprimen una respuesta, por lo que cualquiera se integra en un script de shell o un paso de CI sin TUI.

Advertencia justa sobre las debilidades honestas, porque una comparación que solo enumera fortalezas es un anuncio. dsh es una vista previa para desarrolladores 0.1 y lo dice en su propia interfaz: se romperá entre versiones, no tiene memoria, no tiene canal de mensajería nativo, e informa menos de sus propias llamadas a herramientas. Hermes es el proyecto más maduro por un amplio margen, pero es el más pesado por token por un factor de 8, se quedó en silencio durante 13 minutos en una tarea que dsh terminó en 2, y escribió mi archivo de salida en el directorio incorrecto.

Lo que DeepSeek Harness vs Hermes Realmente Cuesta por Tarea

Ahora la aritmética, con los supuestos a la vista.

Atlas publica una tasa de entrada para V4 Pro ($1,68 por 1M) sin una tasa separada de acierto de caché en la página del modelo. Así que precio cada token de prompt a la tasa de entrada completa, incluidas las lecturas en caché. Eso es un techo conservador, no una suposición disfrazada de medición.

Ejemplo práctico, dsh ronda 1:

  • Prompt: 14.840 nuevos + 117.760 en caché = 132.600 tokens. A $1,68/1M eso es $0,2228.
  • Salida: 5.231 tokens. A $3,38/1M eso es $0,0177.
  • Total: $0,2404 por tarea.

Mismo método en Hermes ronda 1: 1.111.573 tokens de prompt son $1,8674, más 19.317 tokens de salida a $0,0653, para $1,9327. El propio --usage-file de Hermes estimó $0,2817 para esa ejecución, lo que implica que asume una tasa de entrada en caché cercana a $0,125 por 1M. Si tu proveedor realmente descuenta las lecturas de caché tan drásticamente, ambos números a continuación caen juntos y la proporción entre ellos apenas se mueve.

EscenarioPor tarea en V4 ProPor tarea en V4 Flash20 tareas/día, 30 días (Pro)
dsh ronda 1$0,24$0,02$144,27
Hermes ronda 1$1,93$0,16$1.159,64
Ronda 2, cualquier harnessno completadano completadano completada

Dos cosas saltan de esa tabla.

La elección del harness vale 8x. Mismo modelo, misma tarea, mismo resultado, y una cáscara cuesta ocho veces la otra. Eso no es una diferencia de redondeo que optimices después.

El nivel del modelo vale 12x además de eso. Que es por qué la división cerebro-y-brazos no es un truco: dsh en Flash aterriza en dos centavos por tarea, y Hermes en Pro aterriza en casi dos dólares para el juego de Breakout idéntico.

Y la optimización más barata de todas sigue siendo la del Paso 3. Una ruta de dsh dejada en su valor predeterminado de 262.144 hace más trabajo de compresión en más pasos para encajar el mismo trabajo, y pagas por cada uno.

Esa es la verdadera respuesta a DeepSeek Harness vs Hermes: mide tu propia cáscara antes de ir a buscar un modelo más barato.

Preguntas Frecuentes sobre DeepSeek Harness vs Hermes

¿Pueden Hermes Agent y DeepSeek Harness usar el mismo modelo y clave API?

Sí, y es la única forma honesta de compararlos. Ambos se comunican con endpoints compatibles con OpenAI. dsh necesita una ruta de proveedor llm-pi-ai con api: openai-completions más baseURL; Hermes necesita provider: custom más un base_url que termine en /v1. Una clave, ambos harnesses, ambos niveles de precio. Configuraciones completas en los Pasos 3 y 4.

¿Es DeepSeek Harness mejor que Hermes para codificar?

En esta prueba, claramente sí: 121 segundos contra 780, 8 llamadas a herramientas contra 35, y un octavo del gasto de tokens, con ambos pasando las tres autocomprobaciones. Pero "mejor para codificar" no es "mejor". Si lo que necesitas es un trabajo programado que informe a Telegram cada mañana y recuerde lo que aprendió la semana pasada, dsh no tiene nada de eso y Hermes lo tiene todo.

¿Son DeepSeek Harness y Hermes gratuitos y de código abierto?

Ambos tienen licencia MIT y son gratuitos para descargar. Lo que pagas son los tokens, y como muestra la tabla anterior, eso no es un error de redondeo. Vale la pena repetir que dsh es explícitamente una vista previa para desarrolladores en 0.1 y advierte sobre cambios que rompen la compatibilidad en su propia interfaz, así que fija tu versión si va a estar cerca de producción.

¿Por qué la misma tarea cuesta más en un harness?

Cuatro razones, aproximadamente en orden de tamaño:

  • Relecturas de la conversación. Los tokens de prompt en caché fueron el 88,8% del total de dsh y el 95,5% del de Hermes. Cada paso adicional reenvía todo lo anterior.
  • Prompt de sistema y esquemas de herramientas. Medido arriba: 10.898 vs 13.892 tokens antes de que ocurra cualquier trabajo.
  • Número de pasos. 8 llamadas a herramientas y 9 pasos frente a 35 llamadas a herramientas en 38 llamadas API.
  • Ventana limitada. dsh al caer en 262.144 en lugar de 1.048.576 fuerza trabajo de compresión adicional en tareas largas.

¿Puedo ejecutar DeepSeek Harness y Hermes al mismo tiempo?

Sí. No comparten nada más que tu clave API: diferentes entornos de ejecución, diferentes directorios de configuración, diferentes almacenes de sesiones, diferentes puertos (3080 y 9119 por defecto). El patrón habitual es Hermes como el cerebro siempre activo en el nivel caro y dsh como los brazos de codificación en el nivel barato.

¿DeepSeek Harness solo funciona con la API propia de DeepSeek?

No, y este es el concepto erróneo más común sobre él. Cualquier puerta de enlace compatible con OpenAI funciona a través de api: openai-completions y un baseURL. Solo recuerda compat.thinkingFormat: deepseek, porque dsh infiere el dialecto de pensamiento de la URL, y una URL de puerta de enlace de terceros no le dice nada en absoluto.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos