Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

DeepSeek Harness vs Hermes: Qual deles queima mais tokens?

DeepSeek Harness vs Hermes: Qual queima mais tokens?

Você executou uma tarefa no Hermes ontem. Executou o que parecia a mesma tarefa no dsh hoje. Mesmo modelo, mesma chave de API, mesmo laptop. Os números de uso vieram diferentes de qualquer maneira.

Seus olhos estão bem. Nada foi reajustado da noite para o dia.

Aqui está o que quase toda comparação DeepSeek Harness vs Hermes ignora: o harness é a casca que envolve o modelo, e essa casca decide quanto contexto vai para fora por etapa, quantas ferramentas ela anuncia, quantas vezes ela tenta novamente e se ela reenvia a conversa inteira em cada chamada. Mude a casca, mude a conta.

Então eu fixei a variável do modelo e medi. Dois harnesses, um endpoint, um deepseek-ai/deepseek-v4-pro, um prompt, uma máquina, uma tarde. Mesma tarefa, ambos concluíram, e um deles moveu 8,4x mais tokens de prompt que o outro.

Principais conclusões

  • Mesmo modelo, mesma tarefa, ambos passaram: dsh levou 121 segundos, Hermes levou 780 segundos.
  • Hermes moveu 1.111.573 tokens de prompt contra 132.600 do dsh. Isso é 8,4x, em uma única tarefa.
  • Antes de qualquer agente fazer algo, seu prompt de sistema custa tokens: dsh 10.898 vs Hermes 13.892 só para responder "OK".
  • O dsh silenciosamente limita você a 262.144 de contexto a menos que você substitua defaultContextWindow, jogando fora 75% da janela do V4.
  • Escolha dsh para codificação, Hermes para memória, cron e superfícies de chat. Ou execute ambos.

Oficina de engenharia dividida com um bloco de motor nu preso em uma estrutura de teste de aço à esquerda e um autômato de latão à direita, ambos alimentados por uma única linha de combustível de cobre

Um linha de combustível, duas estruturas de teste. Esse é o experimento inteiro. Gerado com openai/gpt-image-2.

DeepSeek Harness vs Hermes, Mesmo Modelo, Mesma Tarefa

Ambos os harnesses receberam isto, palavra por palavra: crie um clone do Breakout em um único arquivo com uma raquete, 5 fileiras de tijolos, um contador de pontuação ao vivo, uma tecla P para pausar, além de um autoteste inline que verifica três invariantes de física e imprime PASS ou FAIL. Em seguida, execute-o headless e corrija até que todos os três imprimam PASS.

Sem bibliotecas. Sem CDN. Sem etapa de build.

Ambos realmente fizeram. Aqui estão os dois arquivos, renderizados em um navegador real.

Lado a lado animado das duas construções do Breakout rodando: DeepSeek Harness (dsh) à esquerda, Hermes Agent à direita, ambos em reprodução automática a partir do mesmo prompt do DeepSeek V4 Pro

As duas construções regravadas lado a lado e deixadas em reprodução automática, para que você possa ver cada uma realmente rodando. Esquerda: dsh, cujo jogo inicia automaticamente. Direita: Hermes , cujo jogo inicia pausado e depois roda. Mesmo prompt de um arquivo, mesmo DeepSeek V4 Pro , dois harnesses.

Agora os números que realmente decidem isso.

ExecuçãoTempo de paredeChamadas de ferramentaTokens de prompt (novos + em cache)Tokens de saídaCusto no V4 Pro
dsh, rodada 1121,2s814.840 + 117.760 = 132.6005.231$0,24
Hermes, rodada 1780s3549.685 + 1.061.888 = 1.111.57319.317$1,93
dsh, rodada 2não concluída11 antes do limite44.291 + 132.6082.463não concluída
Hermes, rodada 2não concluídanão executadanão concluídanão concluídanão concluída

Medido em 2026-08-21 no deepseek-ai/deepseek-v4-pro, uma máquina, diretório de trabalho vazio por execução. As contagens de tokens são lidas por máquina: as do dsh a partir do seu log de sessão, as do Hermes a partir do seu JSON --usage-file. Esteja ciente de que as duas contagens de ferramentas não são obtidas da mesma forma: as 8 do dsh são contadas a partir do seu log (ele afirmou 6), enquanto as 35 do Hermes são o relatório dele próprio, com seu arquivo de uso registrando 38 chamadas de API. O método de custo está detalhado na última seção.

Por que as duas linhas em branco? A rodada 2 nunca foi executada, e a razão é o melhor ponto de dado único do artigo. A rodada 1 do Hermes sozinha empurrou 1,13 milhão de tokens através da conta, e no meio da rodada 2 do dsh o endpoint respondeu:

plaintext
1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded",
2"message":"Member day spend limit reached (set by your team admin);
3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}

Um agente, um jogo Breakout, o limite de orçamento de um dia. Não vou preencher essas células com estimativas.

Mais um detalhe que vale destacar. O dsh relatou "Tool calls used: 6" em sua resposta final. Seu próprio log de sessão registra 8. Agentes são narradores não confiáveis sobre seus próprios gastos, e é exatamente por isso que este teste lê logs em vez de resumos.

Por que a Maioria das Comparações DeepSeek Harness vs Hermes São Quebradas

Veredito primeiro: quase todas as páginas ranqueadas para esta palavra-chave medem a variável errada, e você pode detectar isso em uma linha da configuração.

O modelo, não a casca, é o que esses testes mediram

Vá ler os principais resultados. O padrão se repete: execute dsh em um modelo DeepSeek, execute Hermes no que quer que Hermes já estivesse apontado, e então atribua toda a diferença ao harness.

Isso não é uma comparação de harness. É uma comparação de modelo vestindo um rótulo em forma de harness.

Se o dsh está no V4 Pro e o Hermes está em outra coisa, o delta que você mede é principalmente dos dois modelos, e a contribuição da casca está enterrada além da recuperação. Então este teste faz a coisa chata e necessária: ambos os harnesses apontam para a mesma URL base, o mesmo id de modelo, a mesma chave.

A escolha do harness move os números por conta própria

Quer prova de que a casca sozinha é cara? Peça a cada um para não fazer nada.

Eu enviei a ambos o mesmo prompt trivial: Reply with exactly the word: OK. Sem ferramentas necessárias, sem arquivos, sem pensamento necessário.

HarnessTokens de prompt para dizer "OK"Tokens de saídaTempo de parede
DeepSeek Harness (dsh)10.89825,6s
Hermes Agent13.892 (+1.024 em cache)178,5s

Mesmo modelo. Mesma pergunta. Uma diferença de 2.994 tokens antes de qualquer trabalho real começar, porque essa diferença é o harness: seu prompt de sistema, seus esquemas de ferramenta, seu arquivo de regras. Hermes entrega mais área de superfície, então Hermes entrega mais tokens.

Agora multiplique isso por um loop de agente de 38 chamadas onde cada chamada reenvia a conversa até agora. Leituras em cache foram 88,8% dos tokens de prompt do dsh e 95,5% do Hermes. Essa releitura é a conta.

Um Endpoint, Dois Harnesses: A Configuração do DeepSeek V4

Para comparar cascas, você precisa que o lado do modelo fique perfeitamente parado. Não apenas o mesmo nome de modelo: o mesmo endpoint, o mesmo limite de taxa, o mesmo preço às 3h da manhã e às 15h.

Esse último ponto é mais importante do que parece. Se seu provedor cobra taxas de pico e fora de pico, então "rodada 1 no Hermes às 09:00" e "rodada 2 no dsh às 11:00" não são execuções comparáveis, e você nunca conseguirá desembaraçar quanto do delta foi do harness e quanto foi do relógio.

Então ambos os harnesses aqui apontam para um endpoint de taxa fixa compatível com OpenAI no Atlas Cloud: https://api.atlascloud.ai/v1. Mesmo preço o dia todo, sem janela de pico, sem fila separada por harness, uma chave para ambos.

Papel no testeId do modeloContexto / saída máximaPreço por 1M entrada / saída
Motor principal para ambos harnessesdeepseek-ai/deepseek-v4-pro1.048.576 / 393.216$1,68 / $3,38
Nível barato, papel dos "braços"deepseek-ai/deepseek-v4-flash1.048.576 / 393.216$0,14 / $0,28
Trabalho cron de longa duraçãodeepseek-ai/deepseek-v3.2163.840 / 163.840$0,26 / $0,38

Preços lidos das páginas dos modelos em 2026-08-21. Sem badge de desconto na família DeepSeek agora, então nada aqui é uma taxa promocional que expira na próxima semana.

Pequena coisa que é fácil de perder: /v1/models relata deepseek-v4-pro e deepseek-v4-flash como fp4, enquanto deepseek-v4-pro-0813 retorna fp8. Quer os pesos de maior precisão? Fixe o id com data.

Certo. Vamos construir.

Execute o Teste DeepSeek Harness vs Hermes Você Mesmo

Prévia: sete etapas, dois arquivos de configuração, um prompt, e você termina com sua própria versão daquela tabela em vez de confiar na minha. Prova de que funciona: cada número acima veio exatamente dessas etapas em um MacBook padrão, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.

Vamos começar.

Etapa 1: Obtenha um endpoint que fique parado

Ambos os harnesses dependem muito de chamadas de função, então antes de instalar qualquer coisa, prove que o endpoint serve ferramentas:

plaintext
1curl -s https://api.atlascloud.ai/v1/models \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'

Saída real dessa chamada:

plaintext
1{
2  "id": "deepseek-ai/deepseek-v4-pro",
3  "context_length": 1048576,
4  "max_output_length": 393216,
5  "supported_features": ["json_mode", "tools", "structured_outputs"]
6}

tools nessa lista é a coisa que você está verificando. Sem ferramentas, sem loop de agente, e ambos os harnesses falharão de maneiras confusas em vez de avisar.

Pegue sua chave na página do modelo DeepSeek V4 Pro, depois export ATLAS_API_KEY=... antes de cada comando abaixo.

Uma pegadinha para o lado do Hermes: a resposta envolve o array como {"code":200,"msg":"succeed","data":[...]}. O Hermes sonda /v1/models durante a configuração e analisa isso corretamente, mas se você estiver escrevendo suas próprias ferramentas contra ele, não espere uma lista simples.

Etapa 2: Instale ambos os agentes

plaintext
1# DeepSeek Harness
2npm install @deepseek-ai/dsh
3
4# Hermes Agent
5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

Três notas de instalação que me custaram tempo:

  • dsh precisa do Node ^22.19.0 || >=24.0.0. Ele não suporta 23.x. A maioria dos tutoriais diz "Node 20+", o que está simplesmente errado.
  • Esse npm install puxou 453 pacotes e levou 8 minutos. Não é uma dependência pequena.
  • Hermes traz seu próprio Python 3.11 via uv, então o Python do seu sistema não importa (o meu é 3.9). Se o instalador morrer no meio do download por um problema no PyPI, execute novamente a sincronização de dependências em vez do script inteiro.

Etapa 3: Aponte DeepSeek Harness para o endpoint

Escreva isso em $DSH_HOME/settings.yaml (padrão ~/.dsh):

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      displayName: Atlas Cloud
5      apiKeyEnv: ATLAS_API_KEY
6      api: openai-completions
7      baseURL: https://api.atlascloud.ai/v1
8      defaultContextWindow: 1048576
9      defaultMaxTokens: 65536
10      compat:
11        thinkingFormat: deepseek
12      models:
13        - id: deepseek-ai/deepseek-v4-pro
14          name: DeepSeek V4 Pro
15          reasoningEfforts:
16            off:
17            high: high
18        - id: deepseek-ai/deepseek-v4-flash
19          name: DeepSeek V4 Flash
20          reasoningEfforts:
21            off:
22            high: high
23agent-default-model:
24  provider: atlas
25  model: deepseek-ai/deepseek-v4-pro

Três linhas aí merecem uma frase cada, porque errar qualquer uma delas altera sua conta:

  1. compat.thinkingFormat: deepseeké a linha que ninguém escreve. O dsh adivinha o dialeto de pensamento a partir da URL do endpoint. O README do seu próprio adaptador é direto: a URL de um gateway privado não diz nada, então um endpoint não reconhecido é tratado "como se fosse o próprio OpenAI". Seu gateway de dialeto DeepSeek então é falado no dialeto OpenAI. Esta chave só existe sob api: openai-completions.
  2. SubstituadefaultContextWindow. Os fallbacks de nível de rota são 262.144 de contexto e 32.768 de tokens máximos. Declare modelos V4 manualmente sem tocar nesses e você terá jogado fora silenciosamente 75% de uma janela de 1.048.576.
  3. agent-default-modelaceitaprovideremodelcomo duas chaves separadas. Escrever model: atlas/deepseek-ai/deepseek-v4-pro como uma string parece razoável e não faz nada. Você obtém MISSING_CREDENTIAL: no API key for provider route "deepseek-official", e vai procurar por um problema de chave que você não tem.

Observe que apiKeyEnv é uma referência de credencial, não o segredo. Nenhuma chave vai neste arquivo.

Etapa 4: Aponte Hermes para o mesmo endpoint

O caminho do assistente é hermes model, depois escolha "Custom endpoint". O caminho roteirizável são cinco comandos:

plaintext
1hermes config set model.provider custom
2hermes config set model.default deepseek-ai/deepseek-v4-pro
3hermes config set model.base_url https://api.atlascloud.ai/v1
4hermes config set model.api_key "$ATLAS_API_KEY"
5hermes config set model.context_length 1048576

Que escreve ~/.hermes/config.yaml:

plaintext
1model:
2  provider: custom
3  default: deepseek-ai/deepseek-v4-pro
4  base_url: https://api.atlascloud.ai/v1
5  api_key: apikey-...
6  context_length: 1048576

provider: custom é um provedor de primeira classe aqui, não um alias, e a URL base precisa terminar em /v1 porque o Hermes anexa /chat/completions por conta própria (documentação do Hermes Agent, Configuring Models, 2026).

Não pule a linha api_key. A documentação diz que a chave cai de volta para OPENAI_API_KEY, e na minha execução exportar essa variável não foi suficiente: o Hermes enviou a solicitação sem autenticação utilizável e o Atlas respondeu HTTP 401: {"code":401,"msg":"unauthorized"}. Definir model.api_key explicitamente corrigiu na próxima tentativa, em 8,5 segundos.

Etapa 5: Execute a rodada 1 em ambos

Limpe o diretório de habilidades do Hermes primeiro (~/.hermes/skills). Uma habilidade pré-existente torna a rodada 1 injusta, e a rodada 2 é onde você quer observar uma habilidade sendo criada e depois reutilizada.

Em seguida, dê a ambos os harnesses isto, byte por byte:

plaintext
1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks,
2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step.
3Then append an inline <script id="selftest"> block that asserts three physics invariants
4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas)
5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only
6when all three asserts print PASS. Report the number of tool calls you used.

Configurações: um diretório vazio novo por harness, raciocínio deixado ligado, saída máxima de pelo menos 32.768, e nada mais rodando na máquina para que os números de tempo de parede signifiquem algo.

plaintext
1# dsh, sessão persistida de uma única execução
2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)"
3
4# Hermes, execução única com relatório de uso legível por máquina
5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json

Duas coisas vão te surpreender aqui.

Primeiro, hermes -z não imprime absolutamente nada até terminar. Sem banner, sem spinner, sem prévias de ferramentas. O meu ficou em silêncio por 13 minutos e parecia travado; não estava, estava moendo através de 38 chamadas de API. Verifique ps para um shell filho se precisar de garantia.

Segundo, o Hermes ignorou meu diretório de trabalho e escreveu game.html em $HOME em vez disso. Se você quiser o arquivo onde lançou, passe --no-restore-cwd ou --in DIR. Perdi uma rodada por causa disso.

O dsh, enquanto isso, terminou em 121 segundos e sua interface web lerá a mesma sessão de volta:

Interface web do DeepSeek Harness mostrando a sessão Breakout concluída, três asserts PASS, 9 etapas e 133K tokens de entrada no DeepSeek V4 Pro

Interface web do dsh em 127.0.0.1:3080. Observe a barra de status: 9 etapas, cache hit 89%, entrada 133K tokens, e o seletor de modelo lendo DeepSeek V4 Pro da configuração da Etapa 3.

--usage-file no lado do Hermes é genuinamente útil e subdocumentado: ele escreve tokens de entrada, tokens de saída, leituras de cache, tokens de raciocínio, api_calls e um custo estimado para JSON, e escreve esse arquivo mesmo quando a execução falha.

O dsh não tem flag equivalente, mas não precisa. Seu log de sessão somente anexação contém tudo, com uma armadilha. O log em $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd é um stream zstd multiframe, um quadro por descarga. zlib.zstdDecompressSync(buf) retorna apenas o primeiro quadro, então um log de 150KB é decodificado para algumas centenas de bytes e parece vazio. Divida nos bytes mágicos você mesmo:

plaintext
1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = [];
2for (let i = 0; i < buf.length - 4; i++)
3  if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i);
4const text = offs
5  .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString())
6  .join('');

O uso está em eventos assistant/chunk onde data.chunk.type === 'usage', um nível mais profundo do que você imagina (data.chunk.usage.inputTokens). Chamadas de ferramenta vêm de blocos de conteúdo assistant/message do tipo tool-call. E request/header.data.header.config mostra o modelo e maxTokens que realmente foram para o fio, que é como você prova que sua configuração da Etapa 3 entrou em vigor em vez de esperar.

Etapa 6: Rodada 2, a solicitação de mudança

Mesmo diretório, game.html já lá da rodada 1. Agora peça a ambos uma mudança:

plaintext
1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle
2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up
3timer. Same file, no libraries.

Esta é a rodada que separa os dois designs. Hermes escreve habilidades após tarefas complexas e mantém uma memória de três camadas, então a rodada 2 é onde uma habilidade da rodada 1 ou compensa ou não. O dsh não tem memória de longo prazo, mas tem um log de sessão somente anexação que você pode bifurcar e reproduzir a partir do meio em vez de reiniciar.

Seja honesto consigo mesmo sobre o orçamento antes de começar esta. Minha rodada 2 morreu 11 chamadas de ferramenta depois em um limite de gasto diário, e é por isso que a tabela acima tem duas linhas vazias em vez de duas inventadas. O próprio painel do Hermes mostra por quê:

Página de sessões do painel do Hermes Agent listando a execução do Breakout com 76 mensagens no deepseek-v4-pro

Hermes v0.20.4 lendo de volta suas próprias sessões. A execução concluída do Breakout tem 76 mensagens, todas no deepseek-v4-pro através do endpoint Atlas.

Etapa 7: Leia a conta

Dois números por execução, do próprio log do harness, nunca do resumo do agente:

plaintext
1# Hermes
2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json
3
4# dsh: agregue o log de sessão decodificado
5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"

Em seguida, verifique novamente com a página de uso do seu provedor. Quando o log do harness e o provedor discordam, confie no provedor: esse é o número que você paga.

Para o que vale, a própria barra de status do dsh concordou com meu analisador de log dentro do arredondamento (133K tokens de entrada, 89% de cache hit contra meus 132.600 calculados e 88,8%). As ferramentas são honestas. Os resumos em inglês dos agentes não são.

Além de DeepSeek Harness vs Hermes: Execute Ambos como Cérebro e Braços

Aqui está a resposta que ninguém no debate "qual um" oferece: você não precisa escolher.

Os dois projetos falham em direções opostas, o que os torna companheiros de equipe excepcionalmente bons.

CapacidadeDeepSeek Harness (dsh)Hermes Agent
Execuções de codificaçãoForte, este é o alvo de designConcluiu a mesma tarefa em 6,4x o tempo
Memória de longo prazoNenhumaTrês camadas, curada pelo agente
Habilidades que se autoaprimoramNenhumaSim, compatível com agentskills.io
Bifurcação/replay de log de sessãoSim, JSONL somente anexaçãoPesquisa de sessão com sumarização LLM
Cron embutidoNãoSim, agendamentos em linguagem natural
Superfícies de chatNãoTelegram, Discord, Slack, WhatsApp, Signal
InterfaceWeb UI, TUI, headlessTUI, CLI, dashboard, gateway
RuntimeNode 22.19+/24+Python 3.11 (empacotado)
MaturidadePrévia para desenvolvedores 0.1, mudanças de quebraLançado fev 2026, v0.20.4
Licença / estrelasMIT, 176.5kMIT, 233.6k

Contagens de estrelas lidas de ambos os repositórios em 2026-08-21 (deepseek-ai/deepseek-harness com 176,5k estrelas e 19,2k forks, NousResearch/hermes-agent com 233,6k estrelas e 46,8k forks). Observe a trajetória, não os totais: o dsh estava em 144.361 estrelas quando verifiquei em 2026-08-17, então adicionou cerca de 32.000 em quatro dias.

Três maneiras de combiná-los:

  • Cérebro e braços. Hermes no V4 Pro segura a memória, a agenda e o thread do Telegram. Ele delega a codificação real ao dsh no nível barato. Uma chave cobre ambos, então você não está gerenciando dois relacionamentos de faturamento.
  • Nível barato para o loop, nível caro para a decisão. Trabalhos cron recorrentes rodam em deepseek-v3.2 ou DeepSeek V4 Flash; a chamada difícil escala para Pro.
  • Ambos headless. dsh --profile headless e Hermes -z ambos aceitam um prompt e imprimem uma resposta, então qualquer um se encaixa em um script shell ou etapa de CI sem TUI.

Aviso justo sobre as fraquezas honestas, porque uma comparação que lista apenas pontos fortes é um anúncio. O dsh é uma prévia para desenvolvedores 0.1 e afirma isso em sua própria interface: ele quebrará entre versões, não tem memória, não tem canal de mensagens nativo e sub-relata suas próprias chamadas de ferramenta. Hermes é o projeto mais maduro por uma ampla margem, mas é o mais pesado por token por um fator de 8, ficou em silêncio por 13 minutos em uma tarefa que o dsh terminou em 2, e escreveu meu arquivo de saída no diretório errado.

O Que DeepSeek Harness vs Hermes Realmente Custa Por Tarefa

Agora a aritmética, com as suposições abertas.

Atlas publica uma taxa de entrada para V4 Pro ($1,68 por 1M) sem taxa separada de cache hit na página do modelo. Então eu precifico cada token de prompt à taxa de entrada completa, leituras em cache incluídas. Isso é um teto conservador, não um palpite vestido de medição.

Exemplo prático, dsh rodada 1:

  • Prompt: 14.840 novos + 117.760 em cache = 132.600 tokens. A $1,68/1M isso é $0,2228.
  • Saída: 5.231 tokens. A $3,38/1M isso é $0,0177.
  • Total: $0,2404 por tarefa.

Mesmo método no Hermes rodada 1: 1.111.573 tokens de prompt é $1,8674, mais 19.317 tokens de saída a $0,0653, para $1,9327. O próprio --usage-file do Hermes estimou $0,2817 para essa execução, o que implica que ele assume uma taxa de entrada em cache próxima de $0,125 por 1M. Se seu provedor realmente desconta leituras em cache tão acentuadamente, ambos os números abaixo caem juntos e a proporção entre eles mal se move.

CenárioPor tarefa no V4 ProPor tarefa no V4 Flash20 tarefas/dia, 30 dias (Pro)
dsh rodada 1$0,24$0,02$144,27
Hermes rodada 1$1,93$0,16$1.159,64
Rodada 2, qualquer harnessnão concluídanão concluídanão concluída

Duas coisas saltam dessa tabela.

A escolha do harness vale 8x. Mesmo modelo, mesma tarefa, mesmo resultado, e uma casca custa oito vezes a outra. Isso não é uma diferença de arredondamento que você otimiza depois.

O nível do modelo vale 12x em cima disso. Que é por que a divisão cérebro-e-braços não é um truque: dsh no Flash custa dois centavos por tarefa, e Hermes no Pro custa quase dois dólares pelo jogo Breakout idêntico.

E a otimização mais barata de todas ainda é a da Etapa 3. Uma rota dsh deixada em seu padrão de 262.144 faz mais trabalho de compressão em mais etapas para encaixar o mesmo trabalho, e você paga por cada uma delas.

Essa é a verdadeira resposta para DeepSeek Harness vs Hermes: meça sua própria casca antes de sair para comprar um modelo mais barato.

FAQ DeepSeek Harness vs Hermes

Hermes Agent e DeepSeek Harness podem usar o mesmo modelo e chave de API?

Sim, e é a única maneira honesta de compará-los. Ambos falam com endpoints compatíveis com OpenAI. dsh precisa de uma rota de provedor llm-pi-ai com api: openai-completions mais baseURL; Hermes precisa de provider: custom mais uma base_url terminando em /v1. Uma chave, ambos os harnesses, ambos os níveis de preço. Configurações completas nas Etapas 3 e 4.

DeepSeek Harness é melhor que Hermes para codificação?

Neste teste, claramente sim: 121 segundos contra 780, 8 chamadas de ferramenta contra 35, e um oitavo do gasto de tokens, com ambos passando em todos os três autotestes. Mas "melhor para codificação" não é "melhor". Se o que você precisa é um trabalho agendado que reporta ao Telegram todas as manhãs e lembra o que aprendeu na semana passada, o dsh não tem nada disso e o Hermes tem tudo.

DeepSeek Harness e Hermes são gratuitos e de código aberto?

Ambos são licenciados MIT e gratuitos para baixar. O que você paga são tokens, e como a tabela acima mostra, isso não é um erro de arredondamento. Vale repetir que o dsh é explicitamente uma prévia para desenvolvedores na versão 0.1 e avisa sobre mudanças de quebra de compatibilidade em sua própria interface, então fixe sua versão se for para perto da produção.

Por que a mesma tarefa custa mais em um harness?

Quatro razões, aproximadamente em ordem de tamanho:

  • Releituras de conversa. Tokens de prompt em cache foram 88,8% do total do dsh e 95,5% do Hermes. Cada etapa extra reenvia tudo antes dela.
  • Prompt de sistema e esquemas de ferramenta. Medido acima: 10.898 vs 13.892 tokens antes de qualquer trabalho acontecer.
  • Contagem de etapas. 8 chamadas de ferramenta e 9 etapas contra 35 chamadas de ferramenta em 38 chamadas de API.
  • Janela limitada. O dsh caindo de volta para 262.144 em vez de 1.048.576 força trabalho extra de compressão em tarefas longas.

Posso executar DeepSeek Harness e Hermes ao mesmo tempo?

Sim. Eles compartilham apenas sua chave de API: diferentes runtimes, diferentes diretórios de configuração, diferentes armazenamentos de sessão, diferentes portas (3080 e 9119 por padrão). O padrão usual é Hermes como o cérebro sempre ligado no nível caro e dsh como os braços de codificação no nível barato.

DeepSeek Harness funciona apenas com a própria API do DeepSeek?

Não, e esse é o equívoco mais comum sobre ele. Qualquer gateway compatível com OpenAI funciona via api: openai-completions e um baseURL. Apenas lembre-se de compat.thinkingFormat: deepseek, porque o dsh infere o dialeto de pensamento da URL, e a URL de um gateway de terceiros não diz nada a ele.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos