Du körde en uppgift i Hermes igår. Du körde vad som kändes som samma uppgift i dsh idag. Samma modell, samma API-nyckel, samma laptop. Användningssiffrorna blev ändå olika.
Dina ögon är bra. Inget har prissatts om över natten.
Här är vad nästan varje DeepSeek Harness vs Hermes-jämförelse missar: styrramen är skalet som omger modellen, och det skalet bestämmer hur mycket kontext som skickas ut per steg, hur många verktyg den annonserar, hur ofta den försöker igen, och om den skickar hela konversationen på varje enskilt anrop. Ändra skalet, ändra räkningen.
Så jag låste modellvariabeln och mätte. Två styrramar, en slutpunkt, en deepseek-ai/deepseek-v4-pro, en prompt, en maskin, en eftermiddag. Samma uppgift, båda slutförde den, och en av dem flyttade 8,4x fler prompt-tokens än den andra.
Viktiga slutsatser
- Samma modell, samma uppgift, båda godkända: dsh tog 121 sekunder, Hermes tog 780 sekunder.
- Hermes flyttade 1 111 573 prompt-tokens jämfört med dsh:s 132 600. Det är 8,4x, på en enda uppgift.
- Innan någon av agenterna gör något kostar deras systemprompt tokens: dsh 10 898 vs Hermes 13 892 bara för att svara "OK".
- dsh begränsar dig tyst till 262 144 kontext om du inte åsidosätter
defaultContextWindow, och slänger bort 75 % av V4:s fönster.- Välj dsh för kodning, Hermes för minne, cron och chattytor. Eller kör båda.

Split engineering workshop med en bar motorblock fastklämd i en stålstyrram till vänster och en mässingsfilautomat till höger, båda matade av en kopparbränsleledning
En bränsleledning, två testriggar. Det är hela experimentet. Genererad med openai/gpt-image-2.
DeepSeek Harness vs Hermes, samma modell, samma uppgift
Båda styrramarna fick detta, ord för ord: bygg en Breakout-klon i en fil med en paddle, 5 rader tegelstenar, en live-poängräknare, en P-tangent för paus, plus ett inline-självtest som hävdar tre fysikinvariant och skriver ut PASS eller FAIL. Kör den sedan huvudlöst och fixa den tills alla tre skriver ut PASS.
Inga bibliotek. Ingen CDN. Inget byggsteg.
Båda gjorde det faktiskt. Här är de två filerna, renderade i en riktig webbläsare.

Animerad sida vid sida av de två Breakout-byggena som spelas: DeepSeek Harness (dsh) till vänster, Hermes Agent till höger, båda autospelade från den identiska DeepSeek V4 Pro-prompten
De två byggena inspelade sida vid sida och lämnade att autospela, så du kan se varje bygge faktiskt köra. Vänster: dsh, vars spel startar automatiskt. Höger: Hermes , vars spel startar pausat, sedan kör. Samma enfilsprompt, samma DeepSeek V4 Pro , två styrramar.
Nu siffrorna som faktiskt avgör detta.
| Körning | Väggklocka | Verktygsanrop | Prompt-tokens (färska + cachade) | Utdata-tokens | Kostnad vid V4 Pro |
|---|---|---|---|---|---|
| dsh, omgång 1 | 121,2s | 8 | 14 840 + 117 760 = 132 600 | 5 231 | 0,24 $ |
| Hermes, omgång 1 | 780s | 35 | 49 685 + 1 061 888 = 1 111 573 | 19 317 | 1,93 $ |
| dsh, omgång 2 | ej slutförd | 11 före avbrott | 44 291 + 132 608 | 2 463 | ej slutförd |
| Hermes, omgång 2 | ej slutförd | ej kördes | ej slutförd | ej slutförd | ej slutförd |
Mätt 2026-08-21 på deepseek-ai/deepseek-v4-pro, en maskin, tom arbetskatalog per körning. Tokenräkningar är maskinlästa: dsh:s från sin sessionslogg, Hermes från sin --usage-file JSON. Var medveten om att de två verktygsräkningarna inte kommer från samma källa: dsh:s 8 är räknat från dess logg (den påstod 6), medan Hermes 35 är dess egen rapport, med dess användningsfil som registrerar 38 API-anrop. Kostnadsmetoden beskrivs i det sista avsnittet.
Varför de två tomma raderna? Omgång 2 kördes aldrig, och anledningen är artikelns bästa enskilda datapunkt. Hermes omgång 1 ensam tryckte 1,13 miljoner tokens genom kontot, och halvvägs in i dsh:s omgång 2 svarade slutpunkten:
plaintext1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded", 2"message":"Member day spend limit reached (set by your team admin); 3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}
En agent, ett Breakout-spel, en dags budgettak. Jag fyller inte de cellerna med uppskattningar.
En detalj till värd att flagga. dsh rapporterade "Tool calls used: 6" i sitt slutliga svar. Dess egen sessionslogg registrerar 8. Agenter är opålitliga berättare om sina egna utgifter, vilket är precis varför detta test läser loggar istället för sammanfattningar.
Varför de flesta DeepSeek Harness vs Hermes-jämförelser är trasiga
Dom först: nästan varje sida som rankas för detta sökord mäter fel variabel, och du kan se det på en rad i deras installation.
Modellen, inte skalet, är vad dessa tester mätte
Gå och läs de främsta resultaten. Mönstret upprepar sig: kör dsh på en DeepSeek-modell, kör Hermes på vad Hermes redan var inställt på, tillskriv sedan hela skillnaden till styrramen.
Det är inte en styrramsjämförelse. Det är en modelljämförelse klädd i en styrramsformad etikett.
Om dsh är på V4 Pro och Hermes är på något annat, är deltat du mäter mestadels de två modellerna, och skalets bidrag är begravt bortom räddning. Så detta test gör det tråkiga, nödvändiga: båda styrramarna pekar på samma bas-URL, samma modell-id, samma nyckel.
Val av styrram påverkar siffrorna på egen hand
Vill du ha bevis på att skalet ensamt är dyrt? Be var och en att göra ingenting.
Jag skickade samma triviala prompt till båda: Reply with exactly the word: OK. Inga verktyg behövdes, inga filer, inget tänkande krävs.
| Styrram | Prompt-tokens för att säga "OK" | Utdata-tokens | Väggklocka |
|---|---|---|---|
| DeepSeek Harness (dsh) | 10 898 | 2 | 5,6s |
| Hermes Agent | 13 892 (+1 024 cachade) | 17 | 8,5s |
Samma modell. Samma fråga. Ett gap på 2 994 tokens innan något riktigt arbete börjar, eftersom det gapet är styrramen: dess systemprompt, dess verktygsscheman, dess regelfil. Hermes levererar mer yta, så Hermes levererar fler tokens.
Multiplicera nu det med en 38-anrops agentslinga där varje anrop skickar om konversationen hittills. Cachade läsningar var 88,8 % av dsh:s prompt-tokens och 95,5 % av Hermes. Den omläsningen är räkningen.
En slutpunkt, två styrramar: DeepSeek V4-installationen
För att jämföra skal måste modellsidan hålla sig helt stilla. Inte bara samma modellnamn: samma slutpunkt, samma hastighetsbegränsning, samma pris kl 3 som kl 15.
Den sista punkten är viktigare än den låter. Om din leverantör tar olika priser under högtrafik och lågtrafik, då är "omgång 1 i Hermes kl 09:00" och "omgång 2 i dsh kl 11:00" inte jämförbara körningar, och du kommer aldrig att reda ut hur mycket av deltat som var styrramen och hur mycket som var klockan.
Så båda styrramarna här pekar på en fastpris OpenAI-kompatibel slutpunkt på Atlas Cloud: https://api.atlascloud.ai/v1. Samma pris hela dagen, ingen högtrafik, ingen separat kö per styrram, en nyckel för båda.
| Roll i testet | Modell-id | Kontext / max utdata | Pris per 1M in / ut |
|---|---|---|---|
| Huvudmotor för båda styrramarna | deepseek-ai/deepseek-v4-pro | 1 048 576 / 393 216 | 1,68 $ / 3,38 $ |
| Billig nivå, "armarna"-rollen | deepseek-ai/deepseek-v4-flash | 1 048 576 / 393 216 | 0,14 $ / 0,28 $ |
| Långvarigt cron-arbete | deepseek-ai/deepseek-v3.2 | 163 840 / 163 840 | 0,26 $ / 0,38 $ |
Priser lästa från modellsidorna 2026-08-21. Ingen rabattmärkning på DeepSeek-familjen just nu, så inget här är en kampanjränta som löper ut nästa vecka.
Liten sak som är lätt att missa: /v1/models rapporterar deepseek-v4-pro och deepseek-v4-flash som fp4, medan deepseek-v4-pro-0813 kommer tillbaka som fp8. Vill du ha de högre precisionens vikter? Pinn det daterade id:t.
Okej. Låt oss bygga det.
Kör DeepSeek Harness vs Hermes-testet själv
Förhandsvisning: sju steg, två konfigurationsfiler, en prompt, och du slutar med din egen version av den tabellen istället för att lita på min. Bevis på att det fungerar: varje siffra ovan kom ut ur exakt dessa steg på en vanlig MacBook, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.
Låt oss börja.
Steg 1: Få en slutpunkt som håller sig stilla
Båda styrramarna lutar sig tungt på funktionsanrop, så innan du installerar något, bevisa att slutpunkten betjänar verktyg:
plaintext1curl -s https://api.atlascloud.ai/v1/models \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'
Verklig utdata från det anropet:
plaintext1{ 2 "id": "deepseek-ai/deepseek-v4-pro", 3 "context_length": 1048576, 4 "max_output_length": 393216, 5 "supported_features": ["json_mode", "tools", "structured_outputs"] 6}
tools i den listan är saken du letar efter. Inga verktyg, ingen agentslinga, och båda styrramarna kommer att misslyckas på förvirrande sätt istället för att säga det.
Hämta din nyckel från DeepSeek V4 Pro-modellsidan, kör sedan export ATLAS_API_KEY=... före varje kommando nedan.
En fallgrop för Hermes-sidan: svaret omsluter arrayen som {"code":200,"msg":"succeed","data":[...]}. Hermes söker /v1/models under installationen och tolkar detta bra, men om du skriver ditt eget verktyg mot det, förvänta dig inte en bar lista.
Steg 2: Installera båda agenterna
plaintext1# DeepSeek Harness 2npm install @deepseek-ai/dsh 3 4# Hermes Agent 5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
Tre installationsanteckningar som kostade mig tid:
- dsh behöver Node
^22.19.0 || >=24.0.0. Det stöder inte 23.x. De flesta tutorials säger "Node 20+", vilket helt enkelt är felaktigt. - Den npm-installationen drog 453 paket och tog 8 minuter. Det är inte ett litet beroende.
- Hermes tar med sin egen Python 3.11 via
uv, så ditt system Python spelar ingen roll (mitt är 3.9). Om installationsprogrammet dör mitt i nerladdningen på en PyPI-hicka, kör om beroendesynkroniseringen istället för hela skriptet.
Steg 3: Peka DeepSeek Harness mot slutpunkten
Skriv detta i $DSH_HOME/settings.yaml (standard ~/.dsh):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 displayName: Atlas Cloud 5 apiKeyEnv: ATLAS_API_KEY 6 api: openai-completions 7 baseURL: https://api.atlascloud.ai/v1 8 defaultContextWindow: 1048576 9 defaultMaxTokens: 65536 10 compat: 11 thinkingFormat: deepseek 12 models: 13 - id: deepseek-ai/deepseek-v4-pro 14 name: DeepSeek V4 Pro 15 reasoningEfforts: 16 off: 17 high: high 18 - id: deepseek-ai/deepseek-v4-flash 19 name: DeepSeek V4 Flash 20 reasoningEfforts: 21 off: 22 high: high 23agent-default-model: 24 provider: atlas 25 model: deepseek-ai/deepseek-v4-pro
Tre rader i detta förtjänar en mening var, eftersom att få någon av dem fel ändrar din räkning:
compat.thinkingFormat: deepseekär raden ingen skriver. dsh gissar tankedialekten från slutpunktens URL. Dess egen adapter README är rak på sak: en privat gateways URL säger ingenting, så en okänd slutpunkt adresseras "som om det vore OpenAI själva". Din DeepSeek-dialekt-gateway får sedan talas till i OpenAI-dialekt. Denna nyckel finns bara underapi: openai-completions.- Åsidosätt
defaultContextWindow. Ruttnivåns fallback är 262 144 kontext och 32 768 max tokens. Deklarera V4-modeller för hand utan att röra dessa och du har tyst slängt bort 75 % av ett 1 048 576-fönster. agent-default-modeltarproviderochmodelsom två separata nycklar. Att skrivamodel: atlas/deepseek-ai/deepseek-v4-prosom en sträng ser rimligt ut och gör ingenting. Du fårMISSING_CREDENTIAL: no API key for provider route "deepseek-official", och du går på jakt efter ett nyckelproblem du inte har.
Notera att apiKeyEnv är en referens till credential, inte hemligheten. Ingen nyckel går i denna fil.
Steg 4: Peka Hermes mot samma slutpunkt
Guidevägen är hermes model, välj sedan "Custom endpoint". Den skriptbara vägen är fem kommandon:
plaintext1hermes config set model.provider custom 2hermes config set model.default deepseek-ai/deepseek-v4-pro 3hermes config set model.base_url https://api.atlascloud.ai/v1 4hermes config set model.api_key "$ATLAS_API_KEY" 5hermes config set model.context_length 1048576
Vilket skriver ~/.hermes/config.yaml:
plaintext1model: 2 provider: custom 3 default: deepseek-ai/deepseek-v4-pro 4 base_url: https://api.atlascloud.ai/v1 5 api_key: apikey-... 6 context_length: 1048576
provider: custom är en förstklassig leverantör här, inte ett alias, och bas-URL:en måste sluta med /v1 eftersom Hermes lägger till /chat/completions själv (Hermes Agent docs, Configuring Models, 2026).
Hoppa inte över den api_key-raden. Dokumentationen säger att nyckeln faller tillbaka på OPENAI_API_KEY, och i min körning var det inte tillräckligt att exportera den variabeln: Hermes skickade begäran utan användbar autentisering och Atlas svarade HTTP 401: {"code":401,"msg":"unauthorized"}. Att ställa in model.api_key explicit fixade det vid nästa försök, på 8,5 sekunder.
Steg 5: Kör omgång 1 på båda
Rensa först Hermes färdighetskatalog (~/.hermes/skills). En befintlig färdighet gör omgång 1 orättvis, och omgång 2 är där du vill se en färdighet skapas och sedan återanvändas.
Ge sedan båda styrramarna detta, byte för byte:
plaintext1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks, 2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step. 3Then append an inline <script id="selftest"> block that asserts three physics invariants 4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas) 5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only 6when all three asserts print PASS. Report the number of tool calls you used.
Inställningar: en ny tom katalog per styrram, resonemang påslaget, max utdata minst 32 768, och inget annat som körs på maskinen så att väggklockans siffror betyder något.
plaintext1# dsh, engångspersisterad session 2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)" 3 4# Hermes, engång med maskinläsbar användningsrapport 5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json
Två saker kommer att överraska dig här.
För det första, hermes -z skriver ut absolut ingenting förrän den är klar. Ingen banner, ingen spinner, inga verktygsförhandsvisningar. Min satt tyst i 13 minuter och såg hängd ut; den var inte det, den malde igenom 38 API-anrop. Kolla ps efter ett barn-skal om du behöver försäkran.
För det andra, Hermes ignorerade min arbetskatalog och skrev game.html till $HOME istället. Om du vill ha filen där du startade från, skicka --no-restore-cwd eller --in DIR. Jag förlorade en omgång på det.
dsh, å andra sidan, blev klar på 121 sekunder och dess webbgränssnitt kommer att läsa samma session tillbaka:

DeepSeek Harness webbgränssnitt som visar den slutförda Breakout-sessionen, tre PASS-asserts, 9 steg och 133K input-tokens på DeepSeek V4 Pro
dsh Webbgränssnitt på 127.0.0.1:3080. Notera statusfältet: 9 steg, cacheträff 89 %, input 133K tokens, och modellväljaren som läser DeepSeek V4 Pro från Steg 3-konfigurationen.
--usage-file på Hermes-sidan är genuint användbart och underdokumenterat: den skriver input-tokens, utdata-tokens, cache-läsningar, resonemang-tokens, api_calls och en uppskattad kostnad till JSON, och den skriver den filen även när körningen misslyckas.
dsh har ingen motsvarande flagga, men den behöver ingen. Dess append-only sessionslogg innehåller allt, med en fälla. Loggen på $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd är en multi-frame zstd-ström, en ram per tömning. zlib.zstdDecompressSync(buf) returnerar endast den första ramen, så en 150KB logg avkodas till ett par hundra byte och ser tom ut. Dela upp på magiska byte själv:
plaintext1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = []; 2for (let i = 0; i < buf.length - 4; i++) 3 if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i); 4const text = offs 5 .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString()) 6 .join('');
Användning finns på assistant/chunk-händelser där data.chunk.type === 'usage', en nivå djupare än du skulle gissa (data.chunk.usage.inputTokens). Verktygsanrop kommer från assistant/message-innehållsblock av typen tool-call. Och request/header.data.header.config visar modellen och maxTokens som faktiskt gick över ledningen, vilket är hur du bevisar att din Steg 3-konfiguration togs i bruk istället för att hoppas.
Steg 6: Omgång 2, ändringsbegäran
Samma katalog, game.html finns redan där från omgång 1. Be nu båda om en ändring:
plaintext1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle 2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up 3timer. Same file, no libraries.
Detta är omgången som skiljer de två designerna. Hermes skriver färdigheter efter komplexa uppgifter och har ett treskiktsminne, så omgång 2 är där en omgång 1-färdighet antingen lönar sig eller inte. dsh har inget långtidsminne alls, men den har en append-only sessionslogg som du kan förgrena och spela om från mitten av körningen istället för att starta om.
Var ärlig mot dig själv om budgeten innan du startar denna. Min omgång 2 dog 11 verktygsanrop in på en daglig utgiftsgräns, vilket är varför tabellen ovan har två tomma rader snarare än två påhittade. Hermes egen instrumentpanel visar varför:

Hermes Agent instrumentpanel sessionssida som listar Breakout-körningen på 76 meddelanden på deepseek-v4-pro
Hermes v0.20.4 läser tillbaka sina egna sessioner. Den slutförda Breakout-körningen är 76 meddelanden, alla på deepseek-v4-pro genom Atlas-slutpunkten.
Steg 7: Läs räkningen
Två siffror per körning, från styrramens egen logg, aldrig från agentens sammanfattning:
plaintext1# Hermes 2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json 3 4# dsh: aggregera den avkodade sessionsloggen 5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"
Kontrollera sedan mot din leverantörs användningssida. När styrramens logg och leverantören inte håller med, lita på leverantören: det är siffran du betalar.
För vad det är värt, dsh:s egen statusfält stämde överens med min loggtolkare inom avrundning (133K input-tokens, 89 % cacheträff mot min beräknade 132 600 och 88,8 %). Verktygen är ärliga. Agenternas engelska sammanfattningar är det inte.
Bortom DeepSeek Harness vs Hermes: Kör båda som Hjärna och Armar
Här är svaret som ingen i "vilken en"-debatten erbjuder: du behöver inte välja.
De två projekten misslyckas i motsatta riktningar, vilket gör dem ovanligt bra lagkamrater.
| Förmåga | DeepSeek Harness (dsh) | Hermes Agent |
|---|---|---|
| Kodningskörningar | Stark, detta är designmålet | Slutförde samma uppgift på 6,4x tiden |
| Långtidsminne | Inget | Treskikts, agent-kurerat |
| Färdigheter som självförbättras | Inget | Ja, agentskills.io kompatibelt |
| Sessionslogg förgrening/uppspelning | Ja, append-only JSONL | Sessionssökning med LLM-sammanfattning |
| Inbyggd cron | Nej | Ja, naturligt språk schema |
| Chatt-ytor | Nej | Telegram, Discord, Slack, WhatsApp, Signal |
| Gränssnitt | Webbgränssnitt, TUI, huvudlös | TUI, CLI, instrumentpanel, gateway |
| Körningstid | Node 22.19+/24+ | Python 3.11 (medföljer) |
| Mognad | 0.1 utvecklarförhandsvisning, brytande ändringar | Släppt feb 2026, v0.20.4 |
| Licens / stjärnor | MIT, 176,5k | MIT, 233,6k |
Stjärnräkningar lästa från båda förråden 2026-08-21 (deepseek-ai/deepseek-harness på 176,5k stjärnor och 19,2k gafflar, NousResearch/hermes-agent på 233,6k stjärnor och 46,8k gafflar). Titta på banan, inte totalsummorna: dsh var på 144 361 stjärnor när jag kollade 2026-08-17, så den lade till ungefär 32 000 på fyra dagar.
Tre sätt att kombinera dem:
- Hjärna och armar. Hermes på V4 Pro håller minnet, schemat och Telegram-tråden. Den delegerar den faktiska kodningen till dsh på den billiga nivån. En nyckel täcker båda, så du hanterar inte två faktureringsrelationer.
- Billig nivå för slingan, dyr nivå för beslutet. Återkommande cron-arbete körs på
deepseek-v3.2eller DeepSeek V4 Flash; det svåra anropet eskalerar till Pro. - Huvudlöst båda. dsh
--profile headlessoch Hermes-ztar båda en prompt och skriver ut ett svar, så endera kan användas i ett skal-skript eller ett CI-steg utan TUI.
Rättvis varning om de ärliga svagheterna, eftersom en jämförelse som bara listar styrkor är en reklam. dsh är en 0.1 utvecklarförhandsvisning och säger det i sitt eget gränssnitt: den kommer att gå sönder mellan versioner, den har inget minne, den har ingen inbyggd meddelandekanal, och den underrapporterar sina egna verktygsanrop. Hermes är det mer mogna projektet med bred marginal, men den är tyngre per token med en faktor 8, den blev tyst i 13 minuter på en uppgift dsh slutförde på 2, och den skrev min utdatafil till fel katalog.
Vad DeepSeek Harness vs Hermes faktiskt kostar per uppgift
Nu aritmetiken, med antagandena i öppen dager.
Atlas publicerar en inmatningsränta för V4 Pro (1,68 $ per 1M) utan separat cacheträffränta på modellsidan. Så jag prissätter varje prompt-token till full inmatningsränta, cachade läsningar inkluderade. Det är ett konservativt tak, inte en gissning klädd som en mätning.
Arbetat exempel, dsh omgång 1:
- Prompt: 14 840 färska + 117 760 cachade = 132 600 tokens. Vid 1,68 $/1M är det 0,2228 $.
- Utdata: 5 231 tokens. Vid 3,38 $/1M är det 0,0177 $.
- Totalt: 0,2404 $ per uppgift.
Samma metod på Hermes omgång 1: 1 111 573 prompt-tokens är 1,8674 $, plus 19 317 utdata-tokens på 0,0653 $, för 1,9327 $. Hermes egen --usage-file uppskattade 0,2817 $ för den körningen, vilket innebär att den antar en cachad inmatningsränta nära 0,125 $ per 1M. Om din leverantör verkligen rabatterar cache-läsningar så brant, faller båda siffrorna nedan tillsammans och förhållandet mellan dem rör sig knappt.
| Scenario | Per uppgift på V4 Pro | Per uppgift på V4 Flash | 20 uppgifter/dag, 30 dagar (Pro) |
|---|---|---|---|
| dsh omgång 1 | 0,24 $ | 0,02 $ | 144,27 $ |
| Hermes omgång 1 | 1,93 $ | 0,16 $ | 1 159,64 $ |
| Omgång 2, endera styrram | ej slutförd | ej slutförd | ej slutförd |
Två saker hoppar ur den tabellen.
Valet av styrram är värt 8x. Samma modell, samma uppgift, samma resultat, och ett skal kostar åtta gånger det andra. Det är inte en avrundningsskillnad du optimerar bort senare.
Modellnivån är värd 12x ovanpå det. Vilket är varför hjärna-och-armar-uppdelningen inte är en gimmick: dsh på Flash landar på två cent per uppgift, och Hermes på Pro landar på nästan två dollar för det identiska Breakout-spelet.
Och den billigaste optimeringen av alla är fortfarande den från Steg 3. En dsh-rutt som lämnas på sin 262 144-standard gör mer komprimeringsarbete i fler steg för att passa samma jobb, och du betalar för varenda en av dem.
Det är det verkliga svaret på DeepSeek Harness vs Hermes: mät ditt eget skal innan du går och handlar efter en billigare modell.
DeepSeek Harness vs Hermes FAQ
Kan Hermes Agent och DeepSeek Harness använda samma modell och API-nyckel?
Ja, och det är det enda ärliga sättet att jämföra dem. Båda pratar med OpenAI-kompatibla slutpunkter. dsh behöver en llm-pi-ai-leverantörsrutt med api: openai-completions plus baseURL; Hermes behöver provider: custom plus en base_url som slutar med /v1. En nyckel, båda styrramarna, båda prisnivåerna. Fulla konfigurationer finns i Steg 3 och 4.
Är DeepSeek Harness bättre än Hermes för kodning?
I detta test, helt klart ja: 121 sekunder mot 780, 8 verktygsanrop mot 35, och en åttondel av tokenförbrukningen, med båda som klarar alla tre självtesterna. Men "bättre för kodning" är inte "bättre". Om vad du behöver är ett schemalagt jobb som rapporterar till Telegram varje morgon och kommer ihåg vad det lärde sig förra veckan, har dsh inget av det och Hermes har allt.
Är DeepSeek Harness och Hermes gratis och öppen källkod?
Båda är MIT-licensierade och gratis att ladda ner. Vad du betalar för är tokens, och som tabellen ovan visar, är det inte ett avrundningsfel. Värt att upprepa att dsh uttryckligen är en utvecklarförhandsvisning på 0.1 och varnar för kompatibilitetsbrytande ändringar i sitt eget gränssnitt, så pinn din version om den är på väg någonstans nära produktion.
Varför kostar samma uppgift mer i en styrram?
Fyra anledningar, ungefär i storleksordning:
- Omläsningar av konversation. Cachade prompt-tokens var 88,8 % av dsh:s total och 95,5 % av Hermes. Varje extra steg skickar om allt före det.
- Systemprompt och verktygsscheman. Uppmätt ovan: 10 898 vs 13 892 tokens innan något arbete händer.
- Stegräkning. 8 verktygsanrop och 9 steg mot 35 verktygsanrop över 38 API-anrop.
- Ett begränsat fönster. dsh som faller tillbaka till 262 144 istället för 1 048 576 tvingar extra komprimeringsarbete på långa uppgifter.
Kan jag köra DeepSeek Harness och Hermes samtidigt?
Ja. De delar inget förutom din API-nyckel: olika körtider, olika konfigurationskataloger, olika sessionslager, olika portar (3080 och 9119 som standard). Det vanliga mönstret är Hermes som den alltid-på-hjärnan på den dyra nivån och dsh som kodningsarmarna på den billiga nivån.
Fungerar DeepSeek Harness endast med DeepSeeks eget API?
Nej, och detta är den vanligaste missuppfattningen om den. Alla OpenAI-kompatibla gateways fungerar via api: openai-completions och en baseURL. Glöm bara inte compat.thinkingFormat: deepseek, eftersom dsh härleder tankedialekten från URL:en, och en tredjepartsgateway-URL säger den ingenting alls.






