Sie haben gestern einen Task in Hermes ausgeführt. Heute haben Sie denselben Task in dsh ausgeführt – gefühlt zumindest. Gleiches Modell, gleicher API-Key, gleicher Laptop. Die Nutzungszahlen waren trotzdem unterschiedlich.
Ihre Augen sind in Ordnung. Über Nacht wurde nichts umpreist.
Hier ist, was fast jeder DeepSeek Harness vs. Hermes-Vergleich übersieht: Der Harness ist die Hülle um das Modell, und diese Hülle bestimmt, wie viel Kontext pro Schritt ausgegeben wird, wie viele Tools sie bewirbt, wie oft sie wiederholt und ob sie bei jedem Aufruf die gesamte Unterhaltung erneut sendet. Ändern Sie die Hülle, ändern Sie die Rechnung.
Also habe ich die Modellvariable fixiert und gemessen. Zwei Harnesses, ein Endpunkt, ein deepseek-ai/deepseek-v4-pro, ein Prompt, ein Rechner, ein Nachmittag. Gleicher Task, beide haben ihn erledigt, und einer hat 8,4-mal mehr Prompt-Tokens bewegt als der andere.
Wichtige Erkenntnisse
- Gleiches Modell, gleicher Task, beide bestanden: dsh brauchte 121 Sekunden, Hermes brauchte 780 Sekunden.
- Hermes bewegte 1.111.573 Prompt-Tokens gegenüber 132.600 bei dsh. Das ist das 8,4-fache, bei einem Task.
- Bevor einer der Agents etwas tut, kostet sein System-Prompt bereits Tokens: dsh 10.898 vs. Hermes 13.892 – nur um "OK" zu antworten.
- dsh begrenzt Sie stillschweigend auf 262.144 Kontext, es sei denn, Sie überschreiben
defaultContextWindow, und wirft damit 75 % des V4-Fensters weg.- Wählen Sie dsh fürs Programmieren, Hermes für Gedächtnis, Cron und Chat-Oberflächen. Oder betreiben Sie beide.

Aufgeteilte Ingenieurswerkstatt mit einem nackten Motorblock, der links in einen stählernen Testprüfstand eingespannt ist, und einem Messing-Automaten rechts, beide von einer Kupferkraftstoffleitung gespeist.
Eine Kraftstoffleitung, zwei Testprüfstände. Das ist das gesamte Experiment. Generiert mit openai/gpt-image-2.
DeepSeek Harness vs. Hermes, gleiches Modell, gleicher Task
Beide Harnesses bekamen das, wortwörtlich: Erstellen Sie einen einteiligen Breakout-Klon mit Schläger, 5 Reihen Steinen, einem Live-Punktestand, einer P-Taste zum Pausieren und einem eingebauten Selbsttest, der drei physikalische Invarianten überprüft und PASS oder FAIL ausgibt. Führen Sie ihn dann kopflos aus und reparieren Sie ihn, bis alle drei PASS ausgeben.
Keine Bibliotheken. Kein CDN. Kein Build-Schritt.
Beide haben es tatsächlich geschafft. Hier sind die beiden Dateien, in einem echten Browser gerendert.

Animierte Gegenüberstellung der beiden Breakout-Builds: DeepSeek Harness (dsh) links, Hermes Agent rechts, beide automatisch abgespielt vom identischen DeepSeek V4 Pro Prompt
Die beiden Builds nebeneinander neu aufgezeichnet und automatisch abgespielt, sodass Sie sehen können, wie jeder tatsächlich läuft. Links: dsh, dessen Spiel automatisch startet. Rechts: Hermes, dessen Spiel pausiert startet und dann läuft. Gleicher Ein-Datei-Prompt, gleiches DeepSeek V4 Pro, zwei Harnesses.
Nun die Zahlen, die das Ganze entscheiden.
| Lauf | Wanduhr | Tool-Aufrufe | Prompt-Tokens (frisch + gecached) | Ausgabe-Tokens | Kosten bei V4 Pro |
|---|---|---|---|---|---|
| dsh, Runde 1 | 121,2 s | 8 | 14.840 + 117.760 = 132.600 | 5.231 | 0,24 $ |
| Hermes, Runde 1 | 780 s | 35 | 49.685 + 1.061.888 = 1.111.573 | 19.317 | 1,93 $ |
| dsh, Runde 2 | nicht beendet | 11 vor Abbruch | 44.291 + 132.608 | 2.463 | nicht beendet |
| Hermes, Runde 2 | nicht beendet | nicht ausgeführt | nicht beendet | nicht beendet | nicht beendet |
Gemessen am 21.08.2026 auf deepseek-ai/deepseek-v4-pro, einem Rechner, leeres Arbeitsverzeichnis pro Lauf. Tokenzahlen maschinell ausgelesen: dsh aus seinem Sitzungsprotokoll, Hermes aus seinem --usage-file JSON. Beachten Sie, dass die beiden Tool-Zahlen nicht gleich ermittelt wurden: dshs 8 werden aus seinem Protokoll gezählt (es gab 6 an), während Hermes' 35 sein eigener Bericht ist, wobei die Nutzungsdatei 38 API-Aufrufe verzeichnet. Die Kostenmethode ist im letzten Abschnitt erläutert.
Warum die beiden leeren Zeilen? Runde 2 wurde nie ausgeführt, und der Grund ist der beste einzelne Datenpunkt des Artikels. Hermes' Runde 1 allein schob 1,13 Millionen Tokens durch das Konto, und mitten in dshs Runde 2 antwortete der Endpunkt:
plaintext1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded", 2"message":"Member day spend limit reached (set by your team admin); 3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}
Ein Agent, ein Breakout-Spiel, ein Tagesbudget. Ich fülle diese Zellen nicht mit Schätzungen.
Noch ein Detail, das erwähnenswert ist. dsh meldete "Tool calls used: 6" in seiner endgültigen Antwort. Das eigene Sitzungsprotokoll verzeichnet 8. Agents sind unzuverlässige Erzähler über ihre eigenen Ausgaben, weshalb dieser Test Protokolle statt Zusammenfassungen liest.
Warum die meisten DeepSeek Harness vs. Hermes-Vergleiche fehlerhaft sind
Erst das Urteil: Fast jede Seite, die für dieses Keyword rankt, misst die falsche Variable, und das erkennt man an einer einzigen Zeile ihres Aufbaus.
Das Modell, nicht die Hülle, ist das, was diese Tests gemessen haben
Lesen Sie die Top-Ergebnisse. Das Muster wiederholt sich: dsh auf einem DeepSeek-Modell ausführen, Hermes auf dem ausführen, worauf Hermes bereits zeigte, und dann die gesamte Differenz dem Harness zuschreiben.
Das ist kein Harness-Vergleich. Das ist ein Modellvergleich im Gewand eines Harness-Labels.
Wenn dsh auf V4 Pro läuft und Hermes auf etwas anderem, dann ist das Delta, das Sie messen, hauptsächlich die beiden Modelle, und der Beitrag der Hülle ist unwiederbringlich vergraben. Also führt dieser Test das langweilige, notwendige Ding durch: Beide Harnesses zeigen auf dieselbe Basis-URL, dieselbe Modell-ID, denselben Schlüssel.
Die Wahl des Harness verschiebt die Zahlen von alleine
Sie wollen den Beweis, dass die Hülle allein teuer ist? Bitten Sie jeden, nichts zu tun.
Ich habe beiden denselben trivialen Prompt geschickt: Reply with exactly the word: OK. Keine Tools nötig, keine Dateien, kein Denken erforderlich.
| Harness | Prompt-Tokens, um "OK" zu sagen | Ausgabe-Tokens | Wanduhr |
|---|---|---|---|
| DeepSeek Harness (dsh) | 10.898 | 2 | 5,6 s |
| Hermes Agent | 13.892 (+1.024 gecached) | 17 | 8,5 s |
Gleiches Modell. Gleiche Frage. Eine Lücke von 2.994 Tokens, bevor irgendeine echte Arbeit beginnt, denn diese Lücke ist der Harness: sein System-Prompt, seine Tool-Schemata, seine Regeln-Datei. Hermes liefert mehr Oberfläche, also liefert Hermes mehr Tokens.
Multiplizieren Sie das nun mit einer 38-Aufruf-Agentenschleife, bei der jeder Aufruf das bisherige Gespräch erneut sendet. Gecachte Lesevorgänge machten 88,8 % der dsh-Prompt-Tokens und 95,5 % der Hermes-Prompt-Tokens aus. Dieses erneute Lesen ist die Rechnung.
Ein Endpunkt, zwei Harnesses: Der DeepSeek V4-Aufbau
Um Hüllen zu vergleichen, muss die Modellseite absolut stillhalten. Nicht nur derselbe Modellname: derselbe Endpunkt, dasselbe Rate-Limit, derselbe Preis um 3 Uhr morgens wie um 15 Uhr nachmittags.
Das ist wichtiger, als es klingt. Wenn Ihr Anbieter Spitzen- und Nebenzeiten berechnet, dann sind "Runde 1 in Hermes um 09:00" und "Runde 2 in dsh um 11:00" nicht vergleichbare Läufe, und Sie werden nie entwirren können, wie viel des Deltas auf den Harness und wie viel auf die Uhrzeit zurückzuführen ist.
Also zeigen beide Harnesses hier auf einen Flatrate-OpenAI-kompatiblen Endpunkt auf Atlas Cloud: https://api.atlascloud.ai/v1. Gleicher Preis den ganzen Tag, keine Spitzenzeiten, keine separate Warteschlange pro Harness, ein Schlüssel für beide.
| Rolle im Test | Modell-ID | Kontext / max. Ausgabe | Preis pro 1 Mio. Eingabe / Ausgabe |
|---|---|---|---|
| Hauptantrieb für beide Harnesses | deepseek-ai/deepseek-v4-pro | 1.048.576 / 393.216 | 1,68 $ / 3,38 $ |
| Günstige Stufe, die "Arme"-Rolle | deepseek-ai/deepseek-v4-flash | 1.048.576 / 393.216 | 0,14 $ / 0,28 $ |
| Langlaufende Cron-Arbeiten | deepseek-ai/deepseek-v3.2 | 163.840 / 163.840 | 0,26 $ / 0,38 $ |
Preise abgelesen von den Modellseiten am 21.08.2026. Derzeit kein Rabattabzeichen auf der DeepSeek-Familie, also nichts hier ist ein Aktionspreis, der nächste Woche ausläuft.
Eine Kleinigkeit, die leicht übersehen wird: /v1/models meldet deepseek-v4-pro und deepseek-v4-flash als fp4, während deepseek-v4-pro-0813 als fp8 zurückkommt. Möchten Sie die höherpräzisen Gewichte? Verwenden Sie die datierte ID.
Also gut. Bauen wir es auf.
Führen Sie den DeepSeek Harness vs. Hermes-Test selbst durch
Vorschau: sieben Schritte, zwei Konfigurationsdateien, ein Prompt, und Sie erhalten Ihre eigene Version der obigen Tabelle, anstatt mir zu vertrauen. Der Beweis, dass es funktioniert: Jede Zahl oben stammt genau aus diesen Schritten auf einem Standard-MacBook, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.
Los geht's.
Schritt 1: Holen Sie sich einen Endpunkt, der stillhält
Beide Harnesses setzen stark auf Funktionsaufrufe. Überprüfen Sie daher vor der Installation, ob der Endpunkt Tools bereitstellt:
plaintext1curl -s https://api.atlascloud.ai/v1/models \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'
Echte Ausgabe dieses Aufrufs:
plaintext1{ 2 "id": "deepseek-ai/deepseek-v4-pro", 3 "context_length": 1048576, 4 "max_output_length": 393216, 5 "supported_features": ["json_mode", "tools", "structured_outputs"] 6}
tools in dieser Liste ist das, worauf Sie prüfen. Keine Tools, keine Agentenschleife, und beide Harnesses werden auf verwirrende Weise fehlschlagen, anstatt es zu sagen.
Holen Sie sich Ihren Schlüssel von der DeepSeek V4 Pro-Modellseite, dann export ATLAS_API_KEY=... vor jedem Befehl unten.
Eine Besonderheit für die Hermes-Seite: Die Antwort umschließt das Array als {"code":200,"msg":"succeed","data":[...]}. Hermes fragt während der Einrichtung /v1/models ab und parst dies problemlos, aber wenn Sie Ihre eigenen Tools dagegen schreiben, erwarten Sie keine bloße Liste.
Schritt 2: Installieren Sie beide Agents
plaintext1# DeepSeek Harness 2npm install @deepseek-ai/dsh 3 4# Hermes Agent 5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
Drei Installationshinweise, die mich Zeit gekostet haben:
- dsh benötigt Node
^22.19.0 || >=24.0.0. Es unterstützt nicht 23.x. Die meisten Tutorials sagen "Node 20+", was schlicht falsch ist. - Der npm-Installationsbefehl zog 453 Pakete und dauerte 8 Minuten. Es ist keine kleine Abhängigkeit.
- Hermes bringt sein eigenes Python 3.11 via
uvmit, daher spielt Ihr System-Python keine Rolle (meines ist 3.9). Wenn der Installer aufgrund eines PyPI-Hickups mitten im Download stirbt, führen Sie die Abhängigkeitssynchronisierung erneut aus, nicht das gesamte Skript.
Schritt 3: Richten Sie DeepSeek Harness auf den Endpunkt aus
Schreiben Sie dies in $DSH_HOME/settings.yaml (Standard ~/.dsh):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 displayName: Atlas Cloud 5 apiKeyEnv: ATLAS_API_KEY 6 api: openai-completions 7 baseURL: https://api.atlascloud.ai/v1 8 defaultContextWindow: 1048576 9 defaultMaxTokens: 65536 10 compat: 11 thinkingFormat: deepseek 12 models: 13 - id: deepseek-ai/deepseek-v4-pro 14 name: DeepSeek V4 Pro 15 reasoningEfforts: 16 off: 17 high: high 18 - id: deepseek-ai/deepseek-v4-flash 19 name: DeepSeek V4 Flash 20 reasoningEfforts: 21 off: 22 high: high 23agent-default-model: 24 provider: atlas 25 model: deepseek-ai/deepseek-v4-pro
Drei Zeilen darin verdienen jeweils einen Satz, denn wenn Sie eine davon falsch machen, ändert sich Ihre Rechnung:
compat.thinkingFormat: deepseekist die Zeile, die niemand schreibt. dsh errät den Thinking-Dialekt anhand der Endpunkt-URL. Die eigene Adapter-README ist deutlich: Die URL eines privaten Gateways sagt nichts aus, daher wird ein nicht erkannter Endpunkt "behandelt, als wäre es OpenAI selbst". Ihr DeepSeek-Dialekt-Gateway wird dann im OpenAI-Dialekt angesprochen. Dieser Schlüssel existiert nur unterapi: openai-completions.- Überschreiben Sie
defaultContextWindow. Die Routen-Standardwerte sind 262.144 Kontext und 32.768 max. Tokens. Wenn Sie V4-Modelle deklarieren, ohne diese zu berühren, haben Sie leise 75 % eines 1.048.576-Fensters weggeworfen. agent-default-modelerwartetproviderundmodelals zwei separate Schlüssel. Wenn Siemodel: atlas/deepseek-ai/deepseek-v4-proals einen String schreiben, sieht das vernünftig aus und tut nichts. Sie erhaltenMISSING_CREDENTIAL: no API key for provider route "deepseek-official", und Sie suchen nach einem Schlüsselproblem, das Sie nicht haben.
Beachten Sie, dass apiKeyEnv eine Anmeldedaten-Referenz ist, nicht das Geheimnis. In dieser Datei steht kein Schlüssel.
Schritt 4: Richten Sie Hermes auf denselben Endpunkt aus
Der Assistentenweg ist hermes model, dann wählen Sie "Custom endpoint". Der skriptbare Weg sind fünf Befehle:
plaintext1hermes config set model.provider custom 2hermes config set model.default deepseek-ai/deepseek-v4-pro 3hermes config set model.base_url https://api.atlascloud.ai/v1 4hermes config set model.api_key "$ATLAS_API_KEY" 5hermes config set model.context_length 1048576
Dies schreibt ~/.hermes/config.yaml:
plaintext1model: 2 provider: custom 3 default: deepseek-ai/deepseek-v4-pro 4 base_url: https://api.atlascloud.ai/v1 5 api_key: apikey-... 6 context_length: 1048576
provider: custom ist hier ein erstklassiger Anbieter, kein Alias, und die Basis-URL muss auf /v1 enden, da Hermes selbst /chat/completions anhängt (Hermes Agent Docs, Configuring Models, 2026).
Überspringen Sie nicht die api_key-Zeile. Die Dokumentation sagt, der Schlüssel fällt auf OPENAI_API_KEY zurück, und in meinem Lauf reichte das Exportieren dieser Variable nicht aus: Hermes sendete die Anfrage ohne verwendbare Authentifizierung, und Atlas antwortete mit HTTP 401: {"code":401,"msg":"unauthorized"}. Das explizite Setzen von model.api_key behob das Problem beim nächsten Versuch in 8,5 Sekunden.
Schritt 5: Führen Sie Runde 1 auf beiden aus
Löschen Sie zuerst das Skills-Verzeichnis von Hermes (~/.hermes/skills). Ein vorhandener Skill macht Runde 1 unfair, und in Runde 2 möchten Sie sehen, wie ein Skill erstellt und dann wiederverwendet wird.
Geben Sie dann beiden Harnesses dies, Byte für Byte:
plaintext1Erstellen Sie eine einzelne, in sich geschlossene Datei game.html: einen Breakout-Klon mit Schläger, 5 Reihen Steinen, 2einem Live-Punktestand und einer P-Taste zum Pausieren. Keine externen Bibliotheken, kein CDN, kein Build-Schritt. 3Hängen Sie dann einen eingebauten <script id="selftest">-Block an, der drei physikalische Invarianten überprüft 4(Ball reflektiert bei Schlägerkontakt, Punktestand erhöht sich genau einmal pro Stein, Ball verlässt nie die Leinwand) 5und PASS/FAIL auf der Konsole ausgibt. Führen Sie es kopflos aus, reparieren Sie alles, was fehlschlägt, und hören Sie erst auf, 6wenn alle drei asserts PASS ausgeben. Melden Sie die Anzahl der von Ihnen verwendeten Tool-Aufrufe.
Einstellungen: ein frisches leeres Verzeichnis pro Harness, Reasoning eingeschaltet, max. Ausgabe mindestens 32.768, und nichts anderes läuft auf dem Rechner, damit die Wanduhr-Zahlen etwas bedeuten.
plaintext1# dsh, einmalige persistierte Sitzung 2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)" 3 4# Hermes, einmalig mit maschinenlesbarem Nutzungsbericht 5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json
Zwei Dinge werden Sie hier überraschen.
Erstens: hermes -z gibt absolut nichts aus, bis es fertig ist. Kein Banner, kein Spinner, keine Tool-Vorschauen. Meins saß 13 Minuten lang still und sah aus, als ob es hängen würde; es tat es nicht, es mahlte sich durch 38 API-Aufrufe. Überprüfen Sie ps auf eine untergeordnete Shell, wenn Sie eine Bestätigung brauchen.
Zweitens: Hermes ignorierte mein Arbeitsverzeichnis und schrieb game.html nach $HOME statt. Wenn Sie die Datei dort haben möchten, wo Sie gestartet haben, übergeben Sie --no-restore-cwd oder --in DIR. Ich habe dafür eine Runde verloren.
dsh hingegen war in 121 Sekunden fertig, und seine Web-UI wird dieselbe Sitzung wieder lesen:

DeepSeek Harness Web-UI mit der abgeschlossenen Breakout-Sitzung, drei PASS-Asserts, 9 Schritten und 133K Eingabe-Tokens auf DeepSeek V4 Pro
dsh Web-UI auf 127.0.0.1:3080. Beachten Sie die Statusleiste: 9 Schritte, Cache-Treffer 89 %, Eingabe 133K Tokens und der Modell-Selektor, der DeepSeek V4 Pro aus der Schritt-3-Konfiguration anzeigt.
--usage-file auf der Hermes-Seite ist wirklich nützlich und unterdokumentiert: Es schreibt Eingabe-Tokens, Ausgabe-Tokens, Cache-Lesevorgänge, Reasoning-Tokens, api_calls und eine geschätzte Kosten in JSON, und es schreibt diese Datei selbst dann, wenn der Lauf fehlschlägt.
dsh hat kein gleichwertiges Flag, braucht es aber auch nicht. Sein anfügebares Sitzungsprotokoll enthält alles, mit einer Falle. Das Protokoll unter $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd ist ein Multi-Frame-Zstd-Stream, ein Frame pro Spülvorgang. zlib.zstdDecompressSync(buf) gibt nur den ersten Frame zurück, daher dekodiert ein 150KB-Protokoll zu ein paar hundert Bytes und sieht leer aus. Teilen Sie selbst an den magischen Bytes auf:
plaintext1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = []; 2for (let i = 0; i < buf.length - 4; i++) 3 if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i); 4const text = offs 5 .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString()) 6 .join('');
Die Nutzung befindet sich in assistant/chunk-Ereignissen, bei denen data.chunk.type === 'usage' ist, eine Ebene tiefer, als Sie vermuten würden (data.chunk.usage.inputTokens). Tool-Aufrufe stammen aus assistant/message-Inhaltsblöcken vom Typ tool-call. Und request/header.data.header.config zeigt das Modell und maxTokens, die tatsächlich auf die Leitung gingen, womit Sie beweisen, dass Ihre Schritt-3-Konfiguration wirksam wurde, anstatt zu hoffen.
Schritt 6: Runde 2, die Änderungsanforderung
Gleiches Verzeichnis, game.html bereits von Runde 1 vorhanden. Bitten Sie nun beide um eine Änderung:
plaintext1Fügen Sie ein fallendes Power-Up hinzu: Wenn ein Stein in der oberen Reihe zerbricht, lassen Sie ein Token fallen, 2das den Schläger für 10 Sekunden verbreitert. Halten Sie alle drei Selftest-Asserts bestanden und fügen Sie ein 3viertes Assert für den Power-Up-Timer hinzu. Gleiche Datei, keine Bibliotheken.
Dies ist die Runde, die die beiden Designs trennt. Hermes schreibt nach komplexen Aufgaben Skills und führt ein dreischichtiges Gedächtnis, daher ist Runde 2 der Ort, an dem sich ein Skill aus Runde 1 entweder auszahlt oder nicht. dsh hat überhaupt kein Langzeitgedächtnis, aber ein anfügebares Sitzungsprotokoll, das Sie ab der Mitte des Laufs forken und wiedergeben können, anstatt neu zu starten.
Seien Sie ehrlich zu sich selbst, was das Budget angeht, bevor Sie diese beginnen. Meine Runde 2 starb nach 11 Tool-Aufrufen an einem täglichen Ausgabenlimit, weshalb die obige Tabelle zwei leere Zeilen hat, anstatt zwei erfundene. Das eigene Dashboard von Hermes zeigt, warum:

Hermes Agent Dashboard-Sitzungsseite mit dem Breakout-Lauf bei 76 Nachrichten auf deepseek-v4-pro
Hermes v0.20.4 liest seine eigenen Sitzungen zurück. Der abgeschlossene Breakout-Lauf hat 76 Nachrichten, alle auf deepseek-v4-pro über den Atlas-Endpunkt.
Schritt 7: Lesen Sie die Rechnung
Zwei Zahlen pro Lauf, aus dem eigenen Protokoll des Harness, niemals aus der Zusammenfassung des Agents:
plaintext1# Hermes 2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json 3 4# dsh: aggregieren Sie das decodierte Sitzungsprotokoll 5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"
Überprüfen Sie dann gegen die Nutzungsseite Ihres Anbieters. Wenn das Harness-Protokoll und der Anbieter uneins sind, vertrauen Sie dem Anbieter: Das ist die Zahl, die Sie bezahlen.
Der Vollständigkeit halber: dshs eigene Statusleiste stimmte mit meinem Protokollparser bis auf Rundung überein (133K Eingabe-Tokens, 89 % Cache-Treffer gegenüber meinen berechneten 132.600 und 88,8 %). Die Werkzeuge sind ehrlich. Die englischen Zusammenfassungen der Agents sind es nicht.
Jenseits von DeepSeek Harness vs. Hermes: Betreiben Sie beide als Gehirn und Arme
Hier ist die Antwort, die niemand in der "Welcher?"-Debatte bietet: Sie müssen nicht wählen.
Die beiden Projekte scheitern in entgegengesetzte Richtungen, was sie zu ungewöhnlich guten Teamkollegen macht.
| Fähigkeit | DeepSeek Harness (dsh) | Hermes Agent |
|---|---|---|
| Programmierläufe | Stark, das ist das Designziel | Gleichen Task in 6,4-facher Zeit erledigt |
| Langzeitgedächtnis | Keins | Dreischichtig, agentkuratiert |
| Selbstverbessernde Skills | Keine | Ja, agentskills.io-kompatibel |
| Sitzungsprotokoll forken / wiederholen | Ja, append-only JSONL | Sitzungssuche mit LLM-Zusammenfassung |
| Integrierter Cron | Nein | Ja, natürlichsprachliche Zeitpläne |
| Chat-Oberflächen | Nein | Telegram, Discord, Slack, WhatsApp, Signal |
| Schnittstelle | Web-UI, TUI, kopflos | TUI, CLI, Dashboard, Gateway |
| Laufzeit | Node 22.19+ / 24+ | Python 3.11 (gebündelt) |
| Reife | 0.1 Developer Preview, Breaking Changes | Ausgeliefert Feb. 2026, v0.20.4 |
| Lizenz / Sterne | MIT, 176,5k | MIT, 233,6k |
Sternzahlen von beiden Repositories am 21.08.2026 (deepseek-ai/deepseek-harness mit 176,5k Sternen und 19,2k Forks, NousResearch/hermes-agent mit 233,6k Sternen und 46,8k Forks). Beobachten Sie die Entwicklung, nicht die Gesamtzahlen: dsh hatte 144.361 Sterne, als ich am 17.08.2026 nachsah, also kamen in vier Tagen etwa 32.000 hinzu.
Drei Möglichkeiten, sie zu kombinieren:
- Gehirn und Arme. Hermes auf V4 Pro hält das Gedächtnis, den Zeitplan und den Telegram-Thread. Es delegiert die eigentliche Programmierung an dsh auf der günstigen Stufe. Ein Schlüssel deckt beide ab, sodass Sie nicht zwei Abrechnungsbeziehungen verwalten müssen.
- Günstige Stufe für die Schleife, teure Stufe für die Entscheidung. Wiederkehrende Cron-Arbeiten laufen auf
deepseek-v3.2oder DeepSeek V4 Flash; der schwierige Aufruf eskaliert zu Pro. - Beide kopflos. dsh
--profile headlessund Hermes-znehmen beide einen Prompt und geben eine Antwort aus, sodass beide in ein Shell-Skript oder einen CI-Schritt passen, ohne TUI.
Fairerweise zu den ehrlichen Schwächen, denn ein Vergleich, der nur Stärken auflistet, ist eine Werbung. dsh ist eine 0.1 Developer Preview und sagt dies in seiner eigenen UI: Es wird zwischen Versionen brechen, es hat kein Gedächtnis, es hat keinen nativen Nachrichtenkanal, und es meldet seine eigenen Tool-Aufrufe zu niedrig. Hermes ist das reifere Projekt mit weitem Abstand, aber es ist pro Token um den Faktor 8 schwerer, es war 13 Minuten lang still bei einer Aufgabe, die dsh in 2 Minuten erledigte, und es schrieb meine Ausgabedatei in das falsche Verzeichnis.
Was DeepSeek Harness vs. Hermes pro Task tatsächlich kostet
Nun die Rechnung, mit offenen Annahmen.
Atlas veröffentlicht einen Eingabesatz für V4 Pro (1,68 $ pro 1 Mio.) ohne separaten Cache-Treffer-Satz auf der Modellseite. Also bepreise ich jeden Prompt-Token zum vollen Eingabesatz, inklusive gecachter Lesevorgänge. Das ist eine konservative Obergrenze, keine Schätzung, die als Messung verkleidet ist.
Beispielrechnung, dsh Runde 1:
- Prompt: 14.840 frisch + 117.760 gecached = 132.600 Tokens. Bei 1,68 $/1 Mio. sind das 0,2228 $.
- Ausgabe: 5.231 Tokens. Bei 3,38 $/1 Mio. sind das 0,0177 $.
- Gesamt: 0,2404 $ pro Task.
Gleiche Methode bei Hermes Runde 1: 1.111.573 Prompt-Tokens sind 1,8674 $, plus 19.317 Ausgabe-Tokens bei 0,0653 $, ergibt 1,9327 $. Hermes' eigenes --usage-file schätzte 0,2817 $ für diesen Lauf, was impliziert, dass es einen gecachten Eingabesatz von etwa 0,125 $ pro 1 Mio. annimmt. Wenn Ihr Anbieter Cache-Lesevorgänge tatsächlich so stark rabattiert, fallen beide Zahlen unten zusammen und das Verhältnis zwischen ihnen bewegt sich kaum.
| Szenario | Pro Task auf V4 Pro | Pro Task auf V4 Flash | 20 Tasks/Tag, 30 Tage (Pro) |
|---|---|---|---|
| dsh Runde 1 | 0,24 $ | 0,02 $ | 144,27 $ |
| Hermes Runde 1 | 1,93 $ | 0,16 $ | 1.159,64 $ |
| Runde 2, beide Harnesses | nicht beendet | nicht beendet | nicht beendet |
Zwei Dinge springen aus dieser Tabelle hervor.
Die Wahl des Harness ist 8x wert. Gleiches Modell, gleicher Task, gleiches Ergebnis, und eine Hülle kostet achtmal so viel wie die andere. Das ist keine Rundungsdifferenz, die Sie später wegoptimieren.
Die Modellstufe ist obendrein 12x wert. Weshalb die Gehirn-und-Arme-Aufteilung kein Trick ist: dsh auf Flash landet bei zwei Cent pro Task, und Hermes auf Pro bei fast zwei Dollar für das identische Breakout-Spiel.
Und die billigste Optimierung von allen ist immer noch die aus Schritt 3. Eine dsh-Route, die auf ihrem 262.144-Standard belassen wird, leistet mehr Kompressionsarbeit in mehr Schritten, um denselben Job zu bewältigen, und Sie bezahlen für jeden einzelnen.
Das ist die wahre Antwort auf DeepSeek Harness vs. Hermes: Messen Sie Ihre eigene Hülle, bevor Sie sich auf die Suche nach einem billigeren Modell machen.
DeepSeek Harness vs. Hermes FAQ
Können Hermes Agent und DeepSeek Harness dasselbe Modell und denselben API-Key verwenden?
Ja, und das ist die einzige ehrliche Art, sie zu vergleichen. Beide sprechen mit OpenAI-kompatiblen Endpunkten. dsh benötigt eine llm-pi-ai-Anbieterroute mit api: openai-completions plus baseURL; Hermes benötigt provider: custom plus eine base_url, die auf /v1 endet. Ein Schlüssel, beide Harnesses, beide Preisstufen. Vollständige Konfigurationen finden Sie in den Schritten 3 und 4.
Ist DeepSeek Harness besser als Hermes zum Programmieren?
In diesem Test eindeutig ja: 121 Sekunden gegenüber 780, 8 Tool-Aufrufe gegenüber 35, und ein Achtel der Token-Ausgaben, wobei beide alle drei Selbsttests bestanden haben. Aber "besser zum Programmieren" ist nicht "besser". Wenn Sie einen geplanten Job benötigen, der jeden Morgen an Telegram berichtet und sich merkt, was er letzte Woche gelernt hat, hat dsh nichts davon und Hermes hat alles.
Sind DeepSeek Harness und Hermes kostenlos und Open Source?
Beide sind MIT-lizenziert und kostenlos herunterladbar. Was Sie bezahlen, sind Tokens, und wie die obige Tabelle zeigt, ist das kein Rundungsfehler. Erwähnenswert ist, dass dsh ausdrücklich eine Developer Preview bei 0.1 ist und in seiner eigenen UI vor kompatibilitätsbrechenden Änderungen warnt. Fixieren Sie daher Ihre Version, wenn sie in die Produktion geht.
Warum kostet derselbe Task in einem Harness mehr?
Vier Gründe, ungefähr in der Reihenfolge ihrer Größe:
- Wiederholtes Lesen der Unterhaltung. Gecachte Prompt-Tokens machten 88,8 % von dshs Gesamtmenge und 95,5 % von Hermes' aus. Jeder zusätzliche Schritt sendet alles Vorherige erneut.
- System-Prompt und Tool-Schemata. Oben gemessen: 10.898 vs. 13.892 Tokens, bevor irgendeine Arbeit stattfindet.
- Schrittzahl. 8 Tool-Aufrufe und 9 Schritte gegenüber 35 Tool-Aufrufen bei 38 API-Aufrufen.
- Ein begrenztes Fenster. dsh fällt auf 262.144 statt 1.048.576 zurück, was bei langen Aufgaben zusätzliche Kompressionsarbeit erzwingt.
Kann ich DeepSeek Harness und Hermes gleichzeitig ausführen?
Ja. Sie teilen nichts außer Ihrem API-Key: verschiedene Laufzeiten, verschiedene Konfigurationsverzeichnisse, verschiedene Sitzungsspeicher, verschiedene Ports (standardmäßig 3080 und 9119). Das übliche Muster ist Hermes als das immer aktive Gehirn auf der teuren Stufe und dsh als die Programmierarme auf der günstigen Stufe.
Funktioniert DeepSeek Harness nur mit DeepSeeks eigener API?
Nein, und das ist das häufigste Missverständnis darüber. Jeder OpenAI-kompatible Gateway funktioniert über api: openai-completions und eine baseURL. Denken Sie nur an compat.thinkingFormat: deepseek, denn dsh leitet den Thinking-Dialekt aus der URL ab, und die URL eines Drittanbieter-Gateways sagt ihm gar nichts.






