DeepSeek Harness vs. OpenCode: Die Token-Nutzungslücke, die die meisten Entwickler übersehen

DeepSeek Harness vs OpenCode, getestet am selben Modell und derselben Aufgabe. Was jede Testumgebung mit Ihrem Token-Verbrauch macht, warum die Lücke real ist und wie Sie sie selbst messen können.

DeepSeek Harness war nicht Teil dieses Benchmarks. Es wurde zwei Tage später veröffentlicht. Das bedeutet, die relevante Frage ist nicht „Welcher hat gewonnen?“. Die relevante Frage ist, wie man dieselbe Aufgabe mit beiden Tools, auf demselben Modell, ausführt und die Abrechnung liest, ohne sich selbst zu täuschen.

Wichtige Erkenntnisse

  • Die Wahl des Harness kann den Token-Verbrauch bei vergleichbaren Agent-Aufgaben um etwa das 7-fache schwanken lassen.
  • Messen Sie DeepSeek Harness und OpenCode mit demselben Modell und demselben Repository-Zustand.
  • Verwenden Sie separate API-Schlüssel, bevor Sie sich für den täglichen Gebrauch entscheiden.

Zwei Laptops, die dieselbe Codierungsaufgabe mit zwei Agent-Harnesses ausführen

Zwei Laptops, die dieselbe Codierungsaufgabe mit zwei Agent-Harnesses ausführen

Das faire Setup: ein Modell, eine Aufgabe, zwei Terminals.

Was der öffentliche Benchmark uns sagt

Composio führte 30 komplexe Multi-App-Workflows mit 8 Agent-Harnesses durch, alle mit DeepSeek V4 Flash, einem 900-Sekunden-Limit pro Aufgabe und binärer programmatischer Bewertung über 240 Läufe (Composio, August 2026). Gleiches Modell, unterschiedlicher Harness.

HarnessBestehensquoteMedianzeitDurchschn. Tokens pro Aufgabe
Pi Agent66,7 %132,2 s559.000
Prime Agent62,5 %242,1 s1.400.000
OMP56,7 %272,4 s742.000
Claude Code53,3 %122,7 s742.000
Codex53,3 %245,0 s678.000
DeepAgents53,3 %187,1 s665.000
Hermes Agent50,0 %175,5 s192.000
OpenCode46,7 %129,7 s692.000

Die Token-Spalte ist wichtiger als die Rangliste. Die Spanne reicht von 192.000 bis 1.400.000 durchschnittliche Tokens pro Aufgabe. Das ist dasselbe Modell, das durch verschiedene Laufzeiten vergleichbare Arbeit leistet.

OpenCode liefert eine nachvollziehbare Basislinie: 692.000 Tokens pro Aufgabe, 46,7 % Bestehensquote und 129,7 Sekunden Medianzeit. DeepSeek Harness hat keine öffentliche direkte Vergleichszahl aus diesem Benchmark, da DeepSeek es am 13. August 2026 veröffentlichte, zwei Tage nachdem der Benchmark veröffentlicht wurde.

Verwenden Sie die Tabelle als Warnung, nicht als Urteil. Sie zeigt, dass der Harness die Kosten dominieren kann. Sie beweist nicht, ob DeepSeek Harness OpenCode in Ihrem Repository schlägt.

Was sich ändert, wenn Sie den Harness wechseln

Vergleichen Sie vor dem Testen die beiden Tools anhand der Aspekte, die einen entwickelnden Entwickler betreffen: Einrichtungsaufwand, Reife, Token-Transparenz und wie viel der Agent-Schleife Sie ersetzen können.

DeepSeek Harness (dsh)OpenCode
VonDeepSeek AIAnomaly (ursprünglich SST)
Veröffentlicht13. August 2026Ende 2025
GitHub-Sterne~143k~198k
LizenzMITMIT
SpracheTypeScriptGo
SchnittstelleWeb-UI auf 127.0.0.1:3080Terminal-TUI
StatusEntwicklervorschau, breaking changes erwartetAusgereift, weit verbreitet
ArchitekturAustauschbare Plugins für Modelle, Tools, Sitzungen, Sandboxes, Speicher, Schleifen und UIFester Kern mit Build/Plan-Agenten, MCP-Unterstützung und LSP-Erweiterungen
Konfiguration$DSH_HOME/settings.yamlopencode.json
Token-AbrechnungToken-Meter mit Kontextdruck und AufschlüsselungsprognosenSitzungsbezogene Token- und Kostenverfolgung im TUI
Am besten geeignet fürTeams, die die Agent-Schleife selbst modifizieren möchtenTeams, die einen Codierungs-Agenten wollen, der heute funktioniert

OpenCode bietet Ihnen einen stabilen Codierungs-Agenten mit Erweiterungspunkten an den Rändern. DeepSeek Harness bietet Ihnen eine Laufzeit, bei der die Schleife selbst ausgetauscht werden kann. Diese Flexibilität hilft, wenn Sie Agent-Infrastruktur aufbauen. Sie erhöht das Risiko, wenn Sie ein Standardwerkzeug für Produktionscode in dieser Woche benötigen.

Beide Tools können denselben OpenAI-kompatiblen Endpunkt ansteuern. Das ermöglicht einen fairen Test: ein Modell, eine Basis-URL, eine Aufgabe und ein Start-Repository-Zustand.

Für diese Anleitung läuft DeepSeek V4 Flash über Atlas Cloud, das einen OpenAI-kompatiblen Endpunkt bereitstellt, der von beiden Tools akzeptiert wird. Der Eintrag deepseek-v4-flash-0731 zeigt 0,14 $ pro Million Eingabe-Tokens, 0,28 $ pro Million Ausgabe-Tokens, ein Kontextfenster von 1.048.576 Tokens und maximal 393.216 Ausgabe-Tokens (Stand August 2026). Jeder Anbieter funktioniert, solange beide Harnesses denselben Endpunkt und Modellnamen verwenden.

OpenCode veröffentlicht auch aggregierte Nutzungsdaten. DeepSeek-Modelle haben 233 Billionen Tokens durch OpenCode bewegt, wobei V4 Flash 85,5 % und V4 Pro 14,5 % ausmacht (OpenCode, August 2026). Dieses Nutzungsmuster macht V4 Flash zu einer praktischen Standardeinstellung für den Vergleich.

Schritt 1: Beide Tools auf dasselbe Modell ausrichten

Erstellen Sie einen API-Schlüssel und eine Basis-URL, und füttern Sie dann beide Tools mit demselben Paar. Erstellen Sie den Schlüssel in der Atlas Cloud-Konsole und exportieren Sie ihn einmal:

plaintext
1export ATLAS_API_KEY="your-api-key"

Überprüfen Sie den Endpunkt, bevor Sie ihn an einen der Harnesses übergeben:

plaintext
1curl https://api.atlascloud.ai/v1/chat/completions \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "deepseek-ai/deepseek-v4-flash-0731",
6    "messages": [{"role": "user", "content": "Reply with the single word: ready"}]
7  }'

Dieser Aufruf beweist, dass die Route, der Schlüssel und die Modell-ID funktionieren, bevor ein Harness Tools, Wiederholungen oder Konversationswiedergaben hinzufügt.

Codierungsaufforderung, generierter Code und Token-Statistiken aus einem Modellaufruf

Codierungsaufforderung, generierter Code und Token-Statistiken aus einem Modellaufruf

Ein direkter Aufruf von deepseek-ai/deepseek-v4-flash-0731: 148 Eingabe-Tokens, 6.879 Ausgabe-Tokens zurück, darunter 5.731 Reasoning-Tokens. Betrachten Sie dies als Basislinie, bevor ein Harness Tool-Schemas und Verlauf hinzufügt.

DeepSeek Harness liest $DSH_HOME/settings.yaml, und benutzerdefinierte OpenAI-kompatible Anbieter werden unter dem Plugin llm-pi-ai eingetragen (DeepSeek Harness-Dokumentation, August 2026):

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      apiKeyEnv: ATLAS_API_KEY
5      api: openai-completions
6      baseURL: https://api.atlascloud.ai/v1
7      models:
8        - id: deepseek-ai/deepseek-v4-flash-0731

Verwenden Sie openai-completions für diesen Endpunkt. Das Web-UI kann denselben Anbieterblock unter Einstellungen, Modelle, Benutzerdefinierten Anbieter hinzufügen schreiben, und dann den Schlüssel in $DSH_HOME/.credentials.yaml speichern.

OpenCode liest opencode.json im Projektstammverzeichnis oder im globalen Konfigurationsverzeichnis (OpenCode-Dokumentation, August 2026):

json
1{
2  "$schema": "https://opencode.ai/config.json",
3  "provider": {
4    "atlas": {
5      "npm": "@ai-sdk/openai-compatible",
6      "name": "Atlas Cloud",
7      "options": {
8        "baseURL": "https://api.atlascloud.ai/v1",
9        "apiKey": "{env:ATLAS_API_KEY}"
10      },
11      "models": {
12        "deepseek-ai/deepseek-v4-flash-0731": {
13          "name": "DeepSeek V4 Flash 0731",
14          "limit": { "context": 1048576, "output": 393216 }
15        }
16      }
17    }
18  },
19  "model": "atlas/deepseek-ai/deepseek-v4-flash-0731"
20}

Verwenden Sie @ai-sdk/openai-compatible, da dieser Endpunkt /v1/chat/completions bedient. Setzen Sie die tatsächlichen Kontext- und Ausgabelimits. OpenCode verwendet sie, wenn es entscheidet, wann zusammengefasst werden soll, und falsche Limits können den Token-Vergleich verzerren.

Schritt 2: Dieselbe Benchmark-Aufgabe in DeepSeek Harness ausführen

Wählen Sie eine Aufgabe, die groß genug ist, um mehrere Tool-Aufrufe zu benötigen, und klein genug, um sie zu bewerten. Verwenden Sie für beide Läufe denselben Repository-Zustand, committen oder stashen Sie also vor dem Start.

Fügen Sie diese genaue Aufgabe in beide Tools ein:

plaintext
1In this repository, add a token-bucket rate limiter middleware for the Express
2app in src/server.js. Limit each IP to 60 requests per minute. On rejection,
3return HTTP 429 with the JSON body {"error":"rate_limited","retryAfter":<seconds>}.
4Wire the middleware into every /api/* route. Add unit tests in
5test/rate-limit.test.js covering three cases: a request under the limit is
6allowed, a request over the limit is blocked with 429, and the counter resets
7after the window expires. Run the test suite and fix failures until it passes.
8Do not modify any file outside src/ and test/.

Starten Sie Harness von Ihrem Projektverzeichnis aus:

plaintext
1cd /path/to/your/repo
2npx @deepseek-ai/dsh web

Die UI läuft unter http://127.0.0.1:3080. Wählen Sie den atlas-Anbieter und das Modell deepseek-ai/deepseek-v4-flash-0731, fügen Sie die Aufgabe ein und lassen Sie sie beenden. Geben Sie nach dem Start des Laufs keine Hinweise. Zusätzliche Hilfe für ein Tool macht den Vergleich ungültig.

Wenn Harness fertig ist, öffnen Sie die Trajectory-Ansicht. Dieser Sitzungsdatensatz enthält die Token-Zahlen.

Schritt 3: Den Lauf in OpenCode wiederholen

Setzen Sie das Repository auf den exakten Startzustand zurück. Der zweite Harness darf keine Dateien erben, die der erste bereits geändert hat.

plaintext
1git checkout -- . && git clean -fd

Führen Sie dann OpenCode mit demselben Modell aus:

plaintext
1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731

Fügen Sie dieselbe Aufgabenaufforderung aus Schritt 2 ein. Verwenden Sie den Standard-build-Agenten. Lassen Sie es ohne Hinweise beenden.

Bewerten Sie beide Läufe mit demselben Befehl:

plaintext
1npm test

Ein Lauf, der die Suite rot hinterlässt, ist fehlgeschlagen, selbst wenn die Agent-Zusammenfassung zuversichtlich klingt. Verwenden Sie binäre Bewertung: bestanden oder nicht bestanden.

Schritt 4: Token-Verbrauch ablesen

Beide Tools verfolgen die Nutzung, aber keiner der Zähler sollte Ihre endgültige Rechnungsnummer sein.

DeepSeek Harness enthält ein standardmäßig aktiviertes Token-Meter. Es zeigt tokenUsage, contextPressure und contextBreakdown in der Trajectory-Ansicht an. contextBreakdown sagt Ihnen, ob die Rechnung vom System-Prompt, Tool-Schemas, Datei-Lesevorgängen oder Konversationswiedergabe stammt. Das Meter schätzt ungefähr ein Token pro vier Zeichen, verwenden Sie es also als Diagnoseansicht.

OpenCode verfolgt Tokens und Kosten pro Sitzung und zeigt sie in der TUI-Statuszeile an. Seine integrierte Aufschlüsselung ist kleiner, daher untersuchen Teams, die eine Pro-Tool-Zuordnung benötigen, die Sitzungsdatenbank oft mit externen Analyzern.

Verwenden Sie für den Vergleich die Zahlen des Anbieters:

Was vergleichenWoher bekommen
Gesamte Eingabe-TokensDashboard des Anbieters, pro API-Schlüssel
Gesamte Ausgabe-TokensDashboard des Anbieters, pro API-Schlüssel
Anzahl der ModellaufrufeHarness-Trajectory-Ansicht / OpenCode-Sitzungsprotokoll
WanduhrzeitStoppuhr, Start bis zur letzten Dateischreiboperation
Bestanden oder nicht bestandennpm test Exit-Code

Erstellen Sie zwei API-Schlüssel, harness-test und opencode-test, und verwenden Sie jeden Schlüssel für einen Lauf. Das Dashboard des Anbieters liefert Ihnen dann eine saubere Seite-an-Seite-Nutzung, ohne zwei interne Schätzer abzugleichen.

Warum die Rechnung schwankt

Der Token-Verbrauch ändert sich aus konkreten Gründen. Diese fünf sind in der Regel wichtiger als der Modellpreis.

Konversationswiedergabe summiert sich. Agenten senden die wachsende Konversation bei jedem Schritt erneut. Eine 40-Schritte-Aufgabe kostet eher die Summe von 40 wachsenden Prompts als 40 identische Prompts. Harnesses, die früh zusammenfassen, landen eher am unteren Ende der Benchmark-Spanne.

Cache-Treffer senken die Eingabekosten. Cache-Treffer bei DeepSeek V4 Flash kosten etwa 0,0028 $ pro Million Tokens gegenüber 0,14 $ pro Million bei einem Fehltreffer, also etwa 98 % günstiger. Caching benötigt ein bytegenaues stabiles Präfix. Wenn ein Harness den System-Prompt-Text zwischen Aufrufen mischt, werden Treffer zu Fehltreffern.

Tool-Schemas reiten mit. Zwanzig verbundene MCP-Server bedeuten zwanzig Schema-Sets im Prompt, selbst wenn die Aufgabe zwei davon verwendet. Trennen Sie Tools, die Sie nicht benötigen, bevor Sie den Benchmark durchführen, sonst messen Sie Ihr Tool-Setup anstelle des Harness.

Große Tool-Ausgaben vergiften den Kontext. Ein cat einer 3.000-zeiligen Datei oder ein ausführliches fehlgeschlagenes Testprotokoll bleibt für spätere Aufrufe in der Konversation. DeepSeek Harness kann übergroße Tool-Ergebnisse vor der Zusammenfassung beschneiden. Schalten Sie das ein, wenn die Aufgabe verrauschte Ausgaben produziert.

Wiederholungen verstecken sich in der Aufrufanzahl. Ein Harness, der eine fehlschlagende Testschleife wiederholt, gibt jedes Mal Tokens aus. Vergleichen Sie Modellaufrufe neben den Gesamt-Tokens, damit Sie eine Wiederholungsschleife von einem teuren Prompt trennen können.

Zum Atlas Cloud-Tarif für DeepSeek V4 Flash liegt eine Aufgabe mit 692.000 Tokens, die auf Eingabe ausgerichtet ist, im niedrigen einstelligen Cent-Bereich. Das ist wenig für einen Lauf und viel für ein Team, das den ganzen Tag Agenten ausführt. Durchsuchen Sie den vollständigen Modellkatalog, wenn Sie den Test mit einem zweiten Modell wiederholen und Modell-Effekte von Harness-Effekten trennen möchten.

DeepSeek Harness ist noch eine Entwicklervorschau, und seine README warnt vor breaking changes. Benchmarken Sie es, wenn Sie die Kontrolle über die Agent-Schleife wünschen. Standardisieren Sie nur darauf, wenn Ihr Team Änderungen verkraften kann. OpenCode ist die stabilere Wahl für Teams, die ein Werkzeug für heute benötigen.

Häufig gestellte Fragen

Ist DeepSeek Harness besser als OpenCode?

Für die meisten Teams noch nicht. OpenCode ist ausgereift, terminal-nativ, hat etwa 198k Sterne und einen großen Anbieterkatalog und funktioniert heute. DeepSeek Harness ist neuer, in der Entwicklervorschau und warnt vor breaking changes. Wählen Sie Harness, wenn Sie Agent-Interna modifizieren möchten. Wählen Sie OpenCode, wenn Sie einen Codierungs-Agenten für die tägliche Arbeit möchten.

Funktioniert DeepSeek Harness nur mit DeepSeek-Modellen?

Nein. Es ist modellunabhängig. Es enthält Katalog-Anbieter für DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure und Codex, und Sie können jeden benutzerdefinierten Anbieter hinzufügen, der openai-completions, openai-responses oder anthropic-messages in $DSH_HOME/settings.yaml spricht. Die Konfiguration in Schritt 1 zeigt es auf einen OpenAI-kompatiblen Endpunkt ohne Adaptercode.

Wie überprüfe ich den Token-Verbrauch von DeepSeek Harness?

Verwenden Sie das integrierte Token-Meter in der Trajectory-Ansicht. Es zeigt tokenUsage, contextPressure und contextBreakdown. Behandeln Sie es als Schätzung, da es ungefähr ein Token pro vier Zeichen verwendet. Für die Abrechnungsgenauigkeit lesen Sie das Dashboard des Anbieters, idealerweise mit einem dedizierten API-Schlüssel für jeden Lauf.

Welcher Harness verbraucht weniger Tokens, DeepSeek Harness oder OpenCode?

Noch kein öffentlicher direkter Vergleich beantwortet das. Der Composio-Benchmark maß OpenCode mit 692.000 durchschnittlichen Tokens pro Aufgabe, aber er wurde ausgeführt, bevor DeepSeek Harness ausgeliefert wurde. Führen Sie den Test von Schritt 2 bis Schritt 4 in Ihrem eigenen Repository durch, da der Token-Verbrauch von der Codebasis-Größe, dem Tool-Setup und der Aufgabenform abhängt.

Kann ich DeepSeek Harness und OpenCode mit demselben API-Schlüssel ausführen?

Ja, für einen beiläufigen Test. Für eine saubere Messung verwenden Sie zwei separate Schlüssel, einen pro Harness. Das Dashboard des Anbieters ordnet dann jeden Token dem korrekten Lauf zu.

Was ist der Unterschied zwischen einem Agent und einem Harness?

DeepSeek beschreibt einen Agent als Modell plus Harness. Das Modell argumentiert. Der Harness verbindet das Modell mit Dateien, Shell-Befehlen, Tools, Sitzungen, Genehmigungen und der Schleife, die die nächste Aktion bestimmt. Ändern Sie den Harness, und dasselbe Modell kann eine unterschiedliche Anzahl von Tokens für dieselbe Aufgabe ausgeben.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden