DeepSeek Harness vs OpenCode: Il gap nell'uso dei token che la maggior parte degli sviluppatori trascura

DeepSeek Harness vs OpenCode, testati sullo stesso modello e sullo stesso compito. Cosa fa ciascun harness al tuo utilizzo dei token, perché il divario è reale e come misurarlo da soli.

DeepSeek Harness non faceva parte di quel benchmark. È stato rilasciato due giorni dopo. Ciò significa che la domanda utile non è "chi ha vinto?". La domanda utile è come eseguire lo stesso compito con entrambi gli strumenti, sullo stesso modello, e leggere il conto senza ingannarsi.

Punti chiave

  • La scelta dell'harness può far variare l'utilizzo dei token di circa 7x in compiti agentici comparabili.
  • Misura DeepSeek Harness e OpenCode con lo stesso modello e lo stesso stato del repository.
  • Usa chiavi API separate prima di sceglierne una per il lavoro quotidiano.

Due laptop che eseguono lo stesso compito di codifica con due harness agentici

Due laptop che eseguono lo stesso compito di codifica con due harness agentici

L'impostazione equa: un modello, un compito, due terminali.

Cosa ci dice il benchmark pubblico

Composio ha eseguito 30 flussi di lavoro multi-app complessi attraverso 8 harness agentici, tutti usando DeepSeek V4 Flash, un limite di 900 secondi per compito e valutazione binaria programmatica su 240 esecuzioni (Composio, agosto 2026). Stesso modello, harness diverso.

HarnessTasso di successoTempo medianoToken medi per compito
Pi Agent66.7%132.2s559.000
Prime Agent62.5%242.1s1.400.000
OMP56.7%272.4s742.000
Claude Code53.3%122.7s742.000
Codex53.3%245.0s678.000
DeepAgents53.3%187.1s665.000
Hermes Agent50.0%175.5s192.000
OpenCode46.7%129.7s692.000

La colonna dei token conta più della classifica. La variazione va da 192.000 a 1.400.000 token medi per compito. Questo è lo stesso modello che svolge un lavoro comparabile attraverso runtime diversi.

OpenCode ci fornisce una base di riferimento: 692.000 token per compito, tasso di successo del 46.7% e tempo mediano di 129.7 secondi. DeepSeek Harness non ha un numero testa a testa pubblico da questo benchmark perché DeepSeek lo ha rilasciato il 13 agosto 2026, due giorni dopo la pubblicazione del benchmark.

Usa la tabella come avvertimento, non come verdetto. Mostra che l'harness può dominare i costi. Non prova se DeepSeek Harness batte OpenCode sul tuo repository.

Cosa cambia quando si cambia harness

Prima di testare, confronta i due strumenti in base agli aspetti che influenzano uno sviluppatore attivo: superficie di configurazione, maturità, visibilità dei token e quanto del ciclo agente puoi sostituire.

DeepSeek Harness (dsh)OpenCode
DaDeepSeek AIAnomaly (originariamente SST)
Rilasciato13 agosto 2026Fine 2025
Stelle GitHub~143k~198k
LicenzaMITMIT
LinguaggioTypeScriptGo
InterfacciaWeb UI su 127.0.0.1:3080Terminale TUI
StatoAnteprima sviluppatore, modifiche sostanziali previsteMaturo, ampiamente distribuito
ArchitetturaPlugin sostituibili per modelli, strumenti, sessioni, sandbox, archiviazione, cicli e UINucleo fisso con agenti di build/pianificazione, supporto MCP ed estensioni LSP
Configurazione$DSH_HOME/settings.yamlopencode.json
Contabilizzazione tokenMeter dei token con pressione di contesto e proiezioni di dettaglioTracciamento dei token e dei costi per sessione nella TUI
Ideale perTeam che vogliono modificare il ciclo agente stessoTeam che vogliono un agente di codifica che funzioni oggi

OpenCode ti offre un agente di codifica stabile con punti di estensione ai bordi. DeepSeek Harness ti offre un runtime in cui il ciclo stesso può essere scambiato. Questa flessibilità aiuta se stai costruendo infrastruttura agente. Aggiunge rischio se hai bisogno di uno strumento predefinito per codice di produzione questa settimana.

Entrambi gli strumenti possono raggiungere lo stesso endpoint compatibile con OpenAI. Questo rende possibile un test equo: un modello, un URL base, un compito e uno stato di partenza del repository.

Per questa guida, DeepSeek V4 Flash viene eseguito tramite Atlas Cloud, che espone un endpoint compatibile con OpenAI accettato da entrambi gli strumenti. La scheda deepseek-v4-flash-0731 mostra $0.14 per milione di token in input, $0.28 per milione di token in output, una finestra di contesto di 1.048.576 token e un output massimo di 393.216 ad agosto 2026. Qualsiasi provider funziona se entrambi gli harness usano lo stesso endpoint e lo stesso ID modello.

OpenCode pubblica anche dati aggregati sull'utilizzo. I modelli DeepSeek hanno mosso 233 trilioni di token attraverso OpenCode, con V4 Flash che rappresenta l'85.5% e V4 Pro il 14.5% (OpenCode, agosto 2026). Questo schema di utilizzo rende V4 Flash un predefinito pratico per il confronto.

Passo 1: Puntare entrambi gli strumenti allo stesso modello

Crea una chiave API e un URL base, poi fornisci a entrambi gli strumenti la stessa coppia. Crea la chiave nella console di Atlas Cloud ed esportala una volta:

plaintext
1export ATLAS_API_KEY="tua-chiave-api"
2

Controlla l'endpoint prima di passarlo a qualsiasi harness:

plaintext
1curl https://api.atlascloud.ai/v1/chat/completions \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "deepseek-ai/deepseek-v4-flash-0731",
6    "messages": [{"role": "user", "content": "Rispondi con una singola parola: pronto"}]
7  }'
8

Quella chiamata dimostra che il percorso, la chiave e l'ID del modello funzionano prima che un harness aggiunga strumenti, tentativi o replay della conversazione.

Prompt di codifica, codice generato e statistiche dei token da una chiamata al modello

Prompt di codifica, codice generato e statistiche dei token da una chiamata al modello

Una chiamata diretta a `deepseek-ai/deepseek-v4-flash-0731`: 148 token in input, 6.879 token in output, inclusi 5.731 token di ragionamento. Consideralo come il minimo prima che un harness aggiunga schemi di strumenti e cronologia.

DeepSeek Harness legge $DSH_HOME/settings.yaml, e i provider personalizzati compatibili con OpenAI vanno sotto il plugin llm-pi-ai (documentazione DeepSeek Harness, agosto 2026):

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      apiKeyEnv: ATLAS_API_KEY
5      api: openai-completions
6      baseURL: https://api.atlascloud.ai/v1
7      models:
8        - id: deepseek-ai/deepseek-v4-flash-0731
9

Usa openai-completions per questo endpoint. L'interfaccia web può scrivere lo stesso blocco provider da Impostazioni, Modelli, Aggiungi provider personalizzato, quindi salvare la chiave in $DSH_HOME/.credentials.yaml.

OpenCode legge opencode.json nella root del tuo progetto o nella directory di configurazione globale (documentazione OpenCode, agosto 2026):

plaintext
1{
2  "$schema": "https://opencode.ai/config.json",
3  "provider": {
4    "atlas": {
5      "npm": "@ai-sdk/openai-compatible",
6      "name": "Atlas Cloud",
7      "options": {
8        "baseURL": "https://api.atlascloud.ai/v1",
9        "apiKey": "{env:ATLAS_API_KEY}"
10      },
11      "models": {
12        "deepseek-ai/deepseek-v4-flash-0731": {
13          "name": "DeepSeek V4 Flash 0731",
14          "limit": { "context": 1048576, "output": 393216 }
15        }
16      }
17    }
18  },
19  "model": "atlas/deepseek-ai/deepseek-v4-flash-0731"
20}
21

Usa @ai-sdk/openai-compatible, perché questo endpoint serve /v1/chat/completions. Imposta i limiti reali di contesto e output. OpenCode li usa quando decide quando riassumere, e limiti errati possono distorcere il confronto dei token.

Passo 2: Eseguire lo stesso compito di benchmark in DeepSeek Harness

Scegli un compito abbastanza grande da richiedere diverse chiamate a strumenti e abbastanza piccolo da poter essere valutato. Usa lo stesso stato del repository per entrambe le esecuzioni, quindi esegui commit o stash prima di iniziare.

Incolla questo compito esatto in entrambi gli strumenti:

plaintext
1In questo repository, aggiungi un middleware di limitazione della velocità a secchiello di token per l'app Express in src/server.js. Limita ogni IP a 60 richieste al minuto. Al rifiuto, restituisci HTTP 429 con il corpo JSON {"error":"rate_limited","retryAfter":<secondi>}. Collega il middleware a ogni route /api/*. Aggiungi test unitari in test/rate-limit.test.js che coprano tre casi: una richiesta sotto il limite è consentita, una richiesta oltre il limite viene bloccata con 429, e il contatore si azzera dopo la scadenza della finestra. Esegui la suite di test e correggi gli errori fino al superamento. Non modificare alcun file al di fuori di src/ e test/.
2

Avvia Harness dalla directory del tuo progetto:

plaintext
1cd /path/to/tuo/repo
2npx @deepseek-ai/dsh web
3

L'interfaccia viene eseguita su http://127.0.0.1:3080. Seleziona il provider atlas e il modello deepseek-ai/deepseek-v4-flash-0731, incolla il compito e lascialo terminare. Non aggiungere suggerimenti dopo l'avvio dell'esecuzione. Un aiuto extra per uno strumento invalida il confronto.

Quando Harness termina, apri la vista Traiettoria. Quel record di sessione è dove si trovano i suoi numeri di token.

Passo 3: Ripetere l'esecuzione in OpenCode

Ripristina il repository allo stato iniziale esatto. Il secondo harness non deve ereditare file che il primo ha già modificato.

plaintext
1git checkout -- . && git clean -fd
2

Poi esegui OpenCode con lo stesso modello:

plaintext
1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731
2

Incolla lo stesso prompt del compito del Passo 2. Usa l'agente build predefinito. Lascialo terminare senza suggerimenti.

Valuta entrambe le esecuzioni con lo stesso comando:

plaintext
1npm test
2

Un'esecuzione che lascia la suite in rosso fallisce, anche se il riepilogo dell'agente sembra sicuro. Usa la valutazione binaria: superato o fallito.

Passo 4: Leggere l'utilizzo dei token

Entrambi gli strumenti tracciano l'utilizzo, ma nessun contatore dovrebbe essere il tuo numero finale di fattura.

DeepSeek Harness include un meter dei token montato di default. Espone tokenUsage, contextPressure e contextBreakdown nella vista Traiettoria. contextBreakdown ti dice se il conto proviene dal prompt di sistema, dagli schemi degli strumenti, dalle letture dei file o dal replay della conversazione. Il meter stima circa un token ogni quattro caratteri, quindi usalo come vista diagnostica.

OpenCode traccia i token e il costo per sessione e li stampa nella riga di stato della TUI. La sua ripartizione integrata è più piccola, quindi i team che necessitano di attribuzione per strumento spesso ispezionano il database delle sessioni con analizzatori esterni.

Usa i numeri dal lato provider per il confronto:

Cosa confrontareDove ottenerlo
Token totali in inputDashboard di utilizzo del provider, per chiave API
Token totali in outputDashboard di utilizzo del provider, per chiave API
Numero di chiamate al modelloVista traiettoria harness / log sessione OpenCode
Tempo realeCronometro, dall'inizio all'ultima scrittura file
Superato o fallitoCodice di uscita npm test

Crea due chiavi API, harness-test e opencode-test, e usa ciascuna chiave per un'esecuzione. La dashboard del provider ti darà quindi un utilizzo affiancato pulito senza dover riconciliare due stimatori interni.

Perché il conto si muove

L'utilizzo dei token cambia per ragioni concrete. Queste cinque di solito contano più del prezzo del modello.

Il replay della conversazione si accumula. Gli agenti reinviano la conversazione crescente a ogni passo. Un compito di 40 passi costa più vicino alla somma di 40 prompt crescenti che a 40 prompt identici. Gli harness che riassumono presto si attestano verso l'estremità inferiore della variazione del benchmark.

I cache hit riducono il costo di input. I cache hit di DeepSeek V4 Flash costano circa $0.0028 per milione di token contro $0.14 per milione in caso di miss, circa il 98% in meno. La memorizzazione nella cache necessita di un prefisso stabile byte per byte. Se un harness mescola il testo del prompt di sistema tra le chiamate, trasforma gli hit in miss.

Gli schemi degli strumenti viaggiano insieme. Venti server MCP connessi significano venti set di schemi nel prompt, anche se il compito ne usa due. Scollega gli strumenti che non ti servono prima di eseguire il benchmark, altrimenti misuri la configurazione dei tuoi strumenti invece dell'harness.

Output di grandi dimensioni degli strumenti avvelenano il contesto. Un cat di un file di 3.000 righe o un log di test fallito verboso rimane nella conversazione per le chiamate successive. DeepSeek Harness può potare i risultati di grandi dimensioni degli strumenti prima di riassumerli. Attivalo quando il compito produce output rumorosi.

I tentativi si nascondono nel conteggio delle chiamate. Un harness che riprova un test fallito in loop spende token ogni volta. Confronta le chiamate al modello insieme ai token totali in modo da poter separare un ciclo di tentativi da un prompt costoso.

Alla tariffa di Atlas Cloud per DeepSeek V4 Flash, un compito di 692.000 token orientato all'input costa pochi centesimi. È poco per una singola esecuzione e molto per un team che esegue agenti tutto il giorno. Sfoglia il catalogo completo dei modelli se vuoi ripetere il test su un secondo modello e separare gli effetti del modello dagli effetti dell'harness.

DeepSeek Harness è ancora in anteprima per sviluppatori, e il suo README avverte di modifiche sostanziali. Mettilo a benchmark se vuoi il controllo sul ciclo agente. Standardizzalo solo se il tuo team può assorbire il cambiamento. OpenCode è la scelta più stabile per i team che hanno bisogno di uno strumento oggi.

Domande frequenti

DeepSeek Harness è migliore di OpenCode?

Non ancora per la maggior parte dei team. OpenCode è maturo, nativo per terminale, ha circa 198k stelle e un ampio catalogo di provider, e funziona oggi. DeepSeek Harness è più recente, in anteprima per sviluppatori e avverte di modifiche sostanziali. Scegli Harness se vuoi modificare gli interni dell'agente. Scegli OpenCode se vuoi un agente di codifica per il lavoro quotidiano.

DeepSeek Harness funziona solo con i modelli DeepSeek?

No. È agnostico rispetto al modello. Include provider di catalogo per DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure e Codex, e puoi aggiungere qualsiasi provider personalizzato che parli openai-completions, openai-responses o anthropic-messages in $DSH_HOME/settings.yaml. La configurazione del Passo 1 lo punta a un endpoint compatibile con OpenAI senza codice adattatore.

Come posso controllare l'utilizzo dei token di DeepSeek Harness?

Usa il meter dei token integrato nella vista Traiettoria. Espone tokenUsage, contextPressure e contextBreakdown. Trattalo come una stima perché usa circa un token ogni quattro caratteri. Per la precisione di fatturazione, leggi la dashboard di utilizzo del provider, idealmente con una chiave API dedicata per ogni esecuzione.

Quale harness usa meno token, DeepSeek Harness o OpenCode?

Nessun benchmark testa a testa pubblico risponde ancora a questo. Il benchmark di Composio ha misurato OpenCode a 692.000 token medi per compito, ma è stato eseguito prima che DeepSeek Harness fosse rilasciato. Esegui il test dal Passo 2 al Passo 4 sul tuo repository perché l'utilizzo dei token dipende dalle dimensioni del codebase, dalla configurazione degli strumenti e dalla forma del compito.

Posso eseguire DeepSeek Harness e OpenCode con la stessa chiave API?

Sì, per un test informale. Per una misurazione pulita, usa due chiavi separate, una per harness. La dashboard del provider attribuirà quindi ogni token all'esecuzione corretta.

Qual è la differenza tra un agente e un harness?

DeepSeek descrive un agente come Modello più Harness. Il modello ragiona. L'harness collega il modello a file, comandi shell, strumenti, sessioni, approvazioni e il ciclo che decide l'azione successiva. Cambia l'harness e lo stesso modello può spendere un numero diverso di token sullo stesso compito.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli