DeepSeek Harness tidak termasuk dalam benchmark tersebut. Itu dirilis dua hari kemudian. Artinya, pertanyaan yang berguna bukanlah "siapa yang menang?" Pertanyaan yang berguna adalah bagaimana menjalankan tugas yang sama melalui kedua alat, pada model yang sama, dan membaca tagihan tanpa menipu diri sendiri.
Poin-poin penting
- Pilihan harness dapat mengubah penggunaan token hingga sekitar 7x dalam tugas agen yang sebanding.
- Ukur DeepSeek Harness dan OpenCode dengan model yang sama dan status repositori yang sama.
- Gunakan kunci API terpisah sebelum Anda memilih salah satu untuk pekerjaan sehari-hari.

Dua laptop menjalankan tugas coding yang sama melalui dua harness agen
Pengaturan yang adil: satu model, satu tugas, dua terminal.
Apa yang dikatakan benchmark publik kepada kita
Composio menjalankan 30 alur kerja multi-aplikasi yang kompleks melalui 8 harness agen, semuanya menggunakan DeepSeek V4 Flash, batas waktu 900 detik per tugas, dan penilaian biner terprogram di 240 kali proses (Composio, Agustus 2026). Model yang sama, harness berbeda.
| Harness | Tingkat kelulusan | Waktu median | Rata-rata token per tugas |
|---|---|---|---|
| Pi Agent | 66,7% | 132,2 detik | 559.000 |
| Prime Agent | 62,5% | 242,1 detik | 1.400.000 |
| OMP | 56,7% | 272,4 detik | 742.000 |
| Claude Code | 53,3% | 122,7 detik | 742.000 |
| Codex | 53,3% | 245,0 detik | 678.000 |
| DeepAgents | 53,3% | 187,1 detik | 665.000 |
| Hermes Agent | 50,0% | 175,5 detik | 192.000 |
| OpenCode | 46,7% | 129,7 detik | 692.000 |
Kolom token lebih penting daripada peringkat. Sebarannya berkisar dari 192.000 hingga 1.400.000 token rata-rata per tugas. Itu adalah model yang sama melakukan pekerjaan yang sebanding melalui runtime yang berbeda.
OpenCode memberi kita dasar yang jelas: 692.000 token per tugas, tingkat kelulusan 46,7%, dan waktu median 129,7 detik. DeepSeek Harness tidak memiliki angka head-to-head publik dari benchmark ini karena DeepSeek merilisnya pada 13 Agustus 2026, dua hari setelah benchmark diterbitkan.
Gunakan tabel sebagai peringatan, bukan vonis. Tabel menunjukkan bahwa harness dapat mendominasi biaya. Itu tidak membuktikan apakah DeepSeek Harness mengalahkan OpenCode di repositori Anda.
Apa yang berubah saat Anda mengganti harness
Sebelum menguji, bandingkan kedua alat berdasarkan bagian yang memengaruhi pengembang yang bekerja: permukaan pengaturan, kematangan, visibilitas token, dan seberapa banyak loop agen yang dapat Anda ganti.
| DeepSeek Harness (dsh) | OpenCode | |
|---|---|---|
| Dari | DeepSeek AI | Anomaly (awalnya SST) |
| Dirilis | 13 Agustus 2026 | Akhir 2025 |
| Bintang GitHub | ~143k | ~198k |
| Lisensi | MIT | MIT |
| Bahasa | TypeScript | Go |
| Antarmuka | UI Web di 127.0.0.1:3080 | Terminal TUI |
| Status | Pratinjau pengembang, perubahan besar diharapkan | Matang, banyak digunakan |
| Arsitektur | Plugin yang dapat diganti untuk model, alat, sesi, sandbox, penyimpanan, loop, dan UI | Inti tetap dengan agen build/plan, dukungan MCP, dan ekstensi LSP |
| Konfigurasi | $DSH_HOME/settings.yaml | opencode.json |
| Akuntansi token | Meter token dengan tekanan konteks dan proyeksi rincian | Pelacakan token dan biaya per sesi di TUI |
| Terbaik untuk | Tim yang ingin memodifikasi loop agen itu sendiri | Tim yang menginginkan agen coding yang berfungsi saat ini |
OpenCode memberi Anda agen coding yang stabil dengan titik ekstensi di sekelilingnya. DeepSeek Harness memberi Anda runtime di mana loop itu sendiri dapat ditukar. Fleksibilitas itu membantu jika Anda membangun infrastruktur agen. Itu menambah risiko jika Anda membutuhkan alat default untuk kode produksi minggu ini.
Kedua alat dapat mencapai endpoint yang kompatibel dengan OpenAI yang sama. Itu memungkinkan pengujian yang adil: satu model, satu base URL, satu tugas, dan satu status repositori awal.
Untuk panduan ini, DeepSeek V4 Flash berjalan melalui Atlas Cloud, yang mengekspos endpoint yang kompatibel dengan OpenAI yang diterima oleh kedua alat. Daftar deepseek-v4-flash-0731 menunjukkan $0,14 per juta token input, $0,28 per juta token output, jendela konteks 1.048.576 token, dan output maksimum 393.216 per Agustus 2026. Penyedia mana pun berfungsi jika kedua harness menggunakan endpoint dan id model yang sama.
OpenCode juga mempublikasikan data penggunaan agregat. Model DeepSeek telah memindahkan 233 triliun token melalui OpenCode, dengan V4 Flash menyumbang 85,5% dan V4 Pro menyumbang 14,5% (OpenCode, Agustus 2026). Pola penggunaan itu menjadikan V4 Flash sebagai default praktis untuk perbandingan.
Langkah 1: Arahkan kedua alat ke model yang sama
Buat satu kunci API dan satu base URL, lalu berikan kedua alat pasangan yang sama. Buat kunci di konsol Atlas Cloud dan ekspor sekali:
plaintext1export ATLAS_API_KEY="your-api-key" 2
Periksa endpoint sebelum memberikannya ke salah satu harness:
plaintext1curl https://api.atlascloud.ai/v1/chat/completions \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "deepseek-ai/deepseek-v4-flash-0731", 6 "messages": [{"role": "user", "content": "Balas dengan satu kata: siap"}] 7 }' 8
Panggilan itu membuktikan rute, kunci, dan id model berfungsi sebelum harness menambahkan alat, percobaan ulang, atau pemutaran ulang percakapan.

Prompt coding, kode yang dihasilkan, dan statistik token dari satu panggilan model
Satu panggilan langsung ke deepseek-ai/deepseek-v4-flash-0731: 148 token prompt masuk, 6.879 token output kembali, termasuk 5.731 token penalaran. Anggap itu sebagai dasar sebelum harness menambahkan skema alat dan riwayat.
DeepSeek Harness membaca $DSH_HOME/settings.yaml, dan penyedia khusus yang kompatibel dengan OpenAI berada di bawah plugin llm-pi-ai (Dokumentasi DeepSeek Harness, Agustus 2026):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 apiKeyEnv: ATLAS_API_KEY 5 api: openai-completions 6 baseURL: https://api.atlascloud.ai/v1 7 models: 8 - id: deepseek-ai/deepseek-v4-flash-0731 9
Gunakan openai-completions untuk endpoint ini. UI web dapat menulis blok penyedia yang sama dari Pengaturan, Model, Tambahkan penyedia kustom, lalu simpan kunci di $DSH_HOME/.credentials.yaml.
OpenCode membaca opencode.json di direktori root proyek atau direktori konfigurasi global (Dokumentasi OpenCode, Agustus 2026):
plaintext1{ 2 "$schema": "https://opencode.ai/config.json", 3 "provider": { 4 "atlas": { 5 "npm": "@ai-sdk/openai-compatible", 6 "name": "Atlas Cloud", 7 "options": { 8 "baseURL": "https://api.atlascloud.ai/v1", 9 "apiKey": "{env:ATLAS_API_KEY}" 10 }, 11 "models": { 12 "deepseek-ai/deepseek-v4-flash-0731": { 13 "name": "DeepSeek V4 Flash 0731", 14 "limit": { "context": 1048576, "output": 393216 } 15 } 16 } 17 } 18 }, 19 "model": "atlas/deepseek-ai/deepseek-v4-flash-0731" 20} 21
Gunakan @ai-sdk/openai-compatible, karena endpoint ini melayani /v1/chat/completions. Tetapkan batas konteks dan output yang sebenarnya. OpenCode menggunakannya saat memutuskan kapan harus meringkas, dan batas yang salah dapat mendistorsi perbandingan token.
Langkah 2: Jalankan tugas benchmark yang sama di DeepSeek Harness
Pilih tugas yang cukup besar untuk membutuhkan beberapa panggilan alat dan cukup kecil untuk dinilai. Gunakan status repositori yang sama untuk kedua proses, jadi commit atau stash sebelum memulai.
Tempelkan tugas persis ini ke kedua alat:
plaintext1Di repositori ini, tambahkan middleware pembatas laju token-bucket untuk aplikasi 2Express di src/server.js. Batasi setiap IP menjadi 60 permintaan per menit. Saat ditolak, 3kembalikan HTTP 429 dengan body JSON {"error":"rate_limited","retryAfter":<detik>}. 4Hubungkan middleware ke setiap rute /api/*. Tambahkan pengujian unit di 5test/rate-limit.test.js yang mencakup tiga kasus: permintaan di bawah batas diizinkan, 6permintaan di atas batas diblokir dengan 429, dan penghitung diatur ulang setelah 7jendela kedaluwarsa. Jalankan rangkaian pengujian dan perbaiki kegagalan hingga lulus. 8Jangan ubah file apa pun di luar src/ dan test/. 9
Mulai Harness dari direktori proyek Anda:
plaintext1cd /path/to/your/repo 2npx @deepseek-ai/dsh web 3
UI berjalan di http://127.0.0.1:3080. Pilih penyedia atlas dan model deepseek-ai/deepseek-v4-flash-0731, tempelkan tugas, dan biarkan selesai. Jangan tambahkan petunjuk setelah proses dimulai. Bantuan tambahan untuk satu alat akan membatalkan perbandingan.
Saat Harness selesai, buka tampilan Trajectory. Rekaman sesi itu adalah tempat angka tokennya berada.
Langkah 3: Ulangi proses di OpenCode
Setel ulang repositori ke status awal yang tepat. Harness kedua tidak boleh mewarisi file yang sudah diubah oleh yang pertama.
plaintext1git checkout -- . && git clean -fd 2
Lalu jalankan OpenCode terhadap model yang sama:
plaintext1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731 2
Tempelkan prompt tugas yang sama dari Langkah 2. Gunakan agen build default. Biarkan selesai tanpa petunjuk.
Nilai kedua proses dengan perintah yang sama:
plaintext1npm test 2
Proses yang meninggalkan rangkaian pengujian merah gagal, bahkan jika ringkasan agen terdengar yakin. Gunakan penilaian biner: lulus atau gagal.
Langkah 4: Baca penggunaan token
Kedua alat melacak penggunaan, tetapi tidak ada penghitung yang harus menjadi nomor tagihan akhir Anda.
DeepSeek Harness menyertakan meter token yang terpasang secara default. Itu mengekspos tokenUsage, contextPressure, dan contextBreakdown di tampilan Trajectory. contextBreakdown memberi tahu Anda apakah tagihan berasal dari prompt sistem, skema alat, pembacaan file, atau pemutaran ulang percakapan. Meter memperkirakan kira-kira satu token per empat karakter, jadi gunakan sebagai tampilan diagnostik.
OpenCode melacak token dan biaya per sesi dan mencetaknya di baris status TUI. Rincian bawaannya lebih kecil, jadi tim yang membutuhkan atribusi per alat sering memeriksa basis data sesi dengan penganalisis eksternal.
Gunakan angka dari sisi penyedia untuk perbandingan:
| Apa yang dibandingkan | Di mana mendapatkannya |
|---|---|
| Total token input | Dasbor penggunaan penyedia, per kunci API |
| Total token output | Dasbor penggunaan penyedia, per kunci API |
| Jumlah panggilan model | Tampilan Trajectory harness / log sesi OpenCode |
| Waktu dinding (wall clock) | Stopwatch, dari awal hingga penulisan file terakhir |
| Lulus atau gagal | Kode keluar npm test |
Buat dua kunci API, harness-test dan opencode-test, dan gunakan masing-masing kunci untuk satu proses. Dasbor penyedia kemudian memberi Anda penggunaan yang bersih berdampingan tanpa merekonsiliasi dua perkiraan internal.
Mengapa tagihan berubah
Penggunaan token berubah karena alasan yang konkret. Lima hal ini biasanya lebih penting daripada harga model.
Pemutaran ulang percakapan bertambah. Agen mengirim ulang percakapan yang terus bertambah pada setiap langkah. Tugas 40 langkah biayanya lebih dekat ke jumlah 40 prompt yang bertambah daripada 40 prompt yang identik. Harness yang meringkas lebih awal akan mendekati ujung bawah sebaran benchmark.
Cache hit mengurangi biaya input. Cache hit DeepSeek V4 Flash dihargai sekitar $0,0028 per juta token dibandingkan $0,14 per juta pada miss, kira-kira 98% lebih murah. Caching membutuhkan prefiks yang stabil byte-per-byte. Jika harness mengacak teks prompt sistem antar panggilan, itu akan mengubah hit menjadi miss.
Skema alat ikut serta. Dua puluh server MCP yang terhubung berarti dua puluh set skema dalam prompt, bahkan jika tugas hanya menggunakan dua di antaranya. Putuskan sambungan alat yang tidak Anda butuhkan sebelum melakukan benchmark, atau Anda mengukur pengaturan alat Anda, bukan harness.
Output alat yang besar meracuni konteks. cat dari file 3.000 baris atau log uji gagal yang bertele-tele tetap berada dalam percakapan untuk panggilan selanjutnya. DeepSeek Harness dapat memangkas hasil alat yang terlalu besar sebelum meringkas. Aktifkan itu saat tugas menghasilkan output yang berisik.
Percobaan ulang bersembunyi di dalam jumlah panggilan. Harness yang mencoba ulang loop uji yang gagal akan menghabiskan token setiap kali. Bandingkan panggilan model di samping total token sehingga Anda dapat memisahkan loop percobaan ulang dari prompt yang mahal.
Pada tarif Atlas Cloud untuk DeepSeek V4 Flash, tugas 692.000 token yang berbobot input berada dalam kisaran sen digit rendah. Itu kecil untuk satu proses dan besar untuk tim yang menjalankan agen sepanjang hari. Jelajahi katalog model lengkap jika Anda ingin mengulangi pengujian pada model kedua dan memisahkan efek model dari efek harness.
DeepSeek Harness masih dalam pratinjau pengembang, dan README-nya memperingatkan tentang perubahan besar. Benchmark jika Anda menginginkan kendali atas loop agen. Standarisasi hanya jika tim Anda dapat menyerap churn. OpenCode adalah pilihan yang lebih stabil untuk tim yang membutuhkan alat hari ini.
Pertanyaan yang Sering Diajukan
Apakah DeepSeek Harness lebih baik dari OpenCode?
Belum untuk sebagian besar tim. OpenCode sudah matang, native terminal, memiliki sekitar 198k bintang dan katalog penyedia yang besar, dan berfungsi hari ini. DeepSeek Harness lebih baru, dalam pratinjau pengembang, dan memperingatkan tentang perubahan besar. Pilih Harness jika Anda ingin memodifikasi internal agen. Pilih OpenCode jika Anda menginginkan agen coding untuk pekerjaan sehari-hari.
Apakah DeepSeek Harness hanya berfungsi dengan model DeepSeek?
Tidak. Itu agnostik model. Ini menyertakan penyedia katalog untuk DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure, dan Codex, dan Anda dapat menambahkan penyedia kustom apa pun yang berbicara openai-completions, openai-responses, atau anthropic-messages di $DSH_HOME/settings.yaml. Konfigurasi Langkah 1 mengarahkannya ke endpoint yang kompatibel dengan OpenAI tanpa kode adaptor.
Bagaimana cara memeriksa penggunaan token DeepSeek Harness?
Gunakan meter token bawaan di tampilan Trajectory. Itu mengekspos tokenUsage, contextPressure, dan contextBreakdown. Anggap sebagai perkiraan karena menggunakan kira-kira satu token per empat karakter. Untuk akurasi penagihan, baca dasbor penggunaan penyedia, idealnya dengan kunci API khusus untuk setiap proses.
Harness mana yang menggunakan lebih sedikit token, DeepSeek Harness atau OpenCode?
Belum ada benchmark head-to-head publik yang menjawabnya. Benchmark Composio mengukur OpenCode pada 692.000 token rata-rata per tugas, tetapi itu dijalankan sebelum DeepSeek Harness dirilis. Jalankan pengujian Langkah 2 hingga Langkah 4 di repositori Anda sendiri karena penggunaan token bergantung pada ukuran basis kode, pengaturan alat, dan bentuk tugas.
Bisakah saya menjalankan DeepSeek Harness dan OpenCode terhadap kunci API yang sama?
Ya, untuk pengujian kasual. Untuk pengukuran yang bersih, gunakan dua kunci terpisah, satu per harness. Dasbor penyedia kemudian akan menghubungkan setiap token ke proses yang benar.
Apa perbedaan antara agen dan harness?
DeepSeek menggambarkan agen sebagai Model ditambah Harness. Model beralasan. Harness menghubungkan model ke file, perintah shell, alat, sesi, persetujuan, dan loop yang memutuskan tindakan selanjutnya. Ubah harness dan model yang sama dapat menghabiskan jumlah token yang berbeda pada tugas yang sama.






