Anda menjalankan tugas di Hermes kemarin. Anda menjalankan tugas yang terasa sama di dsh hari ini. Model yang sama, kunci API yang sama, laptop yang sama. Angka pemakaiannya tetap berbeda.
Mata Anda baik-baik saja. Tidak ada yang berubah harga dalam semalam.
Inilah yang hampir semua perbandingan DeepSeek Harness vs Hermes lewatkan: harness adalah cangkang yang membungkus model, dan cangkang itulah yang menentukan berapa banyak konteks yang keluar per langkah, berapa banyak alat yang diiklankan, seberapa sering ia mencoba ulang, dan apakah ia mengirim ulang seluruh percakapan pada setiap panggilan. Ubah cangkangnya, ubah tagihannya.
Jadi saya kunci variabel model dan mengukurnya. Dua harness, satu endpoint, satu deepseek-ai/deepseek-v4-pro, satu perintah, satu mesin, satu sore. Tugas yang sama, keduanya menyelesaikannya, dan salah satunya memindahkan 8,4x lebih banyak token perintah daripada yang lain.
Poin penting
- Model yang sama, tugas yang sama, keduanya lulus: dsh memakan waktu 121 detik, Hermes memakan waktu 780 detik.
- Hermes memindahkan 1.111.573 token perintah dibandingkan 132.600 milik dsh. Itu 8,4x, dalam satu tugas.
- Sebelum agen mana pun melakukan apa pun, system prompt-nya sudah menghabiskan token: dsh 10.898 vs Hermes 13.892 hanya untuk menjawab "OK".
- dsh secara diam-diam membatasi Anda pada konteks 262.144 kecuali Anda menimpa
defaultContextWindow, membuang 75% dari jendela V4.- Pilih dsh untuk pengkodean, Hermes untuk memori, cron, dan antarmuka obrolan. Atau jalankan keduanya.

Bengkel teknik terbagi dengan blok mesin telanjang yang dijepit ke rig test-harness baja di kiri dan robot kuningan di kanan, keduanya diberi makan oleh satu jalur bahan bakar tembaga
Satu jalur bahan bakar, dua rig pengujian. Itulah keseluruhan eksperimen. Dihasilkan dengan openai/gpt-image-2.
DeepSeek Harness vs Hermes, Model yang Sama, Tugas yang Sama
Kedua harness mendapatkan ini, kata demi kata: buat clone Breakout satu file dengan paddle, 5 baris bata, penghitung skor live, jeda tombol P, ditambah self-test inline yang menegaskan tiga invarian fisika dan mencetak PASS atau FAIL. Kemudian jalankan tanpa kepala dan perbaiki sampai ketiganya mencetak PASS.
Tanpa library. Tanpa CDN. Tanpa langkah build.
Keduanya benar-benar melakukannya. Berikut dua filenya, dirender di peramban sungguhan.

Perbandingan berdampingan animasi dari dua build Breakout yang berjalan: DeepSeek Harness (dsh) di kiri, Hermes Agent di kanan, keduanya diputar otomatis dari perintah DeepSeek V4 Pro yang identik
Kedua build direkam ulang berdampingan dan dibiarkan diputar otomatis, sehingga Anda dapat melihat masing-masing benar-benar berjalan. Kiri: dsh, yang gimnya mulai otomatis. Kanan: Hermes , yang gimnya mulai dalam keadaan jeda, lalu berjalan. Perintah satu file yang sama, DeepSeek V4 Pro yang sama, dua harness.
Sekarang angka-angka yang benar-benar menentukan hal ini.
| Proses | Waktu tempuh | Panggilan alat | Token perintah (segar + cache) | Token keluaran | Biaya di V4 Pro |
|---|---|---|---|---|---|
| dsh, putaran 1 | 121,2 detik | 8 | 14.840 + 117.760 = 132.600 | 5.231 | $0,24 |
| Hermes, putaran 1 | 780 detik | 35 | 49.685 + 1.061.888 = 1.111.573 | 19.317 | $1,93 |
| dsh, putaran 2 | tidak selesai | 11 sebelum batas | 44.291 + 132.608 | 2.463 | tidak selesai |
| Hermes, putaran 2 | tidak selesai | tidak dijalankan | tidak selesai | tidak selesai | tidak selesai |
Diukur pada 2026-08-21 di deepseek-ai/deepseek-v4-pro, satu mesin, direktori kerja kosong per proses. Hitungan token dibaca mesin: dsh dari log sesinya, Hermes dari JSON --usage-file-nya. Perhatikan bahwa kedua hitungan alat tidak bersumber dari cara yang sama: 8 milik dsh dihitung dari lognya (diklaim 6), sementara 35 milik Hermes adalah laporannya sendiri, dengan file penggunaannya mencatat 38 panggilan API. Metode biaya dijelaskan di bagian terakhir.
Mengapa dua baris kosong? Putaran 2 tidak pernah berjalan, dan alasannya adalah titik data tunggal terbaik artikel ini. Putaran 1 Hermes sendiri mendorong 1,13 juta token melalui akun tersebut, dan di tengah jalan putaran 2 dsh, endpoint menjawab:
plaintext1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded", 2"message":"Member day spend limit reached (set by your team admin); 3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}
Satu agen, satu gim Breakout, satu batas anggaran harian. Saya tidak mengisi sel-sel itu dengan perkiraan.
Satu detail lagi yang perlu ditandai. dsh melaporkan "Tool calls used: 6" dalam jawaban akhirnya. Log sesinya sendiri mencatat 8. Agen adalah narator yang tidak dapat diandalkan tentang pengeluaran mereka sendiri, dan itulah tepatnya mengapa pengujian ini membaca log daripada ringkasan.
Mengapa Sebagian Besar Perbandingan DeepSeek Harness vs Hermes Rusak
Putusan dulu: hampir setiap halaman yang masuk peringkat untuk kata kunci ini mengukur variabel yang salah, dan Anda dapat melihatnya dalam satu baris pengaturan mereka.
Modelnya, bukan cangkangnya, yang diukur oleh pengujian tersebut
Baca hasil teratas. Polanya berulang: jalankan dsh pada model DeepSeek, jalankan Hermes pada apa pun yang sudah diarahkan Hermes, lalu atribusikan seluruh perbedaan ke harness.
Itu bukan perbandingan harness. Itu adalah perbandingan model yang memakai label berbentuk harness.
Jika dsh menggunakan V4 Pro dan Hermes menggunakan yang lain, delta yang Anda ukur sebagian besar adalah dua model tersebut, dan kontribusi cangkang terkubur tak terselamatkan. Jadi pengujian ini melakukan hal yang membosankan namun perlu: kedua harness menunjuk ke URL dasar yang sama, ID model yang sama, kunci yang sama.
Pilihan harness menggerakkan angka dengan sendirinya
Ingin bukti bahwa cangkang saja mahal? Minta masing-masing untuk tidak melakukan apa pun.
Saya mengirim keduanya perintah sepele yang sama: Reply with exactly the word: OK. Tidak perlu alat, tidak perlu file, tidak perlu berpikir.
| Harness | Token perintah untuk mengatakan "OK" | Token keluaran | Waktu tempuh |
|---|---|---|---|
| DeepSeek Harness (dsh) | 10.898 | 2 | 5,6 detik |
| Hermes Agent | 13.892 (+1.024 cache) | 17 | 8,5 detik |
Model yang sama. Pertanyaan yang sama. Kesenjangan 2.994 token sebelum pekerjaan nyata dimulai, karena kesenjangan itu adalah harness: system prompt-nya, skema alatnya, file aturannya. Hermes mengirimkan lebih banyak area permukaan, jadi Hermes mengirimkan lebih banyak token.
Sekarang kalikan dengan loop agen 38 panggilan di mana setiap panggilan mengirim ulang percakapan sejauh ini. Pembacaan cache adalah 88,8% dari token perintah dsh dan 95,5% milik Hermes. Pembacaan ulang itulah tagihannya.
Satu Endpoint, Dua Harness: Pengaturan DeepSeek V4
Untuk membandingkan cangkang, Anda perlu sisi model diam sempurna. Bukan hanya nama model yang sama: endpoint yang sama, batas kecepatan yang sama, harga yang sama pada jam 3 pagi maupun jam 3 sore.
Yang terakhir itu lebih penting daripada kedengarannya. Jika penyedia Anda mengenakan tarif puncak dan di luar jam sibuk, maka "putaran 1 di Hermes pada pukul 09:00" dan "putaran 2 di dsh pada pukul 11:00" bukanlah proses yang sebanding, dan Anda tidak akan pernah bisa mengurai berapa banyak delta yang disebabkan oleh harness dan berapa banyak oleh jam.
Jadi kedua harness di sini menunjuk ke satu endpoint kompatibel OpenAI tarif tetap di Atlas Cloud: https://api.atlascloud.ai/v1. Harga sama sepanjang hari, tanpa jendela puncak, tanpa antrian terpisah per harness, satu kunci untuk keduanya.
| Peran dalam pengujian | ID model | Konteks / keluaran maks | Harga per 1M masuk / keluar |
|---|---|---|---|
| Mesin utama untuk kedua harness | deepseek-ai/deepseek-v4-pro | 1.048.576 / 393.216 | $1,68 / $3,38 |
| Tingkat murah, peran "lengan" | deepseek-ai/deepseek-v4-flash | 1.048.576 / 393.216 | $0,14 / $0,28 |
| Pekerjaan cron jangka panjang | deepseek-ai/deepseek-v3.2 | 163.840 / 163.840 | $0,26 / $0,38 |
Harga dibaca dari halaman model pada 2026-08-21. Tidak ada lencana diskon pada keluarga DeepSeek saat ini, jadi tidak ada apa pun di sini yang merupakan tarif promosi yang kedaluwarsa minggu depan.
Hal kecil yang mudah terlewatkan: /v1/models melaporkan deepseek-v4-pro dan deepseek-v4-flash sebagai fp4, sementara deepseek-v4-pro-0813 kembali sebagai fp8. Ingin bobot presisi lebih tinggi? Pin ID yang bertanggal.
Baik. Mari kita bangun.
Jalankan Pengujian DeepSeek Harness vs Hermes Sendiri
Pratinjau: tujuh langkah, dua file konfigurasi, satu perintah, dan Anda akan mendapatkan versi tabel itu sendiri alih-alih mempercayai milik saya. Buktinya berhasil: setiap angka di atas keluar dari langkah-langkah ini persis di MacBook standar, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.
Mari kita mulai.
Langkah 1: Dapatkan endpoint yang diam
Kedua harness sangat bergantung pada pemanggilan fungsi, jadi sebelum menginstal apa pun, buktikan endpoint melayani alat:
plaintext1curl -s https://api.atlascloud.ai/v1/models \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'
Keluaran nyata dari panggilan itu:
plaintext1{ 2 "id": "deepseek-ai/deepseek-v4-pro", 3 "context_length": 1048576, 4 "max_output_length": 393216, 5 "supported_features": ["json_mode", "tools", "structured_outputs"] 6}
tools dalam daftar itu adalah hal yang Anda periksa. Tanpa alat, tidak ada loop agen, dan kedua harness akan gagal dengan cara yang membingungkan alih-alih mengatakannya.
Ambil kunci Anda dari halaman model DeepSeek V4 Pro, lalu export ATLAS_API_KEY=... sebelum setiap perintah di bawah.
Satu kendala untuk sisi Hermes: respons membungkus larik sebagai {"code":200,"msg":"succeed","data":[...]}. Hermes memeriksa /v1/models selama pengaturan dan menguraikannya dengan baik, tetapi jika Anda menulis alat Anda sendiri untuk melawannya, jangan harapkan daftar kosong.
Langkah 2: Instal kedua agen
plaintext1# DeepSeek Harness 2npm install @deepseek-ai/dsh 3 4# Hermes Agent 5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
Tiga catatan instalasi yang memakan waktu saya:
- dsh membutuhkan Node
^22.19.0 || >=24.0.0. Itu tidak mendukung 23.x. Sebagian besar tutorial mengatakan "Node 20+", yang sebenarnya salah. - Instalasi npm itu menarik 453 paket dan memakan waktu 8 menit. Itu bukan dependensi kecil.
- Hermes membawa Python 3.11 sendiri melalui
uv, jadi Python sistem Anda tidak masalah (saya punya 3.9). Jika penginstal mati di tengah unduhan karena gangguan PyPI, jalankan ulang sinkronisasi dependensi daripada seluruh skrip.
Langkah 3: Arahkan DeepSeek Harness ke endpoint
Tulis ini ke dalam $DSH_HOME/settings.yaml (bawaan ~/.dsh):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 displayName: Atlas Cloud 5 apiKeyEnv: ATLAS_API_KEY 6 api: openai-completions 7 baseURL: https://api.atlascloud.ai/v1 8 defaultContextWindow: 1048576 9 defaultMaxTokens: 65536 10 compat: 11 thinkingFormat: deepseek 12 models: 13 - id: deepseek-ai/deepseek-v4-pro 14 name: DeepSeek V4 Pro 15 reasoningEfforts: 16 off: 17 high: high 18 - id: deepseek-ai/deepseek-v4-flash 19 name: DeepSeek V4 Flash 20 reasoningEfforts: 21 off: 22 high: high 23agent-default-model: 24 provider: atlas 25 model: deepseek-ai/deepseek-v4-pro
Tiga baris di dalamnya pantas mendapatkan satu kalimat masing-masing, karena mendapatkan salah satunya salah akan mengubah tagihan Anda:
compat.thinkingFormat: deepseekadalah baris yang tidak ditulis siapa pun. dsh menebak dialek berpikir dari URL endpoint. README adaptornya sendiri blak-blakan tentangnya: URL gateway pribadi tidak mengatakan apa pun, jadi endpoint yang tidak dikenal akan dialamatkan "seolah-olah itu adalah OpenAI sendiri". Gateway dialek DeepSeek Anda kemudian akan diajak bicara dalam dialek OpenAI. Kunci ini hanya ada di bawahapi: openai-completions.- Timpa
defaultContextWindow. Fallback tingkat rute adalah 262.144 konteks dan 32.768 token maks. Mendeklarasikan model V4 secara manual tanpa menyentuhnya berarti Anda telah diam-diam membuang 75% dari jendela 1.048.576. agent-default-modelmengambilproviderdanmodelsebagai dua kunci terpisah. Menulismodel: atlas/deepseek-ai/deepseek-v4-prosebagai satu string terlihat masuk akal dan tidak melakukan apa pun. Anda mendapatkanMISSING_CREDENTIAL: no API key for provider route "deepseek-official", dan Anda akan mencari masalah kunci yang tidak Anda miliki.
Perhatikan bahwa apiKeyEnv adalah referensi kredensial, bukan rahasianya. Tidak ada kunci yang masuk dalam file ini.
Langkah 4: Arahkan Hermes ke endpoint yang sama
Jalur wizard adalah hermes model, lalu pilih "Custom endpoint". Jalur yang dapat diskrip adalah lima perintah:
plaintext1hermes config set model.provider custom 2hermes config set model.default deepseek-ai/deepseek-v4-pro 3hermes config set model.base_url https://api.atlascloud.ai/v1 4hermes config set model.api_key "$ATLAS_API_KEY" 5hermes config set model.context_length 1048576
Yang menulis ~/.hermes/config.yaml:
plaintext1model: 2 provider: custom 3 default: deepseek-ai/deepseek-v4-pro 4 base_url: https://api.atlascloud.ai/v1 5 api_key: apikey-... 6 context_length: 1048576
provider: custom adalah penyedia kelas satu di sini, bukan alias, dan URL dasar harus diakhiri dengan /v1 karena Hermes menambahkan /chat/completions sendiri (dokumen Hermes Agent, Configuring Models, 2026).
Jangan lewatkan baris api_key itu. Dokumen mengatakan kunci fallback ke OPENAI_API_KEY, dan dalam proses saya, mengekspor variabel itu tidak cukup: Hermes mengirim permintaan tanpa otentikasi yang dapat digunakan dan Atlas menjawab HTTP 401: {"code":401,"msg":"unauthorized"}. Mengatur model.api_key secara eksplisit memperbaikinya pada percobaan berikutnya, dalam 8,5 detik.
Langkah 5: Jalankan putaran 1 pada keduanya
Kosongkan direktori skills Hermes terlebih dahulu (~/.hermes/skills). Skill yang sudah ada sebelumnya membuat putaran 1 menjadi tidak adil, dan putaran 2 adalah tempat Anda ingin melihat skill dibuat dan kemudian digunakan kembali.
Kemudian berikan kedua harness ini, byte demi byte:
plaintext1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks, 2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step. 3Then append an inline <script id="selftest"> block that asserts three physics invariants 4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas) 5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only 6when all three asserts print PASS. Report the number of tool calls you used.
Pengaturan: direktori kosong baru per harness, penalaran dibiarkan aktif, keluaran maksimal setidaknya 32.768, dan tidak ada yang lain berjalan di mesin sehingga angka waktu tempuh berarti sesuatu.
plaintext1# dsh, sesi tersimpan satu kali 2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)" 3 4# Hermes, satu kali dengan laporan penggunaan yang dapat dibaca mesin 5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json
Dua hal akan mengejutkan Anda di sini.
Pertama, hermes -z tidak mencetak apa pun sampai selesai. Tidak ada spanduk, tidak ada spinner, tidak ada pratinjau alat. Milik saya diam selama 13 menit dan tampak macet; sebenarnya tidak, itu sedang bekerja melalui 38 panggilan API. Periksa ps untuk child shell jika Anda butuh kepastian.
Kedua, Hermes mengabaikan direktori kerja saya dan menulis game.html ke $HOME sebagai gantinya. Jika Anda ingin file di tempat Anda meluncurkan, berikan --no-restore-cwd atau --in DIR. Saya kehilangan satu putaran karena itu.
Sementara itu, dsh selesai dalam 121 detik dan UI Web-nya akan membaca sesi yang sama kembali:

UI Web DeepSeek Harness menunjukkan sesi Breakout yang selesai, tiga pernyataan PASS, 9 langkah, dan 133K token masukan di DeepSeek V4 Pro
UI Web dsh pada 127.0.0.1:3080. Perhatikan bilah status: 9 langkah, cache hit 89%, masukan 133K token, dan pemilih model yang membaca DeepSeek V4 Pro dari konfigurasi Langkah 3.
--usage-file di sisi Hermes benar-benar berguna dan kurang terdokumentasi: ia menulis token masukan, token keluaran, pembacaan cache, token penalaran, api_calls, dan perkiraan biaya ke JSON, dan ia menulis file itu bahkan ketika proses gagal.
dsh tidak memiliki flag yang setara, tetapi tidak membutuhkannya. Log sesi append-only-nya menyimpan semuanya, dengan satu jebakan. Log di $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd adalah aliran zstd multi-frame, satu frame per flush. zlib.zstdDecompressSync(buf) hanya mengembalikan frame pertama, jadi log 150KB didekode menjadi beberapa ratus byte dan tampak kosong. Pisahkan sendiri pada byte ajaib:
plaintext1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = []; 2for (let i = 0; i < buf.length - 4; i++) 3 if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i); 4const text = offs 5 .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString()) 6 .join('');
Penggunaan hidup di peristiwa assistant/chunk di mana data.chunk.type === 'usage', satu tingkat lebih dalam dari yang Anda duga (data.chunk.usage.inputTokens). Panggilan alat berasal dari blok konten assistant/message bertipe tool-call. Dan request/header.data.header.config menunjukkan model dan maxTokens yang benar-benar dikirim melalui kabel, yang merupakan cara Anda membuktikan konfigurasi Langkah 3 Anda berlaku alih-alih berharap.
Langkah 6: Putaran 2, permintaan perubahan
Direktori yang sama, game.html sudah ada dari putaran 1. Sekarang minta keduanya untuk perubahan:
plaintext1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle 2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up 3timer. Same file, no libraries.
Ini adalah putaran yang memisahkan kedua desain. Hermes menulis skill setelah tugas kompleks dan menyimpan memori tiga lapis, jadi putaran 2 adalah tempat skill putaran 1 akan membuahkan hasil atau tidak. dsh tidak memiliki memori jangka panjang sama sekali, tetapi ia memiliki log sesi append-only yang dapat Anda fork dan putar ulang dari tengah proses alih-alih memulai ulang.
Bersikaplah jujur pada diri sendiri tentang anggaran sebelum memulai yang satu ini. Putaran 2 saya mati 11 panggilan alat karena batas pengeluaran harian, itulah sebabnya tabel di atas memiliki dua baris kosong daripada dua baris yang dibuat-buat. Dasbor Hermes sendiri menunjukkan alasannya:

Halaman sesi dasbor Hermes Agent yang mencantumkan proses Breakout dengan 76 pesan di deepseek-v4-pro
Hermes v0.20.4 membaca kembali sesinya sendiri. Proses Breakout yang selesai adalah 76 pesan, semuanya di deepseek-v4-pro melalui endpoint Atlas.
Langkah 7: Baca tagihannya
Dua angka per proses, dari log harness itu sendiri, jangan pernah dari ringkasan agen:
plaintext1# Hermes 2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json 3 4# dsh: agregat log sesi yang didekode 5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"
Kemudian periksa silang dengan halaman penggunaan penyedia Anda. Ketika log harness dan penyedia tidak setuju, percayalah pada penyedia: itulah angka yang Anda bayar.
Sebagai perbandingan, bilah status dsh sendiri setuju dengan pengurai log saya dalam batas pembulatan (133K token masukan, 89% cache hit terhadap 132.600 dan 88,8% yang saya hitung). Peralatannya jujur. Ringkasan bahasa Inggris agen tidak.
Melampaui DeepSeek Harness vs Hermes: Jalankan Keduanya sebagai Otak dan Lengan
Inilah jawaban yang tidak ditawarkan siapa pun dalam perdebatan "yang mana": Anda tidak harus memilih.
Kedua proyek gagal dalam arah yang berlawanan, yang membuat mereka menjadi rekan setim yang sangat baik.
| Kemampuan | DeepSeek Harness (dsh) | Hermes Agent |
|---|---|---|
| Proses pengkodean | Kuat, ini target desainnya | Menyelesaikan tugas yang sama dalam 6,4x waktu |
| Memori jangka panjang | Tidak ada | Tiga lapis, dikurasi agen |
| Skill yang meningkat sendiri | Tidak ada | Ya, kompatibel dengan agentskills.io |
| Fork / putar ulang log sesi | Ya, JSONL append-only | Pencarian sesi dengan peringkasan LLM |
| Cron bawaan | Tidak | Ya, jadwal bahasa alami |
| Permukaan obrolan | Tidak | Telegram, Discord, Slack, WhatsApp, Signal |
| Antarmuka | UI Web, TUI, tanpa kepala | TUI, CLI, dasbor, gateway |
| Runtime | Node 22.19+/24+ | Python 3.11 (dibundel) |
| Kematangan | 0.1 pratinjau pengembang, perubahan merusak | Dirilis Feb 2026, v0.20.4 |
| Lisensi / bintang | MIT, 176,5k | MIT, 233,6k |
Jumlah bintang dibaca dari kedua repositori pada 2026-08-21 (deepseek-ai/deepseek-harness dengan 176,5k bintang dan 19,2k fork, NousResearch/hermes-agent dengan 233,6k bintang dan 46,8k fork). Perhatikan lintasannya, bukan totalnya: dsh berada di 144.361 bintang saat saya periksa pada 2026-08-17, jadi ia menambahkan sekitar 32.000 dalam empat hari.
Tiga cara untuk menggabungkannya:
- Otak dan lengan. Hermes di V4 Pro memegang memori, jadwal, dan utas Telegram. Ia mendelegasikan pengkodean sebenarnya ke dsh di tingkat murah. Satu kunci mencakup keduanya, jadi Anda tidak mengelola dua hubungan penagihan.
- Tingkat murah untuk loop, tingkat mahal untuk keputusan. Pekerjaan cron berulang berjalan di
deepseek-v3.2atau DeepSeek V4 Flash; panggilan sulit naik ke Pro. - Tanpa kepala keduanya. dsh
--profile headlessdan Hermes-zkeduanya menerima perintah dan mencetak satu jawaban, sehingga keduanya dapat dimasukkan ke dalam skrip shell atau langkah CI tanpa TUI.
Peringatan wajar tentang kelemahan jujur, karena perbandingan yang hanya mencantumkan kekuatan adalah iklan. dsh adalah pratinjau pengembang 0.1 dan mengatakannya di UI-nya sendiri: ia akan rusak antar versi, ia tidak memiliki memori, ia tidak memiliki saluran pesan asli, dan ia kurang melaporkan panggilan alatnya sendiri. Hermes adalah proyek yang lebih matang dengan margin lebar, tetapi ia lebih berat per token dengan faktor 8, ia diam selama 13 menit untuk tugas yang diselesaikan dsh dalam 2 menit, dan ia menulis file keluaran saya ke direktori yang salah.
Berapa Biaya Sebenarnya DeepSeek Harness vs Hermes Per Tugas
Sekarang aritmetikanya, dengan asumsi yang terbuka.
Atlas menerbitkan satu tarif masukan untuk V4 Pro ($1,68 per 1M) tanpa tarif cache hit terpisah di halaman model. Jadi saya memberi harga setiap token perintah dengan tarif masukan penuh, termasuk pembacaan cache. Itu adalah batas atas yang konservatif, bukan tebakan yang dikemas sebagai pengukuran.
Contoh perhitungan, dsh putaran 1:
- Perintah: 14.840 segar + 117.760 cache = 132.600 token. Pada $1,68/1M itu $0,2228.
- Keluaran: 5.231 token. Pada $3,38/1M itu $0,0177.
- Total: $0,2404 per tugas.
Metode yang sama pada Hermes putaran 1: 1.111.573 token perintah adalah $1,8674, ditambah 19.317 token keluaran sebesar $0,0653, menjadi $1,9327. --usage-file Hermes sendiri memperkirakan $0,2817 untuk proses itu, yang menyiratkan ia mengasumsikan tarif masukan cache mendekati $0,125 per 1M. Jika penyedia Anda benar-benar mendiskon pembacaan cache setajam itu, kedua angka di bawah turun bersama dan rasio di antara keduanya hampir tidak berubah.
| Skenario | Per tugas di V4 Pro | Per tugas di V4 Flash | 20 tugas/hari, 30 hari (Pro) |
|---|---|---|---|
| dsh putaran 1 | $0,24 | $0,02 | $144,27 |
| Hermes putaran 1 | $1,93 | $0,16 | $1.159,64 |
| Putaran 2, harness mana pun | tidak selesai | tidak selesai | tidak selesai |
Dua hal yang menonjol dari tabel itu.
Pilihan harness bernilai 8x. Model yang sama, tugas yang sama, hasil yang sama, dan satu cangkang berharga delapan kali lipat dari yang lain. Itu bukan perbedaan pembulatan yang Anda optimalkan nanti.
Tingkat model bernilai 12x di atasnya. Itulah sebabnya pemisahan otak-dan-lengan bukanlah gimmick: dsh di Flash mendarat di dua sen per tugas, dan Hermes di Pro mendarat di hampir dua dolar untuk gim Breakout yang identik.
Dan optimasi termurah dari semuanya masih dari Langkah 3. Sebuah rute dsh yang dibiarkan pada bawaan 262.144 melakukan lebih banyak pekerjaan kompresi dalam lebih banyak langkah untuk menyesuaikan pekerjaan yang sama, dan Anda membayar untuk setiap langkah itu.
Itulah jawaban sebenarnya untuk DeepSeek Harness vs Hermes: ukur cangkang Anda sendiri sebelum Anda pergi berbelanja model yang lebih murah.
FAQ DeepSeek Harness vs Hermes
Bisakah Hermes Agent dan DeepSeek Harness menggunakan model dan kunci API yang sama?
Ya, dan itu adalah satu-satunya cara jujur untuk membandingkannya. Keduanya berbicara ke endpoint yang kompatibel dengan OpenAI. dsh membutuhkan rute penyedia llm-pi-ai dengan api: openai-completions plus baseURL; Hermes membutuhkan provider: custom plus base_url yang diakhiri dengan /v1. Satu kunci, kedua harness, kedua tingkat harga. Konfigurasi lengkap ada di Langkah 3 dan 4.
Apakah DeepSeek Harness lebih baik dari Hermes untuk pengkodean?
Pada pengujian ini, jelas ya: 121 detik dibandingkan 780, 8 panggilan alat dibandingkan 35, dan seperdelapan dari pengeluaran token, dengan keduanya lulus semua tiga self-test. Tetapi "lebih baik untuk pengkodean" bukanlah "lebih baik". Jika yang Anda butuhkan adalah pekerjaan terjadwal yang melapor ke Telegram setiap pagi dan mengingat apa yang dipelajari minggu lalu, dsh tidak memiliki semua itu dan Hermes memilikinya.
Apakah DeepSeek Harness dan Hermes gratis dan sumber terbuka?
Keduanya berlisensi MIT dan gratis untuk diunduh. Yang Anda bayar adalah token, dan seperti yang ditunjukkan tabel di atas, itu bukan kesalahan pembulatan. Perlu diulang bahwa dsh secara eksplisit adalah pratinjau pengembang di 0.1 dan memperingatkan tentang perubahan yang merusak kompatibilitas di UI-nya sendiri, jadi pin versi Anda jika akan digunakan di dekat produksi.
Mengapa tugas yang sama lebih mahal di satu harness?
Empat alasan, kira-kira berdasarkan urutan besarnya:
- Pembacaan ulang percakapan. Token perintah cache adalah 88,8% dari total dsh dan 95,5% milik Hermes. Setiap langkah tambahan mengirim ulang semua yang sebelumnya.
- System prompt dan skema alat. Diukur di atas: 10.898 vs 13.892 token sebelum pekerjaan terjadi.
- Jumlah langkah. 8 panggilan alat dan 9 langkah dibandingkan 35 panggilan alat di seluruh 38 panggilan API.
- Jendela yang dibatasi. dsh fallback ke 262.144 alih-alih 1.048.576 memaksa pekerjaan kompresi ekstra pada tugas panjang.
Bisakah saya menjalankan DeepSeek Harness dan Hermes secara bersamaan?
Ya. Mereka tidak berbagi apa pun selain kunci API Anda: runtime berbeda, direktori konfigurasi berbeda, penyimpanan sesi berbeda, port berbeda (3080 dan 9119 secara bawaan). Pola yang biasa adalah Hermes sebagai otak yang selalu aktif di tingkat mahal dan dsh sebagai lengan pengkodean di tingkat murah.
Apakah DeepSeek Harness hanya bekerja dengan API DeepSeek sendiri?
Tidak, dan ini adalah kesalahpahaman paling umum tentangnya. Gateway apa pun yang kompatibel dengan OpenAI berfungsi melalui api: openai-completions dan baseURL. Ingat saja compat.thinkingFormat: deepseek, karena dsh menyimpulkan dialek berpikir dari URL, dan URL gateway pihak ketiga tidak memberi tahu apa pun.






