Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

DeepSeek Harness vs Hermes: Yang Mana Menghabiskan Lebih Banyak Token?

DeepSeek Harness vs Hermes: Mana yang Menghabiskan Lebih Banyak Token?

Anda menjalankan tugas di Hermes kemarin. Anda menjalankan tugas yang terasa sama di dsh hari ini. Model yang sama, kunci API yang sama, laptop yang sama. Angka pemakaiannya tetap berbeda.

Mata Anda baik-baik saja. Tidak ada yang berubah harga dalam semalam.

Inilah yang hampir semua perbandingan DeepSeek Harness vs Hermes lewatkan: harness adalah cangkang yang membungkus model, dan cangkang itulah yang menentukan berapa banyak konteks yang keluar per langkah, berapa banyak alat yang diiklankan, seberapa sering ia mencoba ulang, dan apakah ia mengirim ulang seluruh percakapan pada setiap panggilan. Ubah cangkangnya, ubah tagihannya.

Jadi saya kunci variabel model dan mengukurnya. Dua harness, satu endpoint, satu deepseek-ai/deepseek-v4-pro, satu perintah, satu mesin, satu sore. Tugas yang sama, keduanya menyelesaikannya, dan salah satunya memindahkan 8,4x lebih banyak token perintah daripada yang lain.

Poin penting

  • Model yang sama, tugas yang sama, keduanya lulus: dsh memakan waktu 121 detik, Hermes memakan waktu 780 detik.
  • Hermes memindahkan 1.111.573 token perintah dibandingkan 132.600 milik dsh. Itu 8,4x, dalam satu tugas.
  • Sebelum agen mana pun melakukan apa pun, system prompt-nya sudah menghabiskan token: dsh 10.898 vs Hermes 13.892 hanya untuk menjawab "OK".
  • dsh secara diam-diam membatasi Anda pada konteks 262.144 kecuali Anda menimpa defaultContextWindow, membuang 75% dari jendela V4.
  • Pilih dsh untuk pengkodean, Hermes untuk memori, cron, dan antarmuka obrolan. Atau jalankan keduanya.

Bengkel teknik terbagi dengan blok mesin telanjang yang dijepit ke rig test-harness baja di kiri dan robot kuningan di kanan, keduanya diberi makan oleh satu jalur bahan bakar tembaga

Satu jalur bahan bakar, dua rig pengujian. Itulah keseluruhan eksperimen. Dihasilkan dengan openai/gpt-image-2.

DeepSeek Harness vs Hermes, Model yang Sama, Tugas yang Sama

Kedua harness mendapatkan ini, kata demi kata: buat clone Breakout satu file dengan paddle, 5 baris bata, penghitung skor live, jeda tombol P, ditambah self-test inline yang menegaskan tiga invarian fisika dan mencetak PASS atau FAIL. Kemudian jalankan tanpa kepala dan perbaiki sampai ketiganya mencetak PASS.

Tanpa library. Tanpa CDN. Tanpa langkah build.

Keduanya benar-benar melakukannya. Berikut dua filenya, dirender di peramban sungguhan.

Perbandingan berdampingan animasi dari dua build Breakout yang berjalan: DeepSeek Harness (dsh) di kiri, Hermes Agent di kanan, keduanya diputar otomatis dari perintah DeepSeek V4 Pro yang identik

Kedua build direkam ulang berdampingan dan dibiarkan diputar otomatis, sehingga Anda dapat melihat masing-masing benar-benar berjalan. Kiri: dsh, yang gimnya mulai otomatis. Kanan: Hermes , yang gimnya mulai dalam keadaan jeda, lalu berjalan. Perintah satu file yang sama, DeepSeek V4 Pro yang sama, dua harness.

Sekarang angka-angka yang benar-benar menentukan hal ini.

ProsesWaktu tempuhPanggilan alatToken perintah (segar + cache)Token keluaranBiaya di V4 Pro
dsh, putaran 1121,2 detik814.840 + 117.760 = 132.6005.231$0,24
Hermes, putaran 1780 detik3549.685 + 1.061.888 = 1.111.57319.317$1,93
dsh, putaran 2tidak selesai11 sebelum batas44.291 + 132.6082.463tidak selesai
Hermes, putaran 2tidak selesaitidak dijalankantidak selesaitidak selesaitidak selesai

Diukur pada 2026-08-21 di deepseek-ai/deepseek-v4-pro, satu mesin, direktori kerja kosong per proses. Hitungan token dibaca mesin: dsh dari log sesinya, Hermes dari JSON --usage-file-nya. Perhatikan bahwa kedua hitungan alat tidak bersumber dari cara yang sama: 8 milik dsh dihitung dari lognya (diklaim 6), sementara 35 milik Hermes adalah laporannya sendiri, dengan file penggunaannya mencatat 38 panggilan API. Metode biaya dijelaskan di bagian terakhir.

Mengapa dua baris kosong? Putaran 2 tidak pernah berjalan, dan alasannya adalah titik data tunggal terbaik artikel ini. Putaran 1 Hermes sendiri mendorong 1,13 juta token melalui akun tersebut, dan di tengah jalan putaran 2 dsh, endpoint menjawab:

plaintext
1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded",
2"message":"Member day spend limit reached (set by your team admin);
3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}

Satu agen, satu gim Breakout, satu batas anggaran harian. Saya tidak mengisi sel-sel itu dengan perkiraan.

Satu detail lagi yang perlu ditandai. dsh melaporkan "Tool calls used: 6" dalam jawaban akhirnya. Log sesinya sendiri mencatat 8. Agen adalah narator yang tidak dapat diandalkan tentang pengeluaran mereka sendiri, dan itulah tepatnya mengapa pengujian ini membaca log daripada ringkasan.

Mengapa Sebagian Besar Perbandingan DeepSeek Harness vs Hermes Rusak

Putusan dulu: hampir setiap halaman yang masuk peringkat untuk kata kunci ini mengukur variabel yang salah, dan Anda dapat melihatnya dalam satu baris pengaturan mereka.

Modelnya, bukan cangkangnya, yang diukur oleh pengujian tersebut

Baca hasil teratas. Polanya berulang: jalankan dsh pada model DeepSeek, jalankan Hermes pada apa pun yang sudah diarahkan Hermes, lalu atribusikan seluruh perbedaan ke harness.

Itu bukan perbandingan harness. Itu adalah perbandingan model yang memakai label berbentuk harness.

Jika dsh menggunakan V4 Pro dan Hermes menggunakan yang lain, delta yang Anda ukur sebagian besar adalah dua model tersebut, dan kontribusi cangkang terkubur tak terselamatkan. Jadi pengujian ini melakukan hal yang membosankan namun perlu: kedua harness menunjuk ke URL dasar yang sama, ID model yang sama, kunci yang sama.

Pilihan harness menggerakkan angka dengan sendirinya

Ingin bukti bahwa cangkang saja mahal? Minta masing-masing untuk tidak melakukan apa pun.

Saya mengirim keduanya perintah sepele yang sama: Reply with exactly the word: OK. Tidak perlu alat, tidak perlu file, tidak perlu berpikir.

HarnessToken perintah untuk mengatakan "OK"Token keluaranWaktu tempuh
DeepSeek Harness (dsh)10.89825,6 detik
Hermes Agent13.892 (+1.024 cache)178,5 detik

Model yang sama. Pertanyaan yang sama. Kesenjangan 2.994 token sebelum pekerjaan nyata dimulai, karena kesenjangan itu adalah harness: system prompt-nya, skema alatnya, file aturannya. Hermes mengirimkan lebih banyak area permukaan, jadi Hermes mengirimkan lebih banyak token.

Sekarang kalikan dengan loop agen 38 panggilan di mana setiap panggilan mengirim ulang percakapan sejauh ini. Pembacaan cache adalah 88,8% dari token perintah dsh dan 95,5% milik Hermes. Pembacaan ulang itulah tagihannya.

Satu Endpoint, Dua Harness: Pengaturan DeepSeek V4

Untuk membandingkan cangkang, Anda perlu sisi model diam sempurna. Bukan hanya nama model yang sama: endpoint yang sama, batas kecepatan yang sama, harga yang sama pada jam 3 pagi maupun jam 3 sore.

Yang terakhir itu lebih penting daripada kedengarannya. Jika penyedia Anda mengenakan tarif puncak dan di luar jam sibuk, maka "putaran 1 di Hermes pada pukul 09:00" dan "putaran 2 di dsh pada pukul 11:00" bukanlah proses yang sebanding, dan Anda tidak akan pernah bisa mengurai berapa banyak delta yang disebabkan oleh harness dan berapa banyak oleh jam.

Jadi kedua harness di sini menunjuk ke satu endpoint kompatibel OpenAI tarif tetap di Atlas Cloud: https://api.atlascloud.ai/v1. Harga sama sepanjang hari, tanpa jendela puncak, tanpa antrian terpisah per harness, satu kunci untuk keduanya.

Peran dalam pengujianID modelKonteks / keluaran maksHarga per 1M masuk / keluar
Mesin utama untuk kedua harnessdeepseek-ai/deepseek-v4-pro1.048.576 / 393.216$1,68 / $3,38
Tingkat murah, peran "lengan"deepseek-ai/deepseek-v4-flash1.048.576 / 393.216$0,14 / $0,28
Pekerjaan cron jangka panjangdeepseek-ai/deepseek-v3.2163.840 / 163.840$0,26 / $0,38

Harga dibaca dari halaman model pada 2026-08-21. Tidak ada lencana diskon pada keluarga DeepSeek saat ini, jadi tidak ada apa pun di sini yang merupakan tarif promosi yang kedaluwarsa minggu depan.

Hal kecil yang mudah terlewatkan: /v1/models melaporkan deepseek-v4-pro dan deepseek-v4-flash sebagai fp4, sementara deepseek-v4-pro-0813 kembali sebagai fp8. Ingin bobot presisi lebih tinggi? Pin ID yang bertanggal.

Baik. Mari kita bangun.

Jalankan Pengujian DeepSeek Harness vs Hermes Sendiri

Pratinjau: tujuh langkah, dua file konfigurasi, satu perintah, dan Anda akan mendapatkan versi tabel itu sendiri alih-alih mempercayai milik saya. Buktinya berhasil: setiap angka di atas keluar dari langkah-langkah ini persis di MacBook standar, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.

Mari kita mulai.

Langkah 1: Dapatkan endpoint yang diam

Kedua harness sangat bergantung pada pemanggilan fungsi, jadi sebelum menginstal apa pun, buktikan endpoint melayani alat:

plaintext
1curl -s https://api.atlascloud.ai/v1/models \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'

Keluaran nyata dari panggilan itu:

plaintext
1{
2  "id": "deepseek-ai/deepseek-v4-pro",
3  "context_length": 1048576,
4  "max_output_length": 393216,
5  "supported_features": ["json_mode", "tools", "structured_outputs"]
6}

tools dalam daftar itu adalah hal yang Anda periksa. Tanpa alat, tidak ada loop agen, dan kedua harness akan gagal dengan cara yang membingungkan alih-alih mengatakannya.

Ambil kunci Anda dari halaman model DeepSeek V4 Pro, lalu export ATLAS_API_KEY=... sebelum setiap perintah di bawah.

Satu kendala untuk sisi Hermes: respons membungkus larik sebagai {"code":200,"msg":"succeed","data":[...]}. Hermes memeriksa /v1/models selama pengaturan dan menguraikannya dengan baik, tetapi jika Anda menulis alat Anda sendiri untuk melawannya, jangan harapkan daftar kosong.

Langkah 2: Instal kedua agen

plaintext
1# DeepSeek Harness
2npm install @deepseek-ai/dsh
3
4# Hermes Agent
5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

Tiga catatan instalasi yang memakan waktu saya:

  • dsh membutuhkan Node ^22.19.0 || >=24.0.0. Itu tidak mendukung 23.x. Sebagian besar tutorial mengatakan "Node 20+", yang sebenarnya salah.
  • Instalasi npm itu menarik 453 paket dan memakan waktu 8 menit. Itu bukan dependensi kecil.
  • Hermes membawa Python 3.11 sendiri melalui uv, jadi Python sistem Anda tidak masalah (saya punya 3.9). Jika penginstal mati di tengah unduhan karena gangguan PyPI, jalankan ulang sinkronisasi dependensi daripada seluruh skrip.

Langkah 3: Arahkan DeepSeek Harness ke endpoint

Tulis ini ke dalam $DSH_HOME/settings.yaml (bawaan ~/.dsh):

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      displayName: Atlas Cloud
5      apiKeyEnv: ATLAS_API_KEY
6      api: openai-completions
7      baseURL: https://api.atlascloud.ai/v1
8      defaultContextWindow: 1048576
9      defaultMaxTokens: 65536
10      compat:
11        thinkingFormat: deepseek
12      models:
13        - id: deepseek-ai/deepseek-v4-pro
14          name: DeepSeek V4 Pro
15          reasoningEfforts:
16            off:
17            high: high
18        - id: deepseek-ai/deepseek-v4-flash
19          name: DeepSeek V4 Flash
20          reasoningEfforts:
21            off:
22            high: high
23agent-default-model:
24  provider: atlas
25  model: deepseek-ai/deepseek-v4-pro

Tiga baris di dalamnya pantas mendapatkan satu kalimat masing-masing, karena mendapatkan salah satunya salah akan mengubah tagihan Anda:

  1. compat.thinkingFormat: deepseekadalah baris yang tidak ditulis siapa pun. dsh menebak dialek berpikir dari URL endpoint. README adaptornya sendiri blak-blakan tentangnya: URL gateway pribadi tidak mengatakan apa pun, jadi endpoint yang tidak dikenal akan dialamatkan "seolah-olah itu adalah OpenAI sendiri". Gateway dialek DeepSeek Anda kemudian akan diajak bicara dalam dialek OpenAI. Kunci ini hanya ada di bawah api: openai-completions.
  2. TimpadefaultContextWindow. Fallback tingkat rute adalah 262.144 konteks dan 32.768 token maks. Mendeklarasikan model V4 secara manual tanpa menyentuhnya berarti Anda telah diam-diam membuang 75% dari jendela 1.048.576.
  3. agent-default-modelmengambilproviderdanmodelsebagai dua kunci terpisah. Menulis model: atlas/deepseek-ai/deepseek-v4-pro sebagai satu string terlihat masuk akal dan tidak melakukan apa pun. Anda mendapatkan MISSING_CREDENTIAL: no API key for provider route "deepseek-official", dan Anda akan mencari masalah kunci yang tidak Anda miliki.

Perhatikan bahwa apiKeyEnv adalah referensi kredensial, bukan rahasianya. Tidak ada kunci yang masuk dalam file ini.

Langkah 4: Arahkan Hermes ke endpoint yang sama

Jalur wizard adalah hermes model, lalu pilih "Custom endpoint". Jalur yang dapat diskrip adalah lima perintah:

plaintext
1hermes config set model.provider custom
2hermes config set model.default deepseek-ai/deepseek-v4-pro
3hermes config set model.base_url https://api.atlascloud.ai/v1
4hermes config set model.api_key "$ATLAS_API_KEY"
5hermes config set model.context_length 1048576

Yang menulis ~/.hermes/config.yaml:

plaintext
1model:
2  provider: custom
3  default: deepseek-ai/deepseek-v4-pro
4  base_url: https://api.atlascloud.ai/v1
5  api_key: apikey-...
6  context_length: 1048576

provider: custom adalah penyedia kelas satu di sini, bukan alias, dan URL dasar harus diakhiri dengan /v1 karena Hermes menambahkan /chat/completions sendiri (dokumen Hermes Agent, Configuring Models, 2026).

Jangan lewatkan baris api_key itu. Dokumen mengatakan kunci fallback ke OPENAI_API_KEY, dan dalam proses saya, mengekspor variabel itu tidak cukup: Hermes mengirim permintaan tanpa otentikasi yang dapat digunakan dan Atlas menjawab HTTP 401: {"code":401,"msg":"unauthorized"}. Mengatur model.api_key secara eksplisit memperbaikinya pada percobaan berikutnya, dalam 8,5 detik.

Langkah 5: Jalankan putaran 1 pada keduanya

Kosongkan direktori skills Hermes terlebih dahulu (~/.hermes/skills). Skill yang sudah ada sebelumnya membuat putaran 1 menjadi tidak adil, dan putaran 2 adalah tempat Anda ingin melihat skill dibuat dan kemudian digunakan kembali.

Kemudian berikan kedua harness ini, byte demi byte:

plaintext
1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks,
2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step.
3Then append an inline <script id="selftest"> block that asserts three physics invariants
4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas)
5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only
6when all three asserts print PASS. Report the number of tool calls you used.

Pengaturan: direktori kosong baru per harness, penalaran dibiarkan aktif, keluaran maksimal setidaknya 32.768, dan tidak ada yang lain berjalan di mesin sehingga angka waktu tempuh berarti sesuatu.

plaintext
1# dsh, sesi tersimpan satu kali
2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)"
3
4# Hermes, satu kali dengan laporan penggunaan yang dapat dibaca mesin
5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json

Dua hal akan mengejutkan Anda di sini.

Pertama, hermes -z tidak mencetak apa pun sampai selesai. Tidak ada spanduk, tidak ada spinner, tidak ada pratinjau alat. Milik saya diam selama 13 menit dan tampak macet; sebenarnya tidak, itu sedang bekerja melalui 38 panggilan API. Periksa ps untuk child shell jika Anda butuh kepastian.

Kedua, Hermes mengabaikan direktori kerja saya dan menulis game.html ke $HOME sebagai gantinya. Jika Anda ingin file di tempat Anda meluncurkan, berikan --no-restore-cwd atau --in DIR. Saya kehilangan satu putaran karena itu.

Sementara itu, dsh selesai dalam 121 detik dan UI Web-nya akan membaca sesi yang sama kembali:

UI Web DeepSeek Harness menunjukkan sesi Breakout yang selesai, tiga pernyataan PASS, 9 langkah, dan 133K token masukan di DeepSeek V4 Pro

UI Web dsh pada 127.0.0.1:3080. Perhatikan bilah status: 9 langkah, cache hit 89%, masukan 133K token, dan pemilih model yang membaca DeepSeek V4 Pro dari konfigurasi Langkah 3.

--usage-file di sisi Hermes benar-benar berguna dan kurang terdokumentasi: ia menulis token masukan, token keluaran, pembacaan cache, token penalaran, api_calls, dan perkiraan biaya ke JSON, dan ia menulis file itu bahkan ketika proses gagal.

dsh tidak memiliki flag yang setara, tetapi tidak membutuhkannya. Log sesi append-only-nya menyimpan semuanya, dengan satu jebakan. Log di $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd adalah aliran zstd multi-frame, satu frame per flush. zlib.zstdDecompressSync(buf) hanya mengembalikan frame pertama, jadi log 150KB didekode menjadi beberapa ratus byte dan tampak kosong. Pisahkan sendiri pada byte ajaib:

plaintext
1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = [];
2for (let i = 0; i < buf.length - 4; i++)
3  if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i);
4const text = offs
5  .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString())
6  .join('');

Penggunaan hidup di peristiwa assistant/chunk di mana data.chunk.type === 'usage', satu tingkat lebih dalam dari yang Anda duga (data.chunk.usage.inputTokens). Panggilan alat berasal dari blok konten assistant/message bertipe tool-call. Dan request/header.data.header.config menunjukkan model dan maxTokens yang benar-benar dikirim melalui kabel, yang merupakan cara Anda membuktikan konfigurasi Langkah 3 Anda berlaku alih-alih berharap.

Langkah 6: Putaran 2, permintaan perubahan

Direktori yang sama, game.html sudah ada dari putaran 1. Sekarang minta keduanya untuk perubahan:

plaintext
1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle
2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up
3timer. Same file, no libraries.

Ini adalah putaran yang memisahkan kedua desain. Hermes menulis skill setelah tugas kompleks dan menyimpan memori tiga lapis, jadi putaran 2 adalah tempat skill putaran 1 akan membuahkan hasil atau tidak. dsh tidak memiliki memori jangka panjang sama sekali, tetapi ia memiliki log sesi append-only yang dapat Anda fork dan putar ulang dari tengah proses alih-alih memulai ulang.

Bersikaplah jujur pada diri sendiri tentang anggaran sebelum memulai yang satu ini. Putaran 2 saya mati 11 panggilan alat karena batas pengeluaran harian, itulah sebabnya tabel di atas memiliki dua baris kosong daripada dua baris yang dibuat-buat. Dasbor Hermes sendiri menunjukkan alasannya:

Halaman sesi dasbor Hermes Agent yang mencantumkan proses Breakout dengan 76 pesan di deepseek-v4-pro

Hermes v0.20.4 membaca kembali sesinya sendiri. Proses Breakout yang selesai adalah 76 pesan, semuanya di deepseek-v4-pro melalui endpoint Atlas.

Langkah 7: Baca tagihannya

Dua angka per proses, dari log harness itu sendiri, jangan pernah dari ringkasan agen:

plaintext
1# Hermes
2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json
3
4# dsh: agregat log sesi yang didekode
5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"

Kemudian periksa silang dengan halaman penggunaan penyedia Anda. Ketika log harness dan penyedia tidak setuju, percayalah pada penyedia: itulah angka yang Anda bayar.

Sebagai perbandingan, bilah status dsh sendiri setuju dengan pengurai log saya dalam batas pembulatan (133K token masukan, 89% cache hit terhadap 132.600 dan 88,8% yang saya hitung). Peralatannya jujur. Ringkasan bahasa Inggris agen tidak.

Melampaui DeepSeek Harness vs Hermes: Jalankan Keduanya sebagai Otak dan Lengan

Inilah jawaban yang tidak ditawarkan siapa pun dalam perdebatan "yang mana": Anda tidak harus memilih.

Kedua proyek gagal dalam arah yang berlawanan, yang membuat mereka menjadi rekan setim yang sangat baik.

KemampuanDeepSeek Harness (dsh)Hermes Agent
Proses pengkodeanKuat, ini target desainnyaMenyelesaikan tugas yang sama dalam 6,4x waktu
Memori jangka panjangTidak adaTiga lapis, dikurasi agen
Skill yang meningkat sendiriTidak adaYa, kompatibel dengan agentskills.io
Fork / putar ulang log sesiYa, JSONL append-onlyPencarian sesi dengan peringkasan LLM
Cron bawaanTidakYa, jadwal bahasa alami
Permukaan obrolanTidakTelegram, Discord, Slack, WhatsApp, Signal
AntarmukaUI Web, TUI, tanpa kepalaTUI, CLI, dasbor, gateway
RuntimeNode 22.19+/24+Python 3.11 (dibundel)
Kematangan0.1 pratinjau pengembang, perubahan merusakDirilis Feb 2026, v0.20.4
Lisensi / bintangMIT, 176,5kMIT, 233,6k

Jumlah bintang dibaca dari kedua repositori pada 2026-08-21 (deepseek-ai/deepseek-harness dengan 176,5k bintang dan 19,2k fork, NousResearch/hermes-agent dengan 233,6k bintang dan 46,8k fork). Perhatikan lintasannya, bukan totalnya: dsh berada di 144.361 bintang saat saya periksa pada 2026-08-17, jadi ia menambahkan sekitar 32.000 dalam empat hari.

Tiga cara untuk menggabungkannya:

  • Otak dan lengan. Hermes di V4 Pro memegang memori, jadwal, dan utas Telegram. Ia mendelegasikan pengkodean sebenarnya ke dsh di tingkat murah. Satu kunci mencakup keduanya, jadi Anda tidak mengelola dua hubungan penagihan.
  • Tingkat murah untuk loop, tingkat mahal untuk keputusan. Pekerjaan cron berulang berjalan di deepseek-v3.2 atau DeepSeek V4 Flash; panggilan sulit naik ke Pro.
  • Tanpa kepala keduanya. dsh --profile headless dan Hermes -z keduanya menerima perintah dan mencetak satu jawaban, sehingga keduanya dapat dimasukkan ke dalam skrip shell atau langkah CI tanpa TUI.

Peringatan wajar tentang kelemahan jujur, karena perbandingan yang hanya mencantumkan kekuatan adalah iklan. dsh adalah pratinjau pengembang 0.1 dan mengatakannya di UI-nya sendiri: ia akan rusak antar versi, ia tidak memiliki memori, ia tidak memiliki saluran pesan asli, dan ia kurang melaporkan panggilan alatnya sendiri. Hermes adalah proyek yang lebih matang dengan margin lebar, tetapi ia lebih berat per token dengan faktor 8, ia diam selama 13 menit untuk tugas yang diselesaikan dsh dalam 2 menit, dan ia menulis file keluaran saya ke direktori yang salah.

Berapa Biaya Sebenarnya DeepSeek Harness vs Hermes Per Tugas

Sekarang aritmetikanya, dengan asumsi yang terbuka.

Atlas menerbitkan satu tarif masukan untuk V4 Pro ($1,68 per 1M) tanpa tarif cache hit terpisah di halaman model. Jadi saya memberi harga setiap token perintah dengan tarif masukan penuh, termasuk pembacaan cache. Itu adalah batas atas yang konservatif, bukan tebakan yang dikemas sebagai pengukuran.

Contoh perhitungan, dsh putaran 1:

  • Perintah: 14.840 segar + 117.760 cache = 132.600 token. Pada $1,68/1M itu $0,2228.
  • Keluaran: 5.231 token. Pada $3,38/1M itu $0,0177.
  • Total: $0,2404 per tugas.

Metode yang sama pada Hermes putaran 1: 1.111.573 token perintah adalah $1,8674, ditambah 19.317 token keluaran sebesar $0,0653, menjadi $1,9327. --usage-file Hermes sendiri memperkirakan $0,2817 untuk proses itu, yang menyiratkan ia mengasumsikan tarif masukan cache mendekati $0,125 per 1M. Jika penyedia Anda benar-benar mendiskon pembacaan cache setajam itu, kedua angka di bawah turun bersama dan rasio di antara keduanya hampir tidak berubah.

SkenarioPer tugas di V4 ProPer tugas di V4 Flash20 tugas/hari, 30 hari (Pro)
dsh putaran 1$0,24$0,02$144,27
Hermes putaran 1$1,93$0,16$1.159,64
Putaran 2, harness mana puntidak selesaitidak selesaitidak selesai

Dua hal yang menonjol dari tabel itu.

Pilihan harness bernilai 8x. Model yang sama, tugas yang sama, hasil yang sama, dan satu cangkang berharga delapan kali lipat dari yang lain. Itu bukan perbedaan pembulatan yang Anda optimalkan nanti.

Tingkat model bernilai 12x di atasnya. Itulah sebabnya pemisahan otak-dan-lengan bukanlah gimmick: dsh di Flash mendarat di dua sen per tugas, dan Hermes di Pro mendarat di hampir dua dolar untuk gim Breakout yang identik.

Dan optimasi termurah dari semuanya masih dari Langkah 3. Sebuah rute dsh yang dibiarkan pada bawaan 262.144 melakukan lebih banyak pekerjaan kompresi dalam lebih banyak langkah untuk menyesuaikan pekerjaan yang sama, dan Anda membayar untuk setiap langkah itu.

Itulah jawaban sebenarnya untuk DeepSeek Harness vs Hermes: ukur cangkang Anda sendiri sebelum Anda pergi berbelanja model yang lebih murah.

FAQ DeepSeek Harness vs Hermes

Bisakah Hermes Agent dan DeepSeek Harness menggunakan model dan kunci API yang sama?

Ya, dan itu adalah satu-satunya cara jujur untuk membandingkannya. Keduanya berbicara ke endpoint yang kompatibel dengan OpenAI. dsh membutuhkan rute penyedia llm-pi-ai dengan api: openai-completions plus baseURL; Hermes membutuhkan provider: custom plus base_url yang diakhiri dengan /v1. Satu kunci, kedua harness, kedua tingkat harga. Konfigurasi lengkap ada di Langkah 3 dan 4.

Apakah DeepSeek Harness lebih baik dari Hermes untuk pengkodean?

Pada pengujian ini, jelas ya: 121 detik dibandingkan 780, 8 panggilan alat dibandingkan 35, dan seperdelapan dari pengeluaran token, dengan keduanya lulus semua tiga self-test. Tetapi "lebih baik untuk pengkodean" bukanlah "lebih baik". Jika yang Anda butuhkan adalah pekerjaan terjadwal yang melapor ke Telegram setiap pagi dan mengingat apa yang dipelajari minggu lalu, dsh tidak memiliki semua itu dan Hermes memilikinya.

Apakah DeepSeek Harness dan Hermes gratis dan sumber terbuka?

Keduanya berlisensi MIT dan gratis untuk diunduh. Yang Anda bayar adalah token, dan seperti yang ditunjukkan tabel di atas, itu bukan kesalahan pembulatan. Perlu diulang bahwa dsh secara eksplisit adalah pratinjau pengembang di 0.1 dan memperingatkan tentang perubahan yang merusak kompatibilitas di UI-nya sendiri, jadi pin versi Anda jika akan digunakan di dekat produksi.

Mengapa tugas yang sama lebih mahal di satu harness?

Empat alasan, kira-kira berdasarkan urutan besarnya:

  • Pembacaan ulang percakapan. Token perintah cache adalah 88,8% dari total dsh dan 95,5% milik Hermes. Setiap langkah tambahan mengirim ulang semua yang sebelumnya.
  • System prompt dan skema alat. Diukur di atas: 10.898 vs 13.892 token sebelum pekerjaan terjadi.
  • Jumlah langkah. 8 panggilan alat dan 9 langkah dibandingkan 35 panggilan alat di seluruh 38 panggilan API.
  • Jendela yang dibatasi. dsh fallback ke 262.144 alih-alih 1.048.576 memaksa pekerjaan kompresi ekstra pada tugas panjang.

Bisakah saya menjalankan DeepSeek Harness dan Hermes secara bersamaan?

Ya. Mereka tidak berbagi apa pun selain kunci API Anda: runtime berbeda, direktori konfigurasi berbeda, penyimpanan sesi berbeda, port berbeda (3080 dan 9119 secara bawaan). Pola yang biasa adalah Hermes sebagai otak yang selalu aktif di tingkat mahal dan dsh sebagai lengan pengkodean di tingkat murah.

Apakah DeepSeek Harness hanya bekerja dengan API DeepSeek sendiri?

Tidak, dan ini adalah kesalahpahaman paling umum tentangnya. Gateway apa pun yang kompatibel dengan OpenAI berfungsi melalui api: openai-completions dan baseURL. Ingat saja compat.thinkingFormat: deepseek, karena dsh menyimpulkan dialek berpikir dari URL, dan URL gateway pihak ketiga tidak memberi tahu apa pun.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model