Bạn đã chạy một tác vụ trên Hermes hôm qua. Hôm nay bạn chạy tác vụ tương tự trên dsh. Cùng model, cùng API key, cùng laptop. Dù vậy, số liệu sử dụng lại khác nhau.
Mắt bạn vẫn ổn. Không có gì bị thay đổi giá qua đêm.
Đây là điều mà hầu hết các so sánh DeepSeek Harness vs Hermes đều bỏ sót: harness là lớp vỏ bọc quanh model, và lớp vỏ đó quyết định lượng context gửi ra mỗi bước, bao nhiêu công cụ nó quảng cáo, tần suất thử lại, và liệu nó có gửi lại toàn bộ cuộc hội thoại trong mỗi lần gọi hay không. Thay đổi lớp vỏ, thay đổi hóa đơn.
Vì vậy, tôi đã cố định biến model và đo lường. Hai harness, một endpoint, một deepseek-ai/deepseek-v4-pro, một prompt, một máy, một buổi chiều. Cùng một tác vụ, cả hai đều hoàn thành, và một trong số chúng đã tiêu tốn gấp 8,4 lần số prompt token so với cái kia.
Những điểm chính
- Cùng model, cùng tác vụ, cả hai đều qua: dsh mất 121 giây, Hermes mất 780 giây.
- Hermes đã xử lý 1.111.573 prompt token so với 132.600 của dsh. Gấp 8,4 lần, chỉ trong một tác vụ.
- Trước khi bất kỳ agent nào làm gì, system prompt của nó đã tốn token: dsh 10.898 vs Hermes 13.892 chỉ để trả lời "OK".
- dsh âm thầm giới hạn bạn ở 262.144 context trừ khi bạn ghi đè
defaultContextWindow, loại bỏ 75% dung lượng cửa sổ của V4.- Hãy chọn dsh cho coding, Hermes cho bộ nhớ, cron và các giao diện chat. Hoặc chạy cả hai.

Phân xưởng kỹ thuật tách rời với khối động cơ trần được kẹp vào khung thử nghiệm thép bên trái và một robot tự động làm bằng đồng thau bên phải, cả hai đều được cấp nhiên liệu từ một đường ống đồng duy nhất
Một đường ống nhiên liệu, hai giàn thử nghiệm. Đó là toàn bộ thí nghiệm. Tạo bởi openai/gpt-image-2.
DeepSeek Harness vs Hermes, Cùng Model, Cùng Tác vụ
Cả hai harness đều nhận được yêu cầu này, từng chữ: xây dựng một bản sao Breakout trong một tệp duy nhất với thanh trượt, 5 hàng gạch, bộ đếm điểm số trực tiếp, phím P để tạm dừng, cùng một khối tự kiểm tra nội tuyến xác nhận ba bất biến vật lý và in PASS hoặc FAIL. Sau đó chạy nó ở chế độ không đầu và sửa lỗi cho đến khi cả ba đều in PASS.
Không dùng thư viện. Không CDN. Không bước xây dựng.
Cả hai đều thực sự làm được. Dưới đây là hai tệp, được hiển thị trên trình duyệt thực.

Hình ảnh động so sánh hai bản Breakout đang chạy: DeepSeek Harness (dsh) bên trái, Hermes Agent bên phải, cả hai đều tự động phát từ cùng một prompt DeepSeek V4 Pro
Hai bản dựng được ghi lại cạnh nhau và tự động phát, để bạn có thể xem từng cái chạy. Bên trái: dsh, trò chơi tự động khởi động. Bên phải: Hermes, trò chơi khởi động ở trạng thái tạm dừng, sau đó chạy. Cùng prompt một tệp, cùng DeepSeek V4 Pro, hai harness.
Bây giờ là những con số thực sự quyết định điều này.
| Lần chạy | Thời gian thực | Số lần gọi công cụ | Prompt token (mới + đã cache) | Output token | Chi phí tại V4 Pro |
|---|---|---|---|---|---|
| dsh, lần 1 | 121,2s | 8 | 14.840 + 117.760 = 132.600 | 5.231 | 0,24$ |
| Hermes, lần 1 | 780s | 35 | 49.685 + 1.061.888 = 1.111.573 | 19.317 | 1,93$ |
| dsh, lần 2 | chưa hoàn thành | 11 trước khi dừng | 44.291 + 132.608 | 2.463 | chưa hoàn thành |
| Hermes, lần 2 | chưa hoàn thành | chưa chạy | chưa hoàn thành | chưa hoàn thành | chưa hoàn thành |
Đo ngày 2026-08-21 trên deepseek-ai/deepseek-v4-pro, một máy, thư mục làm việc trống cho mỗi lần chạy. Số token được đọc bằng máy: dsh từ nhật ký phiên của nó, Hermes từ tệp JSON --usage-file. Lưu ý rằng hai số lượng lệnh gọi công cụ không được lấy từ cùng một nguồn: 8 của dsh được đếm từ nhật ký của nó (nó tuyên bố là 6), trong khi 35 của Hermes là báo cáo của chính nó, với tệp usage ghi lại 38 lần gọi API. Phương pháp tính chi phí được trình bày ở phần cuối.
Tại sao lại có hai hàng trống? Lần 2 không bao giờ chạy, và lý do là điểm dữ liệu đơn lẻ tốt nhất của bài viết. Riêng lần 1 của Hermes đã đẩy 1,13 triệu token qua tài khoản, và giữa chừng lần 2 của dsh, endpoint trả lời:
plaintext1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded", 2"message":"Member day spend limit reached (set by your team admin); 3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}
Một agent, một trò chơi Breakout, giới hạn ngân sách một ngày. Tôi không điền vào các ô đó bằng ước tính.
Một chi tiết nữa đáng chú ý. dsh báo cáo "Tool calls used: 6" trong câu trả lời cuối cùng. Nhật ký phiên của chính nó ghi lại 8. Các agent là những người kể chuyện không đáng tin cậy về chi tiêu của chính họ, và đó chính xác là lý do tại sao bài kiểm tra này đọc nhật ký thay vì tóm tắt.
Tại sao hầu hết các so sánh DeepSeek Harness vs Hermes đều sai
Phán quyết trước: hầu hết mọi trang xếp hạng cho từ khóa này đều đo sai biến số, và bạn có thể phát hiện ra điều đó trong một dòng thiết lập của họ.
Model, không phải lớp vỏ, là thứ mà các bài kiểm tra đó đo lường
Hãy đọc các kết quả hàng đầu. Mô hình lặp lại: chạy dsh trên một model DeepSeek, chạy Hermes trên bất kỳ thứ gì Hermes đã được trỏ tới, sau đó quy toàn bộ sự khác biệt cho harness.
Đó không phải là so sánh harness. Đó là so sánh model đội lốt harness.
Nếu dsh dùng V4 Pro và Hermes dùng thứ khác, thì sự khác biệt bạn đo được chủ yếu là do hai model, và đóng góp của lớp vỏ bị chôn vùi không thể phục hồi. Vì vậy, bài kiểm tra này làm điều nhàm chán nhưng cần thiết: cả hai harness đều trỏ đến cùng một base URL, cùng một model id, cùng một key.
Lựa chọn harness tự nó làm thay đổi các con số
Muốn bằng chứng rằng chỉ riêng lớp vỏ đã đắt? Hãy yêu cầu mỗi cái không làm gì cả.
Tôi gửi cho cả hai cùng một prompt tầm thường: Reply with exactly the word: OK. Không cần công cụ, không tệp, không cần suy nghĩ.
| Harness | Prompt token để nói "OK" | Output token | Thời gian thực |
|---|---|---|---|
| DeepSeek Harness (dsh) | 10.898 | 2 | 5,6s |
| Hermes Agent | 13.892 (+1.024 đã cache) | 17 | 8,5s |
Cùng model. Cùng câu hỏi. Khoảng cách 2.994 token trước khi bất kỳ công việc thực tế nào bắt đầu, bởi vì khoảng cách đó chính là harness: system prompt, lược đồ công cụ, tệp quy tắc của nó. Hermes có nhiều bề mặt hơn, vì vậy Hermes có nhiều token hơn.
Bây giờ hãy nhân điều đó với một vòng lặp agent 38 lần gọi, nơi mỗi lần gọi gửi lại toàn bộ cuộc hội thoại cho đến nay. Các lần đọc cache chiếm 88,8% prompt token của dsh và 95,5% của Hermes. Việc đọc lại đó chính là hóa đơn.
Một Endpoint, Hai Harness: Thiết lập DeepSeek V4
Để so sánh các lớp vỏ, bạn cần phía model đứng yên hoàn toàn. Không chỉ cùng tên model: cùng endpoint, cùng giới hạn tốc độ, cùng giá lúc 3 giờ sáng và 3 giờ chiều.
Điều cuối cùng quan trọng hơn vẻ ngoài của nó. Nếu nhà cung cấp của bạn tính phí theo giờ cao điểm và thấp điểm, thì "lần 1 trên Hermes lúc 09:00" và "lần 2 trên dsh lúc 11:00" không phải là các lần chạy có thể so sánh được, và bạn sẽ không bao giờ gỡ rối được bao nhiêu phần trăm chênh lệch là do harness và bao nhiêu là do đồng hồ.
Vì vậy, cả hai harness ở đây đều trỏ đến một endpoint tương thích OpenAI với giá cố định trên Atlas Cloud: https://api.atlascloud.ai/v1. Cùng một giá cả ngày, không có khung giờ cao điểm, không có hàng đợi riêng cho mỗi harness, một key cho cả hai.
| Vai trò trong bài kiểm tra | Model id | Context / max output | Giá trên 1M in / out |
|---|---|---|---|
| Động cơ chính cho cả hai harness | deepseek-ai/deepseek-v4-pro | 1.048.576 / 393.216 | 1,68$ / 3,38$ |
| Bậc rẻ, vai trò "cánh tay" | deepseek-ai/deepseek-v4-flash | 1.048.576 / 393.216 | 0,14$ / 0,28$ |
| Công việc cron chạy dài | deepseek-ai/deepseek-v3.2 | 163.840 / 163.840 | 0,26$ / 0,38$ |
Giá được đọc từ các trang model vào ngày 2026-08-21. Không có huy hiệu giảm giá nào trên dòng DeepSeek ngay bây giờ, vì vậy không có gì ở đây là tỷ lệ khuyến mãi hết hạn vào tuần tới.
Một điều nhỏ dễ bỏ lỡ: /v1/models báo cáo deepseek-v4-pro và deepseek-v4-flash là fp4, trong khi deepseek-v4-pro-0813 trả về fp8. Muốn trọng số có độ chính xác cao hơn? Hãy ghim id có ngày tháng.
Được rồi. Hãy xây dựng nó.
Tự chạy bài kiểm tra DeepSeek Harness vs Hermes
Xem trước: bảy bước, hai tệp cấu hình, một prompt, và bạn sẽ có phiên bản bảng của riêng mình thay vì tin tưởng của tôi. Bằng chứng nó hoạt động: mọi con số ở trên đều đến từ chính xác các bước này trên một MacBook tiêu chuẩn, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4.
Hãy bắt đầu.
Bước 1: Lấy một endpoint ổn định
Cả hai harness đều phụ thuộc nhiều vào function calling, vì vậy trước khi cài đặt bất cứ thứ gì, hãy chứng minh endpoint phục vụ các công cụ:
plaintext1curl -s https://api.atlascloud.ai/v1/models \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'
Đầu ra thực tế từ lệnh gọi đó:
plaintext1{ 2 "id": "deepseek-ai/deepseek-v4-pro", 3 "context_length": 1048576, 4 "max_output_length": 393216, 5 "supported_features": ["json_mode", "tools", "structured_outputs"] 6}
tools trong danh sách đó là thứ bạn đang kiểm tra. Không có tools, không có vòng lặp agent, và cả hai harness sẽ thất bại theo những cách khó hiểu thay vì nói ra.
Lấy key của bạn từ trang model DeepSeek V4 Pro, sau đó export ATLAS_API_KEY=... trước mỗi lệnh dưới đây.
Một lưu ý cho phía Hermes: phản hồi bao bọc mảng dưới dạng {"code":200,"msg":"succeed","data":[...]}. Hermes thăm dò /v1/models trong quá trình thiết lập và phân tích cú pháp này ổn, nhưng nếu bạn đang viết công cụ của riêng mình, đừng mong đợi một danh sách trần.
Bước 2: Cài đặt cả hai agent
plaintext1# DeepSeek Harness 2npm install @deepseek-ai/dsh 3 4# Hermes Agent 5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
Ba lưu ý cài đặt đã tốn thời gian của tôi:
- dsh yêu cầu Node
^22.19.0 || >=24.0.0. Nó không hỗ trợ 23.x. Hầu hết các hướng dẫn đều nói "Node 20+", điều này hoàn toàn sai. - Lệnh npm install đó đã kéo 453 gói và mất 8 phút. Nó không phải là một phụ thuộc nhỏ.
- Hermes mang theo Python 3.11 riêng qua
uv, vì vậy Python hệ thống của bạn không quan trọng (của tôi là 3.9). Nếu trình cài đặt chết giữa chừng do lỗi PyPI, hãy chạy lại đồng bộ hóa phụ thuộc thay vì toàn bộ script.
Bước 3: Trỏ DeepSeek Harness vào endpoint
Viết nội dung này vào $DSH_HOME/settings.yaml (mặc định ~/.dsh):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 displayName: Atlas Cloud 5 apiKeyEnv: ATLAS_API_KEY 6 api: openai-completions 7 baseURL: https://api.atlascloud.ai/v1 8 defaultContextWindow: 1048576 9 defaultMaxTokens: 65536 10 compat: 11 thinkingFormat: deepseek 12 models: 13 - id: deepseek-ai/deepseek-v4-pro 14 name: DeepSeek V4 Pro 15 reasoningEfforts: 16 off: 17 high: high 18 - id: deepseek-ai/deepseek-v4-flash 19 name: DeepSeek V4 Flash 20 reasoningEfforts: 21 off: 22 high: high 23agent-default-model: 24 provider: atlas 25 model: deepseek-ai/deepseek-v4-pro
Ba dòng trong đó đáng được giải thích riêng, vì bất kỳ sai sót nào cũng làm thay đổi hóa đơn của bạn:
compat.thinkingFormat: deepseeklà dòng không ai viết. dsh suy luận phương ngữ thinking từ URL endpoint. README adapter của nó thẳng thắn về điều này: URL của một gateway riêng không nói lên điều gì, vì vậy một endpoint không được nhận dạng sẽ được xử lý "như thể nó là chính OpenAI". Gateway phương ngữ DeepSeek của bạn sau đó sẽ bị nói chuyện bằng phương ngữ OpenAI. Khóa này chỉ tồn tại dướiapi: openai-completions.- Ghi đè
defaultContextWindow**. Các giá trị dự phòng ở cấp route là 262.144 context và 32.768 max tokens. Nếu bạn khai báo model V4 mà không chạm vào những giá trị đó, bạn đã âm thầm vứt bỏ 75% cửa sổ 1.048.576. agent-default-modelnhậnprovidervàmodellà hai khóa riêng biệt. Viếtmodel: atlas/deepseek-ai/deepseek-v4-prothành một chuỗi trông có vẻ hợp lý nhưng không làm gì cả. Bạn sẽ nhận đượcMISSING_CREDENTIAL: no API key for provider route "deepseek-official", và bạn sẽ đi tìm một vấn đề về key mà bạn không có.
Lưu ý rằng apiKeyEnv là một tham chiếu thông tin đăng nhập, không phải bí mật. Không có key nào được đưa vào tệp này.
Bước 4: Trỏ Hermes vào cùng một endpoint
Đường dẫn wizard là hermes model, sau đó chọn "Custom endpoint". Đường dẫn có thể viết script là năm lệnh:
plaintext1hermes config set model.provider custom 2hermes config set model.default deepseek-ai/deepseek-v4-pro 3hermes config set model.base_url https://api.atlascloud.ai/v1 4hermes config set model.api_key "$ATLAS_API_KEY" 5hermes config set model.context_length 1048576
Thao tác này ghi ~/.hermes/config.yaml:
plaintext1model: 2 provider: custom 3 default: deepseek-ai/deepseek-v4-pro 4 base_url: https://api.atlascloud.ai/v1 5 api_key: apikey-... 6 context_length: 1048576
provider: custom là một provider hạng nhất ở đây, không phải bí danh, và base URL phải kết thúc bằng /v1 vì Hermes tự thêm /chat/completions (Tài liệu Hermes Agent, Configuring Models, 2026).
Đừng bỏ qua dòng api_key. Tài liệu nói rằng key sẽ dự phòng xuống OPENAI_API_KEY, và trong lần chạy của tôi, việc xuất biến đó là không đủ: Hermes gửi yêu cầu mà không có xác thực khả dụng và Atlas trả lời HTTP 401: {"code":401,"msg":"unauthorized"}. Đặt model.api_key một cách rõ ràng đã khắc phục điều đó trong lần thử tiếp theo, trong 8,5 giây.
Bước 5: Chạy lần 1 trên cả hai
Xóa thư mục skills của Hermes trước (~/.hermes/skills). Một skill có sẵn sẽ làm cho lần 1 không công bằng, và lần 2 là nơi bạn muốn theo dõi một skill được tạo và sau đó được tái sử dụng.
Sau đó, đưa cho cả hai harness yêu cầu này, từng byte:
plaintext1Create a single self-contained file game.html: a Breakout clone with paddle, 5 rows of bricks, 2a live score counter, and a P key that pauses. No external libraries, no CDN, no build step. 3Then append an inline <script id="selftest"> block that asserts three physics invariants 4(ball reflects on paddle hit, score increments exactly once per brick, ball never leaves the canvas) 5and prints PASS/FAIL to the console. Run it headlessly, fix anything that fails, and stop only 6when all three asserts print PASS. Report the number of tool calls you used.
Cài đặt: một thư mục trống mới cho mỗi harness, reasoning để ở chế độ mặc định, max output ít nhất 32.768, và không có gì khác chạy trên máy để các con số thời gian thực có ý nghĩa.
plaintext1# dsh, phiên một lần 2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)" 3 4# Hermes, một lần với báo cáo usage có thể đọc bằng máy 5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json
Hai điều sẽ làm bạn ngạc nhiên ở đây.
Đầu tiên, hermes -z không in ra gì cả cho đến khi hoàn thành. Không banner, không spinner, không xem trước công cụ. Của tôi im lặng trong 13 phút và trông như bị treo; thực ra không, nó đang cặm cụi xử lý 38 lần gọi API. Hãy kiểm tra ps để tìm một shell con nếu bạn cần trấn an.
Thứ hai, Hermes đã bỏ qua thư mục làm việc của tôi và ghi game.html vào $HOME. Nếu bạn muốn tệp ở nơi bạn khởi chạy, hãy truyền --no-restore-cwd hoặc --in DIR. Tôi đã mất một lần chạy vì điều đó.
Trong khi đó, dsh hoàn thành trong 121 giây và Web UI của nó sẽ đọc lại cùng một phiên:

Giao diện web DeepSeek Harness hiển thị phiên Breakout đã hoàn thành, ba xác nhận PASS, 9 bước và 133K input token trên DeepSeek V4 Pro
Web UI của dsh trên 127.0.0.1:3080. Lưu ý thanh trạng thái: 9 bước, cache hit 89%, input 133K token, và bộ chọn model đọc DeepSeek V4 Pro từ cấu hình Bước 3.
--usage-file ở phía Hermes thực sự hữu ích và ít được tài liệu hóa: nó ghi input tokens, output tokens, cache reads, reasoning tokens, api_calls và chi phí ước tính vào JSON, và nó ghi tệp đó ngay cả khi lần chạy thất bại.
dsh không có cờ tương đương, nhưng nó không cần. Nhật ký phiên chỉ ghi thêm của nó chứa mọi thứ, với một cái bẫy. Nhật ký tại $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd là một luồng zstd nhiều khung, một khung cho mỗi lần xả. zlib.zstdDecompressSync(buf) chỉ trả về khung đầu tiên, vì vậy một nhật ký 150KB giải mã thành vài trăm byte và trông có vẻ trống. Hãy tự tách bằng các byte magic:
plaintext1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = []; 2for (let i = 0; i < buf.length - 4; i++) 3 if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i); 4const text = offs 5 .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString()) 6 .join('');
Usage nằm trên các sự kiện assistant/chunk nơi data.chunk.type === 'usage', sâu hơn một cấp so với bạn nghĩ (data.chunk.usage.inputTokens). Lệnh gọi công cụ đến từ các khối nội dung assistant/message thuộc loại tool-call. Và request/header.data.header.config hiển thị model và maxTokens thực sự đã lên dây, đó là cách bạn chứng minh cấu hình Bước 3 của mình có hiệu lực thay vì hy vọng.
Bước 6: Lần 2, yêu cầu thay đổi
Cùng thư mục, game.html đã có sẵn từ lần 1. Bây giờ hãy yêu cầu cả hai thay đổi:
plaintext1Add a falling power-up: when a brick in the top row breaks, drop a token that widens the paddle 2for 10 seconds. Keep all three selftest asserts passing and add a fourth assert for the power-up 3timer. Same file, no libraries.
Đây là lần chạy phân biệt hai thiết kế. Hermes ghi skills sau các tác vụ phức tạp và duy trì bộ nhớ ba lớp, vì vậy lần 2 là nơi một skill từ lần 1 sẽ được đền đáp hoặc không. dsh không có bộ nhớ dài hạn nào cả, nhưng nó có nhật ký phiên chỉ ghi thêm mà bạn có thể fork và phát lại từ giữa lần chạy thay vì khởi động lại.
Hãy thành thật với bản thân về ngân sách trước khi bạn bắt đầu lần này. Lần 2 của tôi đã chết sau 11 lần gọi công cụ do giới hạn chi tiêu hàng ngày, đó là lý do tại sao bảng trên có hai hàng trống thay vì hai hàng được bịa ra. Bảng điều khiển của Hermes cho thấy lý do:

Trang phiên của bảng điều khiển Hermes Agent liệt kê lần chạy Breakout với 76 tin nhắn trên deepseek-v4-pro
Hermes v0.20.4 đọc lại các phiên của chính nó. Lần chạy Breakout đã hoàn thành có 76 tin nhắn, tất cả trên deepseek-v4-pro thông qua endpoint Atlas.
Bước 7: Đọc hóa đơn
Hai con số cho mỗi lần chạy, từ nhật ký của chính harness, không bao giờ từ bản tóm tắt của agent:
plaintext1# Hermes 2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json 3 4# dsh: tổng hợp nhật ký phiên đã giải mã 5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"
Sau đó kiểm tra chéo với trang usage của nhà cung cấp. Khi nhật ký harness và nhà cung cấp không khớp, hãy tin tưởng nhà cung cấp: đó là con số bạn phải trả.
Đáng nói, thanh trạng thái của dsh khớp với trình phân tích nhật ký của tôi trong phạm vi làm tròn (133K input token, 89% cache hit so với 132.600 và 88,8% tính toán của tôi). Công cụ này trung thực. Bản tóm tắt tiếng Anh của các agent thì không.
Ngoài DeepSeek Harness vs Hermes: Chạy cả hai như Não và Tay
Đây là câu trả lời mà không ai trong cuộc tranh luận "chọn cái nào" đưa ra: bạn không cần phải chọn.
Hai dự án thất bại theo các hướng ngược nhau, điều này khiến chúng trở thành đồng đội đặc biệt tốt.
| Khả năng | DeepSeek Harness (dsh) | Hermes Agent |
|---|---|---|
| Chạy coding | Mạnh, đây là mục tiêu thiết kế | Hoàn thành cùng tác vụ trong 6,4x thời gian |
| Bộ nhớ dài hạn | Không có | Ba lớp, do agent quản lý |
| Skills tự cải thiện | Không có | Có, tương thích agentskills.io |
| Fork / replay nhật ký phiên | Có, JSONL chỉ ghi thêm | Tìm kiếm phiên với tóm tắt LLM |
| Cron tích hợp | Không có | Có, lịch biểu ngôn ngữ tự nhiên |
| Giao diện chat | Không có | Telegram, Discord, Slack, WhatsApp, Signal |
| Giao diện | Web UI, TUI, headless | TUI, CLI, dashboard, gateway |
| Môi trường chạy | Node 22.19+/24+ | Python 3.11 (đi kèm) |
| Độ chín | 0.1 developer preview, thay đổi phá vỡ | Phát hành tháng 2/2026, v0.20.4 |
| Giấy phép / sao | MIT, 176,5k | MIT, 233,6k |
Số sao được đọc từ cả hai kho lưu trữ vào ngày 2026-08-21 (deepseek-ai/deepseek-harness với 176,5k sao và 19,2k fork, NousResearch/hermes-agent với 233,6k sao và 46,8k fork). Hãy theo dõi quỹ đạo, không phải tổng số: dsh ở 144.361 sao khi tôi kiểm tra vào ngày 2026-08-17, vì vậy nó đã tăng thêm khoảng 32.000 trong bốn ngày.
Ba cách để kết hợp chúng:
- Não và tay. Hermes trên V4 Pro giữ bộ nhớ, lịch trình và luồng Telegram. Nó ủy thác việc coding thực tế cho dsh trên bậc rẻ. Một key bao gồm cả hai, vì vậy bạn không phải quản lý hai mối quan hệ thanh toán.
- Bậc rẻ cho vòng lặp, bậc đắt cho quyết định. Công việc cron định kỳ chạy trên
deepseek-v3.2hoặc DeepSeek V4 Flash; cuộc gọi khó sẽ leo lên Pro. - Headless cả hai. dsh
--profile headlessvà Hermes-zđều nhận prompt và in một câu trả lời, vì vậy cả hai đều có thể được đưa vào shell script hoặc bước CI mà không cần TUI.
Cảnh báo công bằng về những điểm yếu trung thực, bởi vì một so sánh chỉ liệt kê điểm mạnh là một quảng cáo. dsh là bản xem trước dành cho nhà phát triển 0.1 và tự nói như vậy trong giao diện của nó: nó sẽ hỏng giữa các phiên bản, không có bộ nhớ, không có kênh nhắn tin gốc, và báo cáo thiếu số lần gọi công cụ của chính nó. Hermes là dự án trưởng thành hơn nhiều, nhưng nó nặng hơn mỗi token với hệ số 8, nó im lặng trong 13 phút cho một tác vụ mà dsh hoàn thành trong 2 phút, và nó ghi tệp đầu ra của tôi vào sai thư mục.
DeepSeek Harness vs Hermes Thực sự Tốn bao nhiêu Mỗi Tác vụ
Bây giờ là phép tính, với các giả định được công khai.
Atlas công bố một mức giá đầu vào cho V4 Pro (1,68$ trên 1M) mà không có tỷ lệ cache-hit riêng trên trang model. Vì vậy, tôi định giá mọi prompt token ở mức giá đầu vào đầy đủ, bao gồm cả các lần đọc cache. Đó là một mức trần thận trọng, không phải một phỏng đoán được tô điểm như một phép đo.
Ví dụ tính toán, dsh lần 1:
- Prompt: 14.840 mới + 117.760 đã cache = 132.600 token. Ở mức 1,68$/1M, đó là 0,2228$.
- Output: 5.231 token. Ở mức 3,38$/1M, đó là 0,0177$.
- Tổng: 0,2404$ mỗi tác vụ.
Cùng phương pháp cho Hermes lần 1: 1.111.573 prompt token là 1,8674$, cộng với 19.317 output token ở mức 0,0653$, tổng cộng 1,9327$. --usage-file của Hermes ước tính 0,2817$ cho lần chạy đó, ngụ ý rằng nó giả định tỷ lệ cached-input gần 0,125$ trên 1M. Nếu nhà cung cấp của bạn thực sự giảm giá cache reads mạnh như vậy, cả hai con số dưới đây sẽ giảm cùng nhau và tỷ lệ giữa chúng hầu như không thay đổi.
| Kịch bản | Mỗi tác vụ trên V4 Pro | Mỗi tác vụ trên V4 Flash | 20 tác vụ/ngày, 30 ngày (Pro) |
|---|---|---|---|
| dsh lần 1 | 0,24$ | 0,02$ | 144,27$ |
| Hermes lần 1 | 1,93$ | 0,16$ | 1.159,64$ |
| Lần 2, cả hai harness | chưa hoàn thành | chưa hoàn thành | chưa hoàn thành |
Hai điều nổi bật từ bảng đó.
Sự lựa chọn harness đáng giá 8x. Cùng model, cùng tác vụ, cùng kết quả, và một lớp vỏ tốn gấp tám lần lớp vỏ kia. Đó không phải là sự khác biệt làm tròn mà bạn có thể tối ưu hóa sau đó.
Bậc model đáng giá 12x trên nó. Đó là lý do tại sao sự phân chia não và tay không phải là một chiêu trò: dsh trên Flash chỉ tốn hai xu một tác vụ, và Hermes trên Pro tốn gần hai đô la cho cùng một trò chơi Breakout.
Và tối ưu hóa rẻ nhất vẫn là từ Bước 3. Một route dsh để ở mặc định 262.144 sẽ thực hiện nhiều công việc nén hơn trong nhiều bước hơn để phù hợp với cùng một công việc, và bạn phải trả tiền cho mỗi bước đó.
Đó là câu trả lời thực sự cho DeepSeek Harness vs Hermes: hãy đo lớp vỏ của riêng bạn trước khi bạn đi mua một model rẻ hơn.
FAQ về DeepSeek Harness vs Hermes
Hermes Agent và DeepSeek Harness có thể dùng chung model và API key không?
Có, và đó là cách trung thực duy nhất để so sánh chúng. Cả hai đều nói chuyện với các endpoint tương thích OpenAI. dsh cần một route provider llm-pi-ai với api: openai-completions cộng với baseURL; Hermes cần provider: custom cộng với base_url kết thúc bằng /v1. Một key, cả hai harness, cả hai bậc giá. Cấu hình đầy đủ có trong Bước 3 và 4.
DeepSeek Harness có tốt hơn Hermes cho coding không?
Trong bài kiểm tra này, rõ ràng là có: 121 giây so với 780, 8 lần gọi công cụ so với 35, và một phần tám chi tiêu token, với cả hai đều vượt qua cả ba bài tự kiểm tra. Nhưng "tốt hơn cho coding" không phải là "tốt hơn". Nếu bạn cần một công việc theo lịch trình báo cáo lên Telegram mỗi sáng và nhớ những gì nó đã học tuần trước, dsh không có gì trong số đó và Hermes có tất cả.
DeepSeek Harness và Hermes có miễn phí và mã nguồn mở không?
Cả hai đều được cấp phép MIT và miễn phí tải xuống. Những gì bạn trả là token, và như bảng trên cho thấy, đó không phải là một sai số làm tròn. Đáng nhắc lại rằng dsh rõ ràng là bản xem trước dành cho nhà phát triển ở 0.1 và cảnh báo về các thay đổi phá vỡ tương thích trong giao diện của nó, vì vậy hãy ghim phiên bản của bạn nếu nó đi đến gần sản xuất.
Tại sao cùng một tác vụ lại tốn nhiều hơn trong một harness?
Bốn lý do, theo thứ tự kích thước:
- Đọc lại cuộc hội thoại. Các prompt token được cache chiếm 88,8% tổng số của dsh và 95,5% của Hermes. Mỗi bước thừa sẽ gửi lại mọi thứ trước đó.
- System prompt và lược đồ công cụ. Đã đo ở trên: 10.898 so với 13.892 token trước khi bất kỳ công việc nào xảy ra.
- Số bước. 8 lần gọi công cụ và 9 bước so với 35 lần gọi công cụ qua 38 lần gọi API.
- Cửa sổ bị giới hạn. dsh dự phòng xuống 262.144 thay vì 1.048.576 buộc phải nén thêm công việc cho các tác vụ dài.
Tôi có thể chạy DeepSeek Harness và Hermes cùng lúc không?
Có. Chúng chỉ chia sẻ API key của bạn: môi trường chạy khác nhau, thư mục cấu hình khác nhau, kho lưu trữ phiên khác nhau, cổng khác nhau (3080 và 9119 theo mặc định). Mô hình thông thường là Hermes là bộ não luôn bật trên bậc đắt và dsh là cánh tay coding trên bậc rẻ.
DeepSeek Harness chỉ hoạt động với API của DeepSeek thôi à?
Không, và đây là quan niệm sai lầm phổ biến nhất về nó. Bất kỳ gateway tương thích OpenAI nào cũng hoạt động thông qua api: openai-completions và baseURL. Chỉ cần nhớ compat.thinkingFormat: deepseek, vì dsh suy luận phương ngữ thinking từ URL, và URL của gateway bên thứ ba không nói cho nó biết điều gì cả.






