Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

DeepSeek Harness vs Hermes: 어느 쪽이 더 많은 토큰을 소모할까?

DeepSeek Harness 대 Hermes: 어떤 것이 더 많은 토큰을 소모할까?

어제 Hermes에서 작업을 실행했습니다. 오늘은 dsh에서 똑같은 작업을 실행한 것 같은 느낌이 들었습니다. 같은 모델, 같은 API 키, 같은 노트북. 그런데 사용량 수치가 다르게 나왔습니다.

눈이 나쁜 게 아닙니다. 가격이 하룻밤 사이에 바뀐 것도 아닙니다.

거의 모든 DeepSeek Harness vs Hermes 비교에서 놓치는 것이 있습니다: 하네스(Harness)는 모델을 감싸는 셸(shell)이고, 이 셸이 한 스텝당 얼마나 많은 컨텍스트를 전송할지, 얼마나 많은 도구를 광고할지, 재시도 빈도, 그리고 매 호출마다 전체 대화를 다시 보낼지 여부를 결정합니다. 셸이 바뀌면 청구서도 바뀝니다.

그래서 모델 변수를 고정하고 측정했습니다. 두 개의 하네스, 하나의 엔드포인트, 하나의 deepseek-ai/deepseek-v4-pro, 하나의 프롬프트, 하나의 머신, 하나의 오후. 같은 작업, 둘 다 완료했는데, 하나가 다른 것보다 8.4배 더 많은 프롬프트 토큰을 이동시켰습니다.

주요 시사점

  • 같은 모델, 같은 작업, 둘 다 통과: dsh는 121초, Hermes는 780초 소요.
  • Hermes는 1,111,573개의 프롬프트 토큰을 이동시킨 반면, dsh는 132,600개를 이동시켰습니다. 한 작업에서 8.4배 차이입니다.
  • 두 에이전트가 아무 일을 하기 전에, 시스템 프롬프트만으로도 토큰이 소모됩니다: dsh 10,898 vs Hermes 13,892 — 단지 "OK"라고 답하는 데 이 정도입니다.
  • dsh는 defaultContextWindow를 재정의하지 않으면 자동으로 262,144 컨텍스트로 제한하여 V4 창의 75%를 버립니다.
  • 코딩에는 dsh를, 메모리, cron 및 채팅 인터페이스에는 Hermes를 선택하세요. 또는 둘 다 실행하세요.

왼쪽에 강철 테스트 하네스 장치에 고정된 분할 엔진 공방, 오른쪽에는 놋쇠 파일 자동 장치, 둘 다 하나의 구리 연료 라인에 연결됨

하나의 연료 라인, 두 개의 테스트 장치. 이것이 실험의 전부입니다. openai/gpt-image-2로 생성됨.

DeepSeek Harness vs Hermes, 같은 모델, 같은 작업

두 하네스 모두 다음 지시를 받았습니다. 한 단어도 빠짐없이: 패들, 5줄의 벽돌, 실시간 점수 카운터, P키 일시정지, 그리고 세 가지 물리 불변식을 검증하고 PASS 또는 FAIL을 출력하는 인라인 셀프 테스트가 포함된 단일 파일 Breakout 클론을 만드세요. 그런 다음 헤드리스로 실행하고 세 가지 모두 PASS를 출력할 때까지 수정하세요.

라이브러리 없음. CDN 없음. 빌드 단계 없음.

둘 다 실제로 해냈습니다. 다음은 실제 브라우저에서 렌더링된 두 파일입니다.

두 Breakout 빌드가 실행되는 애니메이션 병렬 비교: 왼쪽 DeepSeek Harness (dsh), 오른쪽 Hermes Agent, 둘 다 동일한 DeepSeek V4 Pro 프롬프트에서 자동 재생됨

두 빌드를 나란히 다시 녹화하고 자동 재생으로 설정하여 각각 실제로 실행되는 모습을 볼 수 있습니다. 왼쪽: dsh, 게임이 자동 시작됩니다. 오른쪽: Hermes, 게임이 일시정지 상태로 시작된 후 실행됩니다. 같은 단일 파일 프롬프트, 같은 DeepSeek V4 Pro, 두 개의 하네스.

이제 실제로 비용을 결정하는 수치를 살펴보겠습니다.

실행실제 시간도구 호출 수프롬프트 토큰 (새로 + 캐시)출력 토큰V4 Pro 비용
dsh, 1차 실행121.2초814,840 + 117,760 = 132,6005,231$0.24
Hermes, 1차 실행780초3549,685 + 1,061,888 = 1,111,57319,317$1.93
dsh, 2차 실행완료되지 않음11 (중단 전)44,291 + 132,6082,463완료되지 않음
Hermes, 2차 실행완료되지 않음실행되지 않음완료되지 않음완료되지 않음완료되지 않음

2026-08-21에 deepseek-ai/deepseek-v4-pro에서 측정, 한 대의 머신, 실행당 빈 작업 디렉토리. 토큰 수는 기계가 읽은 값입니다: dsh는 세션 로그에서, Hermes는 --usage-file JSON에서 가져왔습니다. 두 도구 호출 수의 출처가 다르다는 점에 유의하세요: dsh의 8개는 로그에서 계산되었고(자체적으로 6개라고 주장), Hermes의 35개는 자체 보고이며, 사용량 파일에는 38개의 API 호출이 기록되었습니다. 비용 계산 방법은 마지막 섹션에 자세히 설명되어 있습니다.

왜 두 줄이 비어 있을까요? 2차 실행이 실행되지 않았기 때문이며, 그 이유가 이 글의 가장 중요한 단일 데이터 포인트입니다. Hermes의 1차 실행만으로 계정에 113만 개의 토큰이 푸시되었고, dsh의 2차 실행 도중 엔드포인트가 응답했습니다:

plaintext
1dsh: QUOTA: 429: {"code":"member_spend_limit_exceeded",
2"message":"Member day spend limit reached (set by your team admin);
3resets at 2026-08-22T00:00:00Z.","type":"insufficient_quota"}

하나의 에이전트, 하나의 Breakout 게임, 하루 예산 한도. 저는 그 셀을 추정치로 채우지 않겠습니다.

한 가지 더 언급할 가치가 있는 세부 사항이 있습니다. dsh는 최종 답변에서 "사용된 도구 호출: 6"이라고 보고했습니다. 자체 세션 로그에는 8개가 기록되어 있습니다. 에이전트는 자신의 지출에 대해 신뢰할 수 없는 내레이터이며, 이것이 바로 이 테스트가 요약 대신 로그를 읽는 이유입니다.

대부분의 DeepSeek Harness vs Hermes 비교가 잘못된 이유

먼저 결론: 이 키워드로 순위가 매겨진 거의 모든 페이지는 잘못된 변수를 측정하고 있으며, 설정의 한 줄에서 이를 발견할 수 있습니다.

그 테스트들이 측정한 것은 셸이 아니라 모델이었습니다

상위 결과를 읽어보세요. 패턴이 반복됩니다: DeepSeek 모델에서 dsh를 실행하고, Hermes가 이미 가리키고 있던 모델에서 Hermes를 실행한 다음, 전체 차이를 하네스 탓으로 돌립니다.

그것은 하네스 비교가 아닙니다. 하네스 모양의 레이블을 단 모델 비교입니다.

dsh가 V4 Pro에 있고 Hermes가 다른 모델에 있다면, 측정하는 델타는 대부분 두 모델의 차이이며, 셸의 기여는 복구 불가능할 정도로 묻힙니다. 따라서 이 테스트는 지루하지만 필요한 작업을 수행합니다: 두 하네스 모두 동일한 기본 URL, 동일한 모델 ID, 동일한 키를 가리킵니다.

하네스 선택만으로도 수치가 움직입니다

셸만으로도 비용이 많이 든다는 증거를 원하십니까? 각각에게 아무것도 하지 말라고 요청하세요.

두 하네스에 동일한 사소한 프롬프트를 보냈습니다: 정확히 이 단어로만 답하세요: OK. 도구 필요 없음, 파일 없음, 생각할 필요 없음.

하네스"OK"라고 말하는 데 필요한 프롬프트 토큰출력 토큰실제 시간
DeepSeek Harness (dsh)10,89825.6초
Hermes Agent13,892 (+1,024 캐시)178.5초

같은 모델. 같은 질문. 실제 작업이 시작되기 전에 2,994개의 토큰 차이가 발생합니다. 그 차이가 바로 하네스이기 때문입니다: 시스템 프롬프트, 도구 스키마, 규칙 파일. Hermes는 더 많은 표면적을 제공하므로 더 많은 토큰을 전송합니다.

이제 매 호출마다 지금까지의 대화를 다시 보내는 38번의 호출 에이전트 루프에 이를 곱해보세요. 캐시 읽기는 dsh 프롬프트 토큰의 88.8%, Hermes의 95.5%를 차지했습니다. 그 재읽기가 바로 청구서입니다.

하나의 엔드포인트, 두 개의 하네스: DeepSeek V4 설정

셸을 비교하려면 모델 측이 완전히 고정되어 있어야 합니다. 같은 모델 이름뿐만 아니라 같은 엔드포인트, 같은 속도 제한, 오전 3시와 오후 3시에 같은 가격이어야 합니다.

마지막 항목은 생각보다 더 중요합니다. 공급자가 피크 시간과 비피크 시간 요금을 부과한다면, "Hermes의 1차 실행(09:00)"과 "dsh의 2차 실행(11:00)"은 비교할 수 없는 실행이며, 델타 중 얼마나 많은 부분이 하네스 때문이고 얼마나 많은 부분이 시간 때문인지 결코 분리할 수 없습니다.

따라서 두 하네스 모두 Atlas Cloud의 하나의 정액제 OpenAI 호환 엔드포인트를 가리킵니다: https://api.atlascloud.ai/v1. 하루 종일 동일한 가격, 피크 시간 없음, 하네스별 별도 대기열 없음, 두 하네스 모두 하나의 키 사용.

테스트에서의 역할모델 ID컨텍스트 / 최대 출력1M 입력/출력당 가격
두 하네스의 메인 엔진deepseek-ai/deepseek-v4-pro1,048,576 / 393,216$1.68 / $3.38
저렴한 계층, "팔" 역할deepseek-ai/deepseek-v4-flash1,048,576 / 393,216$0.14 / $0.28
장기 실행 cron 작업deepseek-ai/deepseek-v3.2163,840 / 163,840$0.26 / $0.38

가격은 2026-08-21에 모델 페이지에서 읽은 것입니다. 현재 DeepSeek 제품군에 할인 배지는 없으므로, 여기에는 다음 주에 만료되는 프로모션 요금이 없습니다.

놓치기 쉬운 작은 것: /v1/modelsdeepseek-v4-prodeepseek-v4-flashfp4로 보고하는 반면, deepseek-v4-pro-0813fp8로 반환합니다. 더 높은 정밀도 가중치를 원하시면 날짜가 포함된 ID를 고정하세요.

좋습니다. 이제 구축해 봅시다.

DeepSeek Harness vs Hermes 테스트 직접 실행해보기

미리보기: 7단계, 두 개의 구성 파일, 하나의 프롬프트, 그리고 제 표를 신뢰하는 대신 여러분만의 버전을 얻을 수 있습니다. 작동 증명: 위의 모든 숫자는 일반 MacBook, Node v24.15.0, dsh 0.1.0-rc.7, Hermes v0.20.4에서 정확히 이 단계를 거쳐 나왔습니다.

시작해 봅시다.

1단계: 고정된 엔드포인트 확보

두 하네스 모두 함수 호출에 크게 의존하므로, 아무것도 설치하기 전에 엔드포인트가 도구를 제공하는지 확인하세요:

plaintext
1curl -s https://api.atlascloud.ai/v1/models \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  | jq '.data[] | select(.id|test("v4-pro$")) | {id, context_length, max_output_length, supported_features}'

해당 호출의 실제 출력:

plaintext
1{
2  "id": "deepseek-ai/deepseek-v4-pro",
3  "context_length": 1048576,
4  "max_output_length": 393216,
5  "supported_features": ["json_mode", "tools", "structured_outputs"]
6}

목록에 있는 tools가 확인해야 할 항목입니다. 도구가 없으면 에이전트 루프가 작동하지 않으며 두 하네스 모두 혼란스러운 방식으로 실패하고 그 이유를 알려주지 않습니다.

DeepSeek V4 Pro 모델 페이지에서 키를 가져온 후, 아래 모든 명령 전에 export ATLAS_API_KEY=...를 실행하세요.

Hermes 측의 한 가지 주의사항: 응답은 배열을 {"code":200,"msg":"succeed","data":[...]}로 감쌉니다. Hermes는 설정 중에 /v1/models를 프로브하고 이를 정상적으로 구문 분석하지만, 이에 대해 자체 도구를 작성하는 경우 빈 목록을 기대하지 마십시오.

2단계: 두 에이전트 설치

plaintext
1# DeepSeek Harness
2npm install @deepseek-ai/dsh
3
4# Hermes Agent
5curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

시간이 걸렸던 세 가지 설치 참고 사항:

  • dsh는 Node ^22.19.0 || >=24.0.0이 필요합니다. 23.x는 지원하지 않습니다. 대부분의 튜토리얼은 "Node 20+"라고 말하는데, 이는 단순히 틀렸습니다.
  • 해당 npm 설치는 453개의 패키지를 가져왔고 8분이 걸렸습니다. 작은 종속성이 아닙니다.
  • Hermes는 uv를 통해 자체 Python 3.11을 가져오므로 시스템 Python은 중요하지 않습니다(제 것은 3.9입니다). 설치 프로그램이 PyPI 문제로 다운로드 중간에 중단되면 전체 스크립트를 다시 실행하는 대신 종속성 동기화를 다시 실행하세요.

3단계: DeepSeek Harness를 엔드포인트에 연결

다음을 $DSH_HOME/settings.yaml(기본값 ~/.dsh)에 작성하세요:

plaintext
1llm-pi-ai:
2  providers:
3    atlas:
4      displayName: Atlas Cloud
5      apiKeyEnv: ATLAS_API_KEY
6      api: openai-completions
7      baseURL: https://api.atlascloud.ai/v1
8      defaultContextWindow: 1048576
9      defaultMaxTokens: 65536
10      compat:
11        thinkingFormat: deepseek
12      models:
13        - id: deepseek-ai/deepseek-v4-pro
14          name: DeepSeek V4 Pro
15          reasoningEfforts:
16            off:
17            high: high
18        - id: deepseek-ai/deepseek-v4-flash
19          name: DeepSeek V4 Flash
20          reasoningEfforts:
21            off:
22            high: high
23agent-default-model:
24  provider: atlas
25  model: deepseek-ai/deepseek-v4-pro

그 중 세 줄은 각각 설명이 필요합니다. 하나라도 잘못 설정하면 청구서가 달라지기 때문입니다:

  1. compat.thinkingFormat: deepseek는 아무도 작성하지 않는 줄입니다. dsh는 엔드포인트 URL에서 추론 방언을 추측합니다. 자체 어댑터 README는 이에 대해 솔직합니다: 개인 게이트웨이의 URL은 아무 것도 알려주지 않으므로 인식되지 않은 엔드포인트는 "OpenAI 자체인 것처럼" 처리됩니다. 그러면 DeepSeek 방언 게이트웨이가 OpenAI 방언으로 대화를 시도합니다. 이 키는 api: openai-completions에서만 존재합니다.
  2. defaultContextWindow를 재정의하세요. 경로 수준의 기본값은 262,144 컨텍스트와 32,768 최대 토큰입니다. V4 모델을 선언하면서 이 값들을 건드리지 않으면 1,048,576 창의 75%를 조용히 버리게 됩니다.
  3. agent-default-modelprovidermodel을 두 개의 별도 키로 사용합니다. model: atlas/deepseek-ai/deepseek-v4-pro를 하나의 문자열로 작성하는 것은 합리적으로 보이지만 아무 효과가 없습니다. MISSING_CREDENTIAL: no API key for provider route "deepseek-official" 오류가 발생하고, 존재하지 않는 키 문제를 찾느라 시간을 낭비하게 됩니다.

apiKeyEnv는 자격 증명 참조 이며, 실제 비밀이 아닙니다. 이 파일에 키가 저장되지 않습니다.

4단계: Hermes를 동일한 엔드포인트에 연결

마법사 경로는 hermes model을 실행한 다음 "Custom endpoint"를 선택하는 것입니다. 스크립트 가능한 경로는 다섯 가지 명령입니다:

plaintext
1hermes config set model.provider custom
2hermes config set model.default deepseek-ai/deepseek-v4-pro
3hermes config set model.base_url https://api.atlascloud.ai/v1
4hermes config set model.api_key "$ATLAS_API_KEY"
5hermes config set model.context_length 1048576

그러면 ~/.hermes/config.yaml이 작성됩니다:

plaintext
1model:
2  provider: custom
3  default: deepseek-ai/deepseek-v4-pro
4  base_url: https://api.atlascloud.ai/v1
5  api_key: apikey-...
6  context_length: 1048576

provider: custom은 여기서 별칭이 아닌 일급 공급자이며, 기본 URL은 /v1로 끝나야 합니다. Hermes가 자체적으로 /chat/completions를 추가하기 때문입니다(Hermes Agent 문서, Configuring Models, 2026).

api_key 줄을 건너뛰지 마세요. 문서에 따르면 키는 OPENAI_API_KEY로 대체되지만, 제 실행에서 해당 변수를 내보내는 것만으로는 충분하지 않았습니다. Hermes는 사용 가능한 인증 없이 요청을 보냈고 Atlas는 HTTP 401: {"code":401,"msg":"unauthorized"}로 응답했습니다. model.api_key를 명시적으로 설정하면 다음 시도에서 8.5초 만에 수정되었습니다.

5단계: 두 하네스에서 1차 실행

먼저 Hermes의 스킬 디렉토리(~/.hermes/skills)를 비우세요. 기존 스킬이 있으면 1차 실행이 불공평해지며, 2차 실행에서 스킬이 생성되고 재사용되는 과정을 관찰하려고 합니다.

그런 다음 두 하네스에 다음을 바이트 단위로 정확히 전달하세요:

plaintext
1단일 자체 포함 파일 game.html을 만드세요: 패들, 5줄의 벽돌, 실시간 점수 카운터, P키로 일시정지가 있는 Breakout 클론. 외부 라이브러리, CDN, 빌드 단계 없음.
2그런 다음 인라인 <script id="selftest"> 블록을 추가하여 세 가지 물리 불변식(공이 패들에 맞으면 반사, 점수는 벽돌당 정확히 한 번 증가, 공이 캔버스를 벗어나지 않음)을 검증하고 PASS/FAIL을 콘솔에 출력하세요.
3헤드리스로 실행하고, 실패하는 항목을 수정하고, 세 가지 어설트가 모두 PASS를 출력할 때까지 중단하지 마세요. 사용한 도구 호출 수를 보고하세요.

설정: 하네스당 새 빈 디렉토리, 추론은 기본값으로 유지, 최대 출력은 최소 32,768, 머신에서 다른 작업은 실행하지 않음(실제 시간 수치가 의미 있도록).

plaintext
1# dsh, 일회성 지속 세션
2DSH_HOME=~/.dsh dsh --profile headless "$(cat prompt-r1.txt)"
3
4# Hermes, 일회성, 기계 판독 가능한 사용량 보고서 포함
5hermes -z "$(cat prompt-r1.txt)" --yolo --usage-file hermes-r1-usage.json

여기서 두 가지 놀라운 점이 있습니다.

첫째, hermes -z는 완료될 때까지 아무것도 출력하지 않습니다. 배너, 스피너, 도구 미리보기 없음. 제 것은 13분 동안 조용히 있었고 멈춘 것처럼 보였습니다. 사실 멈춘 것이 아니라 38번의 API 호출을 처리 중이었습니다. 안심이 필요하면 자식 셸의 ps를 확인하세요.

둘째, Hermes는 작업 디렉토리를 무시하고 game.html$HOME에 썼습니다. 파일을 실행한 디렉토리에 두려면 --no-restore-cwd 또는 --in DIR을 전달하세요. 그 때문에 한 라운드를 잃었습니다.

한편, dsh는 121초 만에 완료되었으며, Web UI에서 동일한 세션을 다시 읽을 수 있습니다:

DeepSeek Harness 웹 UI에 완료된 Breakout 세션, 세 개의 PASS 어설트, 9단계, DeepSeek V4 Pro에서 133K 입력 토큰 표시

dsh Web UI, 127.0.0.1:3080. 상태 표시줄 참고: 9단계, 캐시 적중률 89%, 입력 133K 토큰, 모델 선택기가 3단계 구성에서 DeepSeek V4 Pro를 읽고 있음.

Hermes 측의 --usage-file은 진정으로 유용하고 문서화가 부족합니다: 입력 토큰, 출력 토큰, 캐시 읽기, 추론 토큰, api_calls 및 예상 비용을 JSON으로 작성하며, 실행이 실패하더라도 해당 파일을 씁니다.

dsh에는 동등한 플래그가 없지만 필요하지 않습니다. 추가 전용 세션 로그에 모든 것이 포함되어 있으며, 한 가지 함정이 있습니다. $DSH_HOME/sessions/<encoded-cwd>/session-<uuid>/session.jsonl.zstd에 있는 로그는 다중 프레임 zstd 스트림이며, 플러시당 하나의 프레임입니다. zlib.zstdDecompressSync(buf)는 첫 번째 프레임만 반환하므로 150KB 로그가 수백 바이트로 디코딩되어 비어 보입니다. 직접 매직 바이트를 기준으로 분할하세요:

plaintext
1const MAGIC = [0x28, 0xb5, 0x2f, 0xfd], offs = [];
2for (let i = 0; i < buf.length - 4; i++)
3  if (MAGIC.every((m, j) => buf[i + j] === m)) offs.push(i);
4const text = offs
5  .map((o, k) => zlib.zstdDecompressSync(buf.subarray(o, offs[k + 1] ?? buf.length)).toString())
6  .join('');

사용량은 assistant/chunk 이벤트에 있으며, 여기서 data.chunk.type === 'usage'이고, 예상보다 한 단계 더 깊습니다(data.chunk.usage.inputTokens). 도구 호출은 assistant/message 콘텐츠 블록의 tool-call 유형에서 가져옵니다. 그리고 request/header.data.header.config는 실제로 전송된 모델과 maxTokens를 보여주므로, 3단계 구성이 적용되었는지 확인할 수 있습니다.

6단계: 2차 실행, 변경 요청

1차 실행에서 game.html이 이미 있는 동일한 디렉토리. 이제 두 하네스에 변경을 요청하세요:

plaintext
1떨어지는 파워업을 추가하세요: 맨 위 줄의 벽돌이 깨지면, 패들을 10초 동안 넓혀주는 토큰을 떨어뜨리세요. 세 가지 셀프테스트 어설트가 모두 통과하도록 유지하고, 파워업 타이머에 대한 네 번째 어설트를 추가하세요. 같은 파일, 라이브러리 없음.

이 라운드는 두 설계를 구분합니다. Hermes는 복잡한 작업 후에 스킬을 작성하고 3계층 메모리를 유지하므로, 2차 실행은 1차 실행 스킬이 효과를 발휘하는지 여부를 보여줍니다. dsh는 장기 메모리가 전혀 없지만, 추가 전용 세션 로그를 분기하여 중간 지점에서 다시 재생할 수 있습니다.

이 라운드를 시작하기 전에 예산에 대해 솔직해지세요. 제 2차 실행은 일일 지출 한도에 도달하여 11번의 도구 호출 만에 중단되었으며, 이것이 위 표에 두 개의 빈 행이 있고 발명된 행이 없는 이유입니다. Hermes의 자체 대시보드가 그 이유를 보여줍니다:

Hermes Agent 대시보드 세션 페이지에 deepseek-v4-pro에서 Breakout 실행이 76개의 메시지로 나열됨

Hermes v0.20.4가 자체 세션을 다시 읽어 보여줍니다. 완료된 Breakout 실행은 76개의 메시지이며, 모두 Atlas 엔드포인트를 통한 deepseek-v4-pro입니다.

7단계: 청구서 읽기

실행당 두 개의 숫자, 에이전트의 요약이 아닌 하네스 자체 로그에서 가져옵니다:

plaintext
1# Hermes
2jq '{input_tokens, output_tokens, cache_read_tokens, api_calls}' hermes-r1-usage.json
3
4# dsh: 디코딩된 세션 로그 집계
5node dsh-stats.js "$DSH_HOME/sessions/<encoded-cwd>"

그런 다음 공급자의 사용량 페이지와 교차 확인하세요. 하네스 로그와 공급자가 일치하지 않으면 공급자를 신뢰하세요: 그것이 실제로 지불하는 금액입니다.

참고로, dsh의 자체 상태 표시줄은 제 로그 파서와 반올림 오차 내에서 일치했습니다(133K 입력 토큰, 89% 캐시 적중률 vs 제가 계산한 132,600 및 88.8%). 도구는 정직합니다. 에이전트의 영어 요약은 그렇지 않습니다.

DeepSeek Harness와 Hermes를 넘어: 뇌와 팔로 함께 사용하기

"어느 것을 선택할 것인가" 논쟁에서 아무도 제시하지 않는 답이 여기 있습니다: 선택할 필요가 없습니다.

두 프로젝트는 반대 방향으로 실패하기 때문에, 함께 사용하면 비정상적으로 좋은 팀이 됩니다.

기능DeepSeek Harness (dsh)Hermes Agent
코딩 실행강력함, 이것이 설계 목표동일한 작업을 6.4배 더 오래 걸려 완료
장기 메모리없음3계층, 에이전트 관리
자기 개선 스킬없음있음, agentskills.io 호환
세션 로그 포크/재생있음, 추가 전용 JSONLLLM 요약을 통한 세션 검색
내장 cron없음있음, 자연어 일정
채팅 인터페이스없음Telegram, Discord, Slack, WhatsApp, Signal
인터페이스Web UI, TUI, headlessTUI, CLI, 대시보드, 게이트웨이
런타임Node 22.19+/24+Python 3.11 (번들)
성숙도0.1 개발자 프리뷰, 호환성 깨는 변경 있음2026년 2월 출시, v0.20.4
라이선스 / 별MIT, 176.5kMIT, 233.6k

별 수는 2026-08-21에 두 저장소에서 읽었습니다(deepseek-ai/deepseek-harness 176.5k 별, 19.2k 포크; NousResearch/hermes-agent 233.6k 별, 46.8k 포크). 총합이 아닌 궤적을 보세요: dsh는 2026-08-17에 확인했을 때 144,361개의 별이었으므로, 4일 만에 약 32,000개가 추가되었습니다.

세 가지 조합 방법:

  • 뇌와 팔. Hermes가 V4 Pro에서 메모리, 일정, Telegram 스레드를 담당합니다. 실제 코딩은 저렴한 계층의 dsh에 위임합니다. 하나의 키로 두 가지를 모두 처리하므로 두 개의 청구 관계를 관리할 필요가 없습니다.
  • 루프에는 저렴한 계층, 결정에는 비싼 계층. 반복 cron 작업은 deepseek-v3.2 또는 DeepSeek V4 Flash에서 실행되고, 어려운 결정은 Pro로 에스컬레이션됩니다.
  • 둘 다 헤드리스로. dsh --profile headless와 Hermes -z는 모두 프롬프트를 받아 하나의 답변을 출력하므로, TUI 없이 셸 스크립트나 CI 단계에 쉽게 통합할 수 있습니다.

정직한 약점에 대한 공정한 경고: 장점만 나열하는 비교는 광고입니다. dsh는 0.1 개발자 프리뷰이며 자체 UI에서 이를 명시합니다: 버전 간에 호환성이 깨질 수 있고, 메모리가 없으며, 기본 메시징 채널이 없고, 자체 도구 호출을 과소 보고합니다. Hermes는 훨씬 더 성숙한 프로젝트이지만, 토큰당 8배 더 무겁고, dsh가 2분 만에 완료한 작업에 13분 동안 조용히 있었으며, 출력 파일을 엉뚱한 디렉토리에 썼습니다.

DeepSeek Harness vs Hermes, 작업당 실제 비용

이제 산술입니다. 가정은 공개된 상태로 진행합니다.

Atlas는 V4 Pro에 대해 하나의 입력 요금($1.68/1M)을 게시하며, 모델 페이지에 별도의 캐시 적중 요금이 없습니다. 따라서 모든 프롬프트 토큰을 전체 입력 요금(캐시 읽기 포함)으로 계산합니다. 이는 측정값으로 위장한 추측이 아닌 보수적인 상한선입니다.

예시, dsh 1차 실행:

  • 프롬프트: 14,840 새로 + 117,760 캐시 = 132,600 토큰. $1.68/1M 기준으로 $0.2228.
  • 출력: 5,231 토큰. $3.38/1M 기준으로 $0.0177.
  • 총계: 작업당 $0.2404.

동일한 방법을 Hermes 1차 실행에 적용: 1,111,573 프롬프트 토큰은 $1.8674, 더하기 19,317 출력 토큰은 $0.0653, 총 $1.9327. Hermes 자체 --usage-file은 해당 실행에 대해 $0.2817로 추정했으며, 이는 캐시된 입력 요금이 약 $0.125/1M라고 가정함을 의미합니다. 공급자가 실제로 캐시 읽기를 그렇게 크게 할인한다면, 아래 두 숫자는 함께 떨어지고 비율은 거의 변하지 않습니다.

시나리오V4 Pro에서 작업당V4 Flash에서 작업당하루 20개 작업, 30일 (Pro)
dsh 1차 실행$0.24$0.02$144.27
Hermes 1차 실행$1.93$0.16$1,159.64
2차 실행, 두 하네스 모두완료되지 않음완료되지 않음완료되지 않음

이 표에서 두 가지가 눈에 띕니다.

하네스 선택은 8배 차이입니다. 같은 모델, 같은 작업, 같은 결과, 한 셸이 다른 셸보다 8배 비쌉니다. 이는 나중에 최적화할 수 있는 반올림 차이가 아닙니다.

모델 계층은 그 위에 12배 차이를 더합니다. 이것이 바로 뇌와 팔 분할이 꼼수가 아닌 이유입니다: dsh on Flash는 작업당 2센트, Hermes on Pro는 동일한 Breakout 게임에 대해 거의 2달러입니다.

그리고 가장 저렴한 최적화는 여전히 3단계의 것입니다. 기본값 262,144로 설정된 dsh 경로는 동일한 작업을 맞추기 위해 더 많은 단계에서 더 많은 압축 작업을 수행하며, 그 모든 단계에 대해 비용을 지불합니다.

DeepSeek Harness vs Hermes에 대한 진정한 답은 이것입니다: 더 저렴한 모델을 찾기 전에 자신의 셸을 먼저 측정하세요.

DeepSeek Harness vs Hermes FAQ

Hermes Agent와 DeepSeek Harness가 동일한 모델과 API 키를 사용할 수 있나요?

네, 그리고 그것이 두 하네스를 비교하는 유일한 정직한 방법입니다. 둘 다 OpenAI 호환 엔드포인트와 통신합니다. dsh는 api: openai-completionsbaseURL이 있는 llm-pi-ai 공급자 경로가 필요하고, Hermes는 provider: custom/v1로 끝나는 base_url이 필요합니다. 하나의 키, 두 하네스, 두 가격 계층. 전체 구성은 3단계와 4단계에 있습니다.

DeepSeek Harness가 코딩에 Hermes보다 더 나은가요?

이 테스트에서는 분명히 그렇습니다: 121초 대 780초, 8개의 도구 호출 대 35개, 토큰 소비는 1/8, 둘 다 세 가지 셀프 테스트를 모두 통과했습니다. 그러나 "코딩에 더 좋다"는 것이 "더 낫다"는 의미는 아닙니다. 매일 아침 Telegram에 보고하고 지난주에 배운 것을 기억하는 예약 작업이 필요하다면, dsh에는 그런 기능이 전혀 없고 Hermes에는 모두 있습니다.

DeepSeek Harness와 Hermes는 무료 오픈 소스인가요?

둘 다 MIT 라이선스이며 무료로 다운로드할 수 있습니다. 지불하는 것은 토큰이며, 위 표에서 볼 수 있듯이 반올림 오차가 아닙니다. dsh는 0.1 버전으로 명시적으로 개발자 프리뷰이며, 자체 UI에서 호환성을 깨는 변경 사항에 대해 경고하므로, 프로덕션에 가까이 사용할 경우 버전을 고정하세요.

동일한 작업이 한 하네스에서 더 비싼 이유는 무엇인가요?

대략적인 크기 순서로 네 가지 이유:

  • 대화 재읽기. 캐시된 프롬프트 토큰은 dsh 총계의 88.8%, Hermes의 95.5%였습니다. 추가 단계마다 이전의 모든 내용을 다시 보냅니다.
  • 시스템 프롬프트 및 도구 스키마. 위에서 측정함: 작업이 시작되기 전에 10,898 대 13,892 토큰.
  • 단계 수. 8개의 도구 호출과 9단계 대 35개의 도구 호출, 38개의 API 호출에 걸쳐.
  • 제한된 창. dsh가 1,048,576 대신 262,144로 기본 설정되면 긴 작업에 대해 추가 압축 작업이 필요합니다.

DeepSeek Harness와 Hermes를 동시에 실행할 수 있나요?

네. API 키 외에는 아무것도 공유하지 않습니다: 다른 런타임, 다른 구성 디렉토리, 다른 세션 저장소, 다른 포트(기본적으로 3080 및 9119). 일반적인 패턴은 Hermes를 비싼 계층의 항상 켜져 있는 뇌로, dsh를 저렴한 계층의 코딩 팔로 사용하는 것입니다.

DeepSeek Harness는 DeepSeek 자체 API에서만 작동하나요?

아니요, 이것이 가장 흔한 오해입니다. api: openai-completionsbaseURL을 통해 모든 OpenAI 호환 게이트웨이에서 작동합니다. compat.thinkingFormat: deepseek를 기억하세요. dsh는 URL에서 추론 방언을 추론하는데, 타사 게이트웨이 URL은 아무 것도 알려주지 않기 때문입니다.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색