DeepSeek Harness는 해당 벤치마크에 포함되지 않았습니다. 이틀 뒤에 출시되었습니다. 즉, 유용한 질문은 "어느 쪽이 이겼나?"가 아닙니다. 유용한 질문은 동일한 모델에서 동일한 작업을 두 도구를 통해 실행하고, 자신을 속이지 않고 청구서를 읽는 방법입니다.
핵심 요약
- 하네스 선택에 따라 유사한 에이전트 작업에서 토큰 사용량이 약 7배까지 차이날 수 있습니다.
- DeepSeek Harness와 OpenCode를 동일한 모델과 동일한 저장소 상태로 측정하세요.
- 일상 작업에 사용할 도구를 선택하기 전에 별도의 API 키를 사용하세요.

동일한 코딩 작업을 두 개의 에이전트 하네스를 통해 실행하는 두 대의 노트북
공정한 설정: 하나의 모델, 하나의 작업, 두 개의 터미널.
공개 벤치마크가 알려주는 것
Composio는 8개의 에이전트 하네스를 통해 30개의 복잡한 멀티 앱 워크플로우를 실행했으며, 모두 DeepSeek V4 Flash를 사용하고, 작업당 900초 상한 및 240회 실행에 대한 이진 프로그래매틱 평가를 수행했습니다(Composio, 2026년 8월). 동일한 모델, 다른 하네스.
| 하네스 | 통과율 | 중간 시간 | 작업당 평균 토큰 수 |
|---|---|---|---|
| Pi Agent | 66.7% | 132.2초 | 559,000 |
| Prime Agent | 62.5% | 242.1초 | 1,400,000 |
| OMP | 56.7% | 272.4초 | 742,000 |
| Claude Code | 53.3% | 122.7초 | 742,000 |
| Codex | 53.3% | 245.0초 | 678,000 |
| DeepAgents | 53.3% | 187.1초 | 665,000 |
| Hermes Agent | 50.0% | 175.5초 | 192,000 |
| OpenCode | 46.7% | 129.7초 | 692,000 |
토큰 열이 순위보다 더 중요합니다. 범위는 작업당 평균 토큰 192,000개에서 1,400,000개까지입니다. 동일한 모델이 다른 런타임을 통해 비슷한 작업을 수행한 결과입니다.
OpenCode는 출처가 명확한 기준선을 제공합니다: 작업당 692,000 토큰, 46.7% 통과율, 129.7초 중간 시간. DeepSeek Harness는 이 벤치마크에서 공개된 직접 비교 수치가 없습니다. DeepSeek이 2026년 8월 13일에 출시했는데, 이는 벤치마크가 게시된 지 이틀 후이기 때문입니다.
이 표를 경고로 받아들이고, 최종 판단으로 삼지 마세요. 하네스가 비용을 좌우할 수 있음을 보여줍니다. DeepSeek Harness가 사용자의 저장소에서 OpenCode를 능가하는지 여부를 증명하지는 않습니다.
하네스를 전환할 때 달라지는 점
테스트하기 전에, 실제 개발자에게 영향을 미치는 부분, 즉 설정 복잡도, 성숙도, 토큰 가시성 및 에이전트 루프 중 얼마나 교체할 수 있는지 기준으로 두 도구를 비교하세요.
| DeepSeek Harness (dsh) | OpenCode | |
|---|---|---|
| 출처 | DeepSeek AI | Anomaly (원래 SST) |
| 출시일 | 2026년 8월 13일 | 2025년 후반 |
| GitHub 별점 | 약 143k | 약 198k |
| 라이선스 | MIT | MIT |
| 언어 | TypeScript | Go |
| 인터페이스 | 127.0.0.1:3080의 웹 UI | 터미널 TUI |
| 상태 | 개발자 프리뷰, 호환성 깨짐 예상 | 성숙, 널리 배포됨 |
| 아키텍처 | 모델, 도구, 세션, 샌드박스, 스토리지, 루프 및 UI를 위한 교체 가능한 플러그인 | 고정 코어에 빌드/계획 에이전트, MCP 지원 및 LSP 확장 |
| 설정 | $DSH_HOME/settings.yaml | opencode.json |
| 토큰 회계 | 컨텍스트 압력 및 세분화 예측이 포함된 토큰 미터 | TUI의 세션별 토큰 및 비용 추적 |
| 최적 용도 | 에이전트 루프 자체를 수정하려는 팀 | 오늘 당장 사용할 수 있는 코딩 에이전트가 필요한 팀 |
OpenCode는 안정적인 코딩 에이전트를 제공하며, 가장자리에 확장 지점이 있습니다. DeepSeek Harness는 루프 자체를 교체할 수 있는 런타임을 제공합니다. 이러한 유연성은 에이전트 인프라를 구축하는 경우 유용합니다. 이번 주에 프로덕션 코드를 위한 기본 도구가 필요한 경우에는 위험을 추가합니다.
두 도구 모두 동일한 OpenAI 호환 엔드포인트를 사용할 수 있습니다. 따라서 공정한 테스트가 가능합니다: 하나의 모델, 하나의 기본 URL, 하나의 작업, 하나의 시작 저장소 상태.
이 연습에서는 DeepSeek V4 Flash가 Atlas Cloud를 통해 실행됩니다. Atlas Cloud는 두 도구 모두에서 허용되는 OpenAI 호환 엔드포인트를 노출합니다. deepseek-v4-flash-0731 목록은 입력 토큰 100만 개당 $0.14, 출력 토큰 100만 개당 $0.28, 1,048,576 토큰 컨텍스트 윈도우, 2026년 8월 기준 최대 출력 393,216을 보여줍니다. 두 하네스가 동일한 엔드포인트와 모델 ID를 사용한다면 모든 프로바이더가 작동합니다.
OpenCode는 또한 집계 사용량 데이터를 게시합니다. DeepSeek 모델은 OpenCode를 통해 233조 개의 토큰을 이동했으며, V4 Flash가 85.5%, V4 Pro가 14.5%를 차지합니다(OpenCode, 2026년 8월). 이 사용 패턴은 V4 Flash를 비교를 위한 실용적인 기본값으로 만듭니다.
1단계: 두 도구를 동일한 모델에 연결
API 키 하나와 기본 URL 하나를 생성한 다음, 두 도구에 동일한 쌍을 제공합니다. Atlas Cloud 콘솔에서 키를 생성하고 한 번 내보냅니다:
plaintext1export ATLAS_API_KEY="your-api-key" 2
엔드포인트를 하네스에 전달하기 전에 확인하세요:
plaintext1curl https://api.atlascloud.ai/v1/chat/completions \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "deepseek-ai/deepseek-v4-flash-0731", 6 "messages": [{"role": "user", "content": "Reply with the single word: ready"}] 7 }' 8
이 호출은 하네스가 도구, 재시도 또는 대화 재생을 추가하기 전에 경로, 키 및 모델 ID가 작동함을 증명합니다.

deepseek-ai/deepseek-v4-flash-0731에 대한 한 번의 직접 호출: 148개의 프롬프트 토큰 입력, 6,879개의 출력 토큰 반환, 여기에는 5,731개의 추론 토큰이 포함됩니다. 하네스가 도구 스키마와 기록을 추가하기 전의 기준선으로 간주하세요.
DeepSeek Harness는 $DSH_HOME/settings.yaml을 읽으며, 사용자 정의 OpenAI 호환 프로바이더는 llm-pi-ai 플러그인 아래에 추가됩니다 (DeepSeek Harness 문서, 2026년 8월):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 apiKeyEnv: ATLAS_API_KEY 5 api: openai-completions 6 baseURL: https://api.atlascloud.ai/v1 7 models: 8 - id: deepseek-ai/deepseek-v4-flash-0731 9
이 엔드포인트에는 openai-completions을 사용하세요. 웹 UI는 설정, 모델, 사용자 정의 프로바이더 추가에서 동일한 프로바이더 블록을 작성한 다음 $DSH_HOME/.credentials.yaml에 키를 저장할 수 있습니다.
OpenCode는 프로젝트 루트 또는 전역 구성 디렉토리에서 opencode.json을 읽습니다 (OpenCode 문서, 2026년 8월):
plaintext1{ 2 "$schema": "https://opencode.ai/config.json", 3 "provider": { 4 "atlas": { 5 "npm": "@ai-sdk/openai-compatible", 6 "name": "Atlas Cloud", 7 "options": { 8 "baseURL": "https://api.atlascloud.ai/v1", 9 "apiKey": "{env:ATLAS_API_KEY}" 10 }, 11 "models": { 12 "deepseek-ai/deepseek-v4-flash-0731": { 13 "name": "DeepSeek V4 Flash 0731", 14 "limit": { "context": 1048576, "output": 393216 } 15 } 16 } 17 } 18 }, 19 "model": "atlas/deepseek-ai/deepseek-v4-flash-0731" 20} 21
이 엔드포인트는 /v1/chat/completions을 제공하므로 @ai-sdk/openai-compatible를 사용하세요. 실제 컨텍스트 및 출력 제한을 설정하세요. OpenCode는 요약 시점을 결정할 때 이를 사용하며, 잘못된 제한은 토큰 비교를 왜곡할 수 있습니다.
2단계: DeepSeek Harness에서 동일한 벤치마크 작업 실행
여러 도구 호출이 필요할 정도로 크고 평가할 수 있을 정도로 작은 작업을 선택하세요. 두 실행 모두 동일한 저장소 상태를 사용하므로 시작하기 전에 커밋하거나 스태시하세요.
다음 정확한 작업을 두 도구에 모두 붙여넣으세요:
plaintext1이 저장소에서 src/server.js의 Express 앱에 토큰 버킷 속도 제한 미들웨어를 추가하세요. 각 IP를 분당 60개의 요청으로 제한하세요. 거부 시 HTTP 429와 함께 JSON 본문 {"error":"rate_limited","retryAfter":<seconds>}을 반환하세요. 미들웨어를 모든 /api/* 경로에 연결하세요. test/rate-limit.test.js에 세 가지 경우(제한 이하의 요청은 허용, 제한 초과 요청은 429로 차단, 윈도우 만료 후 카운터 재설정)를 다루는 단위 테스트를 추가하세요. 테스트 스위트를 실행하고 통과할 때까지 실패를 수정하세요. src/ 및 test/ 외부의 파일은 수정하지 마세요. 2
프로젝트 디렉토리에서 Harness를 시작하세요:
plaintext1cd /path/to/your/repo 2npx @deepseek-ai/dsh web 3
UI는 http://127.0.0.1:3080에서 실행됩니다. atlas 프로바이더와 deepseek-ai/deepseek-v4-flash-0731 모델을 선택하고, 작업을 붙여넣은 후 완료될 때까지 기다리세요. 실행이 시작된 후 힌트를 추가하지 마세요. 한 도구에 대한 추가 도움말은 비교를 무효화합니다.
Harness가 완료되면 Trajectory 뷰를 여세요. 이 세션 기록에 토큰 숫자가 있습니다.
3단계: OpenCode에서 실행 반복
저장소를 정확한 시작 상태로 재설정하세요. 두 번째 하네스는 첫 번째 도구가 이미 변경한 파일을 상속받아서는 안 됩니다.
plaintext1git checkout -- . && git clean -fd 2
그런 다음 동일한 모델에 대해 OpenCode를 실행하세요:
plaintext1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731 2
2단계의 동일한 작업 프롬프트를 붙여넣으세요. 기본 build 에이전트를 사용하세요. 힌트 없이 완료될 때까지 기다리세요.
두 실행을 동일한 명령으로 평가하세요:
plaintext1npm test 2
에이전트 요약이 확신에 차 있더라도 스위트가 빨간색으로 남아 있으면 실패입니다. 이진 평가 사용: 통과 또는 실패.
4단계: 토큰 사용량 읽기
두 도구 모두 사용량을 추적하지만, 어떤 카운터도 최종 청구서 번호가 되어서는 안 됩니다.
DeepSeek Harness는 기본적으로 장착된 토큰 미터와 함께 제공됩니다. Trajectory 뷰에서 tokenUsage, contextPressure 및 contextBreakdown을 노출합니다. contextBreakdown은 청구서가 시스템 프롬프트, 도구 스키마, 파일 읽기 또는 대화 재생에서 발생했는지 알려줍니다. 미터는 문자 약 4개를 토큰 1개로 추정하므로 진단 뷰로 사용하세요.
OpenCode는 세션당 토큰 및 비용을 추적하여 TUI 상태 표시줄에 출력합니다. 기본 제공 세분화가 더 작기 때문에 툴별 속성이 필요한 팀은 종종 외부 분석기로 세션 데이터베이스를 검사합니다.
비교를 위해 프로바이더 측 숫자를 사용하세요:
| 비교 항목 | 확인 위치 |
|---|---|
| 총 입력 토큰 | 프로바이더 사용량 대시보드, API 키별 |
| 총 출력 토큰 | 프로바이더 사용량 대시보드, API 키별 |
| 모델 호출 수 | Harness trajectory 뷰 / OpenCode 세션 로그 |
| 실제 경과 시간 | 스톱워치, 시작부터 마지막 파일 쓰기까지 |
| 통과 또는 실패 | npm test 종료 코드 |
harness-test 및 opencode-test라는 두 개의 API 키를 생성하고 각 실행에 하나의 키를 사용하세요. 그러면 프로바이더 대시보드가 두 내부 추정기를 조정하지 않고도 깔끔한 나란히 사용량을 제공합니다.
청구서가 변동하는 이유
토큰 사용량은 구체적인 이유로 변경됩니다. 일반적으로 다음 다섯 가지가 모델 가격보다 더 중요합니다.
대화 재생이 누적됩니다. 에이전트는 각 단계에서 커지는 대화를 재전송합니다. 40단계 작업의 비용은 40개의 동일한 프롬프트 비용보다 40개의 증가하는 프롬프트의 합계에 더 가깝습니다. 일찍 요약하는 하네스는 벤치마크 분포의 하단에 가깝게 위치합니다.
캐시 적중이 입력 비용을 절감합니다. DeepSeek V4 Flash 캐시 적중은 토큰 100만 개당 약 $0.0028이며, 미스 시 $0.14로 약 98% 저렴합니다. 캐싱에는 바이트 단위로 안정적인 접두사가 필요합니다. 하네스가 호출 간에 시스템 프롬프트 텍스트를 섞으면 적중이 미스로 바뀝니다.
도구 스키마가 함께 따라옵니다. 20개의 연결된 MCP 서버는 작업이 그중 두 개만 사용하더라도 프롬프트에 20개의 스키마 세트를 의미합니다. 벤치마크하기 전에 필요하지 않은 도구를 연결 해제하세요. 그렇지 않으면 하네스 대신 도구 설정을 측정하게 됩니다.
큰 도구 출력이 컨텍스트를 오염시킵니다. 3,000줄 파일의 cat 또는 장황한 실패 테스트 로그는 이후 호출을 위해 대화에 남아 있습니다. DeepSeek Harness는 요약하기 전에 큰 도구 결과를 정리할 수 있습니다. 작업이 시끄러운 출력을 생성할 때 이를 켜세요.
재시도는 호출 수 안에 숨겨집니다. 실패하는 테스트 루프를 재시도하는 하네스는 매번 토큰을 소비합니다. 총 토큰 옆에 모델 호출을 비교하면 재시도 루프와 비싼 프롬프트를 분리할 수 있습니다.
DeepSeek V4 Flash에 대한 Atlas Cloud 요율로, 입력 쪽으로 가중치가 있는 692,000 토큰 작업은 낮은 단위 센트에 해당합니다. 이는 한 번 실행에는 적은 금액이지만, 하루 종일 에이전트를 실행하는 팀에는 큰 금액입니다. 두 번째 모델에서 테스트를 반복하고 모델 효과와 하네스 효과를 분리하려면 전체 모델 카탈로그를 살펴보세요.
DeepSeek Harness는 여전히 개발자 프리뷰이며, README에서 호환성 깨짐에 대해 경고합니다. 에이전트 루프를 제어하려면 벤치마크하세요. 팀이 변경을 흡수할 수 있는 경우에만 표준화하세요. OpenCode는 오늘 당장 도구가 필요한 팀에게 더 안정적인 선택입니다.
자주 묻는 질문
DeepSeek Harness가 OpenCode보다 더 나은가요?
아직은 대부분의 팀에 해당하지 않습니다. OpenCode는 성숙하고, 터미널 네이티브이며, 약 198k의 별점과 큰 프로바이더 카탈로그를 보유하고 있으며, 오늘 바로 작동합니다. DeepSeek Harness는 더 새롭고, 개발자 프리뷰 상태이며, 호환성 깨짐을 경고합니다. 에이전트 내부를 수정하려면 Harness를 선택하세요. 일상 작업을 위한 코딩 에이전트를 원한다면 OpenCode를 선택하세요.
DeepSeek Harness는 DeepSeek 모델에서만 작동하나요?
아니요. 모델에 구애받지 않습니다. DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure 및 Codex에 대한 카탈로그 프로바이더와 함께 제공되며, $DSH_HOME/settings.yaml에서 openai-completions, openai-responses 또는 anthropic-messages를 사용하는 모든 사용자 정의 프로바이더를 추가할 수 있습니다. 1단계 구성은 어댑터 코드 없이 OpenAI 호환 엔드포인트를 가리킵니다.
DeepSeek Harness 토큰 사용량을 어떻게 확인하나요?
Trajectory 뷰의 내장 토큰 미터를 사용하세요. tokenUsage, contextPressure 및 contextBreakdown을 노출합니다. 문자 약 4개를 토큰 1개로 추정하므로 추정치로 취급하세요. 청구 정확도를 위해서는 프로바이더 사용량 대시보드를 읽고, 각 실행에 전용 API 키를 사용하는 것이 이상적입니다.
DeepSeek Harness와 OpenCode 중 어떤 하네스가 더 적은 토큰을 사용하나요?
아직 공개된 직접 비교 벤치마크가 없습니다. Composio 벤치마크는 OpenCode를 작업당 평균 692,000 토큰으로 측정했지만, DeepSeek Harness가 출시되기 전에 실행되었습니다. 토큰 사용량은 코드베이스 크기, 도구 설정 및 작업 형태에 따라 달라지므로 자체 저장소에서 2~4단계 테스트를 실행하세요.
DeepSeek Harness와 OpenCode를 동일한 API 키에 대해 실행할 수 있나요?
간단한 테스트의 경우 가능합니다. 깔끔한 측정을 위해서는 하네스당 하나씩 두 개의 별도 키를 사용하세요. 그러면 프로바이더 대시보드가 모든 토큰을 올바른 실행에 귀속시킵니다.
에이전트와 하네스의 차이점은 무엇인가요?
DeepSeek은 에이전트를 모델 + 하네스로 설명합니다. 모델은 추론합니다. 하네스는 모델을 파일, 셸 명령, 도구, 세션, 승인 및 다음 동작을 결정하는 루프에 연결합니다. 하네스를 변경하면 동일한 모델이 동일한 작업에 대해 다른 수의 토큰을 사용할 수 있습니다.






