Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

DeepSeek Harness vs OpenCode: 대부분의 개발자가 놓치는 토큰 사용 격차

DeepSeek Harness 대 OpenCode, 동일한 모델과 동일한 작업에서 테스트함. 각 하네스가 토큰 사용량에 미치는 영향, 차이가 실제로 발생하는 이유, 그리고 직접 측정하는 방법.

싼 모델을 골랐다. 모델 카드에서 계산을 했다. 그런데 청구서가 왔는데 계산과 전혀 달랐다.

그 차이는 거의 항상 모델이 아니라 하네스(Harness) 때문이다. 하네스는 모델이 호출되는 횟수, 매 호출마다 대화의 어느 부분이 재생되는지, 툴 스키마의 크기, 그리고 실패한 테스트 실행을 세 번 재시도할지 열두 번 재시도할지를 결정한다. 같은 모델, 같은 작업, 두 개의 다른 하네스, 엄청나게 다른 토큰 수.

2026년 8월 13일, DeepSeek이 자체 에이전트 하네스를 오픈소스로 공개하면서 논쟁이 빠르게 격화되었다. 한쪽은 모델을 만든 연구소의 2주 된 저장소를 가지고 있다. 다른 쪽은 GitHub에서 가장 많은 스타를 받은 코딩 에이전트인 OpenCode를 가지고 있다. 둘 다 MIT 라이선스다. 둘 다 가리키는 모델을 실행한다.

그래서 이것이 비교의 정직한 버전이다. 분위기가 아니라, 스타 수가 아니다. 각 하네스가 실제로 토큰 사용량에 어떤 영향을 미치는지, 그리고 약 15분 안에 자신의 저장소에서 측정하는 방법이다.

핵심 요점

  • DeepSeek Harness는 DeepSeek AI의 플러그인 우선 에이전트 런타임이며, MIT 라이선스, TypeScript로 작성되었으며, 아직 개발자 프리뷰 상태이다. 모델, 툴, 세션, 스토리지, 샌드박스, 루프, 심지어 에이전트 루프 자체까지 모두 교체 가능한 플러그인이다.
  • OpenCode는 Go로 작성된 터미널 네이티브 코딩 에이전트로, 약 198,000개의 GitHub 스타, 성숙한 TUI, LSP 지원 및 대규모 제공자 카탈로그를 보유하고 있다. 오늘날 안전한 기본값이다.
  • 하네스 선택이 대부분의 예상보다 토큰 사용량을 더 크게 움직인다. DeepSeek V4 Flash에서 30개 워크플로우 벤치마크에서 테스트된 하네스는 작업당 평균 토큰 수가 약 192,000에서 1,400,000까지 다양했다.
  • DeepSeek Harness는 해당 벤치마크에 포함되지 않았다. 벤치마크가 발표된 지 이틀 후에 출시되었으므로, 지금 Harness 벤치마크 수치를 인용하는 사람은 추측하는 것이다.
  • 둘 다 모델에 구애받지 않는다. 따라서 두 하네스를 하나의 OpenAI 호환 엔드포인트에 연결하고 진정한 동등 조건 테스트를 실행할 수 있다. 그것이 코드베이스에 대해 유일하게 중요한 숫자이다.

코드가 표시된 노트북에 손으로 타이핑하고 커피 잔이 옆에 있는 이미지

햇볕이 드는 책상 위에 같은 코딩 작업을 두 개의 다른 에이전트 하네스를 통해 실행하는 두 대의 노트북

DeepSeek Harness와 OpenCode를 공정하게 실행하는 유일한 방법: 하나의 모델, 하나의 작업, 두 개의 터미널.

DeepSeek Harness vs OpenCode가 이달의 논쟁이 된 이유

DeepSeek의 프레이밍은 슬로건이다: 에이전트 = 모델 + 하네스. 모델이 생각하고, 하네스는 파일을 읽고, 터미널을 실행하고, 툴을 호출한다. 2년 동안 모두가 전반부를 최적화하고 후반부를 배관으로 취급했다.

그 배관은 비용이 많이 드는 것으로 드러났다.

Composio는 8개의 다른 에이전트 하네스를 통해 30개의 복잡한 다중 앱 워크플로우를 실행했으며, 모두 동일한 DeepSeek V4 Flash 모델을 구동했고, 작업당 900초 제한, 240회 실행에 걸친 이진 프로그래매틱 채점을 적용했다(Composio, 2026년 8월). 모든 곳에서 동일한 모델이 사용되었다. 결과는 가깝지 않았다.

하네스통과율중간 시간작업당 평균 토큰 수
Pi Agent66.7%132.2초559,000
Prime Agent62.5%242.1초1,400,000
OMP56.7%272.4초742,000
Claude Code53.3%122.7초742,000
Codex53.3%245.0초678,000
DeepAgents53.3%187.1초665,000
Hermes Agent50.0%175.5초192,000
OpenCode46.7%129.7초692,000

토큰 열을 다시 읽어보라. 가장 절약적인 하네스는 가장 낭비적인 하네스의 약 1/7의 토큰을 사용했으며, 동일한 작업에서 동일한 모델을 실행했다. 벤치마크 자체의 결론은 하네스가 "실행하는 모델만큼 중요할 수 있다"는 것이었다.

이제 대부분의 기사가 건너뛰는 부분이다. DeepSeek Harness는 해당 표에 없다. 벤치마크는 8월 11일에 발표되었고 Harness는 8월 13일에 출시되었다. 아직 DeepSeek Harness에 대한 신뢰할 수 있는 일대일 토큰 수치는 없으며, 이번 달에 하나를 보여주는 사람은 직접 좁은 작업에서 실행했거나 지어낸 것이다. 표가 제공하는 것은 OpenCode에 대한 견고하고 출처가 명확한 기준선이다: 작업당 692,000 토큰, 46.7% 통과율, 129.7초 중간 시간.

그것이 당신이 이기려고 하는 숫자이며, 이 기사의 나머지 부분은 그것을 정직하게 테스트하는 방법이다.

DeepSeek Harness vs OpenCode: 동일한 모델, 하나의 엔드포인트, 두 개의 런타임

아무것도 실행하기 전에 각 도구의 실용적인 형태는 다음과 같다.

DeepSeek Harness (dsh)OpenCode
제공자DeepSeek AIAnomaly (원래 SST)
출시일2026년 8월 13일2025년 말
GitHub 스타약 143,000약 198,000
라이선스MITMIT
언어TypeScriptGo
인터페이스127.0.0.1:3080의 웹 UI터미널 TUI
상태개발자 프리뷰, 호환성 변경 예정성숙, 널리 배포됨
아키텍처모든 것이 플러그인: 모델, 툴, 스킬, 세션, 샌드박스, 스토리지, 루프, 스케줄링, UI고정된 코어, 두 개의 내장 에이전트(build, plan), MCP 및 LSP 확장
설정$DSH_HOME/settings.yamlopencode.json
토큰 계산내장 토큰 미터(컨텍스트 압력 및 분석 예측 포함), 폴딩을 통한 압축 기능세션별 토큰 및 비용 추적, TUI 내 최소한의 분석
최적 대상에이전트 루프 자체를 다시 작성하려는 팀오늘 바로 작동하는 코딩 에이전트를 원하는 팀

중요한 줄은 아키텍처 행이다. OpenCode는 잘 만들어진 에이전트를 제공하고 가장자리를 확장할 수 있게 한다. DeepSeek Harness는 뼈대를 제공하고 척추를 교체할 수 있게 하며, 에이전트 루프 자체도 플러그인이다. 이것은 진정으로 특이하며, 또한 아직 프리뷰인 이유이기도 하다.

둘 다 모델에 구애받지 않으며, 이것이 공정한 테스트가 가능한 전부 이유이다. 하나의 모델을 제공하는 하나의 OpenAI 호환 엔드포인트에 두 하네스를 모두 연결하면 측정하는 모든 차이는 하네스에 속한다.

이 연습에서는 Atlas Cloud에서 DeepSeek V4 Flash를 제공한다. Atlas Cloud는 두 하네스가 어댑터 코드 없이도 수용하는 일반 OpenAI 호환 엔드포인트를 노출하고, 동일한 키가 두 실행 모두에서 작동하기 때문이다. deepseek-v4-flash-0731 목록은 입력 백만 토큰당 $0.14, 출력 백만 토큰당 $0.28이며, 2026년 8월 기준으로 1,048,576 토큰 컨텍스트 창과 393,216 최대 출력을 제공한다. 이 테스트에는 모든 OpenAI 호환 제공자가 작동한다. 요점은 두 하네스가 동일한 제공자를 사용해야 한다는 것이다.

모델을 선택하기 전에 알아두면 좋은 점: OpenCode는 자체 집계 사용량 데이터를 게시하며, DeepSeek 모델은 이를 통해 233조 개의 토큰을 이동시켰고, V4 Flash가 85.5%, V4 Pro가 나머지 14.5%를 차지한다(OpenCode, 2026년 8월). Flash가 생태계가 실제로 실행하는 모델이다.

1단계: DeepSeek Harness와 OpenCode를 동일한 모델에 연결

하나의 API 키와 하나의 기본 URL을 가져온 다음 두 도구에 정확히 동일한 쌍을 제공한다. Atlas Cloud 콘솔에서 키를 생성하고 한 번 내보낸다:

bash
1export ATLAS_API_KEY="your-api-key"
2

하네스를 연결하기 전에 엔드포인트와 정확한 모델 ID를 한 번 호출하여 확인한다. 이 호출이 텍스트를 반환하지 않으면 하위 모든 것이 작동하지 않는다:

bash
1curl https://api.atlascloud.ai/v1/chat/completions \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "deepseek-ai/deepseek-v4-flash-0731",
6    "messages": [{"role": "user", "content": "Reply with the single word: ready"}]
7  }'
8

모델이 실제 작업에 한 번, 엔드포인트를 통해 직접 응답하는 것을 보는 것이 도움이 된다. 그런 다음 실패한 실행이 하네스 때문인지 경로 때문인지 알 수 있다:

코딩 프롬프트와 생성된 코드 및 토큰 통계를 비교하는 다이어그램

기사의 작업 프롬프트가 api.atlascloud.ai에 게시되고, 그 옆에 DeepSeek V4 Flash 0731이 반환한 실제 응답과 호출이 보고한 토큰 사용량이 표시됨

deepseek-ai/deepseek-v4-flash-0731에 대한 실제 호출 한 번, 두 하네스가 사용할 동일한 모델 ID: 입력 148 토큰, 출력 6,879 토큰 반환, 그 중 5,731개는 추론. 하네스가 단일 툴 스키마를 추가하기 전의 기준점이다.

이제 각 측을 구성한다. DeepSeek Harness는 $DSH_HOME/settings.yaml을 읽으며, 사용자 정의 OpenAI 호환 제공자는 llm-pi-ai 플러그인 아래에 추가된다 (DeepSeek Harness 문서, 2026년 8월):

yaml
1llm-pi-ai:
2  providers:
3    atlas:
4      apiKeyEnv: ATLAS_API_KEY
5      api: openai-completions
6      baseURL: https://api.atlascloud.ai/v1
7      models:
8        - id: deepseek-ai/deepseek-v4-flash-0731
9

api 필드는 openai-completions, openai-responses 또는 anthropic-messages를 허용한다. 여기서는 openai-completions를 사용한다. YAML을 수동으로 편집하고 싶지 않다면 웹 UI에 설정 > 모델 > 사용자 정의 제공자 추가가 있으며, 동일한 블록을 작성하고 키를 $DSH_HOME/.credentials.yaml에 저장한다.

OpenCode는 프로젝트 루트 또는 전역 설정 디렉토리에서 opencode.json을 읽는다 (OpenCode 문서, 2026년 8월):

json
1{
2  "$schema": "https://opencode.ai/config.json",
3  "provider": {
4    "atlas": {
5      "npm": "@ai-sdk/openai-compatible",
6      "name": "Atlas Cloud",
7      "options": {
8        "baseURL": "https://api.atlascloud.ai/v1",
9        "apiKey": "{env:ATLAS_API_KEY}"
10      },
11      "models": {
12        "deepseek-ai/deepseek-v4-flash-0731": {
13          "name": "DeepSeek V4 Flash 0731",
14          "limit": { "context": 1048576, "output": 393216 }
15        }
16      }
17    }
18  },
19  "model": "atlas/deepseek-ai/deepseek-v4-flash-0731"
20}
21

이 엔드포인트는 /v1/chat/completions를 제공하므로 @ai-sdk/openai가 아닌 @ai-sdk/openai-compatible을 사용한다. limit 값을 실제 컨텍스트 및 출력 숫자로 설정한다. OpenCode는 이를 사용하여 요약 시점을 결정하며, 잘못된 제한은 토큰 비교를 크게 왜곡한다.

2단계: DeepSeek Harness에서 벤치마크 작업 실행

여러 번의 툴 호출이 필요할 만큼 크고 객관적으로 채점할 수 있을 만큼 작은 작업 하나를 선택한다. 여러 파일과 실제로 통과해야 하는 테스트 스위트를 포함한다. 두 실행 모두 동일한 저장소 상태를 사용하므로 먼저 커밋하거나 스태시한다.

이것이 정확한 작업 프롬프트다. 두 하네스에 그대로 붙여넣는다:

text
1이 저장소에서 src/server.js의 Express 앱에 토큰 버킷 속도 제한 미들웨어를 추가하십시오. 각 IP를 분당 60개 요청으로 제한하십시오. 거부 시 HTTP 429와 JSON 본문 {"error":"rate_limited","retryAfter":<초>}을 반환하십시오. 모든 /api/* 경로에 미들웨어를 연결하십시오. test/rate-limit.test.js에 세 가지 경우(제한 미만 요청 허용, 제한 초과 요청 429로 차단, 창 만료 후 카운터 재설정)를 다루는 단위 테스트를 추가하십시오. 테스트 스위트를 실행하고 통과할 때까지 실패를 수정하십시오. src/ 및 test/ 외부의 파일은 수정하지 마십시오.

프로젝트 디렉토리에서 Harness를 시작한다:

bash
1cd /path/to/your/repo
2npx @deepseek-ai/dsh web
3

그러면 http://127.0.0.1:3080에 웹 UI가 제공된다. atlas 제공자와 deepseek-ai/deepseek-v4-flash-0731 모델을 선택하고, 작업을 붙여넣고 완료될 때까지 실행한다. 개입하지 말고, 힌트가 있는 명확한 질문에 답하지 마라. 한 하네스에만 도움을 주고 다른 하네스에는 주지 않으면 비교가 무효화된다.

완료되면 Trajectory 보기를 연다. 이것이 세션 기록이며 토큰 숫자가 있는 곳이다.

3단계: 공정한 DeepSeek Harness vs OpenCode 테스트를 위해 OpenCode에서 실행 반복

저장소를 정확히 동일한 시작 상태로 재설정한다. 이 단계는 대부분의 비공식 비교가 조용히 깨지는 곳이다. 두 번째 하네스는 첫 번째 하네스가 이미 절반 수정한 저장소에서 시작하기 때문이다.

bash
1git checkout -- . && git clean -fd
2

그런 다음 동일한 모델에 대해 OpenCode를 실행한다:

bash
1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731
2

2단계의 동일한 작업 프롬프트를 붙여넣는다. 기본 build 에이전트를 사용한다. 이것이 전체 파일 및 셸 액세스 권한이 있는 에이전트이기 때문이다. 다시 한 번, 힌트, 코스 수정 없이 동일한 비개입 처리를 한다.

완료될 때까지 기다린 다음, PR을 검토하는 것과 같은 방식으로 두 실행을 모두 확인한다:

bash
1npm test
2

스위트가 빨간색으로 남아 있는 실행은 요약이 아무리 확신에 차 있어도 통과하지 못한 것이다. Composio 방법론과 정확히 동일하게 이진 방식으로 채점한다. 반쯤 작동하는 속도 제한기는 실패이다.

4단계: DeepSeek Harness vs OpenCode 토큰 사용량 읽기

이제 숫자를 수집한다. 두 하네스 모두 사용량을 추적하지만 표시 방식은 매우 다르며, 이것이 둘 사이의 가장 큰 일상적 차이점이다.

DeepSeek Harness는 기본적으로 마운트된 토큰 미터를 제공한다. 직접 읽을 수 있는 세 가지 세션 예측을 제공한다: tokenUsage(실행 중 합계), contextPressure(창에 얼마나 가까운지), contextBreakdown(토큰이 실제로 어디에 사용되었는지). 마지막 항목이 가장 유용한데, 청구서가 시스템 프롬프트, 툴 스키마, 파일 읽기 또는 대화 재생 중 어디에서 발생하는지 알려주기 때문이다. 미터는 실제 토크나이저 대신 토큰당 약 4자라는 고정 휴리스틱을 사용하므로 강력한 추정치로 간주하고 송장으로 간주하지 마라.

Harness는 또한 전체 컨텍스트를 다르게 처리한다. 잘라내는 대신 압축 엔진이 접는다: 모델에 표시되는 표면을 요약으로 대체하는 반면 전체 로그는 지속성 계층에 남아 있다. 프롬프트에서 토큰이 손실되지만 기록에서 손실되지는 않는다.

OpenCode는 세션별 토큰과 비용을 추적하고 작업 중 상태 표시줄에 인쇄한다. TUI 내 분석은 의도적으로 최소화되어 있으며, 이것이 OpenCode의 세션 데이터베이스를 직접 읽어 툴 및 캐시 적중률별로 사용량을 분석하는 작은 외부 분석기 생태계가 존재하는 이유이다. 툴별 속성을 원한다면 무언가를 설치해야 할 것이다.

비교 자체의 경우, 최종 단어로 각 도구의 자체 카운터를 신뢰하지 마라. 제공자 측 숫자를 사용하라. 그것이 실제로 지불하는 금액이기 때문이다:

비교할 항목가져올 위치
총 입력 토큰제공자 사용량 대시보드, API 키별
총 출력 토큰제공자 사용량 대시보드, API 키별
모델 호출 횟수Harness Trajectory 보기 / OpenCode 세션 로그
벽시계 시간스톱워치, 시작부터 마지막 파일 쓰기까지
통과 또는 실패npm test 종료 코드

가장 깔끔한 방법은 harness-testopencode-test라는 두 개의 별도 API 키를 만들고 각각을 정확히 한 번의 실행에 사용하는 것이다. 그러면 제공자의 자체 사용량 페이지에서 추정 오류 없이 논쟁의 여지가 없는 나란히 비교를 제공한다. 이 방법은 2분이면 되며 카운터가 옳은지에 대한 모든 불일치 소스를 제거한다.

DeepSeek Harness 토큰 사용량: 실제로 청구서를 움직이는 것은 무엇인가

실제 숫자를 얻으면 다음은 건드릴 가치가 있는 레버이다. 두 하네스 모두에 적용되며, 어떤 것을 선택했는지보다 훨씬 중요하다.

대화 재생은 일반적으로 가장 큰 항목이다. 에이전트는 각 단계에서 커지는 대화를 재전송한다. 40단계 작업은 40개의 프롬프트 비용이 들지 않고, 점점 길어지는 40개의 프롬프트 합계에 가까운 비용이 든다. 이것이 벤치마크 범위가 동일한 작업에서 192,000에서 1,400,000 토큰까지 확산된 이유이다. 공격적으로 요약하는 하네스는 해당 범위의 하단에 위치한다.

캐시 적중은 사용 가능한 가장 저렴한 최적화이다. DeepSeek V4 Flash 캐시 적중 가격은 백만 토큰당 약 $0.0028인 반면 미스 시 $0.14로 약 98% 저렴하다. 캐싱은 요청 접두사가 바이트 단위로 동일할 때만 작동하며, 이것이 바로 DeepSeek Harness가 엄격한 {{variable}} 보간(실패 시 큰 소리로 알림)을 시행하고 안정적인 요청 헤더를 유지하는 이유이다. 호출 간에 시스템 프롬프트를 섞는 하네스는 모든 적중을 조용히 미스로 만든다.

툴 스키마는 모든 단일 호출에 함께 탑승한다. 20개의 MCP 서버가 연결되면 작업이 관련되든 말든 20개의 스키마 세트가 영원히 프롬프트에 포함된다. 벤치마크 전에 이 작업에 필요하지 않은 것은 연결을 해제하라. 그렇지 않으면 하네스가 아닌 MCP 구성을 측정하게 된다.

과도하게 큰 툴 결과는 컨텍스트를 오염시킨다. 3,000줄 파일의 cat 한 번 또는 전체 스택 추적을 덤프하는 장황한 테스트 실행기는 실행의 나머지 부분 동안 대화에 남아 있다. Harness에는 요약하기 전에 과도하게 큰 툴 결과를 다시 작성하는 선택적 결과 정리 동반자가 있다. 켜는 것이 좋다.

재시도는 호출을 계산하기 전에는 보이지 않는다. 실패한 테스트를 세 번 재시도하는 하네스는 세 배를 소비한다. 총 토큰뿐만 아니라 호출 횟수 열도 비교하라. 그렇지 않으면 재시도 루프를 비싼 모델로 잘못 진단할 것이다.

비용 측면에서 토큰 수를 알면 산술은 간단하다. DeepSeek V4 Flash의 Atlas Cloud 요금으로 입력 위주의 692,000 토큰 작업은 낮은 단위 센트에 해당한다. 이것이 이 전체 범주에 대한 좋은 소식이다: 모델이 충분히 저렴하여 하네스 낭비는 예산 비상사태라기보다는 효율성 문제이다. 팀이 하루 종일 매일 실행할 때 곱해야만 실제 숫자가 된다. 두 번째 모델에 대해 동일한 테스트를 실행하고 모델 효과를 하네스 효과와 분리하려면 전체 모델 카탈로그를 살펴보라.

어떤 토큰 숫자보다 결정을 형성해야 하는 한 가지 주의 사항: DeepSeek Harness는 명시적으로 개발자 프리뷰 상태이며 자체 README는 호환성을 깨는 변경이 있을 것이라고 대문자로 경고한다. 벤치마킹하기에는 괜찮지만 이번 달에 팀 표준화하기에는 위험한 것이다. OpenCode는 지루한 선택이며, 프로덕션 저장소에 대해 실행될 때 지루함은 기능이다.

자주 묻는 질문

DeepSeek Harness가 OpenCode보다 더 나은가요?

아직은 대부분의 사람들에게 그렇지 않습니다. OpenCode는 성숙하고, 터미널 네이티브이며, 약 198,000개의 스타와 대규모 제공자 카탈로그를 보유하고 있으며 오늘날 작동합니다. DeepSeek Harness는 2주밖에 되지 않았고, 개발자 프리뷰 상태이며, 호환성 변경에 대해 경고합니다. Harness는 아키텍처적으로 더 흥미롭습니다. 에이전트 루프를 포함한 모든 구성 요소가 교체 가능한 플러그인이기 때문입니다. 에이전트 내부를 다시 작성하려면 Harness가 그 용도에 맞게 제작되었습니다. 이번 주에 코드를 배송하려면 OpenCode를 사용하십시오.

DeepSeek Harness는 DeepSeek 모델에서만 작동하나요?

아닙니다. 모델에 구애받지 않습니다. DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure 및 Codex에 대한 카탈로그 제공자를 제공하며, $DSH_HOME/settings.yaml에 블록을 추가하여 openai-completions, openai-responses 또는 anthropic-messages를 사용하는 모든 사용자 정의 제공자를 추가할 수 있습니다. 1단계의 구성은 어댑터 코드 없이 타사 OpenAI 호환 엔드포인트를 가리킵니다.

DeepSeek Harness 토큰 사용량을 어떻게 확인하나요?

기본적으로 마운트된 내장 토큰 미터를 사용하십시오. Trajectory 보기에서 볼 수 있는 tokenUsage, contextPressurecontextBreakdown 예측을 노출합니다. 실제 토크나이저를 실행하는 대신 토큰당 약 4자라는 고정 휴리스틱으로 추정합니다. 청구 정확성을 위해 대신 제공자의 사용량 대시보드를 읽으십시오. 이상적으로는 실행당 전용 API 키를 사용하십시오. 토큰 사용량 대시보드와 같은 커뮤니티 플러그인은 상단에 영구 세션별 레코드를 추가합니다.

어떤 하네스가 더 적은 토큰을 사용하나요, DeepSeek Harness 아니면 OpenCode?

아직 공개된 일대일 비교는 없습니다. DeepSeek V4 Flash에 대한 8개 하네스 벤치마크는 OpenCode를 작업당 평균 692,000 토큰으로 측정했지만, DeepSeek Harness가 출시되기 이틀 전에 실행되었으므로 Harness는 포함되지 않았습니다. 해당 벤치마크에서 Harness 숫자를 인용하는 사람은 존재하지 않는 것을 인용하는 것입니다. 자신의 저장소에서 2~4단계 테스트를 실행하십시오. 토큰 사용량은 코드베이스 크기, MCP 구성 및 작업 형태에 크게 의존하기 때문입니다.

DeepSeek Harness와 OpenCode를 동일한 API 키에 대해 실행할 수 있나요?

예, 간단한 테스트에는 괜찮습니다. 깔끔한 측정을 위해 하네스당 두 개의 별도 키를 사용하십시오. 그러면 제공자의 사용량 대시보드가 모든 토큰을 올바른 실행에 자동으로 귀속시키고 두 개의 다른 내부 추정기를 하나의 송장과 조정할 필요가 없습니다.

에이전트와 하네스의 차이점은 무엇인가요?

DeepSeek 자체 프레이밍은 에이전트 = 모델 + 하네스입니다. 모델이 추론을 수행합니다. 하네스는 이를 현실에 연결하는 모든 것입니다: 파일 읽기 및 쓰기, 셸 명령 실행, 툴 호출, 세션 관리, 승인 처리 및 다음에 일어날 일을 결정하는 루프 구동. 동일한 모델에 다른 하네스를 추가하면 측정 가능하게 다른 에이전트가 생성되며, 이것이 이 비교의 전체 요점입니다.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색