DeepSeek Harness không nằm trong bài đánh giá chuẩn đó. Nó được phát hành sau hai ngày. Do đó, câu hỏi hữu ích không phải là "cái nào thắng?" mà là cách chạy cùng một tác vụ qua cả hai công cụ, trên cùng một mô hình, và đọc hóa đơn mà không tự lừa dối mình.
Những điểm chính
- Lựa chọn harness có thể làm thay đổi mức sử dụng token lên đến khoảng 7 lần trong các tác vụ agent tương đương.
- Đo lường DeepSeek Harness và OpenCode với cùng một mô hình và cùng trạng thái repo.
- Sử dụng các khóa API riêng biệt trước khi bạn chọn một cái cho công việc hàng ngày.

Hai máy tính xách tay chạy cùng một tác vụ mã hóa qua hai agent harness
Thiết lập công bằng: một mô hình, một tác vụ, hai terminal.
Những gì bài đánh giá chuẩn công khai cho chúng ta biết
Composio đã chạy 30 quy trình làm việc đa ứng dụng phức tạp qua 8 agent harness, tất cả đều sử dụng DeepSeek V4 Flash, giới hạn 900 giây mỗi tác vụ và chấm điểm nhị phân theo chương trình trên 240 lần chạy (Composio, tháng 8 năm 2026). Cùng một mô hình, harness khác nhau.
| Harness | Tỷ lệ đỗ | Thời gian trung bình | Token trung bình mỗi tác vụ |
|---|---|---|---|
| Pi Agent | 66.7% | 132.2s | 559,000 |
| Prime Agent | 62.5% | 242.1s | 1,400,000 |
| OMP | 56.7% | 272.4s | 742,000 |
| Claude Code | 53.3% | 122.7s | 742,000 |
| Codex | 53.3% | 245.0s | 678,000 |
| DeepAgents | 53.3% | 187.1s | 665,000 |
| Hermes Agent | 50.0% | 175.5s | 192,000 |
| OpenCode | 46.7% | 129.7s | 692,000 |
Cột token quan trọng hơn thứ hạng. Mức chênh lệch từ 192.000 đến 1.400.000 token trung bình mỗi tác vụ. Đó là cùng một mô hình thực hiện công việc tương đương qua các runtime khác nhau.
OpenCode cung cấp cho chúng ta một đường cơ sở có nguồn gốc: 692.000 token mỗi tác vụ, tỷ lệ đỗ 46,7% và thời gian trung bình 129,7 giây. DeepSeek Harness không có con số đối đầu công khai từ bài đánh giá chuẩn này vì DeepSeek phát hành nó vào ngày 13 tháng 8 năm 2026, hai ngày sau khi bài đánh giá chuẩn được công bố.
Sử dụng bảng như một lời cảnh báo, không phải phán quyết. Nó cho thấy harness có thể chi phối chi phí. Nó không chứng minh liệu DeepSeek Harness có đánh bại OpenCode trên repo của bạn hay không.
Điều gì thay đổi khi bạn chuyển đổi harness
Trước khi thử nghiệm, hãy so sánh hai công cụ dựa trên các yếu tố ảnh hưởng đến một nhà phát triển đang làm việc: bề mặt thiết lập, độ trưởng thành, khả năng hiển thị token và mức độ bạn có thể thay thế vòng lặp agent.
| DeepSeek Harness (dsh) | OpenCode | |
|---|---|---|
| Nhà phát triển | DeepSeek AI | Anomaly (ban đầu là SST) |
| Ngày phát hành | 13 tháng 8 năm 2026 | Cuối năm 2025 |
| Sao GitHub | ~143k | ~198k |
| Giấy phép | MIT | MIT |
| Ngôn ngữ | TypeScript | Go |
| Giao diện | Web UI trên 127.0.0.1:3080 | Terminal TUI |
| Trạng thái | Bản xem trước dành cho nhà phát triển, dự kiến có thay đổi phá vỡ | Trưởng thành, được triển khai rộng rãi |
| Kiến trúc | Plugin có thể thay thế cho mô hình, công cụ, phiên, sandbox, lưu trữ, vòng lặp và UI | Cốt lõi cố định với agent build/plan, hỗ trợ MCP và tiện ích mở rộng LSP |
| Cấu hình | $DSH_HOME/settings.yaml | opencode.json |
| Hạch toán token | Đồng hồ đo token với áp lực ngữ cảnh và dự báo phân tích | Theo dõi token và chi phí mỗi phiên trong TUI |
| Phù hợp nhất cho | Nhóm muốn sửa đổi chính vòng lặp agent | Nhóm muốn một agent mã hóa hoạt động ngay hôm nay |
OpenCode cung cấp cho bạn một agent mã hóa ổn định với các điểm mở rộng xung quanh. DeepSeek Harness cung cấp cho bạn một runtime nơi vòng lặp có thể được hoán đổi. Tính linh hoạt đó hữu ích nếu bạn đang xây dựng cơ sở hạ tầng agent. Nó thêm rủi ro nếu bạn cần một công cụ mặc định cho mã sản xuất trong tuần này.
Cả hai công cụ đều có thể truy cập cùng một endpoint tương thích OpenAI. Điều đó làm cho một thử nghiệm công bằng có thể thực hiện được: một mô hình, một base URL, một tác vụ và một trạng thái repo bắt đầu.
Trong hướng dẫn này, DeepSeek V4 Flash chạy qua Atlas Cloud, nơi cung cấp endpoint tương thích OpenAI được cả hai công cụ chấp nhận. Danh sách deepseek-v4-flash-0731 hiển thị $0,14 mỗi triệu token đầu vào, $0,28 mỗi triệu token đầu ra, cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 393.216 tính đến tháng 8 năm 2026. Bất kỳ nhà cung cấp nào cũng được nếu cả hai harness sử dụng cùng endpoint và id mô hình.
OpenCode cũng công bố dữ liệu sử dụng tổng hợp. Mô hình DeepSeek đã di chuyển 233 nghìn tỷ token qua OpenCode, với V4 Flash chiếm 85,5% và V4 Pro chiếm 14,5% (OpenCode, tháng 8 năm 2026). Mô hình sử dụng đó làm cho V4 Flash trở thành mặc định thực tế cho việc so sánh.
Bước 1: Chỉ cả hai công cụ vào cùng một mô hình
Tạo một khóa API và một base URL, sau đó cung cấp cho cả hai công cụ cùng một cặp. Tạo khóa trong bảng điều khiển Atlas Cloud và xuất nó một lần:
plaintext1export ATLAS_API_KEY="your-api-key" 2
Kiểm tra endpoint trước khi bạn đưa nó cho bất kỳ harness nào:
plaintext1curl https://api.atlascloud.ai/v1/chat/completions \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "deepseek-ai/deepseek-v4-flash-0731", 6 "messages": [{"role": "user", "content": "Reply with the single word: ready"}] 7 }' 8
Cuộc gọi đó chứng minh route, khóa và id mô hình hoạt động trước khi harness thêm công cụ, thử lại hoặc phát lại cuộc trò chuyện.

Lời nhắc mã hóa, mã được tạo và thống kê token từ một cuộc gọi mô hình
Một cuộc gọi trực tiếp đến deepseek-ai/deepseek-v4-flash-0731: 148 token lời nhắc vào, 6.879 token đầu ra trả về, bao gồm 5.731 token suy luận. Coi đó là mức sàn trước khi harness thêm lược đồ công cụ và lịch sử.
DeepSeek Harness đọc $DSH_HOME/settings.yaml, và các nhà cung cấp tùy chỉnh tương thích OpenAI nằm dưới plugin llm-pi-ai (Tài liệu DeepSeek Harness, tháng 8 năm 2026):
plaintext1llm-pi-ai: 2 providers: 3 atlas: 4 apiKeyEnv: ATLAS_API_KEY 5 api: openai-completions 6 baseURL: https://api.atlascloud.ai/v1 7 models: 8 - id: deepseek-ai/deepseek-v4-flash-0731 9
Sử dụng openai-completions cho endpoint này. Web UI có thể viết cùng một khối nhà cung cấp từ Settings, Models, Add custom provider, sau đó lưu khóa trong $DSH_HOME/.credentials.yaml.
OpenCode đọc opencode.json trong thư mục gốc dự án của bạn hoặc thư mục cấu hình toàn cục (Tài liệu OpenCode, tháng 8 năm 2026):
plaintext1{ 2 "$schema": "https://opencode.ai/config.json", 3 "provider": { 4 "atlas": { 5 "npm": "@ai-sdk/openai-compatible", 6 "name": "Atlas Cloud", 7 "options": { 8 "baseURL": "https://api.atlascloud.ai/v1", 9 "apiKey": "{env:ATLAS_API_KEY}" 10 }, 11 "models": { 12 "deepseek-ai/deepseek-v4-flash-0731": { 13 "name": "DeepSeek V4 Flash 0731", 14 "limit": { "context": 1048576, "output": 393216 } 15 } 16 } 17 } 18 }, 19 "model": "atlas/deepseek-ai/deepseek-v4-flash-0731" 20} 21
Sử dụng @ai-sdk/openai-compatible, vì endpoint này phục vụ /v1/chat/completions. Đặt giới hạn ngữ cảnh và đầu ra thực tế. OpenCode sử dụng chúng khi quyết định thời điểm tóm tắt và giới hạn sai có thể làm sai lệch so sánh token.
Bước 2: Chạy cùng một tác vụ chuẩn trong DeepSeek Harness
Chọn một tác vụ đủ lớn để cần nhiều cuộc gọi công cụ và đủ nhỏ để chấm điểm. Sử dụng cùng trạng thái repo cho cả hai lần chạy, vì vậy hãy commit hoặc stash trước khi bạn bắt đầu.
Dán chính xác tác vụ này vào cả hai công cụ:
plaintext1Trong kho lưu trữ này, thêm middleware giới hạn tốc độ token-bucket cho ứng dụng 2Express trong src/server.js. Giới hạn mỗi IP 60 yêu cầu mỗi phút. Khi từ chối, 3trả về HTTP 429 với nội dung JSON {"error":"rate_limited","retryAfter":<giây>}. 4Kết nối middleware vào mọi route /api/*. Thêm kiểm thử đơn vị trong 5test/rate-limit.test.js bao gồm ba trường hợp: một yêu cầu dưới giới hạn được 6cho phép, một yêu cầu vượt quá giới hạn bị chặn với 429 và bộ đếm đặt lại 7sau khi cửa sổ hết hạn. Chạy bộ kiểm thử và sửa lỗi cho đến khi nó vượt qua. 8Không sửa đổi bất kỳ tệp nào bên ngoài src/ và test/. 9
Khởi động Harness từ thư mục dự án của bạn:
plaintext1cd /path/to/your/repo 2npx @deepseek-ai/dsh web 3
UI chạy tại http://127.0.0.1:3080. Chọn nhà cung cấp atlas và mô hình deepseek-ai/deepseek-v4-flash-0731, dán tác vụ và để nó hoàn thành. Không thêm gợi ý sau khi quá trình chạy bắt đầu. Trợ giúp thêm cho một công cụ sẽ làm mất hiệu lực so sánh.
Khi Harness hoàn thành, mở Trajectory view. Bản ghi phiên đó là nơi chứa số token của nó.
Bước 3: Lặp lại quá trình chạy trong OpenCode
Đặt lại repo về trạng thái bắt đầu chính xác. Harness thứ hai không được kế thừa các tệp mà harness đầu tiên đã thay đổi.
plaintext1git checkout -- . && git clean -fd 2
Sau đó chạy OpenCode với cùng mô hình:
plaintext1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731 2
Dán cùng lời nhắc tác vụ từ Bước 2. Sử dụng agent build mặc định. Để nó hoàn thành mà không có gợi ý.
Chấm điểm cả hai lần chạy bằng cùng một lệnh:
plaintext1npm test 2
Một lần chạy để lại bộ kiểm thử màu đỏ là thất bại, ngay cả khi tổng kết agent nghe có vẻ tự tin. Sử dụng chấm điểm nhị phân: đỗ hoặc trượt.
Bước 4: Đọc mức sử dụng token
Cả hai công cụ đều theo dõi mức sử dụng, nhưng không có bộ đếm nào nên là số hóa đơn cuối cùng của bạn.
DeepSeek Harness cung cấp đồng hồ đo token được gắn mặc định. Nó hiển thị tokenUsage, contextPressure và contextBreakdown trong Trajectory view. contextBreakdown cho bạn biết liệu hóa đơn đến từ lời nhắc hệ thống, lược đồ công cụ, đọc tệp hay phát lại cuộc trò chuyện. Đồng hồ đo ước tính khoảng một token cho mỗi bốn ký tự, vì vậy hãy sử dụng nó như một chế độ xem chẩn đoán.
OpenCode theo dõi token và chi phí mỗi phiên và in chúng trong dòng trạng thái TUI. Bảng phân tích tích hợp của nó nhỏ hơn, vì vậy các nhóm cần phân bổ mỗi công cụ thường kiểm tra cơ sở dữ liệu phiên với các trình phân tích bên ngoài.
Sử dụng số từ phía nhà cung cấp để so sánh:
| So sánh cái gì | Lấy nó ở đâu |
|---|---|
| Tổng token đầu vào | Bảng điều khiển sử dụng nhà cung cấp, mỗi khóa API |
| Tổng token đầu ra | Bảng điều khiển sử dụng nhà cung cấp, mỗi khóa API |
| Số cuộc gọi mô hình | Trajectory view harness / Nhật ký phiên OpenCode |
| Thời gian thực tế | Đồng hồ bấm giờ, từ đầu đến lần ghi tệp cuối cùng |
| Đỗ hay trượt | Mã thoát npm test |
Tạo hai khóa API, harness-test và opencode-test, và sử dụng mỗi khóa cho một lần chạy. Bảng điều khiển nhà cung cấp sau đó cung cấp cho bạn mức sử dụng song song sạch sẽ mà không cần đối chiếu hai bộ ước tính nội bộ.
Tại sao hóa đơn thay đổi
Mức sử dụng token thay đổi vì những lý do cụ thể. Năm yếu tố sau thường quan trọng hơn giá mô hình.
Phát lại cuộc trò chuyện tăng lên. Agent gửi lại cuộc trò chuyện đang phát triển trên mỗi bước. Một tác vụ 40 bước có chi phí gần bằng tổng của 40 lời nhắc đang phát triển hơn là 40 lời nhắc giống hệt nhau. Harness tóm tắt sớm sẽ nằm ở mức thấp hơn của phạm vi chuẩn.
Lượt truy cập bộ nhớ đệm giảm chi phí đầu vào. Lượt truy cập bộ nhớ đệm DeepSeek V4 Flash có giá khoảng $0,0028 mỗi triệu token so với $0,14 mỗi triệu token khi bỏ lỡ, rẻ hơn khoảng 98%. Bộ nhớ đệm cần một tiền tố ổn định từng byte. Nếu một harness xáo trộn văn bản lời nhắc hệ thống giữa các cuộc gọi, nó sẽ biến lượt truy cập thành bỏ lỡ.
Lược đồ công cụ đi kèm. Hai mươi máy chủ MCP được kết nối có nghĩa là hai mươi bộ lược đồ trong lời nhắc, ngay cả khi tác vụ sử dụng hai trong số chúng. Ngắt kết nối các công cụ bạn không cần trước khi đánh giá chuẩn, nếu không bạn sẽ đo lường thiết lập công cụ thay vì harness.
Đầu ra công cụ lớn làm nhiễm độc ngữ cảnh. Một cat tệp 3.000 dòng hoặc nhật ký kiểm thử thất bại dài dòng vẫn nằm trong cuộc trò chuyện cho các cuộc gọi sau. DeepSeek Harness có thể cắt tỉa kết quả công cụ quá lớn trước khi tóm tắt. Bật tính năng đó khi tác vụ tạo ra đầu ra ồn ào.
Thử lại ẩn bên trong số cuộc gọi. Một harness thử lại vòng lặp kiểm thử thất bại sẽ tiêu tốn token mỗi lần. So sánh số cuộc gọi mô hình bên cạnh tổng token để bạn có thể tách biệt vòng lặp thử lại khỏi lời nhắc đắt đỏ.
Với mức giá Atlas Cloud cho DeepSeek V4 Flash, một tác vụ 692.000 token nghiêng về đầu vào rơi vào khoảng vài cent thấp. Điều đó nhỏ cho một lần chạy và lớn trên một nhóm chạy agent cả ngày. Duyệt qua danh mục mô hình đầy đủ nếu bạn muốn lặp lại thử nghiệm trên một mô hình thứ hai và tách riêng hiệu ứng mô hình khỏi hiệu ứng harness.
DeepSeek Harness vẫn là bản xem trước dành cho nhà phát triển và README của nó cảnh báo về các thay đổi phá vỡ. Hãy đánh giá chuẩn nếu bạn muốn kiểm soát vòng lặp agent. Chuẩn hóa nó chỉ khi nhóm của bạn có thể hấp thụ sự thay đổi. OpenCode là lựa chọn ổn định hơn cho các nhóm cần một công cụ ngay hôm nay.
Câu hỏi thường gặp
DeepSeek Harness có tốt hơn OpenCode không?
Không phải đối với hầu hết các nhóm hiện tại. OpenCode trưởng thành, hoạt động trong terminal, có khoảng 198k sao và danh mục nhà cung cấp lớn, và nó hoạt động ngay hôm nay. DeepSeek Harness mới hơn, trong bản xem trước dành cho nhà phát triển và cảnh báo về các thay đổi phá vỡ. Chọn Harness nếu bạn muốn sửa đổi nội bộ agent. Chọn OpenCode nếu bạn muốn một agent mã hóa cho công việc hàng ngày.
DeepSeek Harness chỉ hoạt động với mô hình DeepSeek?
Không. Nó không phụ thuộc vào mô hình. Nó cung cấp các nhà cung cấp danh mục cho DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure và Codex, và bạn có thể thêm bất kỳ nhà cung cấp tùy chỉnh nào nói openai-completions, openai-responses hoặc anthropic-messages trong $DSH_HOME/settings.yaml. Cấu hình Bước 1 chỉ nó vào một endpoint tương thích OpenAI mà không có mã bộ điều hợp.
Làm thế nào để kiểm tra mức sử dụng token của DeepSeek Harness?
Sử dụng đồng hồ đo token tích hợp trong Trajectory view. Nó hiển thị tokenUsage, contextPressure và contextBreakdown. Coi nó như một ước tính vì nó sử dụng khoảng một token cho mỗi bốn ký tự. Để có độ chính xác thanh toán, hãy đọc bảng điều khiển sử dụng nhà cung cấp, lý tưởng nhất là với một khóa API chuyên dụng cho mỗi lần chạy.
Harness nào sử dụng ít token hơn, DeepSeek Harness hay OpenCode?
Chưa có bài đánh giá chuẩn đối đầu công khai nào trả lời điều đó. Bài đánh giá chuẩn Composio đo OpenCode ở mức trung bình 692.000 token mỗi tác vụ, nhưng nó chạy trước khi DeepSeek Harness được phát hành. Chạy thử nghiệm Bước 2 đến Bước 4 trên repo của riêng bạn vì mức sử dụng token phụ thuộc vào kích thước cơ sở mã, thiết lập công cụ và hình dạng tác vụ.
Tôi có thể chạy DeepSeek Harness và OpenCode với cùng một khóa API không?
Có, cho một thử nghiệm thông thường. Để có một phép đo sạch sẽ, hãy sử dụng hai khóa riêng biệt, một khóa cho mỗi harness. Bảng điều khiển nhà cung cấp sau đó sẽ quy mọi token cho đúng lần chạy.
Sự khác biệt giữa agent và harness là gì?
DeepSeek mô tả agent là Mô hình cộng với Harness. Mô hình suy luận. Harness kết nối mô hình với tệp, lệnh shell, công cụ, phiên, phê duyệt và vòng lặp quyết định hành động tiếp theo. Thay đổi harness và cùng một mô hình có thể tiêu tốn một số token khác nhau cho cùng một tác vụ.






