Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

DeepSeek Harness vs OpenCode: Khoảng cách sử dụng token mà đa số lập trình viên bỏ lỡ

DeepSeek Harness vs OpenCode, thử nghiệm trên cùng mô hình và cùng tác vụ. Mỗi harness ảnh hưởng thế nào đến lượng token bạn sử dụng, tại sao khoảng cách là thật, và cách tự đo lường.

Bạn chọn một mô hình giá rẻ. Bạn đã tính toán trên thẻ thông số mô hình. Rồi hóa đơn đến và không giống với tính toán của bạn chút nào.

Khoảng cách đó hầu như không bao giờ đến từ mô hình. Nó đến từ khung tác nhân (harness). Khung tác nhân quyết định mô hình của bạn được gọi bao nhiêu lần, bao nhiêu phần trăm cuộc hội thoại được phát lại trên mỗi lần gọi, kích thước lược đồ công cụ là bao nhiêu, và liệu một lần chạy thử thất bại có được thử lại ba lần hay mười hai lần. Cùng một mô hình, cùng một tác vụ, hai khung tác nhân khác nhau, số lượng token khác nhau một trời một vực.

Vào ngày 13 tháng 8 năm 2026, DeepSeek đã mã nguồn mở khung tác nhân của riêng mình và cuộc tranh luận ngay lập tức trở nên gay gắt. Một bên là kho lưu trữ mới hai tuần tuổi từ phòng thí nghiệm xây dựng mô hình. Bên kia là OpenCode, tác nhân viết mã được gắn sao nhiều nhất trên GitHub. Cả hai đều theo giấy phép MIT. Cả hai đều chạy bất kỳ mô hình nào bạn chỉ định.

Vậy đây là phiên bản trung thực của sự so sánh. Không phải cảm nhận, không phải số sao. Mỗi cái thực sự tác động thế nào đến việc sử dụng token của bạn, và cách đo lường nó trên chính kho lưu trữ của bạn trong khoảng mười lăm phút.

Những điểm chính

  • DeepSeek Harness là một môi trường chạy tác nhân ưu tiên plugin từ DeepSeek AI, được cấp phép MIT, viết bằng TypeScript, vẫn được gắn nhãn bản xem trước dành cho nhà phát triển. Mô hình, công cụ, phiên, lưu trữ, hộp cát, vòng lặp và thậm chí cả vòng lặp tác nhân đều là các plugin có thể hoán đổi.
  • OpenCode là một tác nhân viết mã gốc terminal, viết bằng Go, với khoảng 198k sao GitHub, giao diện TUI hoàn thiện, hỗ trợ LSP và danh mục nhà cung cấp lớn. Đây là lựa chọn mặc định an toàn hiện nay.
  • Việc chọn khung tác nhân tác động đến mức sử dụng token nhiều hơn hầu hết mọi người nghĩ. Trong một điểm chuẩn 30 quy trình làm việc trên DeepSeek V4 Flash, các khung tác nhân được kiểm tra dao động từ khoảng 192.000 đến 1.400.000 token trung bình mỗi tác vụ.
  • DeepSeek Harness không có trong điểm chuẩn đó. Nó ra mắt hai ngày sau khi điểm chuẩn được công bố, vì vậy bất kỳ ai trích dẫn số liệu điểm chuẩn của Harness ngay bây giờ đều đang phỏng đoán.
  • Cả hai đều không phụ thuộc vào mô hình, vì vậy bạn có thể chỉ cả hai vào một điểm cuối tương thích với OpenAI và chạy một bài kiểm tra thực sự công bằng. Đó là con số duy nhất có ý nghĩa đối với cơ sở mã của bạn.

Bàn tay gõ trên máy tính xách tay hiển thị mã code bên cạnh một tách cà phê

Hai máy tính xách tay đặt cạnh nhau trên bàn làm việc đầy nắng, cùng chạy một tác vụ viết mã qua hai khung tác nhân khác nhau

Cách duy nhất công bằng để chạy DeepSeek Harness so với OpenCode: một mô hình, một tác vụ, hai terminal.

Tại sao DeepSeek Harness vs OpenCode lại trở thành cuộc tranh luận của tháng

Cách DeepSeek định khung là một khẩu hiệu: Tác nhân = Mô hình + Khung. Mô hình suy nghĩ, khung đọc tệp, chạy terminal và gọi công cụ. Trong hai năm, mọi người đều tối ưu hóa nửa đầu và coi nửa sau chỉ là phần đường ống.

Phần đường ống hóa ra lại đắt đỏ.

Composio đã chạy 30 quy trình làm việc đa ứng dụng phức tạp qua 8 khung tác nhân khác nhau, tất cả đều sử dụng cùng một mô hình DeepSeek V4 Flash, với giới hạn 900 giây mỗi tác vụ và chấm điểm nhị phân theo chương trình trên 240 lần chạy (Composio, tháng 8 năm 2026). Cùng một mô hình ở mọi nơi. Kết quả không hề gần nhau.

HarnessTỷ lệ vượt quaThời gian trung vịSố token trung bình mỗi tác vụ
Pi Agent66,7%132,2s559.000
Prime Agent62,5%242,1s1.400.000
OMP56,7%272,4s742.000
Claude Code53,3%122,7s742.000
Codex53,3%245,0s678.000
DeepAgents53,3%187,1s665.000
Hermes Agent50,0%175,5s192.000
OpenCode46,7%129,7s692.000

Hãy đọc lại cột token. Khung tác nhân tiết kiệm nhất sử dụng khoảng một phần bảy số token so với khung lãng phí nhất, chạy cùng một mô hình trên cùng các tác vụ. Kết luận của chính điểm chuẩn là các khung tác nhân "có thể quan trọng ngang bằng với các mô hình mà chúng chạy."

Bây giờ là phần mà hầu hết các bài báo bỏ qua. DeepSeek Harness không có trong bảng đó. Điểm chuẩn được công bố vào ngày 11 tháng 8 và Harness ra mắt vào ngày 13 tháng 8. Chưa có con số token đối đầu đáng tin cậy nào cho DeepSeek Harness, và bất kỳ ai cho bạn xem một con số như vậy trong tháng này hoặc là tự chạy nó trên một tác vụ hẹp hoặc là bịa ra. Điều mà bảng này cung cấp cho bạn là một đường cơ sở vững chắc, có nguồn gốc cho OpenCode: 692.000 token mỗi tác vụ, tỷ lệ vượt qua 46,7%, thời gian trung vị 129,7 giây.

Đó là con số bạn đang cố gắng vượt qua, và phần còn lại của bài viết này là cách kiểm tra nó một cách trung thực.

DeepSeek Harness vs OpenCode: cùng mô hình, một điểm cuối, hai môi trường chạy

Đây là hình dạng thực tế của từng công cụ trước khi chúng ta chạy bất cứ thứ gì.

DeepSeek Harness (dsh)OpenCode
TừDeepSeek AIAnomaly (ban đầu là SST)
Phát hành13 tháng 8, 2026Cuối năm 2025
Sao GitHub~143k~198k
Giấy phépMITMIT
Ngôn ngữTypeScriptGo
Giao diệnWeb UI trên 127.0.0.1:3080Terminal TUI
Trạng tháiBản xem trước dành cho nhà phát triển, dự kiến có thay đổi phá vỡ tương thíchTrưởng thành, được triển khai rộng rãi
Kiến trúcMọi thứ đều là plugin: mô hình, công cụ, kỹ năng, phiên, hộp cát, lưu trữ, vòng lặp, lập lịch, UILõi cố định, hai tác nhân tích hợp sẵn (build, plan), phần mở rộng MCP và LSP
Cấu hình$DSH_HOME/settings.yamlopencode.json
Hạch toán tokenBộ đo token tích hợp sẵn với áp lực ngữ cảnh và dự báo phân tích, cùng với tính năng nén bằng cách gấpTheo dõi token và chi phí mỗi phiên, phân tích tối thiểu trong TUI
Phù hợp nhất choNhóm muốn viết lại chính vòng lặp tác nhânNhóm muốn một tác nhân viết mã hoạt động ngay hôm nay

Dòng quan trọng là hàng kiến trúc. OpenCode cung cấp cho bạn một tác nhân được xây dựng tốt và cho phép bạn mở rộng các phần rìa. DeepSeek Harness cung cấp cho bạn một bộ xương và cho phép bạn thay thế xương sống, bao gồm cả vòng lặp tác nhân, vốn tự nó là một plugin. Điều đó thực sự khác thường, và đó cũng là lý do tại sao nó vẫn còn là bản xem trước.

Cả hai đều không phụ thuộc vào mô hình, và đó là toàn bộ lý do một bài kiểm tra công bằng có thể thực hiện được. Chỉ cả hai vào một điểm cuối tương thích với OpenAI phục vụ một mô hình và mọi khác biệt bạn đo được đều thuộc về khung tác nhân.

Đối với hướng dẫn này, tôi đang phục vụ DeepSeek V4 Flash từ Atlas Cloud, vì nó cung cấp một điểm cuối tương thích OpenAI thuần túy mà cả hai khung đều chấp nhận mà không cần mã chuyển đổi, và cùng một khóa hoạt động cho cả hai lần chạy. Danh sách deepseek-v4-flash-0731 ở đó có giá $0.14 cho mỗi triệu token đầu vào và $0.28 cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 1.048.576 token và tối đa đầu ra 393.216, tính đến tháng 8 năm 2026. Bất kỳ nhà cung cấp tương thích OpenAI nào cũng có thể dùng cho bài kiểm tra này. Vấn đề là cả hai khung phải truy cập cùng một điểm cuối.

Đáng biết trước khi bạn chọn mô hình: OpenCode công bố dữ liệu sử dụng tổng hợp của riêng mình, và các mô hình DeepSeek đã di chuyển 233 nghìn tỷ token qua nó, với V4 Flash chiếm 85,5% và V4 Pro chiếm 14,5% còn lại (OpenCode, tháng 8 năm 2026). Flash là thứ mà hệ sinh thái thực sự chạy trên đó.

Bước 1: Chỉ DeepSeek Harness vs OpenCode vào cùng một mô hình

Lấy một khóa API và một URL cơ sở, sau đó cung cấp cho cả hai công cụ chính xác cùng một cặp. Tạo khóa trong bảng điều khiển Atlas Cloud và xuất nó một lần:

bash
1export ATLAS_API_KEY="your-api-key"
2

Trước khi kết nối bất kỳ khung nào, hãy kiểm tra điểm cuối và ID mô hình chính xác bằng một lệnh gọi. Nếu lệnh này không trả về văn bản, thì không có gì ở phía sau hoạt động:

bash
1curl https://api.atlascloud.ai/v1/chat/completions \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "deepseek-ai/deepseek-v4-flash-0731",
6    "messages": [{"role": "user", "content": "Reply with the single word: ready"}]
7  }'
8

Sẽ rất hữu ích khi thấy mô hình trả lời tác vụ thực tế một lần, trực tiếp qua điểm cuối, trước khi bạn đưa nó cho tác nhân. Sau đó bạn biết một lần chạy thất bại là do khung chứ không phải do đường truyền:

Sơ đồ so sánh lời nhắc viết mã với mã đã tạo và thống kê token

Lời nhắc tác vụ của bài viết được đăng lên api.atlascloud.ai, bên cạnh câu trả lời thực tế mà DeepSeek V4 Flash 0731 trả về và mức sử dụng token mà lệnh gọi báo cáo

Một lệnh gọi thực tế đến deepseek-ai/deepseek-v4-flash-0731, cùng ID mô hình mà cả hai khung sẽ sử dụng: 148 token đầu vào, 6.879 token đầu ra trả về, trong đó 5.731 là suy luận. Đó là mức tối thiểu của bạn trước khi một khung thêm bất kỳ lược đồ công cụ nào.

Bây giờ cấu hình mỗi bên. DeepSeek Harness đọc $DSH_HOME/settings.yaml, và các nhà cung cấp tương thích OpenAI tùy chỉnh nằm dưới plugin llm-pi-ai (Tài liệu DeepSeek Harness, tháng 8 năm 2026):

yaml
1llm-pi-ai:
2  providers:
3    atlas:
4      apiKeyEnv: ATLAS_API_KEY
5      api: openai-completions
6      baseURL: https://api.atlascloud.ai/v1
7      models:
8        - id: deepseek-ai/deepseek-v4-flash-0731
9

Trường api chấp nhận openai-completions, openai-responses hoặc anthropic-messages. Sử dụng openai-completions ở đây. Nếu bạn không muốn chỉnh sửa YAML thủ công, giao diện web có Settings > Models > Add a custom provider, thao tác này sẽ ghi cùng một khối và lưu khóa vào $DSH_HOME/.credentials.yaml thay thế.

OpenCode đọc opencode.json trong thư mục gốc của dự án hoặc thư mục cấu hình toàn cục (Tài liệu OpenCode, tháng 8 năm 2026):

json
1{
2  "$schema": "https://opencode.ai/config.json",
3  "provider": {
4    "atlas": {
5      "npm": "@ai-sdk/openai-compatible",
6      "name": "Atlas Cloud",
7      "options": {
8        "baseURL": "https://api.atlascloud.ai/v1",
9        "apiKey": "{env:ATLAS_API_KEY}"
10      },
11      "models": {
12        "deepseek-ai/deepseek-v4-flash-0731": {
13          "name": "DeepSeek V4 Flash 0731",
14          "limit": { "context": 1048576, "output": 393216 }
15        }
16      }
17    }
18  },
19  "model": "atlas/deepseek-ai/deepseek-v4-flash-0731"
20}
21

Sử dụng @ai-sdk/openai-compatible, không phải @ai-sdk/openai, vì điểm cuối này phục vụ /v1/chat/completions. Đặt các giá trị limit thành số ngữ cảnh và đầu ra thực tế, vì OpenCode sử dụng chúng để quyết định khi nào tóm tắt và một giới hạn sai sẽ làm sai lệch so sánh token của bạn một cách nghiêm trọng.

Bước 2: Chạy tác vụ điểm chuẩn trong DeepSeek Harness

Chọn một tác vụ đủ lớn để cần một vài lần gọi công cụ và đủ nhỏ để chấm điểm khách quan. Nhiều tệp, cộng với một bộ kiểm thử thực sự phải vượt qua. Sử dụng cùng trạng thái kho lưu trữ cho cả hai lần chạy, vì vậy hãy commit hoặc stash trước.

Đây là lời nhắc tác vụ chính xác. Dán nguyên văn vào cả hai khung:

text
1In this repository, add a token-bucket rate limiter middleware for the Express
2app in src/server.js. Limit each IP to 60 requests per minute. On rejection,
3return HTTP 429 with the JSON body {"error":"rate_limited","retryAfter":<seconds>}.
4Wire the middleware into every /api/* route. Add unit tests in
5test/rate-limit.test.js covering three cases: a request under the limit is
6allowed, a request over the limit is blocked with 429, and the counter resets
7after the window expires. Run the test suite and fix failures until it passes.
8Do not modify any file outside src/ and test/.
9

Khởi động Harness từ thư mục dự án của bạn:

bash
1cd /path/to/your/repo
2npx @deepseek-ai/dsh web
3

Thao tác này sẽ phục vụ giao diện web tại http://127.0.0.1:3080. Chọn nhà cung cấp atlas và mô hình deepseek-ai/deepseek-v4-flash-0731, dán tác vụ và để nó chạy đến khi hoàn thành. Không can thiệp, không trả lời các câu hỏi làm rõ bằng gợi ý. Bất kỳ sự trợ giúp nào bạn dành cho một khung mà không dành cho khung kia đều làm mất hiệu lực so sánh.

Khi nó kết thúc, mở chế độ xem Trajectory. Đó là bản ghi phiên và nơi chứa các số token.

Bước 3: Lặp lại lần chạy trong OpenCode để có một bài kiểm tra DeepSeek Harness vs OpenCode công bằng

Đặt lại kho lưu trữ về trạng thái bắt đầu chính xác. Đây là bước mà hầu hết các so sánh thông thường âm thầm bị hỏng, vì khung thứ hai bắt đầu trên một kho lưu trữ mà khung đầu tiên đã sửa một nửa.

bash
1git checkout -- . && git clean -fd
2

Sau đó chạy OpenCode với cùng một mô hình:

bash
1opencode --model atlas/deepseek-ai/deepseek-v4-flash-0731
2

Dán lời nhắc tác vụ giống hệt từ Bước 2. Sử dụng tác nhân build mặc định, vì đó là tác nhân có toàn quyền truy cập tệp và shell. Một lần nữa, không gợi ý, không chỉnh sửa hướng, cùng cách xử lý không can thiệp.

Để nó kết thúc, sau đó xác minh cả hai lần chạy theo cách bạn sẽ chấm điểm bất kỳ PR nào:

bash
1npm test
2

Một lần chạy để lại bộ kiểm thử đỏ là không vượt qua, bất kể bản tóm tắt nghe có vẻ tự tin thế nào. Chấm điểm nhị phân, chính xác như phương pháp luận của Composio. Một bộ giới hạn tốc độ hoạt động nửa vời là một lần thất bại.

Bước 4: Đọc mức sử dụng token của DeepSeek Harness vs OpenCode

Bây giờ thu thập các số liệu. Cả hai khung đều theo dõi mức sử dụng, nhưng chúng hiển thị rất khác nhau và đây là sự khác biệt lớn nhất hàng ngày giữa chúng.

DeepSeek Harness đi kèm với một bộ đo token được gắn mặc định. Nó cung cấp ba dự báo phiên mà bạn có thể đọc trực tiếp: tokenUsage cho tổng số đang chạy, contextPressure cho biết bạn gần đến cửa sổ đến mức nào, và contextBreakdown cho biết token thực sự đi đâu. Cái cuối cùng là cái hữu ích, vì nó cho bạn biết hóa đơn của bạn là do lời nhắc hệ thống, lược đồ công cụ, đọc tệp hay phát lại hội thoại. Bộ đo sử dụng một heuristic cố định khoảng một token cho bốn ký tự thay vì một tokenizer thực, vì vậy hãy coi nó như một ước tính mạnh, không phải hóa đơn.

Harness cũng xử lý một ngữ cảnh đầy đủ khác. Thay vì cắt bớt, công cụ nén của nó gấp: nó thay thế bề mặt hiển thị của mô hình bằng một bản tóm tắt trong khi nhật ký đầy đủ vẫn ở trong lớp lưu trữ. Bạn mất token khỏi lời nhắc, không phải lịch sử khỏi bản ghi.

OpenCode theo dõi token và chi phí mỗi phiên và in chúng trong dòng trạng thái khi bạn làm việc. Phân tích trong TUI được cố tình tối giản, đó là lý do tại sao tồn tại một hệ sinh thái nhỏ các trình phân tích bên ngoài đọc trực tiếp cơ sở dữ liệu phiên của OpenCode để phân tích mức sử dụng theo công cụ và theo tỷ lệ hit cache. Nếu bạn muốn phân bổ theo từng công cụ, bạn sẽ phải cài đặt một thứ gì đó.

Đối với bản thân so sánh, đừng tin vào bộ đếm của chính công cụ này như lời cuối. Sử dụng số từ phía nhà cung cấp, vì đó là những gì bạn thực sự trả tiền:

Những gì cần so sánhNơi lấy nó
Tổng số token đầu vàoBảng điều khiển sử dụng của nhà cung cấp, theo khóa API
Tổng số token đầu raBảng điều khiển sử dụng của nhà cung cấp, theo khóa API
Số lần gọi mô hìnhChế độ xem Trajectory của Harness / Nhật ký phiên của OpenCode
Thời gian thực tếĐồng hồ bấm giờ, từ lúc bắt đầu đến lần ghi tệp cuối cùng
Vượt qua hay thất bạiMã thoát của npm test

Phương pháp sạch nhất là tạo hai khóa API riêng biệt, một tên harness-test và một tên opencode-test, và sử dụng mỗi khóa cho chính xác một lần chạy. Sau đó, trang sử dụng của chính nhà cung cấp cho bạn một so sánh song song không thể tranh cãi với sai số ước tính bằng không. Thủ thuật đó mất hai phút và loại bỏ mọi nguồn bất đồng về việc bộ đếm của ai đúng.

Mức sử dụng token của DeepSeek Harness: điều gì thực sự làm tăng hóa đơn

Khi bạn có số liệu thực tế, đây là những đòn bẩy đáng để chạm vào. Chúng áp dụng cho cả hai khung và chúng quan trọng hơn nhiều so với việc bạn chọn cái nào.

Phát lại hội thoại thường là khoản mục lớn nhất. Các tác nhân gửi lại cuộc hội thoại đang phát triển trên mỗi bước. Một tác vụ 40 bước không tốn 40 lời nhắc, nó tốn một thứ gần bằng tổng của 40 lời nhắc ngày càng dài. Đây là lý do tại sao điểm chuẩn dao động từ 192.000 đến 1.400.000 token trên cùng một công việc. Các khung tóm tắt mạnh mẽ nằm ở cuối phạm vi đó.

Hit cache là tối ưu hóa rẻ nhất hiện có. Hit cache của DeepSeek V4 Flash có giá khoảng $0.0028 cho mỗi triệu token so với $0.14 cho mỗi triệu khi miss, rẻ hơn khoảng 98%. Bộ nhớ đệm chỉ hoạt động khi tiền tố yêu cầu giống hệt nhau từng byte, đó chính xác là lý do tại sao DeepSeek Harness thực thi nội suy {{variable}} nghiêm ngặt với ngữ nghĩa thất bại ồn ào và giữ một tiêu đề yêu cầu ổn định. Một khung xáo trộn lời nhắc hệ thống của bạn giữa các lần gọi sẽ âm thầm biến mọi hit thành miss.

Lược đồ công cụ đi kèm trên mọi lần gọi. Hai mươi máy chủ MCP được kết nối có nghĩa là hai mươi bộ lược đồ trong lời nhắc, mãi mãi, bất kể tác vụ có chạm vào chúng hay không. Ngắt kết nối những gì tác vụ này không cần trước khi bạn đánh giá điểm chuẩn, nếu không bạn đang đo cấu hình MCP của mình chứ không phải khung của bạn.

Kết quả công cụ quá khổ đầu độc ngữ cảnh. Một lệnh cat của một tệp 3.000 dòng, hoặc một trình chạy thử dài dòng in ra toàn bộ stack trace, sẽ nằm trong cuộc hội thoại cho phần còn lại của lần chạy. Harness có một công cụ đồng hành cắt tỉa kết quả tùy chọn, viết lại kết quả công cụ quá khổ trước khi tóm tắt. Đáng để bật lên.

Các lần thử lại vô hình cho đến khi bạn đếm số lần gọi. Một khung thử lại một bài kiểm tra thất bại ba lần sẽ tốn gấp ba. So sánh cột số lần gọi, không chỉ tổng token, nếu không bạn sẽ chẩn đoán sai một vòng lặp thử lại là một mô hình đắt đỏ.

Về chi phí, số học rất đơn giản khi bạn có số token. Ở mức giá Atlas Cloud cho DeepSeek V4 Flash, một tác vụ 692.000 token nghiêng về đầu vào nằm ở mức vài xu thấp. Đó là tin tốt về toàn bộ danh mục này: mô hình đủ rẻ để lãng phí của khung là vấn đề hiệu quả chứ không phải khẩn cấp về ngân sách. Nó chỉ trở thành một con số thực sự khi bạn nhân lên với một nhóm, chạy cả ngày, mỗi ngày. Duyệt qua danh mục mô hình đầy đủ nếu bạn muốn chạy cùng một bài kiểm tra với một mô hình thứ hai và tách biệt hiệu ứng mô hình khỏi hiệu ứng khung.

Một lưu ý sẽ định hình quyết định của bạn nhiều hơn bất kỳ con số token nào: DeepSeek Harness rõ ràng đang trong bản xem trước dành cho nhà phát triển và README của chính nó cảnh báo bằng chữ in hoa rằng sẽ có những thay đổi phá vỡ tương thích. Đó là một điều tốt để đánh giá điểm chuẩn và một điều rủi ro để chuẩn hóa một nhóm trong tháng này. OpenCode là lựa chọn nhàm chán và nhàm chán là một tính năng khi nó chạy trên kho lưu trữ sản xuất của bạn.

Câu hỏi thường gặp

DeepSeek Harness có tốt hơn OpenCode không?

Chưa, đối với hầu hết mọi người. OpenCode đã trưởng thành, gốc terminal, có khoảng 198k sao và một danh mục nhà cung cấp lớn, và nó hoạt động ngay hôm nay. DeepSeek Harness mới hai tuần tuổi, trong bản xem trước dành cho nhà phát triển và cảnh báo về các thay đổi phá vỡ. Harness thú vị hơn về mặt kiến trúc, vì mọi thành phần bao gồm cả vòng lặp tác nhân đều là plugin có thể thay thế. Nếu bạn muốn viết lại nội bộ tác nhân, Harness được xây dựng cho điều đó. Nếu bạn muốn gửi mã trong tuần này, OpenCode.

DeepSeek Harness chỉ hoạt động với các mô hình DeepSeek?

Không. Nó không phụ thuộc vào mô hình. Nó đi kèm với các nhà cung cấp danh mục cho DeepSeek, Anthropic, OpenAI, Bedrock, Vertex, Azure và Codex, và bạn có thể thêm bất kỳ nhà cung cấp tùy chỉnh nào nói openai-completions, openai-responses hoặc anthropic-messages bằng cách thêm một khối vào $DSH_HOME/settings.yaml. Cấu hình trong Bước 1 chỉ nó vào một điểm cuối tương thích OpenAI của bên thứ ba mà không có mã chuyển đổi.

Làm cách nào để kiểm tra mức sử dụng token của DeepSeek Harness?

Sử dụng bộ đo token tích hợp sẵn, được gắn mặc định và hiển thị các dự báo tokenUsage, contextPressurecontextBreakdown, có thể thấy trong chế độ xem Trajectory. Lưu ý rằng nó ước tính bằng một heuristic cố định khoảng một token cho bốn ký tự thay vì chạy một tokenizer thực. Để có độ chính xác thanh toán, hãy đọc bảng điều khiển sử dụng của nhà cung cấp, tốt nhất là với một khóa API chuyên dụng cho mỗi lần chạy. Các plugin cộng đồng như bảng điều khiển mức sử dụng token thêm các bản ghi phiên liên tục trên đó.

Khung nào sử dụng ít token hơn, DeepSeek Harness hay OpenCode?

Chưa có so sánh trực tiếp nào được công bố. Điểm chuẩn 8 khung trên DeepSeek V4 Flash đã đo OpenCode ở mức trung bình 692.000 token mỗi tác vụ, nhưng nó được chạy hai ngày trước khi DeepSeek Harness được phát hành, vì vậy Harness không được bao gồm. Bất kỳ ai trích dẫn số Harness từ điểm chuẩn đó đều trích dẫn một thứ không tồn tại. Chạy bài kiểm tra từ Bước 2 đến Bước 4 trên kho lưu trữ của riêng bạn, vì mức sử dụng token phụ thuộc nhiều vào kích thước cơ sở mã, cấu hình MCP và hình dạng tác vụ của bạn.

Tôi có thể chạy DeepSeek Harness và OpenCode với cùng một khóa API không?

Có, và đối với một bài kiểm tra thông thường, điều đó ổn. Để có một phép đo sạch, hãy sử dụng hai khóa riêng biệt, một cho mỗi khung. Sau đó, bảng điều khiển sử dụng của nhà cung cấp sẽ tự động gán mọi token cho lần chạy đúng và bạn không bao giờ phải đối chiếu hai bộ ước tính nội bộ khác nhau với một hóa đơn.

Sự khác biệt giữa tác nhân và khung là gì?

Cách định nghĩa của DeepSeek là Tác nhân = Mô hình + Khung. Mô hình thực hiện suy luận. Khung là mọi thứ kết nối nó với thực tế: đọc và ghi tệp, chạy lệnh shell, gọi công cụ, quản lý phiên, xử lý phê duyệt và điều khiển vòng lặp quyết định điều gì xảy ra tiếp theo. Cùng một mô hình cộng với một khung khác nhau sẽ cho bạn một tác nhân khác nhau có thể đo lường được, đó là toàn bộ điểm của sự so sánh này.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình