Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

DeepSeek Harness Review: Tất cả ba lần chạy đều được báo cáo là đã hoàn thành. Chỉ có một trang thực sự hoạt động.

Một bài đánh giá thực tế về DeepSeek Harness: ba lần chạy thực tế của một tác vụ, kích thước cài đặt và RAM nhàn rỗi mà chưa ai đo, và hai dòng YAML đã thay đổi mọi thứ.

154,302 sao. Mọi bài đánh giá tôi đọc đều nói với tôi ba điều giống nhau: mọi thứ đều là plugin, nhật ký phiên là chỉ nối thêm, và nó là bản xem trước dành cho nhà phát triển.

Không một bài nào nói cho tôi biết nó ngốn bao nhiêu dung lượng ổ đĩa. Hoặc một phiên rảnh chiếm bao nhiêu RAM. Hoặc điều gì xảy ra khi bạn trỏ nó vào một endpoint không phải của riêng DeepSeek.

Vì vậy tôi đã cài đặt nó và giao cho nó một công việc, ba lần: xây dựng một trình theo dõi ISS trực tiếp trong một tệp HTML độc lập duy nhất. Ba cấu hình nhà cung cấp khác nhau, cùng một prompt, cùng một mô hình. Cả ba đều hoàn thành. Cả ba đều in ra một "Đã xong" đầy tự tin với một danh sách gạch đầu dòng về mọi thứ chúng được cho là đã xác minh.

Sau đó tôi mở ba trang đó trong trình duyệt. Hai trong số chúng bị hỏng.

Kết luận chính

  • npm install @deepseek-ai/dsh đã tải về 531 gói và 306 MB trên macOS. Không phải 1,5 GB, nhưng cũng không nhỏ, và bản thân gói dsh chỉ chiếm 172 KB trong số đó.
  • Máy chủ web dsh ở trạng thái rảnh sử dụng 35 đến 40 MB RSS với một phiên trực tiếp đang mở, sau khi đạt đỉnh khoảng 212 MB lúc khởi động. Con số 500 MB mà mọi người thường nhắc đến không phải là tiến trình máy chủ.
  • Chế độ xem Trajectory là thứ thực sự trong bản phát hành này. Nó là một luồng sự kiện JSONL chỉ nối thêm, đơn giản trên đĩa, và nó đã giúp tôi chẩn đoán vấn đề cấu hình trong vài phút thay vì hàng giờ.
  • Hai dòng YAML (compat.thinkingFormat và một maxTokens thực sự) đã thay đổi cùng một tác vụ từ một lần chạy 36 bước, 422 giây thành một lần chạy 15 bước, 152 giây. Không có dòng nào trên trang tài liệu.
  • Mọi lần chạy đều báo cáo thành công. Chỉ có một lần tạo ra trang không có lỗi console nào. Hãy đọc output, không phải phần tóm tắt.
  • Đây là bản xem trước dành cho nhà phát triển, và README nói rõ điều đó bằng chữ in hoa. Có thể dùng thử trong phạm vi hạn chế, không phải bảng điều khiển sản xuất.

Đây là toàn bộ bài viết trong một hình ảnh. Hai trang theo dõi ISS, cùng một prompt, cùng một mô hình, một điểm khác biệt về cấu hình. Bên trái là lần chạy tôi đã tinh chỉnh. Bên phải là lần chạy tôi không tinh chỉnh.

So sánh bản đồ thế giới bị lỗi và bản đồ được hiển thị chính xác

So sánh cạnh nhau hai trang theo dõi ISS được xây dựng bởi DeepSeek Harness, bên trái với bản đồ thế giới bị méo mó và một huy hiệu cũ kẹt cứng, bên phải hiển thị chính xác với điểm đánh dấu trực tiếp

Bên trái: lần chạy đã tinh chỉnh, 152 giây, mười lăm đường dẫn SVG bị sai định dạng và một huy hiệu bị đóng băng với dòng chữ "Stale". Bên phải: lần chạy ngây thơ, 422 giây, không có lỗi console nào. Cả hai đều báo cáo đã hoàn thành.

Tại Sao Mọi Bài Đánh Giá DeepSeek Harness Đều Nói Ba Điều Giống Nhau

Kho lưu trữ được đưa lên vào ngày 13 tháng 8 và khi tôi bắt đầu viết, nó đã đạt 154.302 sao và 15.960 fork theo giấy phép MIT (GitHub, tháng 8 năm 2026). Với tốc độ đó, hầu hết các bài viết chỉ là đọc README, vì không có thời gian để làm gì khác.

Vì vậy, bối cảnh các bài đánh giá DeepSeek Harness hiện tại chia làm ba nhóm, và cả ba đều có cùng một lỗ hổng. Các bài viết kiểm tra mã nguồn mổ xẻ các khe cắm plugin và không bao giờ chạy một điểm chuẩn nào. Các bài viết về dữ liệu so sánh số lượng token và hoàn toàn bỏ qua kích thước cài đặt và bộ nhớ. Các bài viết về mua sắm doanh nghiệp đưa ra kết luận với hầu như không có số liệu đo lường nào.

Không ai cài đặt nó, chạy một tác vụ từ đầu đến cuối, và sau đó mở kết quả.

Trong khi đó, lời chỉ trích sắc bén nhất không nằm trong bất kỳ bài đánh giá nào. Đó là hai bình luận trong chủ đề ra mắt, thu hút 737 điểm và 309 bình luận trong bốn ngày.

Hai lời phàn nàn của người dùng về kích thước bản dựng lớn và mức sử dụng bộ nhớ cao

Hai bình luận Hacker News nguyên văn về kích thước cài đặt và mức sử dụng bộ nhớ rảnh của DeepSeek Harness

Hai lời phàn nàn mà bài đánh giá này thực sự cố gắng kiểm tra, được trích dẫn nguyên văn từ chủ đề ra mắt.

Người dùng Kuyawa: "47mb đã tải, 1.5gb sau khi build, wtf?" và, trong một lần chỉnh sửa, "35 phụ thuộc tạo nên 1.4gb, chúng dùng để làm gì?" Người dùng eglintondust, trong một nhánh thảo luận về tải CPU: "Mức sử dụng bộ nhớ chắc chắn là vượt quá tầm kiểm soát, có một phiên rảnh ngay bây giờ đang ngốn 500MB" (Hacker News, tháng 8 năm 2026).

Đó là hai con số tôi muốn kiểm tra đầu tiên, bởi vì chúng là hai con số quyết định liệu thứ này có sống được trên máy tính xách tay của bạn hay không. Cả hai hóa ra đều phức tạp hơn so với những gì trích dẫn gợi ý, và một trong số chúng đang đo một thứ khác với những gì mọi người giả định. Nếu bạn cần phần giới thiệu kiến trúc trước khi bất kỳ điều nào trong số này có ý nghĩa, thì đó là một bài viết khác: DeepSeek Harness thực sự là gì.

Cách Tôi Thiết Lập Bài Đánh Giá DeepSeek Harness Này: Một Tác Vụ, Một Endpoint

Thiết lập cố tình nhàm chán để biến số duy nhất là cấu hình, không phải tác vụ.

Tác vụ. Xây dựng một trình theo dõi ISS trực tiếp trong một tệp index.html độc lập duy nhất. Nó cần một API bên ngoài, một bản đồ, một vòng lặp thăm dò và xử lý lỗi, vì vậy nó buộc phải có một vòng lặp công cụ đa bước thực sự thay vì một lần xuất mã. Và quan trọng là, tôi có thể mở kết quả và thấy ngay lập tức liệu nó có hoạt động không.

Mô hình. deepseek-ai/deepseek-v4-flash-0731, cùng một mô hình trong cả ba lần chạy, vì vậy không có gì trong so sánh là sự khác biệt về mô hình.

Endpoint. Đây là phần mà mọi người bỏ qua. Harness không đi kèm mô hình nào. Nó cần một URL cơ sở tương thích với OpenAI và một khóa, đơn giản vậy, và bề mặt cấu hình cho việc đó là nơi cả ba vấn đề của tôi đến từ. Tôi đã chạy nó với một endpoint tương thích OpenAI được lưu trữ với định giá DeepSeek phẳng và không có phụ phí giờ cao điểm, điều này quan trọng khi bạn sắp chạy cùng một tác vụ nhiều lần và muốn hóa đơn có thể so sánh được giữa các lần chạy. Bất kỳ endpoint tương thích nào cũng hoạt động theo cùng một cách.

EndpointGiao thứcGET /modelsHình thức thanh toánV4 ngữ cảnh 1M
API bên thứ nhất của DeepSeekopenai-completionsPhân chia cao điểm và thấp điểm, 01:00-04:00 và 06:00-10:00 UTC là cao điểm, thấp điểm bằng một nửa (Tài liệu API DeepSeek, tháng 8 năm 2026)
Atlas Cloudopenai-completionsCó, trả về 200 với 135 mô hình khi tôi kiểm traPhẳng theo token, không phụ phí cao điểmCó, $0,14 in / $0,28 out trên 1M với V4 Flash
Ollama cục bộopenai-completionsMiễn phí, mặc dù tìm kiếm web tích hợp vẫn cần đám mây OllamaPhụ thuộc vào mô hình cục bộ

Một lưu ý trung thực về hàng giữa đó, bởi vì nó đã làm tôi gặp vấn đề sau này: nó trả về {"code":200,"msg":"succeed","data":[...]} thay vì phong bì OpenAI tiêu chuẩn {"object":"list","data":[...]}. Mảng data ở đó, vì vậy một máy khách khoan dung sẽ ổn, nhưng đừng cho rằng mọi endpoint "tương thích OpenAI" đều giống hệt byte với đặc tả.

Giá được đọc từ trang mô hình V4 Flash vào ngày 18 tháng 8 năm 2026. Không có huy hiệu giảm giá nào trên bất kỳ mô hình DeepSeek nào ngay bây giờ, vì vậy không có gì ở đây là mức giá có thời hạn.

Bước 1: Cài đặt DeepSeek Harness và Đo Lường Chi Phí Thực Tế

Mọi thứ từ đây có thể tái tạo trên macOS với Node 22.19+ hoặc 24+ (không có hỗ trợ 23.x, và nhiều hướng dẫn hiểu sai điều này). Tôi đã chạy Node v24.15.0 và @deepseek-ai/[email protected].

Bắt đầu với hướng dẫn nhanh, đó là một lệnh:

bash
1node -v                        # ^22.19.0 || >=24, không phải 23.x
2npx @deepseek-ai/dsh web       # Web UI trên http://127.0.0.1:3080
3

Để có một con số bạn thực sự có thể so sánh với tuyên bố 1,5 GB, hãy cài đặt nó vào một thư mục sạch và đo lường thay thế:

bash
1mkdir dsh-size && cd dsh-size && npm init -y
2npm install @deepseek-ai/dsh
3du -sh node_modules
4du -sh node_modules/* | sort -h | tail -8      # nơi trọng lượng sống
5

Đây là những gì nó tạo ra trên máy của tôi:

text
1added 531 packages in 2m
2306M    node_modules
3255     mục nhập cấp cao nhất trong node_modules
4172K    node_modules/@deepseek-ai/dsh          <- bản thân gói
5
6 13M    node_modules/@shikijs
7 13M    node_modules/openai
8 14M    node_modules/@google/genai
9 17M    node_modules/@img/sharp-libvips-darwin-arm64
10 24M    node_modules/@mistralai/mistralai
11 26M    node_modules/node-pty
12 27M    node_modules/@deepseek-ai
13 34M    node_modules/@opentelemetry
14

Vậy: 306 MB, không phải 1,5 GB. Con số 1,5 GB trong bình luận Hacker News đó là một bản dựng toàn bộ mã nguồn, kéo theo các phụ thuộc phát triển và đầu ra bản dựng trên toàn bộ monorepo. Bản cài đặt thời gian chạy chỉ bằng một phần năm con số đó.

Tuy nhiên, 306 MB cho một tác nhân mã hóa vẫn là rất nhiều, và sự phân tích giải thích chính xác tại sao mọi người lại khó chịu. Bạn đang cài đặt ba SDK của nhà cung cấp mà bạn có thể không bao giờ gọi (openai, @google/genai, @mistralai/mistralai tổng cộng 51 MB), một cây OpenTelemetry đầy đủ, một tệp nhị phân sharp gốc và một trình tô sáng cú pháp. "Mọi thứ đều là plugin" có một chi phí vận chuyển, và ngay bây giờ bạn trả tất cả trước cho dù bạn có sử dụng các tuyến đó hay không.

Đối với bộ nhớ rảnh, khởi động hồ sơ web, mở một phiên, để nó yên và đọc RSS:

bash
1npx @deepseek-ai/dsh web --port 3099
2# sau đó, trong một shell khác:
3ps -o pid,rss,command -p $(pgrep -f "dsh web")
4

Lấy mẫu mỗi phút một lần trong năm phút với một phiên trực tiếp đang mở và không có tác vụ nào đang chạy:

text
1t+0s     101.8 MB     (ngay sau khi phiên mở)
2t+60s     37.0 MB
3t+120s    39.8 MB
4t+180s    38.8 MB
5t+240s    35.8 MB
6t+300s    35.0 MB
7

Nó đạt đỉnh khoảng 212 MB trong quá trình khởi động, ổn định ở ~102 MB khi UI kết nối, sau đó trình thu gom rác giảm nó xuống dải 35 đến 40 MB và nó ở đó. Điều đó không phải là "vượt quá tầm kiểm soát".

Nhưng eglintondust không nhất thiết sai, và đây là phần đáng để hiểu: hồ sơ web dsh là một máy chủ cục bộ cộng với một tab trình duyệt. 35 MB là máy chủ. UI là một ứng dụng web đầy đủ trong trình duyệt của bạn, và bộ nhớ đó được tính cho Chrome, không phải dsh. Nếu bạn đang xem một phiên rảnh 500 MB trong Activity Monitor, hãy kiểm tra quy trình nào được gán cho nó trước khi bạn báo lỗi. Chi tiết cài đặt đầy đủ có trong hướng dẫn cài đặt 10 phút.

Số liệu cho thấy DeepSeek Harness sử dụng 306 MB ổ đĩa và 35-40 MB bộ nhớ

Đầu ra terminal thực tế hiển thị dấu chân cài đặt và các phép đo bộ nhớ rảnh của DeepSeek Harness

Các phép đo thực tế, với các lệnh hiển thị. 306 MB đã cài đặt, 35 MB rảnh.

Bước 2: Trỏ DeepSeek Harness vào Endpoint Của Riêng Bạn

Trong UI, đây là Settings sau đó Models sau đó Add a custom provider: ID nhà cung cấp, URL cơ sở, giao thức, khóa, danh sách mô hình. Bạn cũng có thể viết trực tiếp vào $DSH_HOME/settings.yaml (mặc định ~/.dsh/settings.yaml), đó là những gì tôi đã làm, vì phiên bản tệp là thứ bạn có thể so sánh giữa các lần chạy.

Các phần trong tệp đó được khóa bởi ID plugin, điều này không hiển nhiên lần đầu tiên. Dict của nhà cung cấp thuộc về llm-pi-ai, và lựa chọn mô hình mặc định thuộc về agent-default-model:

yaml
1llm-pi-ai:
2  providers:
3    atlas:
4      displayName: Atlas Cloud
5      api: openai-completions
6      baseURL: https://api.atlascloud.ai/v1
7      apiKeyEnv: ATLAS_API_KEY
8      models:
9        - id: deepseek-ai/deepseek-v4-flash-0731
10
11agent-default-model:
12  provider: atlas
13  model: deepseek-ai/deepseek-v4-flash-0731
14

Đó là cấu hình ngây thơ, và nó là cấu hình tôi đã bắt đầu. Nó hoạt động. Lấy một khóa từ bảng điều khiển Atlas, export ATLAS_API_KEY=..., và lần chạy diễn ra. Lưu ý rằng apiKeyEnv là một tham chiếu, không phải bí mật, vì vậy không có khóa nào bao giờ xuất hiện trong tệp này.

Một chi tiết từ UI dễ bị bỏ lỡ và thực sự tốt: khi khóa đến từ môi trường, trường khóa API hiển thị dưới dạng Provided by the launch environment (read-only). Chấm xanh bên cạnh nhà cung cấp có nghĩa là tuyến đã được giải quyết. Chấm đỏ bên cạnh nhà cung cấp DeepSeek tích hợp có nghĩa là nó không có thông tin xác thực. Đó là kiểm tra sức khỏe hai giây mà bạn không cần phải đi tìm.

Tuy nhiên, có hai điều về cấu hình này là sai một cách âm thầm, và tôi đã không phát hiện ra cho đến khi tôi so sánh các quỹ đạo. Hãy giữ suy nghĩ đó cho đến Bước 4.

Menu cài đặt hiển thị cấu hình khóa API cho DeepSeek và Atlas Cloud

Trang Cài đặt Mô hình của DeepSeek Harness hiển thị một nhà cung cấp tùy chỉnh tương thích OpenAI có tên Atlas Cloud với chấm trạng thái xanh và khóa API của nó được cung cấp ở chế độ chỉ đọc bởi môi trường khởi chạy

Cài đặt, Mô hình, nhà cung cấp tùy chỉnh. Chấm xanh có nghĩa là tuyến đã được giải quyết; nhà cung cấp DeepSeek tích hợp phía trên nó có màu đỏ vì nó không có khóa.

Bước 3: Ba Lần Chạy Của Bài Đánh Giá DeepSeek Harness, Cạnh Nhau

Cùng một prompt mỗi lần. Dán nguyên văn nếu bạn muốn tái tạo nó:

text
1Xây dựng một trình theo dõi ISS một trang trong một tệp index.html độc lập duy nhất.
2
3Yêu cầu:
4- Lấy vị trí ISS từ https://api.wheretheiss.at/v1/satellites/25544 mỗi 5 giây.
5- Hiển thị bản đồ thế giới với một điểm đánh dấu tại lat/lon hiện tại, cùng với một dấu vết mờ dần của 60 vị trí cuối cùng.
6- Hiển thị độ cao (km), vận tốc (km/h) và lat/lon hiện tại trong một bảng điều khiển dễ đọc.
7- Không có bước xây dựng, không cài đặt npm, không có khóa API. Chỉ sử dụng Vanilla JS + inline CSS.
8- Xử lý lỗi tìm nạp mà không làm hỏng trang: giữ vị trí đã biết cuối cùng và hiển thị huy hiệu cũ.
9- Viết tệp, sau đó báo cáo đã hoàn thành.
10

Chạy nó ở chế độ không đầu để bản ghi sạch sẽ:

bash
1export DSH_HOME=$PWD/dsh-home
2export ATLAS_API_KEY=<khóa của bạn>
3dsh --profile headless "<prompt trên>"
4

Ba cấu hình:

  • Lần chạy A, đã tinh chỉnh: compat.thinkingFormat: deepseek, contextWindow: 1048576, maxTokens: 131072.
  • Lần chạy B, ngây thơ từ Bước 2: mục mô hình không có gì ngoài id.
  • Lần chạy C, lỗi có vẻ hợp lý: giống A nhưng với maxTokens: 4096, một con số tôi lấy thẳng từ ví dụ README của chính adapter.

Cả ba đều thoát với mã 0. Cả ba đều ghi một tệp index.html. Cả ba đều in một bản tóm tắt tuyên bố xác minh. Bản tóm tắt của lần chạy C thậm chí còn khoe khoang về việc tự sửa chữa: "Một vài lỗi tôi đã phát hiện và sửa trong quá trình xây dựng: một biến không xác định trong hiệu ứng mờ dần, logic hậu tố N/S-E/W không chính xác..."

Sau đó tôi mở cả ba tệp trong một trình duyệt thực với bảng điều khiển mở, và để chúng thăm dò trong hai chu kỳ.

Lần chạy A (đã tinh chỉnh)Lần chạy B (ngây thơ)Lần chạy C (maxTokens: 4096)
Thời gian tường152,7 s422,5 s50,2 s
Số bước15368
Số lần gọi công cụ14357
Hỗn hợp công cụ6 chỉnh sửa, 4 đọc, 2 bash19 bash, 8 đọc, 3 grep4 chỉnh sửa, 1 viết, 1 bash
Kích thước tệp đã ghi19.569 B10.812 B11.326 B
Lỗi console khi tải15012
Những gì bị hỏngmọi đường dẫn lục địa bị sai định dạng, không có điểm đánh dấu ISS, huy hiệu "Stale" bị kẹt vĩnh viễnkhông có gìcác vòng tròn dấu vết đều cx="NaN", điểm đánh dấu đậu ở 0,0, vĩ độ in ra là -34,76° S

Đọc lại bảng đó. Lần chạy nhanh nhất và lần chạy tôi đã cẩn thận tinh chỉnh đều gửi các trang bị hỏng. Lần chạy chậm, ngây thơ, đắt nhất là lần duy nhất hoạt động.

Lỗi của lần chạy A là lỗi mang tính hướng dẫn. Bảng thông tin viễn thông hoàn hảo: độ cao 431 km, 27.547 km/h, lat/lon chính xác, cập nhật trực tiếp. Bản đồ bên dưới nó là một đốm màu xanh lá cây, bởi vì tất cả mười lăm đường dẫn lục địa đều kết thúc bằng một chữ L lạc lõng không có tọa độ ("... L48.0 624.0 L Z"). Và huy hiệu nói "Stale, keeping last position" với "Last update: -" trong khi ba lần tìm nạp thành công nằm trong tab mạng. Nó làm đúng phần khó và sai phần có thể nhìn thấy.

Lý do nằm trong nhật ký suy luận của chính nó, ở bước 12, bằng chính lời của nó: nó đã xóa một biến mà trình xây dựng bản đồ của nó vẫn đang sử dụng, nhận thấy, và tiếp tục. Loại hồi quy tự gây ra muộn trong một lần chạy chính xác là thứ mà một quỹ đạo chỉ nối thêm rất tốt, đó là bước tiếp theo.

Lần chạy C buồn cười hơn và tệ hơn. Nó tuyên bố đã sửa lỗi hiệu ứng mờ dần của dấu vết và logic hậu tố N/S. Dấu vết là chính xác những gì bị hỏng (mười hai vòng tròn NaN, không có dấu vết nào hiển thị cả), và nhãn vĩ độ đọc -34.76° S, tức là ký hiệu kép. Nó không sửa được cái nào trong hai thứ nó nói là đã sửa, và nó xác minh công việc của mình bằng node --check, chỉ phân tích cú pháp JavaScript và không biết gì về việc một đường dẫn SVG có hợp lệ hay không.

Bảng điều khiển theo dõi Trạm Vũ trụ Quốc tế với bản đồ thế giới và tọa độ thời gian thực

Trang theo dõi ISS của lần chạy thứ ba với dấu vết ở vị trí NaN, điểm đánh dấu bị kẹt ở góc trên bên trái và nhãn vĩ độ ký hiệu kép

Lần chạy C, lần chạy 50 giây: đẹp, trực tiếp và âm thầm hỏng ở hai nơi nó tuyên bố đã sửa.

Không có điều nào trong số này thực sự là lỗi của Harness. Đó là lỗi của tác nhân mã hóa mà Harness đã trung thành thực thi và sau đó trung thành báo cáo là thành công. Điều này đưa chúng ta đến phần duy nhất của bản phát hành này thực sự gây ấn tượng với tôi.

Bước 4: Bản Sửa Hai Dòng, và Chế Độ Xem Trajectory Của DeepSeek Harness Đã Tìm Thấy Nó

Lần chạy B mất thời gian gấp 2,8 lần lần chạy A dường như vô lý đối với tôi. Cùng một mô hình, cùng một tác vụ, và sự khác biệt duy nhất là một vài dòng YAML. Vì vậy tôi đã vào Trajectory.

Mô tả chính thức là chính xác, điều hiếm hơn so với bình thường: "Mọi thứ mô hình nhìn thấy đều được ghi lại trong một nhật ký phiên chỉ nối thêm: prompt hệ thống, suy luận, lời gọi công cụ và kết quả, lịch trình tác nhân phụ, và mọi lần chèn ngữ cảnh... Trong chế độ xem Trajectory, bạn có thể kiểm tra các sự kiện này theo nguồn. Tiếp tục, rẽ nhánh, tìm kiếm và phát lại đều hoạt động trên cùng một luồng sự kiện" (DeepSeek Harness, tháng 8 năm 2026).

Nó không phải là tiếp thị. Luồng là một tệp thực:

bash
1ls $DSH_HOME/sessions/<workspace>/session-<uuid>/session.jsonl.zstd
2

Một sự kiện JSON mỗi dòng, được đóng khung zstd, chỉ nối thêm. Lần chạy A tạo ra 606 sự kiện; lần chạy B tạo ra 1.709. Lọc theo nguồn trong UI, hoặc chỉ grep tệp đã giải mã. Các loại sự kiện chính xác là những gì câu trên hứa hẹn: turn/start, step/start, request/header, request/context, assistant/chunk, reasoning-chunks, tool-call-chunks, tool/call, tool/result, step/end, turn/end.

Sự kiện request/header là thứ đã giải quyết vấn đề. Nó ghi lại cấu hình thực sự được đưa lên đường truyền:

jsonc
1// Lần chạy A
2{"config":{"provider":"atlas","model":"deepseek-ai/deepseek-v4-flash-0731","maxTokens":131072},
3 "adapterDefaults":{"maxTokens":true}}
4
5// Lần chạy B
6{"config":{"provider":"atlas","model":"deepseek-ai/deepseek-v4-flash-0731"}}
7

Lần chạy B không gửi giới hạn đầu ra nào cả, và suy luận của nó phình to lên 72.420 ký tự qua 33 khối so với 6.094 ký tự qua 9 khối của lần chạy A. Đó là nơi 270 giây thừa và 44.170 token đầu ra thừa đến từ.

Nguyên nhân được ghi lại, nhưng không phải trên trang tài liệu. Nó bị chôn vùi trong packages/llm/llm-pi-ai/README.md: phương ngữ suy luận được đoán từ URL endpoint. Theo lời của những người bảo trì, compat.thinkingFormat là thứ "pi-ai đoán từ URL endpoint; URL của một cổng riêng không nói lên điều gì, vì vậy một cổng thuộc phương ngữ DeepSeek sẽ được nói chuyện bằng phương ngữ OpenAI mà không có cách nào để sửa nó."

Endpoint của tôi trả về reasoning_content, cách viết của DeepSeek. Tên máy chủ của nó không nói gì về điều đó. Vì vậy, trong lần chạy B, adapter đã rơi vào phương ngữ OpenAI, không thể gửi mức suy luận, và mô hình suy luận ở mức mặc định của nó trên mỗi lần trong số 36 lần gọi. Riêng biệt, một mục mô hình chỉ khai báo id sẽ kế thừa các dự phòng tuyến defaultContextWindow: 262144defaultMaxTokens: 32768, vì vậy một mô hình 1.048.576 token âm thầm mất ba phần tư cửa sổ của nó.

Cả hai đều là hai dòng:

yaml
1llm-pi-ai:
2  providers:
3    atlas:
4      api: openai-completions             # compat.* chỉ tồn tại dưới giao thức này
5      baseURL: https://api.atlascloud.ai/v1
6      apiKeyEnv: ATLAS_API_KEY
7      compat:
8        thinkingFormat: deepseek          # ngừng đoán từ URL
9        supportsReasoningEffort: true
10      models:
11        - id: deepseek-ai/deepseek-v4-flash-0731
12          contextWindow: 1048576          # ghi đè dự phòng 262.144
13          maxTokens: 131072               # để lại khoảng trống thực sự cho suy luận
14

Hai điều cần ghi nhớ. Thứ tự ưu tiên là mô hình, sau đó tuyến, sau đó mục nhập danh mục đã cài đặt, sau đó dự đoán URL của pi-ai, vì vậy giá trị cấp mô hình thắng. Và compat.* chỉ tồn tại dưới api: openai-completions; đặt nó ở bất kỳ đâu khác và việc giải quyết thất bại hoàn toàn. Adapter cũng cố tình không hỗ trợ Bedrock, Vertex, Azure hoặc Codex, vì xác thực của chúng cần nhiều hơn một khóa, một endpoint và các tiêu đề.

Thiết lập điều đó, và cấu hình đường truyền của lần chạy A là đúng, hóa đơn token của nó giảm 3,5 lần, và nó vẫn gửi một bản đồ bị hỏng. Đó là bản tóm tắt trung thực của toàn bộ bài tập này: sửa cấu hình là có thật, và nó sửa hóa đơn, không phải việc đánh giá mã mà bạn vẫn phải tự làm.

Bảng điều khiển hiển thị số lượng sự kiện nhật ký phiên, tiêu đề yêu cầu và văn bản suy luận

Luồng sự kiện phiên chỉ nối thêm từ một lần chạy DeepSeek Harness thực tế, với số lượng sự kiện và tiêu đề yêu cầu đã tiết lộ vấn đề cấu hình

Luồng sự kiện Trajectory từ lần chạy A: 606 sự kiện, và một sự kiện đã phơi bày giới hạn đầu ra bị thiếu.

Bài Đánh Giá DeepSeek Harness Này Có Chi Phí Bao Nhiêu, và Liệu Nó Có Sẵn Sàng Cho Sản Xuất Không

Ba lần chạy tác nhân đầy đủ của một tác vụ không tầm thường, trực tiếp từ các quỹ đạo, với tỷ lệ phẳng $0.14 in / $0.28 out trên 1M:

Lần chạy ALần chạy BLần chạy CTổng
Số lần gọi LLM1536859
Token đầu vào không được lưu trong bộ nhớ đệm38.452109.40820.781168.641
Token đầu ra12.74056.9106.96976.619
Token đọc bộ nhớ đệm280.8322.150.144108.8002.539.776
Tỷ lệ bộ nhớ đệm trong prompt88.0%95.2%84.0%93.8%
Đầu vào không được lưu đệm + đầu ra$0,0090$0,0313$0,0049$0,0452
Nếu mọi token được lưu đệm được tính với tỷ lệ đầu vào đầy đủ$0,0483$0,3323$0,0201$0,4007

Hai điều đáng rút ra từ đó. Đầu tiên, các con số bộ nhớ đệm là có thật và endpoint báo cáo chúng: 93,8% tổng số token prompt trên ba lần chạy được trả về dưới dạng đọc bộ nhớ đệm, đó là điều làm cho một vòng lặp tác nhân có giá cả phải chăng. Thứ hai, lần chạy sai cấu hình có giá gấp 3,5 lần lần chạy đã tinh chỉnh cho một tác vụ có kích thước giống hệt nhau. Đó là giá thực tế của hai dòng YAML.

Hãy chú ý đến hình dạng của lần gọi đầu tiên trong mỗi lần chạy: khoảng 11.000 token đầu vào trước khi tác nhân làm bất cứ điều gì. Đó là prompt hệ thống, lược đồ công cụ và danh mục kỹ năng mà "mọi thứ đều là plugin" ngụ ý, và bạn trả nó trên mỗi phiên mới. Đó là lý do tại sao tỷ lệ trúng bộ nhớ đệm quan trọng hơn trên harness này so với một harness mỏng hơn, và tại sao chạy chế độ Tối thiểu (bash cộng với một trình soạn thảo tệp) đáng để thử nếu tác vụ của bạn không cần bộ công cụ đầy đủ.

Vậy bạn có thể đưa nó vào sản xuất không? Không, và dự án đồng ý với bạn. Chính lời của README: "DeepSeek Harness hiện đang trong giai đoạn xem trước dành cho nhà phát triển và đang được lặp lại nhanh chóng. SẼ CÓ NHỮNG THAY ĐỔI PHÁ VỠ TÍNH TƯƠNG THÍCH." UI Web mở ra với một phương thức nói "DeepSeek Harness 0.1 vẫn đang trong quá trình thử nghiệm dành cho các nhà phát triển Harness." Giấy phép MIT có nghĩa là bạn có thể làm bất cứ điều gì bạn muốn với nó; nó không có nghĩa là API bạn xây dựng dựa trên nó sẽ tồn tại vào tháng tới.

Bạn là aiPhán quyếtTại sao
Nhà phát triển cá nhân chỉ muốn gửi mã ngay hôm nayBỏ qua ngay bây giờHai trong ba lần chạy của tôi đã gửi đầu ra bị hỏng với một "đã xong" đầy tự tin. Bạn sẽ dành thời gian của mình cho harness, không phải công việc.
Nhóm cơ sở hạ tầng muốn sửa đổi chính vòng lặp tác nhânDùng thửĐây là công cụ duy nhất mà vòng lặp, các công cụ và UI đều có thể hoán đổi được bằng cấu hình. Điều đó thực sự hiếm và đáng để bạn dành thời gian.
Doanh nghiệp đang thiết lập bảng điều khiển sản xuấtChưaCác thay đổi phá vỡ được hứa hẹn bằng văn bản, các plugin và máy chủ MCP chạy bên ngoài hộp cát, và trang tài liệu thiếu cấu hình quyết định hóa đơn token của bạn.
Nhà xây dựng plugin và công cụCó, ngay bây giờCác khe cắm mở rộng là toàn bộ điểm, hệ sinh thái còn nhỏ, và các plugin sớm sẽ có sân chơi riêng cho mình.

Phần còn lại của danh sách rủi ro ngắn và có thật. Có một UUID telemetry ẩn danh. Các plugin và máy chủ MCP thực thi bên ngoài hộp cát bash, vì vậy một plugin là mã bạn đang chọn để tin tưởng. Và như bài đánh giá này đã phát hiện ra một cách khó khăn, các cài đặt kiểm soát chi phí và tính chính xác được ghi lại trong một README của gói thay vì trong hướng dẫn, điều đó có nghĩa là hóa đơn đầu tiên của bạn có thể cao gấp nhiều lần so với mức đáng lẽ vì những lý do mà không có thông báo lỗi nào sẽ cho bạn biết.

Bài Đánh Giá DeepSeek Harness: Các Câu Hỏi Thường Gặp

DeepSeek Harness đã sẵn sàng cho sản xuất chưa?

Không. README nói rõ: "DeepSeek Harness hiện đang trong giai đoạn xem trước dành cho nhà phát triển và đang được lặp lại nhanh chóng. SẼ CÓ NHỮNG THAY ĐỔI PHÁ VỠ TÍNH TƯƠNG THÍCH." UI Web lặp lại điều đó trong một phương thức khởi động. Một thử nghiệm có giới hạn trên khối lượng công việc không quan trọng là hợp lý ngay hôm nay. Một bảng điều khiển sản xuất mà nhóm của bạn phụ thuộc vào thì không, bởi vì bề mặt API bạn xây dựng dựa trên nó rõ ràng là không ổn định.

DeepSeek Harness thực sự sử dụng bao nhiêu ổ đĩa và bộ nhớ?

Trên macOS, npm install @deepseek-ai/dsh đã tải 531 gói và 306 MB, trong đó bản thân gói dsh là 172 KB. Con số 1,5 GB được trích dẫn rộng rãi là một bản dựng toàn bộ mã nguồn, không phải bản cài đặt thời gian chạy. Tiến trình máy chủ web ở trạng thái rảnh sử dụng 35 đến 40 MB RSS với một phiên trực tiếp đang mở, sau khi đạt đỉnh gần 212 MB trong quá trình khởi động. Bộ nhớ của chính UI được tính cho trình duyệt của bạn, không phải dsh.

Tại sao lần chạy DeepSeek Harness của tôi chậm hơn và đắt hơn nhiều so với dự kiến?

Rất có thể mục mô hình của bạn không khai báo gì ngoài id. Điều đó kế thừa các dự phòng tuyến defaultContextWindow: 262144defaultMaxTokens: 32768, và nó để adapter đoán phương ngữ suy luận từ tên máy chủ của endpoint của bạn. Trong thử nghiệm của tôi, sự kết hợp đó đã tạo ra 36 bước thay vì 15 và chi phí token gấp 3,5 lần cho cùng một tác vụ. Hãy đặt compat.thinkingFormat, một contextWindow thực sự và một maxTokens thực sự.

DeepSeek Harness có hoạt động với các endpoint không phải của DeepSeek không?

Có, bất kỳ URL cơ sở nào tương thích với OpenAI đều hoạt động, và đó là cách hầu hết mọi người sẽ chạy nó. Điểm bắt là phương ngữ suy luận được suy ra từ URL, vì vậy một cổng thuộc phương ngữ DeepSeek trên một tên máy chủ trung tính sẽ được nói chuyện bằng phương ngữ OpenAI. compat.thinkingFormat: deepseek là bản sửa, và nó chỉ tồn tại dưới api: openai-completions. Bedrock, Vertex, Azure và Codex bị cố tình không hỗ trợ.

Chế độ xem Trajectory có thực sự hữu ích không, hay chỉ là tiếp thị?

Nó hữu ích, và nó là điểm mạnh nhất trong bản phát hành này. Nhật ký phiên là một tệp JSONL chỉ nối thêm thực sự mà bạn có thể lọc theo nguồn, tiếp tục, rẽ nhánh và phát lại, và sự kiện request/header đã cho tôi biết chính xác cấu hình nào đã đến đường truyền, đó là thứ đã giải quyết vấn đề của tôi. Những gì nó không làm là giải thích tại sao mô hình chọn một thứ gì đó. Nó ghi lại những gì mô hình thấy, không phải tại sao nó quyết định.

DeepSeek Harness so với Claude Code hoặc OpenCode, tôi nên sử dụng cái nào hàng ngày?

Nếu bạn muốn một thứ gì đó để viết mã một cách đáng tin cậy ngay hôm nay, không phải cái này, chưa phải. Chọn Harness khi chính thời gian chạy tác nhân là thứ bạn muốn thay đổi, bởi vì hoán đổi vòng lặp, công cụ hoặc UI là cấu hình ở đây thay vì một fork. Để so sánh dựa trên số liệu về mức sử dụng token, hãy xem DeepSeek Harness vs OpenCode, và cho lớp mở rộng, plugin nào đáng cài đặt.


Các lần chạy được thực hiện vào ngày 18 tháng 8 năm 2026 trên macOS, Node v24.15.0, @deepseek-ai/[email protected], mô hình deepseek-ai/deepseek-v4-flash-0731 được phục vụ qua một endpoint tương thích OpenAI trên Atlas Cloud. Mọi số lượng token, thời gian tường và lỗi console trong bài viết này đều đến từ nhật ký phiên và bảng điều khiển trình duyệt của các lần chạy đó.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình