Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức

Điểm chuẩn GPT-6 Astra: 7 Chỉ Số Cần Kiểm Tra Trước Khi Mua

Một điểm số có thể đồng thời là một kết quả, một bộ khung đánh giá, một bộ công cụ và một quyết định ngân sách. Nếu bạn đang chọn một tác nhân cho công việc kiểm thử trình duyệt, lập trình hoặc nghiên cứu vào tuần tới, các điểm chuẩn GPT-6 Astra là bằng chứng hữu ích, không phải là phán quyết triển khai.

Một điểm số có thể đồng thời là kết quả, một bộ khung đánh giá, một ngăn xếp công cụ và một quyết định ngân sách. Nếu bạn đang lựa chọn một agent cho công việc QA trình duyệt, lập trình hoặc nghiên cứu vào tuần tới, GPT-6 Astra benchmarks là bằng chứng hữu ích, không phải là phán quyết triển khai.

Câu trả lời ngắn: kết quả computer-use và terminal của Astra là những con số ra mắt có lộ trình rõ ràng nhất đến công việc thực tế. Kết quả 99,9% ARC-AGI-3 là một tín hiệu nổi bật về một thiết lập benchmark cụ thể, nhưng nó không thể tự dự đoán tỷ lệ lỗi sản xuất của bạn. Hãy coi mỗi điểm số là một tuyên bố cần kiểm toán dựa trên quyền hạn, công cụ, số lần thử lại, bài kiểm tra chấp nhận và quy trình rà soát của bạn.

OpenAI báo cáo 72,6% trên OSWorld 2.0, 57,9% trên Terminal-Bench 4.0, 64,6% trên Terminal-Bench Science 0.1, 41,4% trên AutomationBench, 95,9% trên BenchCAD, 61 trên Artificial Analysis Intelligence Index và 99,9% trên ARC-AGI-3. Bảy con số đó trả lời những câu hỏi khác nhau. Một chương trình thí điểm hữu ích bắt đầu bằng việc giữ chúng tách biệt.

Những điểm chính

  • Computer use là tín hiệu khởi đầu mà hầu hết đội nhóm có thể kiểm thử.
  • Đọc điểm số, phiên bản, bộ khung, công cụ và mức nỗ lực cùng nhau.
  • OSWorld, Terminal-Bench và AutomationBench kiểm thử các loại công việc khác nhau.
  • Điểm số bão hòa không làm cho lỗi sản xuất biến mất.
  • Một cuộc kiểm toán 15 phút có thể xác định một thí điểm an toàn đầu tiên.

04-benchmark-evidence-audit-motion.gif

Chuỗi kiểm toán bằng chứng benchmark minh họa với thẻ giấy, hồ sơ, đồng hồ bấm giờ và người rà soát

Chuỗi kiểm toán minh họa để đọc một tuyên bố benchmark: thẻ bằng chứng và ghi chú thời gian được rà soát trước khi quyết định thí điểm. Đây là quy trình rà soát có giám sát, không phải kết quả benchmark.

Vì Sao GPT-6 Astra Benchmarks Gây Sốt, Và Vì Sao Thí Điểm Thất Bại

Các con số cao xuất hiện cùng với các bản demo trông gần giống công việc chuyên môn thông thường. Ví dụ KiCad của OpenAI biến sơ đồ nguyên lý thành bố cục bo mạch. Ví dụ Blender-to-Unreal chuyển mô hình ngôi nhà thành một khung cảnh có thể đi lại được. Ví dụ Tidal Rush kết thúc bằng một trò đua xe kart có thể chơi được. Điều đó cụ thể hơn nhiều so với một benchmark trò chuyện.

Cái bẫy tiêu đề là coi mô hình như toàn bộ hệ thống. Một agent hoạt động bao gồm bộ khung benchmark, các công cụ được bật, trình duyệt hoặc terminal, số lần thử lại, thông tin xác thực được phép và chính sách quyết định thời điểm con người phải phê duyệt một hành động. Thay đổi bất kỳ điều nào trong số đó và mức độ hoàn thành tác vụ có thể thay đổi.

OSWorld 2.0 là mục gần nhất ở đây với công việc máy tính để bàn và trình duyệt có kiểm soát. OpenAI báo cáo 72,6% trên bộ điểm một phần ngoại tuyến của nó và giảm khoảng 47% thời gian mỗi tác vụ trong mô phỏng độ trễ của họ. Đó là lý do để kiểm thử một quy trình công việc có kiểm soát như QA biểu mẫu hoặc danh sách kiểm tra công cụ thiết kế. Đó không phải là lý do để cấp quyền truy cập sản xuất rộng rãi.

Terminal-Bench 4.0 hỏi liệu một agent có hoàn thành các tác vụ terminal phức tạp như kỹ thuật, cấu hình và phân tích dữ liệu hay không. OpenAI báo cáo 57,9% cho Astra. Bảng xếp hạng theo phiên bản cụ thể của chính bảng này là lời nhắc hữu ích rằng hãy giữ phiên bản benchmark, bộ khung, chi phí và bối cảnh độ tin cậy gắn liền với mỗi so sánh (Terminal-Bench leaderboard, tháng 9 năm 2026). Một điểm số trên một bản phát hành không nên được gộp một cách tùy tiện với biểu đồ từ bản khác.

ARC-AGI-3 cũng cần sự cẩn thận tương tự. Kết quả 99,9% của OpenAI là kết quả tối đa ở mọi mức nỗ lực sử dụng bộ khung Responses API của họ. Công ty cho biết môi trường nghiên cứu hoặc API của họ có thể khác với ChatGPT sản xuất vì các prompt hệ thống và công cụ có thể khác nhau. Cuộc thảo luận công khai tập trung vào sự khác biệt bộ khung đó vì nó thay đổi những gì có thể so sánh được. Nó không xóa bỏ kết quả. Nó cho bạn biết chính xác những gì phải được ghi lại trước khi bạn chuyển nó thành quyết định sản phẩm.

Bản demo Blender-to-Unreal là một trường hợp tích cực hữu ích. Nó có đầu vào rõ ràng, một chuỗi công cụ giới hạn, các tệp trung gian có thể quan sát và trạng thái cuối hiển thị được. Điều đó làm cho nó trở thành ứng viên tốt hơn cho một thử nghiệm nội bộ có giám sát so với một tác vụ mơ hồ với dữ liệu thay đổi và các hành động bên ngoài không thể đảo ngược.

05-packaging-prototype-handoff-motion.gif

Chuỗi bàn giao nguyên mẫu đóng gói minh họa với mẫu vật liệu, thước cặp và người rà soát

Chuỗi bàn giao minh họa cho cuộc thảo luận đa công cụ: một nguyên mẫu đóng gói vật lý trải qua bước kiểm tra vật liệu, đo lường và người rà soát trước khi chuyển giao. Đây là một kịch bản có giám sát riêng biệt, không phải kết quả benchmark.

Quy trình GPT-6 Astra Benchmark: Xây Dựng Một Bước Kiểm Tra Thực Tế Nhỏ

Bạn không cần một phòng thí nghiệm benchmark để đọc một benchmark một cách cẩn thận. Bạn cần một hàng nguồn cố định, một người phân tích tuyên bố, một nhà phê bình độc lập và một kế hoạch thí điểm gắn với bài kiểm tra chấp nhận của riêng bạn. Chuỗi đó có thể nằm trong một tab trình duyệt, trong khi thí điểm cuối cùng vẫn nằm trong môi trường kiểm thử được ủy quyền của bạn.

Đối với một nhóm đối chứng nhẹ, Atlas Cloud có thể giữ hai vai trò rà soát riêng biệt. Đây không phải là tuyên bố rằng họ lưu trữ Astra và nó không tái tạo benchmark chính thức. Tính đến ngày 4 tháng 9 năm 2026, danh mục không liệt kê GPT-6 Astra.

   
Sử dụngVai trò trong bài viết nàyRanh giới khả dụng
Tuyên bố được kiểm toánChỉ trích dẫn kết quả công khai chính thứcKhông khẳng định nó chạy trên Atlas Cloud
Người phân tích tuyên bốTrích xuất các điều kiện và thiếu sótChỉ rà soát tài liệu nguồn được trích dẫn
Nhà phê bình độc lậpThách thức kết luận áp dụngKhông khẳng định quyền truy cập Astra

Giữ cuộc kiểm toán độc lập với tiêu đề ra mắt. Kiểm tra lại nguồn chính thức và danh mục tại thời điểm xuất bản vì khả dụng danh mục và giá token có thể thay đổi. Trang ra mắt chính thức báo cáo giá API Standard của Astra và chế độ Fast riêng biệt. (Artificial Analysis model profile, tháng 9 năm 2026) độc lập liệt kê giá trị Intelligence Index là 61 cho cấu hình tối đa và ghi chú mức giá token $10/$50.

Bước 1: Đóng Băng Tuyên Bố Trước Khi Diễn Giải

Sao chép hàng benchmark gốc, phiên bản, hàng so sánh, chú thích cuối trang và ngày xuất bản. Điều này ngăn người rà soát tự ý điền các thiết lập còn thiếu. Sử dụng tuyên bố OSWorld/PCB cho lần đầu tiên, sau đó lặp lại cho bất kỳ điểm số nào ảnh hưởng đến quyết định mua sắm của bạn.

plaintext
1You are a benchmark-audit analyst. Read only the source text below.
2
3Create a claim card with exactly these fields:
41. benchmark name and version
52. reported GPT-6 Astra score
63. compared system and score
74. task the benchmark actually measures
85. harness, tools, retries, or reasoning settings explicitly disclosed
96. what is not disclosed
107. one deployment claim this evidence supports
118. one deployment claim this evidence does not support
12
13Rules:
14- Do not infer missing settings.
15- Label vendor-reported, benchmark-owner-reported, and community interpretation separately.
16- If a fact is absent, write "not disclosed".
17
18SOURCE:
19[PASTE THE OFFICIAL BENCHMARK ROW AND FOOTNOTES HERE]

Cài đặt: nhiệt độ 0.2; top_p 1; max_tokens 900; seed cố định 20260904. Chạy cùng một tài liệu 3 lần và ghi lại liệu các trường có thay đổi hay không. Đây là phân tích đối chứng, không phải chạy lại benchmark Astra.

Bước 2: Chạy Một Lập Luận Phản Đối

Yêu cầu lý do mạnh nhất để trì hoãn thí điểm. Một bản tóm tắt thứ hai thường lặp lại nội dung ra mắt; một đánh giá mua sắm phơi bày các phụ thuộc mà tiêu đề không mang theo.

plaintext
1Act as a skeptical AI procurement reviewer.
2
3Using the benchmark claim card below, write a concise red-team review for a team deciding whether to pilot GPT-6 Astra for browser QA.
4
5Return:
6- evidence that transfers to this workflow
7- evidence that does not transfer
8- three hidden operating assumptions
9- the smallest safe pilot
10- a pass/fail acceptance metric
11- a reason to delay adoption
12
13Do not rank vendors. Do not invent external benchmark results. Do not claim access to GPT-6 Astra.
14
15CLAIM CARD:
16[PASTE STEP 1 OUTPUT]

Cài đặt: nhiệt độ 0.2; top_p 1; max_tokens 1,100; seed cố định 20260904. Chạy 3 lần với cùng thẻ tuyên bố. Giữ phiên bản nêu rõ các giả định thay vì chỉ nói rằng hệ thống cần kiểm thử.

Bước 3: Biến Tuyên Bố Thành Một Thí Điểm Có Thể Kiểm Thử

Sử dụng hai đầu ra để xác định một phần tác vụ mà đội của bạn có thể chạy với tài khoản kiểm thử được ủy quyền và dữ liệu phi sản xuất. Không thêm tìm kiếm web hoặc thông tin xác thực bên ngoài. Một con người rà soát mọi hành động có thể ảnh hưởng đến hệ thống khác.

plaintext
1Turn the audit below into a one-week pilot plan.
2
3Context:
4- We evaluate a tool-using assistant for a real workflow.
5- We will use only authorized test accounts and non-production data.
6- Human review is required before any external action.
7
8Return a table with:
9Task slice | starting input | allowed tools | completion definition |
10human review checkpoint | failure condition | cost cap | sample size.
11
12Then write one sentence that states exactly what result would justify moving from pilot to production.
13
14AUDIT:
15[PASTE STEP 1 AND STEP 2 OUTPUTS]

Cài đặt: nhiệt độ 0.1; max_tokens 1,000; không dùng tìm kiếm web của bên thứ ba; tạo một lần, sau đó để con người kiểm tra ma trận dựa trên tài khoản và quyền hạn thực tế của bạn.

Các Biến Thể GPT-6 Astra Benchmark: 3 Khối Lượng Công Việc, 3 Câu Trả Lời

Biến thể A: PCB và sử dụng máy tính có kiểm soát. Trường hợp KiCad rất hứa hẹn cho phần mềm kỹ thuật nơi các quy tắc rõ ràng và kết quả có thể kiểm tra. Kiểm thử xem agent có nhất quán tuân thủ các kiểm tra quy tắc thiết kế và ràng buộc nhà sản xuất trên một mẫu hay không, không phải liệu nó đã định tuyến một bo mạch một lần hay không. Giữ phê duyệt trước khi phát hành cho chế tạo.

01-pcb-approval-motion.gif

Chuỗi phê duyệt PCB minh họa: đo bo mạch, rà soát sơ đồ nguyên lý và bàn giao phê duyệt của con người

Trường hợp chuyển động minh họa cho Biến thể A: kiểm tra bo mạch từ trên xuống cắt sang đánh giá bên cạnh và sau đó là bàn giao phê duyệt rộng. Clip cho thấy một kịch bản thí điểm có giám sát, không phải kết quả benchmark.

Biến thể B: Blender đến Unreal và sản xuất đa công cụ. Chuyển đổi tài sản, bàn giao công cụ và công việc nội bộ có thể đảo ngược là những ứng viên tốt khi các tệp trung gian có thể kiểm tra. Bài kiểm tra chấp nhận nên bao gồm khả năng tương thích định dạng, cấu trúc tài sản dự kiến và một người rà soát được chỉ định. Một bản hướng dẫn trau chuốt không thay thế phê duyệt thiết kế hoặc kỹ thuật.

02-cross-tool-handoff-motion.gif

Chuỗi bàn giao đa công cụ minh họa với mô hình ngôi nhà, rà soát kế hoạch và phê duyệt đội nhóm

Trường hợp chuyển động minh họa cho Biến thể B: chuỗi cắt từ mô hình vật lý và kế hoạch đến bàn giao của nó, sau đó đến đánh giá rộng của đội nhóm. Nó cho thấy một kịch bản thí điểm có giám sát, không phải kết quả benchmark.

Biến thể C: Tidal Rush và khoảng cách demo-sản phẩm. Một nguyên mẫu có thể chơi được có thể giúp đội nhóm làm rõ ngắn gọn một cách nhanh chóng. Nó nói ít hơn về độ phủ hồi quy, quyền sở hữu mã, phân loại lỗi, khả năng truy cập, quy trình build và chi phí duy trì dự án sau ngày demo.

03-prototype-review-motion.gif

Chuỗi rà soát nguyên mẫu minh họa với xe kart đồ chơi, bộ điều khiển, ghi chú kiểm thử và người rà soát

Trường hợp chuyển động minh họa cho Biến thể C: cảnh quay xe kart trên đường đua cắt sang kiểm thử thực hành và sau đó là rà soát các ghi chú kiểm thử bằng văn bản. Một sản phẩm bàn giao có thể chơi được vẫn cần độ phủ kiểm thử, bảo trì và xác nhận sửa lỗi trước khi trở thành quy trình sản phẩm. Đây không phải là kết quả benchmark.

GPT-6 Astra Benchmark: Chi Phí, Quyền Truy Cập và Ranh Giới An Toàn

Quyền truy cập. Trang ra mắt cho biết Astra được triển khai trước tiên cho một nhóm tổ chức giới hạn, sau đó đến người dùng Plus, Pro, Business, Enterprise, API, Azure và Bedrock trong những ngày tới. Quản trị viên doanh nghiệp phải bật nó và quyền truy cập bị tắt theo mặc định khi ra mắt. Lên kế hoạch dựa trên trạng thái truy cập bạn thực sự có thể xác minh, không phải lộ trình triển khai đã hứa.

Chi phí. Giá token chỉ là khoản mục nhìn thấy được. Mức nỗ lực suy luận, lời gọi công cụ, số lần thử lại, tác vụ thất bại và rà soát của con người quyết định chi phí của một công việc hoàn thành. Chạy cùng một phần tác vụ ở mức nỗ lực bạn định triển khai, sau đó thêm thời gian rà soát vào so sánh của bạn.

An toàn. Cấp cho thí điểm bộ quyền nhỏ nhất hoạt động được. Sử dụng hộp cát, tài khoản kiểm thử, nhật ký hành động và cổng phê duyệt cho các thay đổi bên ngoài. Đối với công việc nhạy cảm về an ninh mạng, giữ hoạt động phòng thủ, được ủy quyền và có thể rà soát. OpenAI cho biết các kiểm tra an toàn bổ sung của họ có thể làm chậm, tạm dừng hoặc dừng một tác vụ, điều này làm cho các kiểm soát đó trở thành một phần của lập kế hoạch vận hành thay vì một điều nghĩ đến sau.

Nếu bạn cần chạy cùng một prompt cố định qua các vai trò đối chứng, hãy rà soát danh mục mô hình Atlas Cloud hiện tại trước khi chọn một nhóm đối chứng. Đó là một cách để tổ chức cuộc kiểm toán, không phải bằng chứng rằng GPT-6 Astra khả dụng ở đó.

Các Câu Hỏi Thường Gặp

Các benchmark GPT-6 Astra quan trọng nhất là gì?

Đối với các đội triển khai agent, hãy bắt đầu với OSWorld 2.0 cho computer use, Terminal-Bench 4.0 cho công việc terminal, AutomationBench cho tự động hóa chuyên nghiệp và Terminal-Bench Science cho quy trình công cụ khoa học. Đọc ARC-AGI-3 như một kết quả suy luận trừu tượng riêng biệt với các điều kiện bộ khung và mức nỗ lực được nêu.

Điểm ARC-AGI-3 của GPT-6 Astra có chứng minh AGI không?

Không. Đó là bằng chứng về hiệu suất trên ARC-AGI-3 trong một thiết lập được tiết lộ. Nó không thiết lập hiệu suất đáng tin cậy, an toàn hoặc khả năng chung trên mọi quy trình công việc thực tế.

Một đội nên đánh giá GPT-6 Astra cho agent lập trình như thế nào?

Sử dụng một tác vụ kho mã phù hợp, bộ kiểm thử, chính sách công cụ và giới hạn chi phí. Các đánh giá lập trình chính thức là bằng chứng hữu ích, nhưng kết luận cho đội của bạn cần cùng các điều kiện vận hành và bài kiểm tra chấp nhận.

Chi phí sử dụng GPT-6 Astra là bao nhiêu?

OpenAI liệt kê giá API Standard là $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra khi ra mắt. Lời gọi công cụ, mức nỗ lực suy luận cao, số lần thử lại và rà soát của con người làm tăng chi phí hoàn thành tác vụ.

Ai có thể truy cập GPT-6 Astra ngay bây giờ?

Tính đến ngày 4 tháng 9 năm 2026, OpenAI mô tả một đợt triển khai tổ chức ban đầu giới hạn, với khả dụng ChatGPT và API rộng hơn theo sau trong những ngày tới. Cài đặt quản trị viên không gian làm việc cũng có thể ảnh hưởng đến quyền truy cập.

GPT-6 Astra có khả dụng trên Atlas Cloud không?

Không. Tại thời điểm bài viết này, danh mục Atlas Cloud không liệt kê nó, vì vậy GPT-6 Astra benchmarks nên được xem như bằng chứng bên ngoài thay vì kết quả trên nền tảng.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình