Chi phí thực sự của GPT-6.1 Sol: Vượt qua mức giá $2 / $10

AIHubMixĐọc 6 phút
Chi phí thực sự của GPT-6.1 Sol: Vượt qua mức giá $2 / $10

GPT-6.1 Sol có cùng mức giá niêm yết như GPT-6 Sol: $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra. Hóa đơn thực tế của bạn phụ thuộc vào bốn yếu tố khác: tần suất bạn truy cập cache, liệu bạn có vượt quá 272K token đầu vào hay không, bạn sử dụng cấp dịch vụ nào và số lượng token lý luận mà mô hình tiêu tốn. Bài viết này sẽ đi qua từng yếu tố.


Danh sách giá đầy đủ

Mức giá tiêu chuẩn (cho mỗi 1 triệu token)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
Đầu vào$2.00$2.00$10.00$0.10
Đầu vào đã cache$0.10$0.20$1.00—
Ghi cache$2.50$2.50——
Đầu ra (bao gồm lý luận)$10.00$10.00$50.00$0.50
Tỷ lệ cache của Astra đến từ báo cáo của bên thứ ba. Tỷ lệ ghi cache của nó nên là $12.50 theo quy tắc 1.25× của OpenAI. Để biết giá cả cache của Luna, xem trang giá của OpenAI.

Các yếu tố nhân

Các quy tắc này đến từ trang mô hình GPT-6.1 Sol:

Điều kiệnĐiều gì xảy ra
Hơn 272K token đầu vàoToàn bộ yêu cầu tính phí ở mức 2× đầu vào và cache, 1.5× đầu ra ($4 / $15, đọc cache $0.20, ghi cache $5)
Batch / FlexMột nửa mức giá tiêu chuẩn
Chế độ nhanhGấp đôi mức giá tiêu chuẩn (không có sẵn với dữ liệu EU)
Xử lý theo vùng+10%
Gọi công cụ (tìm kiếm, sử dụng máy tính, v.v.)Tính phí theo lần gọi. AIHubMix liệt kê tìm kiếm web ở mức $0.01 cho mỗi yêu cầu
Siêu nhanh (sắp có trên Codex)Chưa có giá chính thức. Một báo cáo cho biết 6× tiêu chuẩn, chưa được xác nhận

Trên AIHubMix, các tuyến đường OpenAI và Azure có giá tương đương với OpenAI trực tiếp, và cấp trên 272K đã được liệt kê.


Sự thay đổi thực sự: đọc cache ở mức 5% của đầu vào

Mức giá niêm yết không thay đổi. Các lần đọc cache đã thay đổi, từ 10% của mức giá đầu vào ($0.20) xuống còn 5% ($0.10). Tài liệu hướng dẫn cache prompt của OpenAI nói rõ: các lần đọc cache là 0.1× đầu vào trên hầu hết các mô hình và "0.05× trên GPT-6.1 Sol."

Điều này quan trọng vì các tác nhân gửi lại cùng một tài liệu ở mỗi bước: prompt hệ thống, định nghĩa công cụ, ngữ cảnh repo và lịch sử cuộc trò chuyện. Hầu hết đầu vào của họ là nội dung lặp lại. Đối với những khối lượng công việc này, tỷ lệ đã cache thực sự là giá đầu vào của bạn.

Ví dụ thực tế: một tác vụ của tác nhân lập trình

Các giả định:

  • Tiền tố cố định 200K token (prompt hệ thống, công cụ, ngữ cảnh repo)
  • 50 bước, mỗi bước thêm 2K token đầu vào mới và tạo ra 3K token đầu ra (bao gồm lý luận)
  • Để đơn giản, tiền tố giữ nguyên kích thước, được ghi vào cache ở bước 1 và truy cập ở tất cả 49 bước còn lại
6.1 Sol, không cache6 Sol + cache6.1 Sol + cacheAstra + cache
Ghi cache ban đầu 200K—$0.50$0.50$2.50
49 lần đọc cache—$1.96$0.98$9.80
Tiền tố tính phí như đầu vào thông thường$20.00———
100K đầu vào mới (tại tỷ lệ ghi)$0.20$0.25$0.25$1.25
150K đầu ra$1.50$1.50$1.50$7.50
Tổng cộng$21.70$4.21$3.23$21.05

Ba điểm rút ra:

  1. Cache là yếu tố quan trọng nhất. Cùng một mô hình, cùng một công việc, và việc chạy không cache tốn gần 7 lần.
  2. 6.1 Sol rẻ hơn khoảng 23% so với 6 Sol tại đây, trong khi cũng đạt điểm cao hơn.
  3. Đối với công việc nặng về cache, Astra tốn nhiều hơn mức chênh lệch giá niêm yết 5× cho thấy. Trong ví dụ này, nó là 6.5×, vì Astra giảm giá đầu vào đã cache 90% và 6.1 Sol giảm 95%.

Điều này phù hợp với chi phí theo tác vụ mà OpenAI đã báo cáo (được tổng hợp bởi Vellum và The Next Web): khoảng $1.50 so với $7.70 trên DeepSWE, $1.30 so với $9.30 trên OSWorld, và $5.47 so với $23.80 trên Terminal-Bench Science.

Một lưu ý: OpenAI cho biết Astra thường cần ít token đầu ra hơn để hoàn thành cùng một tác vụ. So sánh các mô hình dựa trên chi phí theo tác vụ, không phải chi phí theo token.

Ghi cache không miễn phí

Ghi cache trên 6.1 Sol tốn 1.25× mức giá đầu vào. Nếu một tiền tố chỉ được sử dụng một lần, việc cache làm cho nó tốn thêm 25%. Sử dụng công thức từ tài liệu của OpenAI:

  • Một lần ghi cộng với một lần đọc: 1.35× chi phí đầu vào thông thường (1.3× trên 6.1 Sol), so với 2× nếu không có cache
  • Một lần ghi cộng với chín lần đọc: khoảng 2.15× (khoảng 1.7× trên 6.1 Sol), so với 10×

Tiền tố có thể cache tối thiểu là 1,024 token. Toán học hòa vốn của OpenAI cho biết một tiền tố có 102 token hoặc ít hơn sẽ không bao giờ có lợi. Nếu bạn mong đợi 10 lần sử dụng trở lên, việc làm đầy bất kỳ thứ gì trên 221 token lên 1,024 sẽ rẻ hơn.

Đối với các cuộc gọi một lần như phân loại một lần hoặc trích xuất hàng loạt, hãy sử dụng chế độ rõ ràng (prompt_cache_options.mode: "explicit") mà không có điểm dừng. Bạn sẽ không bị tính phí cho bất kỳ lần ghi nào.


Vách đá 272K

6.1 Sol chấp nhận 1.05 triệu token ngữ cảnh, nhưng khi đầu vào vượt quá 272K, toàn bộ yêu cầu sẽ chuyển sang mức giá cao hơn, không chỉ các token vượt quá giới hạn.

Yêu cầuĐầu vàoĐầu raChi phí
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

Mười nghìn token đầu vào thêm gần như gấp đôi hóa đơn.

Cách để giữ dưới mức đó:

  • Đếm token phía khách hàng và nén hoặc cắt bớt trước khi bạn đạt 272K
  • Lấy các phần liên quan của tài liệu dài thay vì gửi toàn bộ
  • Khi bạn thực sự cần ngữ cảnh dài, hãy đặt phần cố định vào một tiền tố đã cache

Cách nỗ lực lý luận xuất hiện trên hóa đơn

Các token lý luận tính phí theo tỷ lệ đầu ra, $10 cho mỗi triệu. Chuyển cùng một tác vụ từ mức thấp lên mức tối đa có thể nhân số token lý luận lên mười lần hoặc hơn.

Chi phí theo tác vụ mà OpenAI báo cáo cung cấp một cảm nhận về quy mô (đây là các điểm chuẩn khác nhau, vì vậy chỉ so sánh các độ lớn):

  • AutomationBench (trung bình): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (cao): ~$1.50
  • Terminal-Bench Science (tối đa): ~$5.47

Phần 2 đề cập đến cách chọn mức độ. Một lời nhắc ở đây: thay đổi reasoning.effort giữa cuộc trò chuyện sẽ làm mất hiệu lực cache. Sử dụng configuration_update thay vào đó.


Cách nó so sánh ở mức giá này

Mô hìnhĐầu vào / đầu raĐầu vào đã cache
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol và Claude Sonnet 5.5 có cùng mức giá niêm yết, và tỷ lệ đã cache của 6.1 Sol là một nửa so với Sonnet. Tuy nhiên, chúng mạnh ở những điểm khác nhau. Trên AutomationBench, ví dụ, Sonnet 5.5 ghi điểm tốt hơn. Khi hai mô hình có cùng giá theo token, mô hình có chi phí thấp hơn theo tác vụ trên khối lượng công việc của bạn là mô hình rẻ hơn.

Danh sách mô hình AIHubMix cho thấy giá hiện tại, và một khóa API hoạt động cho tất cả chúng, vì vậy việc thử nghiệm song song là dễ dàng.

Giá của đối thủ đến từ các nguồn bên thứ ba và có thể thay đổi. Kiểm tra các trang giá chính thức trước khi dựa vào chúng.

Danh sách kiểm tra chi phí

  1. Đặt nội dung ổn định lên hàng đầu. Prompt hệ thống, định nghĩa công cụ và tài liệu tham khảo đi ở đầu. Dữ liệu theo thời gian và theo người dùng đi ở cuối.
  2. Thêm vào, không viết lại. Tóm tắt, cắt ngắn và nén đều khởi động lại cache.
  3. Giữ danh sách công cụ ổn định. Không thêm hoặc xóa công cụ theo yêu cầu. Sử dụng tool_choice hoặc allowed_tools thay vào đó.
  4. Chuyển đổi nỗ lực bằng configuration_update, không phải tham số yêu cầu.
  5. Giữ dưới 272K đầu vào.
  6. Gửi công việc không khẩn cấp qua Batch hoặc Flex với giá một nửa.
  7. Định tuyến theo tác vụ. Luna cho công việc đơn giản với khối lượng lớn, 6.1 Sol cho hầu hết các thứ, Astra cho các vấn đề khó nhất.
  8. Chú ý ba con số: cached_tokens, cache_write_tokens, và reasoning_tokens.

Điểm mấu chốt: mức giá niêm yết không thay đổi, nhưng các lần đọc cache đã giảm 50%. Đối với khối lượng công việc của tác nhân, điều này làm cho 6.1 Sol trở thành mô hình có giá trị tốt nhất trong gia đình GPT-6, miễn là bạn sử dụng cache tốt và giữ dưới 272K.

Tiếp theo: các vấn đề bạn có thể gặp phải khi chuyển đổi.


Câu hỏi thường gặp

GPT-6.1 Sol có giá bao nhiêu? $2 cho mỗi triệu token đầu vào, $10 cho mỗi triệu token đầu ra, $0.10 cho đầu vào đã cache, và $2.50 cho ghi cache. Các yêu cầu trên 272K token đầu vào tính phí $4 cho đầu vào và $15 cho đầu ra cho toàn bộ yêu cầu.

Có rẻ hơn khi qua AIHubMix hay OpenAI trực tiếp không? Cùng mức giá. Các tuyến đường OpenAI và Azure của AIHubMix đều phù hợp với mức giá chính thức của OpenAI.

Tại sao hóa đơn của tôi cao hơn tôi ước tính? Bốn lý do phổ biến: các token lý luận tính phí theo tỷ lệ đầu ra; bạn đã vượt quá 272K đầu vào; bạn đã bỏ lỡ cache hoặc phải trả phí ghi cho các tiền tố một lần; hoặc chế độ nhanh hoặc xử lý theo vùng đang được bật.

Các lần ghi cache có tốn thêm không? Các token được ghi tính phí ở mức 1.25× tỷ lệ đầu vào. Điều này thay thế phí đầu vào thông thường thay vì cộng thêm vào đó. Một tiền tố tự trả cho chính nó sau hai lần sử dụng. Đối với các tiền tố một lần, chế độ rõ ràng cho phép bạn bỏ qua hoàn toàn các lần ghi.

6.1 Sol rẻ hơn Astra bao nhiêu? Rẻ hơn năm lần theo mức giá niêm yết. Đối với công việc nặng về cache của tác nhân, khoảng cách có thể đạt 6 đến 7× vì 6.1 Sol giảm giá đầu vào đã cache mạnh hơn. Tuy nhiên, Astra thường sử dụng ít token đầu ra hơn cho mỗi tác vụ, vì vậy hãy so sánh chi phí theo tác vụ.

Có thể kết hợp Batch với cache không? Batch và Flex đều có giá một nửa. Để biết cách chúng kết hợp với cache, hãy kiểm tra trang giá của OpenAI.


Tiếp tục đọc: chuỗi GPT-6.1 Sol


Nguồn