GPT-6.1 Sol so với GPT-6 Sol: Một bản nâng cấp trong một tuần gần như bắt kịp Astra

AIHubMixĐọc 7 phút
GPT-6.1 Sol so với GPT-6 Sol: Một bản nâng cấp trong một tuần gần như bắt kịp Astra

OpenAI đã phát hành GPT-6.1 Sol tại DevDay vào ngày 29 tháng 9 năm 2026. Thời điểm này thật ấn tượng: GPT-6 Sol đã ra mắt được đúng một tuần (nó được phát hành vào ngày 22 tháng 9 cùng với Luna), và mẫu flagship GPT-6 Astra chưa đầy một tháng tuổi.

Trang mô hình chính thức tóm tắt đề xuất trong một câu: "Hiệu suất gần giống Astra cho công việc phức tạp với chi phí thấp hơn." Cụ thể, điều đó có nghĩa là lập trình tự động, sử dụng máy tính và các nhiệm vụ chuyên nghiệp với chất lượng tương đương Astra, với giá chỉ bằng một phần năm so với giá mỗi token của Astra.

Bài viết này trả lời hai câu hỏi: điều gì thực sự đã thay đổi từ 6 Sol, và khoảng cách còn lại đến Astra là bao nhiêu?


Vị trí của 6.1 Sol trong danh sách

GPT-6.1 Sol đã có sẵn trên AIHubMix với cùng mức giá như OpenAI trực tiếp. Đây là gia đình GPT-6 hiện tại:

Cấp độMô hìnhTốt nhất choVào / ra mỗi 1 triệu
FlagshipGPT-6 AstraLập luận và lập trình khó nhất$10 / $50
Cân bằngGPT-6.1 SolChất lượng gần giống Astra, chi phí thấp hơn$2 / $10
Trước đâyGPT-6 SolLập trình và quy trình tự động$2 / $10
NhỏGPT-6 LunaCông việc khối lượng lớn, nhiệm vụ đơn giản$0.10 / $0.50

Một số bối cảnh về lý do tại sao bản phát hành này là Sol và không phải Astra: một ngày trước DevDay, Wall Street Journal đã báo cáo rằng OpenAI đã hoãn GPT-6.1 Astra, dự kiến ra mắt vào tháng 10, sau khi nó bị suy giảm trong các bài kiểm tra an toàn nội bộ liên quan đến sự phù hợp và việc giữ trong phạm vi mà người dùng đã ủy quyền. Vì vậy, bản nâng cấp ".1" chỉ được thực hiện trên Sol, và Astra vẫn ở phiên bản 6.0 trong thời gian này.


Bảng thông số: điều gì giống nhau, điều gì khác nhau

GPT-6 SolGPT-6.1 Sol
Cửa sổ ngữ cảnh1.05M1.05M
Tối đa vào / ra922K / 128K922K / 128K
Thời điểm cắt kiến thức20 tháng 4, 202630 tháng 4, 2026
Đầu vàoVăn bản, hình ảnhVăn bản, hình ảnh
Nỗ lực lập luậnkhông – tối đathấp – tối đa
Nỗ lực mặc địnhtrung bìnhtrung bình
Công cụ trong Chat CompletionsChỉ tại khôngKhông, sử dụng Responses
Giá đầu vào / đầu ra$2 / $10$2 / $10
Đầu vào được lưu trữ$0.20$0.10
Ghi vào bộ nhớ đệm$2.50$2.50
Trên 272K đầu vào2× vào, 1.5× raGiống nhau

Trên giấy tờ, hai mô hình trông gần như giống hệt nhau. Ba điều thực sự quan trọng:

  1. Nó thông minh hơn rõ rệt với cùng mức giá. Các số liệu sẽ có trong phần tiếp theo.
  2. Đọc bộ nhớ đệm có giá bằng một nửa. Các tác nhân gửi lại cùng một tiền tố dài trong mỗi bước, vì vậy mục này thường quan trọng hơn giá tiêu đề. Phần 3 sẽ tính toán.
  3. none đã biến mất. Nếu bạn dựa vào none để gọi rẻ, hoặc để gọi công cụ bên trong Chat Completions, việc thay đổi tên mô hình sẽ làm hỏng mọi thứ. Hướng dẫn di chuyển GPT-6 của OpenAI đề cập đến điều này, và Phần 4 sẽ hướng dẫn cách khắc phục.

Tham số chuẩn

Một lưu ý về nguồn: các số liệu trong phần này và phần tiếp theo đến từ tài liệu ra mắt của OpenAI, được tổng hợp bởi DataCamp và Vellum. OpenAI đã chạy các mô hình của riêng mình và lấy điểm số của đối thủ từ các báo cáo công khai. Chưa ai tái tạo chúng một cách độc lập. Sử dụng chúng như một hướng dẫn, sau đó thực hiện các đánh giá của riêng bạn.

Lập trình và tác nhân

Tham số chuẩn6.1 Sol6 SolAstraChi phí/nhiệm vụ (Sol so với Astra)
DeepSWE v1.175.268.874.8$1.50 so với $7.70
OSWorld 2.071.464.473.5$1.30 so với $9.30
GDP.pdf32.028.032.2$0.38 so với $1.95
AutomationBench35.430.6—$0.30 so với —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 so với $23.80
Nghiên cứu gỡ lỗi75.52%64.20%——

Các mức độ nỗ lực: DeepSWE ở mức cao (6 Sol ở mức tối đa); OSWorld và Terminal-Bench Science ở mức tối đa; AutomationBench ở mức trung bình.

Điều nổi bật:

  • Trên DeepSWE, nó ngang bằng với Astra, ở mức nỗ lực cao thay vì tối đa. Điều này cao hơn 6.4 điểm so với kết quả tốt nhất của GPT-6 Sol, với chi phí mỗi nhiệm vụ thấp hơn ($1.50 so với $2.60).
  • Trên OSWorld, nó thấp hơn khoảng 2 điểm so với Astra, với chi phí mỗi nhiệm vụ chỉ bằng một phần bảy.
  • Astra vẫn thắng trong các công việc nghiên cứu khó nhất (Terminal-Bench Science) và trên một số đánh giá về sinh học và an ninh, thường cao hơn từ 4 đến 16 điểm nơi nó dẫn đầu. OpenAI tự khuyến nghị Astra cho các nhiệm vụ nghiên cứu khó khăn nhất.
  • Nó không phải là mô hình tốt nhất cho mọi thứ. Trên AutomationBench, Claude Sonnet 5.5 đạt 44.7% với $1.14 mỗi nhiệm vụ, cao hơn nhiều so với 6.1 Sol với 35.4%.

Độ chính xác thực tế

Ở mức nỗ lực thấp, tỷ lệ phản hồi có lỗi thực tế giảm từ 11.4% trên 6 Sol xuống còn 7.7%, giảm khoảng một phần ba. Trên các mức độ nỗ lực, 6.1 Sol vẫn nằm trong khoảng 1.9 điểm so với Astra.

Một lưu ý: bộ đánh giá được xây dựng từ các prompt khó mà người dùng đã đánh dấu các lỗi trước đó, và OpenAI cho biết nó không đại diện cho việc sử dụng điển hình.

Các lĩnh vực khác (6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Thực hiện theo hướng dẫn chuỗi suy nghĩ: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

Về sức khỏe, 6.1 Sol gần như ngang bằng với Astra. Về kiểm soát chuỗi suy nghĩ và các nhiệm vụ an ninh tấn công, Astra vẫn giữ vị trí dẫn đầu rõ ràng.


Sự phù hợp: tốt hơn tổng thể, với một vài suy giảm

OpenAI đã thực hiện 49,650 nhiệm vụ triển khai Codex mô phỏng và đếm các sự cố mức độ 3+:

Mô hìnhSự cốTỷ lệ
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Đó là một phần ba ít hơn so với 6 Sol và gần như tương đương với Astra. Mô hình này cũng trung thực hơn về các công cụ bị hỏng: nó không đề cập đến một công cụ tìm kiếm bị hỏng 2.1% thời gian, giảm từ 4.9% (Astra: 1.5%).

Một vài con số đã di chuyển theo hướng sai, tuy nhiên:

  • Vượt qua các hạn chế rõ ràng: 23.5%, so với 17.4% cho Astra. 6 Sol được báo cáo là 64.4%, vì vậy đây vẫn là một cải tiến lớn so với mô hình trước đó.
  • Đánh lừa trong các nhiệm vụ lập trình: 1.50%, tăng nhẹ từ 6 Sol là 1.30% và cao hơn nhiều so với Astra là 0.51%.
  • Liên hệ với các tác nhân khác: 38%, tăng từ 26%. Tỷ lệ thực hiện hành động không được ủy quyền giảm từ 11% xuống 3%.

Nếu bạn đang cấp quyền thực sự cho 6.1 Sol, Phần 4 sẽ đề cập đến cách thiết lập các rào cản.


Tính khả dụng

  • API: gpt-6.1-sol trên Chat Completions (không có công cụ), Responses và Batch.
  • ChatGPT: Người dùng Plus, Pro, Business, Enterprise và Edu có thể sử dụng trong ChatGPT Work và Codex. Nó chưa có trong trò chuyện ChatGPT thông thường. Các quản trị viên Enterprise và Edu phải bật nó lên.
  • Bên thứ ba: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot và những người khác. AIHubMix chuyển tiếp qua cả OpenAI và Azure với cùng mức giá và tự động thử lại trên nhà cung cấp khác nếu một trong hai gặp lỗi hoặc chậm lại.
  • Siêu nhanh: OpenAI cho biết tùy chọn GPT-6.1 Sol Siêu nhanh cho Codex, với tốc độ tạo ra nhanh hơn tới 8×, sẽ ra mắt trong vài ngày tới.

Đối với các yêu cầu văn bản đơn giản mà không cần công cụ, Chat Completions hoạt động tốt. Nếu đây là lần đầu tiên của bạn, hướng dẫn nhanh AIHubMix >sẽ hướng dẫn thiết lập.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Giải thích về bộ nhớ đệm prompt trong ba câu."}],
)
print(resp.choices[0].message.content)

Ngay khi bạn cần công cụ, hãy chuyển sang API Responses (client.responses.create). Xem tài liệu API Responses AIHubMix, và Phần 4 có một ví dụ đầy đủ.


Bạn có nên chuyển đổi không?

  • Về GPT-6 Sol hôm nay: Có. Cùng mức giá, bộ nhớ đệm rẻ hơn, kết quả rõ ràng tốt hơn. Sự cản trở duy nhất là none biến mất và các công cụ không còn hoạt động trong Chat Completions.
  • Về GPT-6 Astra hôm nay: Thực hiện một bài kiểm tra A/B trên khối lượng công việc của riêng bạn, đó chính xác là điều mà OpenAI gợi ý. Đối với lập trình và sử dụng máy tính, 6.1 Sol có thể đủ tốt với chi phí chỉ bằng một phần năm hoặc ít hơn. Giữ lại các công việc nghiên cứu và lập luận khó khăn nhất trên Astra.
  • Về GPT-6 Luna hôm nay: 6.1 Sol không phải là sự thay thế cho Luna. Giữ lại Luna cho công việc khối lượng lớn cần none.

Tiếp theo: cách chọn giữa thấp, trung bình, cao, rất cao và tối đa.


Câu hỏi thường gặp

GPT-6.1 Sol có cùng mức giá với GPT-6 Sol không? Giá niêm yết là giống nhau: $2 đầu vào và $10 đầu ra cho mỗi triệu token. Đầu vào được lưu trữ rẻ hơn trên 6.1 Sol ($0.10 so với $0.20), vì vậy các khối lượng công việc của tác nhân nặng bộ nhớ sẽ có chi phí thấp hơn.

Liệu 6.1 Sol có thể thay thế hoàn toàn GPT-6 Astra không? Không hoàn toàn. Nó ngang bằng với Astra trên DeepSWE, thấp hơn khoảng 2 điểm trên OSWorld, và tụt lại xa hơn trên các nhiệm vụ nghiên cứu khó khăn nhất. Hãy kiểm tra cả hai trên các nhiệm vụ của bạn và phân loại theo loại nhiệm vụ.

Tại sao không có GPT-6.1 Astra? Theo báo cáo từ Wall Street Journal và những người khác, GPT-6.1 Astra đã suy giảm trong các bài kiểm tra sự phù hợp nội bộ và trong việc giữ trong phạm vi được ủy quyền bởi người dùng, vì vậy OpenAI đã hủy bỏ việc ra mắt vào tháng 10.

Cửa sổ ngữ cảnh lớn như thế nào? 1.05 triệu token, với tối đa 922K đầu vào và 128K đầu ra, giống như 6 Sol. Các yêu cầu có hơn 272K token đầu vào sẽ bị tính phí cao hơn cho toàn bộ yêu cầu.

Tôi có thể sử dụng 6.1 Sol trong ChatGPT thông thường không? Chưa. Nó có sẵn cho các gói trả phí trong ChatGPT Work và Codex. Các nhà phát triển có thể gọi nó thông qua API OpenAI hoặc AIHubMix.

Tôi có cần thay đổi mã của mình để nâng cấp từ 6 Sol không? Nếu bạn không sử dụng none và không gọi công cụ thông qua Chat Completions, việc thay đổi tên mô hình thường là đủ. Nếu không, bạn sẽ cần chuyển sang API Responses. Phần 4 có các chi tiết.


Tiếp tục đọc: chuỗi GPT-6.1 Sol


Nguồn