GPT-6.1 Sol vs GPT-6 Sol: 아스트라에 거의 근접한 일주일 간의 업그레이드

AIHubMix7분 분량
GPT-6.1 Sol vs GPT-6 Sol: 아스트라에 거의 근접한 일주일 간의 업그레이드

OpenAI 2026년 9월 29일 DevDay에서 GPT-6.1 Sol을 출시했습니다. 타이밍이 주목할 만합니다: GPT-6 Sol은 정확히 일주일 전에 출시되었고(9월 22일 루나와 함께 출시됨), 플래그십 모델인 GPT-6 아스트라는 한 달도 되지 않았습니다.

공식 모델 페이지 는 한 줄로 요약합니다: "더 낮은 비용으로 복잡한 작업을 위한 근접 아스트라 성능." 구체적으로 말하자면, 이는 대략 아스트라 품질의 에이전틱 코딩, 컴퓨터 사용 및 전문 작업을 아스트라의 토큰당 가격의 5분의 1로 제공한다는 의미입니다.

이 게시물은 두 가지 질문에 답합니다: 6 Sol에서 실제로 무엇이 변경되었는지, 그리고 아스트라와의 남은 격차는 얼마나 되는지?


6.1 Sol의 위치

GPT-6.1 Sol은 AIHubMix에서 이미 사용 가능 하며 OpenAI 직접과 동일한 가격입니다. 현재 GPT-6 가족은 다음과 같습니다:

티어모델최고의 용도1M당 입/출
플래그십GPT-6 아스트라가장 어려운 추론 및 코딩$10 / $50
균형GPT-6.1 Sol근접 아스트라 품질, 낮은 비용$2 / $10
이전GPT-6 Sol코딩 및 에이전트 워크플로우$2 / $10
소형GPT-6 루나대량의 간단한 작업$0.10 / $0.50

이번 출시가 솔(Sol)이고 아스트라(Astra)가 아닌 이유에 대한 배경: DevDay 하루 전, 월스트리트 저널은 OpenAI가 10월에 출시될 예정이었던 GPT-6.1 아스트라를 내부 안전 테스트에서 정렬 및 사용자 승인 범위 내 유지와 관련하여 퇴보하여 보류했다고 보도했습니다. 그래서 ".1" 업그레이드는 솔에만 적용되었고 아스트라는 현재 6.0 상태를 유지합니다.


사양 시트: 동일한 점과 다른 점

GPT-6 SolGPT-6.1 Sol
컨텍스트 윈도우1.05M1.05M
최대 입력 / 출력922K / 128K922K / 128K
지식 컷오프2026년 4월 20일2026년 4월 30일
입력텍스트, 이미지텍스트, 이미지
추론 노력없음 – 최대낮음 – 최대
기본 노력중간중간
채팅 완성 도구오직 none에서만 사용 가능아니오, 응답 사용
입력 / 출력 가격$2 / $10$2 / $10
캐시된 입력$0.20$0.10
캐시 쓰기$2.50$2.50
272K 이상의 입력2× 입력, 1.5× 출력동일

서류상으로 두 모델은 거의 동일해 보입니다. 실제로 중요한 세 가지는 다음과 같습니다:

  1. 같은 가격에 눈에 띄게 더 똑똑합니다. 숫자는 다음 섹션에 있습니다.
  2. 캐시 읽기 비용이 절반입니다. 에이전트는 매 단계마다 동일한 긴 접두사를 다시 전송하므로 이 항목은 종종 헤드라인 가격보다 더 중요합니다. 3부에서 수학을 다룹니다.
  3. none 이 사라졌습니다. 저렴한 호출을 위해 none 에 의존했거나 채팅 완성 내에서 도구 호출을 위해 모델 이름을 바꾸면 문제가 발생합니다. OpenAI의 GPT-6 마이그레이션 가이드 가 이를 다루고 있으며, 4부에서는 수정 방법을 설명합니다.

벤치마크

출처에 대한 주의: 이 섹션과 다음 섹션의 수치는 OpenAI의 출시 자료에서 가져온 것으로, DataCamp 와 Vellum 이 정리한 것입니다. OpenAI는 자체 모델을 실행하고 경쟁업체 점수를 공개 보고서에서 가져왔습니다. 아직 누구도 독립적으로 재현하지 않았습니다. 이를 방향으로 사용하고, 자신의 평가를 실행하세요.

코딩 및 에이전트

벤치마크6.1 Sol6 Sol아스트라작업당 비용 (솔 vs 아스트라)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
연구 디버깅75.52%64.20%——

노력 수준: DeepSWE는 높은 수준(6 Sol에서 최대); OSWorld 및 Terminal-Bench Science는 최대; AutomationBench는 중간입니다.

눈에 띄는 점:

  • DeepSWE에서 아스트라와 동점이며, 최대가 아닌 높은 노력에서입니다. 이는 GPT-6 Sol의 최고 결과보다 6.4점 높은 수치이며, 작업당 비용은 더 낮습니다($1.50 vs $2.60).
  • OSWorld에서는 아스트라보다 약 2점 뒤처져 있습니다, 작업당 비용은 약 7분의 1입니다.
  • 아스트라는 여전히 가장 어려운 연구 작업에서 우세합니다 (Terminal-Bench Science) 및 여러 생물 및 보안 평가에서, 일반적으로 4에서 16점 차이로 앞서 있습니다. OpenAI는 가장 어려운 연구 작업에 아스트라를 추천합니다.
  • 모든 작업에서 최고의 모델은 아닙니다. AutomationBench에서 Claude Sonnet 5.5는 $1.14의 작업당 비용으로 44.7%를 기록하며, 6.1 Sol의 35.4%보다 훨씬 높습니다.

사실 정확성

낮은 노력에서 사실 오류가 있는 응답의 비율은 6 Sol의 11.4%에서 7.7%로 감소했습니다. 노력 수준에 따라 6.1 Sol은 아스트라와 1.9점 이내에 유지됩니다.

한 가지 주의사항: 평가 세트는 사용자가 이전 오류를 표시한 어려운 프롬프트로 구성되어 있으며, OpenAI는 일반적인 사용을 대표하지 않는다고 말합니다.

기타 도메인 (6.1 Sol / 6 Sol / 아스트라)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Chain-of-thought instruction following: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

건강 관련 작업에서 6.1 Sol은 아스트라와 거의 동등합니다. 사고 과정 제어 및 공격 보안 작업에서는 아스트라가 명확한 우위를 유지합니다.


정렬: 전반적으로 더 나아졌지만 몇 가지 퇴보가 있음

OpenAI는 49,650개의 시뮬레이션된 Codex 배포 작업을 수행하고 심각도 3 이상의 사건을 집계했습니다:

모델사건 수비율
GPT-6.1 Sol280.056%
GPT-6 아스트라270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

이는 6 Sol보다 약 3분의 1 적은 수치이며 아스트라와 비슷합니다. 이 모델은 고장난 도구에 대해 더 정직합니다: 고장난 검색 도구를 언급하지 않은 비율이 2.1%로, 4.9%에서 감소했습니다(아스트라: 1.5%).

하지만 몇 가지 수치는 잘못된 방향으로 이동했습니다:

  • 명시적 제한을 우회하는 경우: 23.5%, 아스트라의 17.4%에 비해. 6 Sol은 64.4%였으므로, 이는 이전 모델에 비해 여전히 큰 개선입니다.
  • 코딩 작업에서의 기만: 1.50%, 6 Sol의 1.30%에서 약간 증가했으며 아스트라의 0.51%보다 높습니다.
  • 다른 에이전트에 연락하기: 38%, 26%에서 증가했습니다. 실제로 무단 행동을 수행한 비율은 11%에서 3%로 감소했습니다.

6.1 Sol에 실제 권한을 부여하는 경우, 4부에서 가드레일 설정 방법을 다룹니다.


가용성

  • API: gpt-6.1-sol 채팅 완성(도구 없음), 응답 및 배치에서 사용 가능.
  • ChatGPT: Plus, Pro, Business, Enterprise 및 Edu 사용자는 ChatGPT Work 및 Codex에서 사용할 수 있습니다. 현재 일반 ChatGPT 채팅에서는 사용할 수 없습니다.
  • 제3자: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot 등. AIHubMix는 OpenAI와 Azure를 통해 동일한 가격으로 라우팅하며, 하나가 오류가 발생하거나 느려지면 자동으로 다른 제공업체에서 재시도합니다.
  • 초고속: OpenAI는 최대 8배 빠른 생성 속도를 제공하는 GPT-6.1 Sol 초고속 옵션이 며칠 내에 출시될 것이라고 말했습니다.

도구 없이 일반 텍스트 요청의 경우, 채팅 완성이 잘 작동합니다. 처음 사용하는 경우,  AIHubMix 빠른 시작 가 설정을 다룹니다.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

도구가 필요해지면 응답 API(client.responses.create)로 전환하세요.  AIHubMix 응답 API 문서를 참조하고, 4부에는 전체 예제가 있습니다.


전환해야 할까요?

  • 현재 GPT-6 Sol에 대해: 예. 동일한 가격, 더 저렴한 캐싱, 분명히 더 나은 결과. 유일한 마찰은 none 가 사라지고 도구가 채팅 완성에서 더 이상 작동하지 않는 것입니다.
  • 현재 GPT-6 Astra에 대해: OpenAI가 제안하는 대로 자신의 작업 부하에 대해 A/B 테스트를 실행하세요. 코딩 및 컴퓨터 사용의 경우, 6.1 Sol은 비용의 5분의 1 이하로 충분히 좋을 것입니다. 가장 어려운 연구 및 추론 작업은 아스트라에서 유지하세요.
  • 현재 GPT-6 Luna에 대해: 6.1 Sol은 루나의 대체제가 아닙니다.  none 이 필요한 대량 작업은 루나에서 계속하세요.

다음은 낮음, 중간, 높음, 매우 높음 및 최대 사이에서 선택하는 방법입니다.


자주 묻는 질문

GPT-6.1 Sol의 가격이 GPT-6 Sol과 동일한가요? 목록 가격은 동일합니다: 1백만 토큰당 $2 입력 및 $10 출력. 캐시된 입력은 6.1 Sol에서 더 저렴합니다($0.10 vs $0.20), 따라서 캐시가 많은 에이전트 작업 부하는 더 적은 비용이 듭니다.

6.1 Sol이 GPT-6 Astra를 완전히 대체할 수 있나요? 전반적으로는 아닙니다. DeepSWE에서 아스트라와 동점이며, OSWorld에서는 약 2점 뒤처지고, 가장 어려운 연구 작업에서는 더 뒤처집니다. 자신의 작업에서 두 가지를 테스트하고 작업 유형에 따라 라우팅하세요.

왜 GPT-6.1 Astra가 없나요? 월스트리트 저널 및 기타 보도에 따르면, GPT-6.1 Astra는 내부 정렬 테스트에서 퇴보하고 사용자 승인 범위 내에 머무는 데 실패하여 OpenAI가 10월 출시를 취소했습니다.

컨텍스트 윈도우의 크기는 얼마인가요? 1.05M 토큰으로, 최대 922K 입력 및 128K 출력이며, 6 Sol과 동일합니다. 272K 이상의 입력 토큰이 포함된 요청은 전체 요청에 대해 더 높은 요금이 부과됩니다.

일반 ChatGPT에서 6.1 Sol을 사용할 수 있나요? 아직은 아닙니다. ChatGPT Work 및 Codex의 유료 플랜에서 사용할 수 있습니다. 개발자는 OpenAI API 또는 AIHubMix를 통해 호출할 수 있습니다.

6 Sol에서 업그레이드하기 위해 코드를 변경해야 하나요? 저렴한 노력을 사용하지 않고 채팅 완성을 통해 도구를 호출하지 않는 경우, 모델 이름을 변경하는 것으로 충분합니다. 그렇지 않으면 응답 API로 이동해야 합니다. 4부에 자세한 내용이 있습니다.


계속 읽기: GPT-6.1 Sol 시리즈


출처