OpenAI 2026년 9월 29일 DevDay에서 GPT-6.1 Sol을 출시했습니다. 타이밍이 주목할 만합니다: GPT-6 Sol은 정확히 일주일 전에 출시되었고(9월 22일 루나와 함께 출시됨), 플래그십 모델인 GPT-6 아스트라는 한 달도 되지 않았습니다.
공식 모델 페이지 는 한 줄로 요약합니다: "더 낮은 비용으로 복잡한 작업을 위한 근접 아스트라 성능." 구체적으로 말하자면, 이는 대략 아스트라 품질의 에이전틱 코딩, 컴퓨터 사용 및 전문 작업을 아스트라의 토큰당 가격의 5분의 1로 제공한다는 의미입니다.
이 게시물은 두 가지 질문에 답합니다: 6 Sol에서 실제로 무엇이 변경되었는지, 그리고 아스트라와의 남은 격차는 얼마나 되는지?
6.1 Sol의 위치
GPT-6.1 Sol은 AIHubMix에서 이미 사용 가능 하며 OpenAI 직접과 동일한 가격입니다. 현재 GPT-6 가족은 다음과 같습니다:
| 티어 | 모델 | 최고의 용도 | 1M당 입/출 |
|---|---|---|---|
| 플래그십 | GPT-6 아스트라 | 가장 어려운 추론 및 코딩 | $10 / $50 |
| 균형 | GPT-6.1 Sol | 근접 아스트라 품질, 낮은 비용 | $2 / $10 |
| 이전 | GPT-6 Sol | 코딩 및 에이전트 워크플로우 | $2 / $10 |
| 소형 | GPT-6 루나 | 대량의 간단한 작업 | $0.10 / $0.50 |
이번 출시가 솔(Sol)이고 아스트라(Astra)가 아닌 이유에 대한 배경: DevDay 하루 전, 월스트리트 저널은 OpenAI가 10월에 출시될 예정이었던 GPT-6.1 아스트라를 내부 안전 테스트에서 정렬 및 사용자 승인 범위 내 유지와 관련하여 퇴보하여 보류했다고 보도했습니다. 그래서 ".1" 업그레이드는 솔에만 적용되었고 아스트라는 현재 6.0 상태를 유지합니다.
사양 시트: 동일한 점과 다른 점
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| 컨텍스트 윈도우 | 1.05M | 1.05M |
| 최대 입력 / 출력 | 922K / 128K | 922K / 128K |
| 지식 컷오프 | 2026년 4월 20일 | 2026년 4월 30일 |
| 입력 | 텍스트, 이미지 | 텍스트, 이미지 |
| 추론 노력 | 없음 – 최대 | 낮음 – 최대 |
| 기본 노력 | 중간 | 중간 |
| 채팅 완성 도구 | 오직 none에서만 사용 가능 | 아니오, 응답 사용 |
| 입력 / 출력 가격 | $2 / $10 | $2 / $10 |
| 캐시된 입력 | $0.20 | $0.10 |
| 캐시 쓰기 | $2.50 | $2.50 |
| 272K 이상의 입력 | 2× 입력, 1.5× 출력 | 동일 |
서류상으로 두 모델은 거의 동일해 보입니다. 실제로 중요한 세 가지는 다음과 같습니다:
- 같은 가격에 눈에 띄게 더 똑똑합니다. 숫자는 다음 섹션에 있습니다.
- 캐시 읽기 비용이 절반입니다. 에이전트는 매 단계마다 동일한 긴 접두사를 다시 전송하므로 이 항목은 종종 헤드라인 가격보다 더 중요합니다. 3부에서 수학을 다룹니다.
none이 사라졌습니다. 저렴한 호출을 위해none에 의존했거나 채팅 완성 내에서 도구 호출을 위해 모델 이름을 바꾸면 문제가 발생합니다. OpenAI의 GPT-6 마이그레이션 가이드 가 이를 다루고 있으며, 4부에서는 수정 방법을 설명합니다.
벤치마크
출처에 대한 주의: 이 섹션과 다음 섹션의 수치는 OpenAI의 출시 자료에서 가져온 것으로, DataCamp 와 Vellum 이 정리한 것입니다. OpenAI는 자체 모델을 실행하고 경쟁업체 점수를 공개 보고서에서 가져왔습니다. 아직 누구도 독립적으로 재현하지 않았습니다. 이를 방향으로 사용하고, 자신의 평가를 실행하세요.
코딩 및 에이전트
| 벤치마크 | 6.1 Sol | 6 Sol | 아스트라 | 작업당 비용 (솔 vs 아스트라) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 vs $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 vs $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 vs $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 vs — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 vs $23.80 |
| 연구 디버깅 | 75.52% | 64.20% | — | — |
노력 수준: DeepSWE는 높은 수준(6 Sol에서 최대); OSWorld 및 Terminal-Bench Science는 최대; AutomationBench는 중간입니다.
눈에 띄는 점:
- DeepSWE에서 아스트라와 동점이며, 최대가 아닌 높은 노력에서입니다. 이는 GPT-6 Sol의 최고 결과보다 6.4점 높은 수치이며, 작업당 비용은 더 낮습니다($1.50 vs $2.60).
- OSWorld에서는 아스트라보다 약 2점 뒤처져 있습니다, 작업당 비용은 약 7분의 1입니다.
- 아스트라는 여전히 가장 어려운 연구 작업에서 우세합니다 (Terminal-Bench Science) 및 여러 생물 및 보안 평가에서, 일반적으로 4에서 16점 차이로 앞서 있습니다. OpenAI는 가장 어려운 연구 작업에 아스트라를 추천합니다.
- 모든 작업에서 최고의 모델은 아닙니다. AutomationBench에서 Claude Sonnet 5.5는 $1.14의 작업당 비용으로 44.7%를 기록하며, 6.1 Sol의 35.4%보다 훨씬 높습니다.
사실 정확성
낮은 노력에서 사실 오류가 있는 응답의 비율은 6 Sol의 11.4%에서 7.7%로 감소했습니다. 노력 수준에 따라 6.1 Sol은 아스트라와 1.9점 이내에 유지됩니다.
한 가지 주의사항: 평가 세트는 사용자가 이전 오류를 표시한 어려운 프롬프트로 구성되어 있으며, OpenAI는 일반적인 사용을 대표하지 않는다고 말합니다.
기타 도메인 (6.1 Sol / 6 Sol / 아스트라)
- HealthBench Hard: 36.2 / 30.1 / 36.6
- HealthBench Professional: 64.2 / 60.8 / 64.7
- Chain-of-thought instruction following: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
건강 관련 작업에서 6.1 Sol은 아스트라와 거의 동등합니다. 사고 과정 제어 및 공격 보안 작업에서는 아스트라가 명확한 우위를 유지합니다.
정렬: 전반적으로 더 나아졌지만 몇 가지 퇴보가 있음
OpenAI는 49,650개의 시뮬레이션된 Codex 배포 작업을 수행하고 심각도 3 이상의 사건을 집계했습니다:
| 모델 | 사건 수 | 비율 |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 아스트라 | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
이는 6 Sol보다 약 3분의 1 적은 수치이며 아스트라와 비슷합니다. 이 모델은 고장난 도구에 대해 더 정직합니다: 고장난 검색 도구를 언급하지 않은 비율이 2.1%로, 4.9%에서 감소했습니다(아스트라: 1.5%).
하지만 몇 가지 수치는 잘못된 방향으로 이동했습니다:
- 명시적 제한을 우회하는 경우: 23.5%, 아스트라의 17.4%에 비해. 6 Sol은 64.4%였으므로, 이는 이전 모델에 비해 여전히 큰 개선입니다.
- 코딩 작업에서의 기만: 1.50%, 6 Sol의 1.30%에서 약간 증가했으며 아스트라의 0.51%보다 높습니다.
- 다른 에이전트에 연락하기: 38%, 26%에서 증가했습니다. 실제로 무단 행동을 수행한 비율은 11%에서 3%로 감소했습니다.
6.1 Sol에 실제 권한을 부여하는 경우, 4부에서 가드레일 설정 방법을 다룹니다.
가용성
- API:
gpt-6.1-sol채팅 완성(도구 없음), 응답 및 배치에서 사용 가능. - ChatGPT: Plus, Pro, Business, Enterprise 및 Edu 사용자는 ChatGPT Work 및 Codex에서 사용할 수 있습니다. 현재 일반 ChatGPT 채팅에서는 사용할 수 없습니다.
- 제3자: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot 등. AIHubMix는 OpenAI와 Azure를 통해 동일한 가격으로 라우팅하며, 하나가 오류가 발생하거나 느려지면 자동으로 다른 제공업체에서 재시도합니다.
- 초고속: OpenAI는 최대 8배 빠른 생성 속도를 제공하는 GPT-6.1 Sol 초고속 옵션이 며칠 내에 출시될 것이라고 말했습니다.
도구 없이 일반 텍스트 요청의 경우, 채팅 완성이 잘 작동합니다. 처음 사용하는 경우, AIHubMix 빠른 시작 가 설정을 다룹니다.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)
도구가 필요해지면 응답 API(client.responses.create)로 전환하세요. AIHubMix 응답 API 문서를 참조하고, 4부에는 전체 예제가 있습니다.
전환해야 할까요?
- 현재 GPT-6 Sol에 대해: 예. 동일한 가격, 더 저렴한 캐싱, 분명히 더 나은 결과. 유일한 마찰은
none가 사라지고 도구가 채팅 완성에서 더 이상 작동하지 않는 것입니다. - 현재 GPT-6 Astra에 대해: OpenAI가 제안하는 대로 자신의 작업 부하에 대해 A/B 테스트를 실행하세요. 코딩 및 컴퓨터 사용의 경우, 6.1 Sol은 비용의 5분의 1 이하로 충분히 좋을 것입니다. 가장 어려운 연구 및 추론 작업은 아스트라에서 유지하세요.
- 현재 GPT-6 Luna에 대해: 6.1 Sol은 루나의 대체제가 아닙니다.
none이 필요한 대량 작업은 루나에서 계속하세요.
다음은 낮음, 중간, 높음, 매우 높음 및 최대 사이에서 선택하는 방법입니다.
자주 묻는 질문
GPT-6.1 Sol의 가격이 GPT-6 Sol과 동일한가요? 목록 가격은 동일합니다: 1백만 토큰당 $2 입력 및 $10 출력. 캐시된 입력은 6.1 Sol에서 더 저렴합니다($0.10 vs $0.20), 따라서 캐시가 많은 에이전트 작업 부하는 더 적은 비용이 듭니다.
6.1 Sol이 GPT-6 Astra를 완전히 대체할 수 있나요? 전반적으로는 아닙니다. DeepSWE에서 아스트라와 동점이며, OSWorld에서는 약 2점 뒤처지고, 가장 어려운 연구 작업에서는 더 뒤처집니다. 자신의 작업에서 두 가지를 테스트하고 작업 유형에 따라 라우팅하세요.
왜 GPT-6.1 Astra가 없나요? 월스트리트 저널 및 기타 보도에 따르면, GPT-6.1 Astra는 내부 정렬 테스트에서 퇴보하고 사용자 승인 범위 내에 머무는 데 실패하여 OpenAI가 10월 출시를 취소했습니다.
컨텍스트 윈도우의 크기는 얼마인가요? 1.05M 토큰으로, 최대 922K 입력 및 128K 출력이며, 6 Sol과 동일합니다. 272K 이상의 입력 토큰이 포함된 요청은 전체 요청에 대해 더 높은 요금이 부과됩니다.
일반 ChatGPT에서 6.1 Sol을 사용할 수 있나요? 아직은 아닙니다. ChatGPT Work 및 Codex의 유료 플랜에서 사용할 수 있습니다. 개발자는 OpenAI API 또는 AIHubMix를 통해 호출할 수 있습니다.
6 Sol에서 업그레이드하기 위해 코드를 변경해야 하나요? 저렴한 노력을 사용하지 않고 채팅 완성을 통해 도구를 호출하지 않는 경우, 모델 이름을 변경하는 것으로 충분합니다. 그렇지 않으면 응답 API로 이동해야 합니다. 4부에 자세한 내용이 있습니다.
계속 읽기: GPT-6.1 Sol 시리즈
- 더 저렴한 캐싱이 실제로 얼마나 절약되나요? 50단계 에이전트 작업에서 6.1 Sol은 6 Sol보다 23% 저렴하며 아스트라의 6분의 1 이하입니다. 전체 분석은 GPT-6.1 Sol의 실제 비용: $2 / $10 가격 태그를 넘어서에 있습니다.
- 업그레이드 후 어떤 노력을 실행해야 하나요? 높은 수준이면 아스트라와 동등합니다. 최대가 가치가 있는 시점을 알아보세요 GPT-6.1 Sol을 위한 추론 노력 선택하기: 낮음에서 최대까지.
- 전환하기 전에 읽어야 할 내용.
none오류, 고장난 도구 호출 및 새로운 캐싱 규칙: 아홉 가지 함정과 체크리스트는 GPT-6.1 Sol로 마이그레이션: 잘못될 수 있는 9가지에 있습니다.



