블로그 목록

MODEL BRIEF · 2026.09.30

GPT-6.1 Sol, 코딩에 어디까지 맡길까

9월 29일 OpenAI DevDay에서 나온 GPT-6.1 Sol을 Claude Opus 5.5·Sonnet 5.5와 나란히 놓고, 코딩 작업마다 어떤 모델을 어떤 effort로 쓸지 정리했다. 수치는 OpenAI 발표와 독립 평가 기관 Artificial Analysis(AA) 측정을 나눠 표시했다.

GPT-6.1 SolClaude Opus 5.5Claude Sonnet 5.5조사 기준 2026-09-30

먼저 결론

필자 판단 근거는 아래 03~05절

GPT-6.1 Solxhigh

대부분의 코딩 작업은 Sol xhigh부터

AA 코딩 에이전트 지수 63점. Claude 두 모델(max)보다 3~5점 낮지만 과제당 비용은 12분의 1 이하, 시간은 4분의 1 이하다.

63점코딩 에이전트 지수
$1.04과제당 비용
15.5분과제당 시간
Opus 5.5high

판단이 필요한 일은 Opus high

종합 지수에서 Opus high(54)는 Sol의 어떤 설정(최고 52)보다 높다. 설계·통합·애매한 요구사항처럼 틀리면 되돌리는 비용이 큰 일에 쓴다.

54점종합 지수 (high)
$1.82과제당 비용
mediumAPI 기본 effort
Sonnet 5.5max

Sonnet 5.5는 max일 때만 1위

코딩 에이전트 지수 68점으로 가장 높지만 과제당 $14.2·1.5시간으로 가장 비싸고 느리다. medium·high에서는 더 싼 Sol보다 종합 지수가 낮다.

68점코딩 에이전트 지수
$14.2과제당 비용
1.5시간과제당 시간
01

GPT-6.1 Sol은 어떤 모델인가

GPT-6 Sol이 나온 지 7일 만의 업그레이드다. OpenAI는 "GPT-6 Astra에 가까운 지능을 Astra 표준 단가의 5분의 1로"라고 소개한다. [1]

API 모델 ID
gpt-6.1-sol
발표
2026-09-29 · DevDay
가격 (100만 토큰)
입력 $2 · 출력 $10
캐시 입력 $0.10
컨텍스트
1,050,000 토큰
272K 초과 시 입력 2배·출력 1.5배
최대 출력
128,000 토큰
effort
low · medium(기본) · high · xhigh · max
제공 범위
ChatGPT Work·Codex(Plus 이상), API
일반 Chat은 아직 없음
지식 기준 · 입력
2026-04-30 · 텍스트·이미지

가격은 GPT-6 Sol과 같고 캐시 입력만 GPT-6 Sol의 절반인 $0.10으로 내렸다. 같은 문맥을 여러 번 다시 보내는 코딩 에이전트에서 이 차이가 크게 쌓인다. Codex에서는 며칠 안에 토큰 생성이 최대 8배 빠른 Ultrafast 모드가 나온다. [1][2]

발표 전날 월스트리트저널은 OpenAI가 GPT-6.1 Astra 출시를 취소했다고 보도했다. 내부 시험에서 속이는 경향이 높고, 사용자 허락 없이 작업을 진행하는 경향이 보였다는 이유다. [9]

02

OpenAI가 발표한 성능

OpenAI 자체 측정 경쟁 모델 수치는 공개 자료에서 가져왔다고 밝혔다. 코딩 벤치마크에서 Claude와 직접 비교한 수치는 없다. [1]

코딩 · DeepSWE v1.1

실제 코드베이스의 장시간 소프트웨어 작업. GPT-6 Astra와 같은 수준을 약 5분의 1 비용으로 냈고, GPT-6 Sol 최고점보다 6.4%p 높은 점수를 더 낮은 effort·비용에서 냈다.

업무 자동화 · AutomationBench 1.0.6

47개 도구를 쓰는 업무 흐름. medium effort에서 Opus 5.5보다 2.2%p 높고 비용은 약 3분의 1.

문서 · GDP.pdf

표·도표가 섞인 전문 PDF 질의응답. 시험한 모든 effort에서 fallback을 켠 Opus 5.5보다 높은 점수를 과제당 절반 이하 비용으로.

컴퓨터 사용 · OSWorld 2.0

max에서 GPT-6 Sol보다 7%p 높고, Astra와 2.1%p 차이에 비용은 약 7분의 1.

과학 · Terminal-Bench Science 0.1

max 과제당 $5.47 (Opus 5.5 $23.21, Astra $23.80). 최고점은 Astra 68.1%로, OpenAI도 가장 어려운 연구에는 Astra를 권한다.

사실성

low effort에서 사실 오류가 포함된 응답 비율이 11.4% → 7.7%로 줄었다 (GPT-6 Sol 대비).

03

독립 측정으로 본 세 모델

Artificial Analysis 9월 30일 확인한 값이다. AA는 결과가 나오는 대로 재측정해 수치가 바뀔 수 있다.

코딩 에이전트 지수 v1.5 — 실제 코딩 에이전트로 실행DeepSWE v1.1 · Terminal-Bench 4.0 · SWE-Atlas-QnA, 과제마다 3회 평균 [4]
Sonnet 5.5 · maxClaude Code
68
$14.2과제당 비용
1.5시간과제당 시간
Opus 5.5 · maxClaude Code
66
$13.0과제당 비용
1.1시간과제당 시간
GPT-6.1 Sol · xhighCodex
63
$1.04과제당 비용
15.5분과제당 시간
GPT-6 Astra · maxCodex · 참고
62
$7.47과제당 비용
29.4분과제당 시간

막대 길이는 0~70점 구간 기준. AA는 GPT-6.1 Sol에서 xhigh가 max보다 3점 높았다고 밝혔다. Claude 두 모델은 max 설정만 측정돼 있다. [3]

코딩 에이전트 지수에서 Claude 두 모델이 3~5점 앞선다. 대신 과제 하나에 드는 돈은 Sol이 12분의 1 이하, 시간은 4분의 1 이하다. Sol이 토큰을 적게 쓰기 때문에 초당 생성 속도가 느려도 과제는 먼저 끝난다.

종합 지능 지수 — effort별큰 숫자 = AA 종합 지능 지수(평가 10개 합산, 높을수록 좋음. 코딩 전용 아님) · $ = 평가 과제 1개당 평균 비용
effort
GPT-6.1 Sol
Opus 5.5
Sonnet 5.5
max
Sol52$0.72
Opus58$5.98
Sonnet56$7.60
xhigh
Sol51$0.39
Opus56$3.46
Sonnet52$2.74
high
Sol50$0.32
Opus54$1.82
Sonnet47$1.08
medium
Sol48$0.21
Opus51$1.34
Sonnet41$0.59
low
Sol42$0.13
Opus42$0.55
Sonnet—미공개

AA Intelligence Index v4.3.2. 10개 평가 중 코딩은 Terminal-Bench 4.0·SciCode 두 개이고, 나머지는 지식 업무·문서·추론·사실성 평가다. 코딩만 본 점수는 위 코딩 에이전트 지수. 비용은 실제로 쓴 토큰까지 반영한 과제당 평균. 밑줄은 그 effort에서 가장 높은 점수. 막대는 0~60점 구간. [5][6][7]

51점대의 비용

종합 지수 51점: Sol xhigh $0.39 vs Opus medium $1.34 — Opus가 3.4배.

52점대의 비용

종합 지수 52점: Sol max $0.72 vs Sonnet xhigh $2.74 — Sonnet이 3.8배.

Sol이 닿지 못하는 구간

Opus high(54)·xhigh(56)·max(58)와 Sonnet max(56). 이 점수대가 필요하면 Claude밖에 선택지가 없다.

Sonnet의 중간 설정

Sonnet medium(41)은 Sol low(42)보다 낮고 비용은 4.5배. Sonnet은 xhigh 이상에서만 Sol보다 높다.

GPT-6.1 Sol

입력 / 출력
$2 / $10
캐시 입력
$0.10
캐시 쓰기
$2.50

Opus 5.5

입력 / 출력
$4 / $20
캐시 읽기
$0.20
캐시 쓰기 (5분)
$5

Sonnet 5.5

입력 / 출력
$2 / $10
캐시 읽기
$0.20
캐시 쓰기 (5분)
$2.50

API 표준 가격, 100만 토큰당 USD. Sol과 Sonnet은 단가가 같아도 한 과제에 쓰는 토큰 수가 달라 과제당 비용이 크게 벌어진다. [2][13]

04

코딩 작업별로 무엇을, 어떤 effort로

필자 판단 위 수치와 반응을 바탕으로 한 판단이다. 자체 코드베이스로 비교 실험을 한 결과는 아니다.

범위가 분명한 기능 개발·버그 수정

매일 하는 주력 코딩. 테스트로 결과를 바로 확인할 수 있는 일.

1순위
GPT-6.1 Solxhigh
대안: Opus 5.5 medium
코딩 에이전트 지수 63점을 과제당 $1.04·15.5분에 낸다. Claude max보다 3~5점 낮은 대신 비용은 12분의 1 이하다. 틀린 결과가 테스트에서 바로 걸리는 일이라 점수 차이보다 속도·비용 이득이 크다.

반복·대량 작업

테스트 추가, 린트·타입 오류 정리, 단순 마이그레이션, 병렬 서브에이전트.

1순위
GPT-6.1 Solmedium
대안: Sol high · Claude Code 안이라면 Sonnet 5.5 medium
Sol medium은 종합 지수 48에 과제당 $0.21. Sonnet medium(41, $0.59)보다 점수가 높고 싸다. OpenAI API의 기본값도 medium이다.

설계·여러 모듈 통합·애매한 요구사항

잘못 정하면 뒤따르는 작업이 전부 다시 도는 일.

1순위
Opus 5.5high
대안: Opus 5.5 xhigh
Opus high의 종합 지수 54는 Sol의 최고 설정(max 52)보다 높다. 이런 일은 모델 단가보다 재작업 비용이 크다. 발표 당일 HN에 올라온 두 비교(팩맨 게임, 이미지→HTML)에서도 완성도는 Opus가 조금 앞섰다.

수 시간짜리 무인 작업

대형 리팩터링, 코드베이스 감사, 밤새 돌리는 에이전트.

1순위
Opus 5.5xhigh
대안: Sonnet 5.5 max (시간·비용 여유가 있을 때)
Anthropic은 xhigh를 30분 넘는 장시간 에이전트·코딩 작업용으로 안내한다. 코딩 에이전트 지수 1위는 Sonnet max(68)지만 과제당 1.5시간·$14.2라, 기다려도 되는 일에만 쓴다. [8]

코드 리뷰(PR)

건수가 많고, 놓치면 비싼 것만 골라내면 되는 일.

1순위
Solhigh→Opusmedium
1차 거르기는 Sol, 최종 판단은 Opus
1차 검토는 싼 모델로 충분하다. HN의 한 사용자는 GPT-6 Sol이 GPT가 쓴 코드 리뷰에서 Opus 5.5보다 나았다고 했지만 표본 하나라 참고만 한다. 병합 여부를 가르는 최종 검토는 판단력이 높은 쪽에 둔다.

UI·프론트엔드 완성도

정렬, 애니메이션, 시안 재현처럼 눈으로 봐야 하는 품질.

1순위
Opus 5.5medium
대안: Sol xhigh + 스크린샷 검수
이미지→HTML 비교에서 Sol이 정렬·시각 요소 일부를 놓쳤고 Opus가 더 잘 맞췄다는 반응이 있다. 어느 모델이든 결과는 실제 화면으로 확인한다.

멀티에이전트 구성

리드가 일을 나누고 작업자가 병렬로 처리하는 구조.

구성
Opusmedium리드
Solmedium~high작업자
판단은 비싼 모델 한 곳에 모으고, 병렬 작업은 싸고 빠른 모델에 준다. 두 회사 모델을 섞으려면 하네스가 두 API를 모두 다룰 수 있어야 한다.

effort를 고를 때

  • Sol은 xhigh가 max보다 코딩 점수가 높았다 (AA 코딩 에이전트 지수). max를 최고 성능으로 가정하지 않는다. [3]
  • 기본값이 다르다: Sol·Opus 5.5는 medium, Sonnet 5.5 API는 high. 같은 이름이라도 모델마다 생각하는 양이 다르다. [8]
  • Claude 구독(Pro·Max)으로 Claude Code를 쓰면 과제당 API 비용 비교가 그대로 맞지 않는다. 그때 기준은 사용량 한도다.
05

사람들 반응

발표 당일(9월 29일, UTC) Hacker News 댓글에서 원문을 확인한 것만 골랐다. 상당수는 직전 모델인 GPT-6 Sol 경험이다. Reddit·X는 검증 가능한 게시물을 찾지 못해 넣지 않았다. [10]

thefourthchime · 자체 테스트완성도 Opus · 비용 Sol
“GPT 6.1 Sol — 91, ~9 min, $0.51 … Opus 5.5 — 99, ~9 min, $2.00 … Opus still plays the best. Sol is almost as good and way cheaper.”팩맨 게임 만들기 비교. Opus 99점·$2.00, Sol 91점·$0.51.
jjcm · 자체 테스트Opus 우세
“Overall, opus executes a bit better than 6.1 sol, which surprises me.”같은 이미지를 HTML로 옮기는 흐름 비교. Sol이 정렬·시각 요소 일부를 놓쳤다고 적었다.
maxdo · 사용 경험Claude 우세
“i still feel like for complex things claude is way better vs anything else. also … opus 5.5 and sonnet 5.5 are much faster too.”복잡한 일은 Claude가 낫고 체감 속도도 빠르다는 의견. AA 측정에서는 과제 완료 시간이 Sol 쪽이 짧았다.
alasano · 자체 테스트 (GPT-6 Sol)Sol 우세
“In my testing yesterday GPT 6 Sol still beat Opus 5.5 on code review (of GPT written code in this case) 6.1 will probably perform even better.”코드 리뷰는 GPT-6 Sol이 나았다는 경험. 리뷰 대상이 GPT가 쓴 코드였다는 조건이 붙는다.
the_duke · 사용 경험 (GPT-6 Sol)Opus로 이동
“Sol 6 was so bad that I switched over to Opus 5.5 exclusively. Huge regression compared to Sol 5.6, often doing really dumb things.”직전 모델 GPT-6 Sol에 대한 불만. 6.1도 크게 다르지 않을 거라며 회의적이었다.
ChaseRensberger · 사용 경험 (GPT-6 Sol)Sol 긍정
“it feels like a cheaper astra to me”출시 이후 GPT-6 Sol만 써 왔고 저렴한 Astra 같다는 평. 최근 Anthropic 모델은 거의 써 보지 않았다고 밝혔다.
완성도

6.1과 Opus 5.5를 직접 비교한 두 테스트 모두 Opus가 조금 앞섰다.

가격

가장 일관된 긍정은 비용이다. 팩맨 테스트에서 Sol은 Opus의 약 4분의 1 비용($0.51 대 $2.00)이었다.

표본

발표 당일 반응이라 수가 적고, 여러 의견은 직전 모델 GPT-6 Sol 경험에 기댄다.

06

한계와 출처

  • 02절 수치는 OpenAI 자체 측정이다. 경쟁 모델 수치는 공개 자료에서 옮겼다고 OpenAI가 밝혔다.
  • AA 코딩 에이전트 지수는 Claude를 max로, Sol을 xhigh로만 측정했다. 같은 effort끼리의 비교가 아니다.
  • 코딩 에이전트 지수는 모델과 에이전트(Claude Code·Codex)를 함께 잰 값이라, 모델 차이와 도구 차이가 섞여 있다.
  • 초당 토큰 생성 속도는 Claude가 빠르다(Sonnet max 139 t/s, Sol max 68 t/s). 과제 완료 시간은 토큰을 적게 쓰는 Sol이 짧다.
  • 04절은 필자 판단이다. 도입 전에는 자기 작업 20~30건으로 같은 조건 비교를 해 보길 권한다.
  1. OpenAI · Introducing GPT-6.1 Sol2026-09-29 · 성능 주장, 가격, 제공 범위
  2. OpenAI API 문서 · GPT-6.1 Sol사양, effort, 가격
  3. Artificial Analysis · GPT-6.1 Sol 분석 기사코딩 에이전트 지수 해설, xhigh·max 비교
  4. Artificial Analysis · Coding Agent Index v1.5점수, 과제당 비용·시간
  5. Artificial Analysis · GPT-6.1 Sol effort별종합 지수, 과제당 비용, 속도
  6. Artificial Analysis · Claude Opus 5.5 effort별종합 지수, 과제당 비용, 속도
  7. Artificial Analysis · Claude Sonnet 5.5 effort별종합 지수, 과제당 비용, 속도
  8. Anthropic · Effort 문서모델별 기본값·권장 effort
  9. TechCrunch · GPT-6.1 Sol 출시 보도2026-09-29 · GPT-6.1 Astra 취소 보도(WSJ) 인용
  10. Hacker News · GPT-6.1 Sol 토론2026-09-29
  11. Pac-Man bakeoff모델별 팩맨 게임 생성 비교
  12. DataCamp · GPT-6.1 Sol 정리발표 수치 정리, 독립 재현이 없다는 단서
  13. 화이트래빗스토리 · Sonnet 5.5 리포트Claude 5.5 가격표 (Anthropic 공식 문서 기준)

화이트래빗스토리 · 2026-09-30 작성. 모든 수치는 위 출처에서 9월 30일 확인한 값이며, 이후 재측정이나 가격 변경으로 달라질 수 있다.