대부분의 코딩 작업은 Sol xhigh부터
AA 코딩 에이전트 지수 63점. Claude 두 모델(max)보다 3~5점 낮지만 과제당 비용은 12분의 1 이하, 시간은 4분의 1 이하다.
MODEL BRIEF · 2026.09.30
9월 29일 OpenAI DevDay에서 나온 GPT-6.1 Sol을 Claude Opus 5.5·Sonnet 5.5와 나란히 놓고, 코딩 작업마다 어떤 모델을 어떤 effort로 쓸지 정리했다. 수치는 OpenAI 발표와 독립 평가 기관 Artificial Analysis(AA) 측정을 나눠 표시했다.
필자 판단 근거는 아래 03~05절
AA 코딩 에이전트 지수 63점. Claude 두 모델(max)보다 3~5점 낮지만 과제당 비용은 12분의 1 이하, 시간은 4분의 1 이하다.
종합 지수에서 Opus high(54)는 Sol의 어떤 설정(최고 52)보다 높다. 설계·통합·애매한 요구사항처럼 틀리면 되돌리는 비용이 큰 일에 쓴다.
코딩 에이전트 지수 68점으로 가장 높지만 과제당 $14.2·1.5시간으로 가장 비싸고 느리다. medium·high에서는 더 싼 Sol보다 종합 지수가 낮다.
GPT-6 Sol이 나온 지 7일 만의 업그레이드다. OpenAI는 "GPT-6 Astra에 가까운 지능을 Astra 표준 단가의 5분의 1로"라고 소개한다. [1]
gpt-6.1-sol실제 코드베이스의 장시간 소프트웨어 작업. GPT-6 Astra와 같은 수준을 약 5분의 1 비용으로 냈고, GPT-6 Sol 최고점보다 6.4%p 높은 점수를 더 낮은 effort·비용에서 냈다.
47개 도구를 쓰는 업무 흐름. medium effort에서 Opus 5.5보다 2.2%p 높고 비용은 약 3분의 1.
표·도표가 섞인 전문 PDF 질의응답. 시험한 모든 effort에서 fallback을 켠 Opus 5.5보다 높은 점수를 과제당 절반 이하 비용으로.
max에서 GPT-6 Sol보다 7%p 높고, Astra와 2.1%p 차이에 비용은 약 7분의 1.
max 과제당 $5.47 (Opus 5.5 $23.21, Astra $23.80). 최고점은 Astra 68.1%로, OpenAI도 가장 어려운 연구에는 Astra를 권한다.
low effort에서 사실 오류가 포함된 응답 비율이 11.4% → 7.7%로 줄었다 (GPT-6 Sol 대비).
Artificial Analysis 9월 30일 확인한 값이다. AA는 결과가 나오는 대로 재측정해 수치가 바뀔 수 있다.
코딩 에이전트 지수에서 Claude 두 모델이 3~5점 앞선다. 대신 과제 하나에 드는 돈은 Sol이 12분의 1 이하, 시간은 4분의 1 이하다. Sol이 토큰을 적게 쓰기 때문에 초당 생성 속도가 느려도 과제는 먼저 끝난다.
AA Intelligence Index v4.3.2. 10개 평가 중 코딩은 Terminal-Bench 4.0·SciCode 두 개이고, 나머지는 지식 업무·문서·추론·사실성 평가다. 코딩만 본 점수는 위 코딩 에이전트 지수. 비용은 실제로 쓴 토큰까지 반영한 과제당 평균. 밑줄은 그 effort에서 가장 높은 점수. 막대는 0~60점 구간. [5][6][7]
종합 지수 51점: Sol xhigh $0.39 vs Opus medium $1.34 — Opus가 3.4배.
종합 지수 52점: Sol max $0.72 vs Sonnet xhigh $2.74 — Sonnet이 3.8배.
Opus high(54)·xhigh(56)·max(58)와 Sonnet max(56). 이 점수대가 필요하면 Claude밖에 선택지가 없다.
Sonnet medium(41)은 Sol low(42)보다 낮고 비용은 4.5배. Sonnet은 xhigh 이상에서만 Sol보다 높다.
API 표준 가격, 100만 토큰당 USD. Sol과 Sonnet은 단가가 같아도 한 과제에 쓰는 토큰 수가 달라 과제당 비용이 크게 벌어진다. [2][13]
필자 판단 위 수치와 반응을 바탕으로 한 판단이다. 자체 코드베이스로 비교 실험을 한 결과는 아니다.
매일 하는 주력 코딩. 테스트로 결과를 바로 확인할 수 있는 일.
테스트 추가, 린트·타입 오류 정리, 단순 마이그레이션, 병렬 서브에이전트.
잘못 정하면 뒤따르는 작업이 전부 다시 도는 일.
대형 리팩터링, 코드베이스 감사, 밤새 돌리는 에이전트.
건수가 많고, 놓치면 비싼 것만 골라내면 되는 일.
정렬, 애니메이션, 시안 재현처럼 눈으로 봐야 하는 품질.
리드가 일을 나누고 작업자가 병렬로 처리하는 구조.
발표 당일(9월 29일, UTC) Hacker News 댓글에서 원문을 확인한 것만 골랐다. 상당수는 직전 모델인 GPT-6 Sol 경험이다. Reddit·X는 검증 가능한 게시물을 찾지 못해 넣지 않았다. [10]
“GPT 6.1 Sol — 91, ~9 min, $0.51 … Opus 5.5 — 99, ~9 min, $2.00 … Opus still plays the best. Sol is almost as good and way cheaper.”팩맨 게임 만들기 비교. Opus 99점·$2.00, Sol 91점·$0.51.
“Overall, opus executes a bit better than 6.1 sol, which surprises me.”같은 이미지를 HTML로 옮기는 흐름 비교. Sol이 정렬·시각 요소 일부를 놓쳤다고 적었다.
“i still feel like for complex things claude is way better vs anything else. also … opus 5.5 and sonnet 5.5 are much faster too.”복잡한 일은 Claude가 낫고 체감 속도도 빠르다는 의견. AA 측정에서는 과제 완료 시간이 Sol 쪽이 짧았다.
“In my testing yesterday GPT 6 Sol still beat Opus 5.5 on code review (of GPT written code in this case) 6.1 will probably perform even better.”코드 리뷰는 GPT-6 Sol이 나았다는 경험. 리뷰 대상이 GPT가 쓴 코드였다는 조건이 붙는다.
“Sol 6 was so bad that I switched over to Opus 5.5 exclusively. Huge regression compared to Sol 5.6, often doing really dumb things.”직전 모델 GPT-6 Sol에 대한 불만. 6.1도 크게 다르지 않을 거라며 회의적이었다.
“it feels like a cheaper astra to me”출시 이후 GPT-6 Sol만 써 왔고 저렴한 Astra 같다는 평. 최근 Anthropic 모델은 거의 써 보지 않았다고 밝혔다.
6.1과 Opus 5.5를 직접 비교한 두 테스트 모두 Opus가 조금 앞섰다.
가장 일관된 긍정은 비용이다. 팩맨 테스트에서 Sol은 Opus의 약 4분의 1 비용($0.51 대 $2.00)이었다.
발표 당일 반응이라 수가 적고, 여러 의견은 직전 모델 GPT-6 Sol 경험에 기댄다.
화이트래빗스토리 · 2026-09-30 작성. 모든 수치는 위 출처에서 9월 30일 확인한 값이며, 이후 재측정이나 가격 변경으로 달라질 수 있다.