블로그 목록

GPT-6 Sol·Luna와 Claude Opus 5.5 비교 — 가격, 작업당 비용, 성능, 초기 사용자 평가

요약. 2026년 9월 22일 OpenAI는 GPT-6 Sol·Luna를, Anthropic은 Claude Opus 5.5를 공개했다. API 표준 요금은 입력·출력 100만 토큰당 Sol $2/$10, Luna $0.10/$0.50, Opus 5.5 $4/$20이다. 그러나 실제 청구액은 작업에 쓴 토큰 수와 추론 강도에 따라 달라진다. 독립 평가 기관 Artificial Analysis의 종합 평가에서 최고 추론 설정의 작업당 비용과 점수는 Luna $0.07·37점, Sol $1.06·48점, Opus 5.5 $5.98·58점이었다. Opus 5.5의 기본값인 중간 추론 설정에서는 $1.34·51점이다. 아래에서 공식 발표와 독립 평가를 살펴본 뒤 Opus 5.5·GPT-6 Astra·Sol의 고성능 비교, 주요 저가형 모델, 공개 사용자 후기를 확인한다.

세 모델의 공식 발표를 각각 읽으면

GPT-6 Sol: 복잡한 코딩과 에이전트 작업

OpenAI는 Sol을 GPT-6 Astra의 성능 개선을 더 빠르고 저렴한 모델에 적용한 선택지로 소개한다. 특히 코딩, 전문 업무, 사실성, 컴퓨터 사용을 강조한다. API 모델 ID는 gpt-6-sol이고 입력은 텍스트·이미지, 출력은 텍스트다. 추론 강도는 none부터 max까지 고를 수 있으며 API 기본값은 medium이다. 컨텍스트는 105만 토큰, 최대 출력은 12.8만 토큰이다. ChatGPT Work와 Codex에도 출시됐으며 일반 Chat 화면 제공은 발표 시점에 아직 시작되지 않았다. OpenAI 발표 · Sol 모델 문서

GPT-6 Luna: 반복량이 많은 저비용 작업

Luna는 GPT-6 모델군의 저비용 모델이다. API 모델 ID는 gpt-6-luna다. OpenAI는 집중된 대량 작업용으로 안내하며, Sol과 마찬가지로 텍스트·이미지 입력과 텍스트 출력을 지원한다. 105만 토큰 컨텍스트와 최대 12.8만 출력 토큰을 제공한다. Plus 이상 이용자는 ChatGPT Work·Codex에서, Free·Go 이용자는 데스크톱 앱에서 접근할 수 있다고 발표했다. OpenAI 발표 · Luna 모델 문서

Claude Opus 5.5: 긴 코딩 세션과 지식 업무

Anthropic은 Opus 5.5를 장시간 코딩·지식 업무용 모델로 발표했다. 자사 평가에서는 대부분의 작업에서 Claude Fable 5.1 수준이며, 일반적인 작업 비용은 Opus 5보다 약 40% 낮다고 설명한다. API 모델 ID는 claude-opus-5-5다. 컨텍스트는 100만 토큰, 최대 출력은 12.8만 토큰이고 추론은 항상 켜져 있다. 추론 강도 기본값은 medium이다. Claude API와 주요 클라우드에서 제공한다. 40%는 Anthropic이 제시한 전형적 작업 추정치로, 모든 요청의 비용이 40% 줄어든다는 보장은 없다. Anthropic 발표 · Opus 5.5 모델 문서

기본 가격: API 표준 요금

아래 금액은 2026년 9월 23일 기준 각 회사의 직접 API, 표준 처리, 짧은 입력 구간의 미국 달러 가격이다. 모두 100만 토큰당 요금이며 구독료와는 별개다. 캐시 읽기는 이전에 처리한 입력을 재사용할 때, 캐시 쓰기는 재사용할 입력을 저장할 때 적용된다. OpenAI 가격표 · Anthropic 가격표

모델입력 / 출력캐시 읽기캐시 쓰기
GPT-6 Luna$0.10 / $0.50$0.01$0.125
GPT-6 Sol$2 / $10$0.20$2.50
Claude Opus 5.5$4 / $20$0.20$5 (5분) / $8 (1시간)

같은 토큰 수라면 Sol의 기본 입력·출력 단가는 Luna의 20배, Opus 5.5는 Sol의 2배다. 캐시 읽기는 Sol과 Opus 5.5가 $0.20으로 같다. 이 표에는 도구 호출료, 지역 처리 할증, 빠른 처리 옵션, 장문맥 할증을 넣지 않았다.

예를 들어 캐시·도구 호출 없이 입력 10만 토큰과 출력 2만 토큰을 쓴 요청 한 건이라면 계산상 Luna $0.02, Sol $0.40, Opus 5.5 $0.80이다. 이는 동일한 토큰 사용량을 가정한 요금 계산 예시다. 실제 모델별 작업 비용을 예측하는 값은 아니다. 추론 과정에 쓰인 출력 토큰과 재시도까지 합쳐 청구량을 확인해야 한다.

긴 입력에는 별도 규칙이 있다. OpenAI 문서상 Sol과 Luna 모두 입력이 27.2만 토큰을 넘으면 요청 전체에 입력·캐시 요금 2배, 출력 요금 1.5배가 적용된다. 대규모 문서나 긴 코드베이스를 한 요청에 넣는 작업에서는 견적에 이 구간을 반영해야 한다. Sol 요금 조건 · Luna 요금 조건

실제 작업에 들어간 비용: Artificial Analysis

Artificial Analysis의 Intelligence Index v4.3.2는 코딩·터미널 작업, 전문 업무, 지식 추론 등 10개 평가를 합친다. 사이트의 ‘작업당 비용’은 각 평가의 입력, 캐시 읽기·쓰기, 추론·답변 출력 비용을 계산해 가중 평균한 값이다. 특정 회사의 개발 업무 한 건 가격이나 API의 고정 수수료는 아니다. 평가 설정과 과제가 바뀌면 값도 바뀐다. 아래 수치는 9월 23일 확인한 값이다. Luna 결과 · Sol 결과 · Opus 결과

모델·추론 강도종합 점수작업당 비용읽는 법
Luna medium29$0.02일반적 추론 설정의 저비용 기준
Luna max37$0.07더 많이 추론해 점수 상승
Sol medium40$0.25Sol의 API 기본 추론 설정
Sol max48$1.06최고 추론 설정
Opus 5.5 medium51$1.34Opus 5.5의 API 기본 추론 설정
Opus 5.5 max58$5.98최고 추론 설정, 기본 fallback 사용
기본 단가에서 계산 예를 거쳐 평가 작업당 비용까지. 출처: OpenAI·Anthropic 가격표, Artificial Analysis Intelligence Index v4.3.2.
기본 단가에서 계산 예를 거쳐 평가 작업당 비용까지. 출처: OpenAI·Anthropic 가격표, Artificial Analysis Intelligence Index v4.3.2.

Sol max와 Opus 5.5 medium은 작업당 $1.06과 $1.34로 비용대가 가깝다. 같은 평가에서 점수는 48과 51이다. 최상위 점수가 필요한 작업에서는 Opus 5.5 max가 58점까지 올라가지만 작업당 비용은 $5.98이다. Luna max는 $0.07에 37점이므로 많은 건을 처리할 때 비용 차이가 크다. Claude 점수에는 Anthropic의 기본 fallback 설정이 포함되어 있다. 안전장치가 개입하는 요청에서 다른 모델로 처리할 수 있으므로 순수한 단일 모델 성능으로 읽으면 안 된다. Artificial Analysis의 Opus 평가 조건

출력량도 비용을 바꾼다. 최고 추론 설정에서 Artificial Analysis는 종합 평가 작업당 Sol 약 3.1만 출력 토큰, Opus 5.5 약 11.9만 출력 토큰을 기록했다. 따라서 Opus 5.5의 작업당 비용이 Sol보다 약 5.6배인 이유를 기본 출력 단가 2배만으로 설명할 수 없다. 작업 중 얼마나 길게 생각하고 쓰는지도 함께 봐야 한다. Artificial Analysis 직접 비교

성능: 같은 평가 체계의 결과

다음 표는 모두 Artificial Analysis의 같은 평가 체계에서 최고 추론 설정으로 측정한 값이다. 전문 업무의 Elo 점수와 나머지 정답률은 단위가 다르다. 표 안에서도 같은 행끼리만 비교한다. Opus·Sol 비교 · Opus·Luna 비교

평가Luna maxSol maxOpus 5.5 max
종합 지능 지수374858
AutomationBench-AA: 앱 업무 자동화53%62%70%
Terminal-Bench 4.0: 터미널 작업13%44%60%
SciCode: 과학 코딩55%58%67%
GDPval-AA v2.1: 전문 업무 Elo136714871846
Humanity’s Last Exam: 고난도 지식39%48%61%
같은 평가에서 확인한 분야별 성능과 비슷한 비용대의 선택지. 출처: Artificial Analysis Intelligence Index v4.3.2.
같은 평가에서 확인한 분야별 성능과 비슷한 비용대의 선택지. 출처: Artificial Analysis Intelligence Index v4.3.2.

코딩용 에이전트만 따로 보면 결론이 조금 달라진다. Artificial Analysis의 Coding Agent Index에서 Sol max는 57점으로 이전 GPT-5.6 Sol max보다 2점 높고, 해당 평가의 작업당 비용은 $2.99로 약 절반이다. Luna max는 41점으로 이전 GPT-5.6 Luna max보다 2점 낮았다. 위의 종합 작업당 비용 $1.06·$0.07과 코딩 전용 작업당 비용은 서로 다른 평가에서 나온 숫자다. Artificial Analysis의 Sol·Luna 분석

출시 회사의 벤치마크에는 다른 결과도 있다. OpenAI는 Sol의 DeepSWE v1.1 최고 설정 점수를 68.8%, Luna를 66.6%로 제시했다. Anthropic은 Opus 5.5가 자사 FrontierCode 평가에서 높은 성능을 낸다고 발표했다. 평가 과제와 실행 도구가 달라 이 수치를 한 행에 놓고 순위를 매기지 않았다. 모델 선택에는 같은 코드베이스·프롬프트·완료 기준으로 직접 시험한 결과가 필요하다. OpenAI 성능 발표 · Anthropic 성능 발표

Opus 5.5·GPT-6 Astra·Sol의 고성능 비교

최상위 성능이 필요할 때 검토할 Opus 5.5와 GPT-6 Astra, 그리고 비용을 낮춘 GPT-6 Sol을 Artificial Analysis Intelligence Index v4.3.2의 최고 추론 설정으로 비교했다. 이는 모든 회사의 최고 모델 순위가 아니라 세 모델 간 비교다. 가격은 일반 유료 API에서 짧은 문맥으로 쓸 때의 입력·출력 100만 토큰당 표준 요금이고, 작업당 비용은 평가 기관이 실제 평가에 사용한 토큰과 캐시를 합산한 평균이다. 출력 속도의 t/s는 답변 생성이 시작된 뒤 1초에 생성한 토큰 수를 뜻한다.

모델·설정점수 · 출력 속도입력 / 출력평가 작업당 비용
Anthropic · Claude Opus 5.5 max58점 · 측정값 없음$4 / $20$5.98
OpenAI · GPT-6 Astra max53점 · 58.7 t/s$10 / $50$3.26
OpenAI · GPT-6 Sol max48점 · 126.0 t/s$2 / $10$1.06

종합 점수는 Opus 5.5 max 58점, Astra max 53점, Sol max 48점 순이다. 평가 작업당 비용은 그 반대로 Sol $1.06, Astra $3.26, Opus $5.98이다. Astra는 Sol보다 토큰 단가가 5배인데도 작업당 비용은 약 3.1배였고, Opus는 Astra보다 토큰 단가가 낮아도 작업당 비용이 더 높았다. 평가에 사용한 출력·추론 토큰 수가 다르기 때문이다. 측정된 출력 속도는 Sol 126.0 t/s, Astra 58.7 t/s이며 Opus 5.5 max는 측정값이 없다. 출력 속도에는 첫 토큰을 기다리는 시간과 추론·도구 호출 시간이 들어가지 않으므로 작업 완료 속도와 같지 않다. 실제 선택에는 같은 업무의 성공률과 재시도 비용을 함께 봐야 한다.

주요 회사의 저가형 모델을 나란히 놓으면

저가형에서는 실제로 쓸 수 있는지까지 확인해야 한다. 특히 Google의 가장 싼 2.5 Flash-Lite는 기존 사용자에게만 API 접근을 제공한다. 그래서 이 모델과 함께 신규 프로젝트에서 시험할 수 있는 3.1·3.5 Flash-Lite도 표에 넣었다. 아래 점수는 같은 종합 평가이며, 추론 설정이 다른 모델은 표에 표시했다.

회사·저가형 모델점수 · 출력 속도입력 / 출력평가 작업당 비용
OpenAI · GPT-6 Luna medium29점 · 142.8 t/s$0.10 / $0.50$0.02
Google · Gemini 2.5 Flash-Lite · 기존 사용자 한정9점·추정 · 376.8 t/s$0.10 / $0.40현재 비교값 없음
Google · Gemini 3.1 Flash-Lite16점 · 353.3 t/s$0.25 / $1.50$0.04
Google · Gemini 3.5 Flash-Lite22점 · 376.5 t/s$0.30 / $2.50$0.12
xAI · Grok 4.3 high25점 · 104.1 t/s$1.25 / $2.50$0.17
Anthropic · Claude Haiku 4.5 · 추론 사용17점 · 103.7 t/s$1 / $5$0.21

저가형에서 출력 속도는 Gemini Flash-Lite 계열이 앞선다. 3.5 Flash-Lite의 376.5 t/s는 Luna medium의 142.8 t/s보다 약 2.6배 높다. 이 숫자만으로 한 작업을 끝내는 데 걸리는 시간이 2.6배 짧다고 해석하면 안 된다. 첫 응답 대기와 추론에 걸린 시간은 따로 봐야 한다.

앞서 비교한 Luna와 Gemini 3.5 Flash-Lite만 놓으면 Luna가 입력은 3분의 1, 출력은 5분의 1 가격이고 종합 점수는 29점 대 22점이다. 그러나 Google의 가장 싼 2.5 Flash-Lite는 출력 단가가 Luna보다 $0.10 낮다. 대신 점수는 추정치 9점이고 신규 API 사용자에게는 접근이 제한된다. 3.1 Flash-Lite는 3.5보다 저렴하지만 점수도 낮다. xAI에는 이보다 토큰 단가가 낮은 Grok Build 0.1이 있지만 코딩 에이전트용 초기 접근 모델이라 범용 저가형 표에서는 뺐다. 무료 체험 구간, 배치 할인, 긴 문맥 할증과 도구 호출 비용은 위 유료 표준 요금에 포함하지 않았다. Google의 2.5 모델 접근 안내

출시 직후 사용자 평가는 어떻게 나왔나

아래는 9월 22~23일 공개된 직접 사용 경험을 골라 요약한 표다. 회사가 발표문에 실은 고객 추천사는 제외했다. 사용 시간과 과제가 제각각이고, 대부분은 하루 이내의 첫인상이다. 사용자 수나 만족도를 추정하는 자료로 읽지 않는다.

모델·사용자해 본 일평가 요지출처
Sol high · Life_is_important단일 HTML 파일의 간단한 모바일 게임 제작작업 후 5시간 사용량의 3%를 썼고 결과에 만족했다. 작업 하나의 사용량 사례다.r/codex 후기
Sol · mchusmaOpus 5.5 medium과 Sol max 초기 비교아주 짧은 시험에서는 Opus 쪽을 선호했다. Sol의 비용 인하는 긍정적으로 봤다.HN 토론
Luna · bioniclyGPT-6 Luna와 이전 5.6 Luna 사용 비교본인이 써 본 범위에서는 이전 Luna가 더 낫다고 느꼈다. 과제·설정은 밝히지 않았다.r/codex 후기
Luna · Simon Willison여러 추론 설정에서 SVG 그림 생성가격 인하를 높게 평가하고 생성 결과를 공개했다. 이 사례는 그림 생성 한 과제의 정성 평가다.HN 결과 공유
Opus 5.5 · Simon Willison최고 추론 설정에서 SVG 그림 생성 두 차례두 번 모두 출력 한도 12.8만 토큰을 추론에 써 답을 완성하지 못했다. 최고 설정의 과도한 추론 사례다.HN 실험 기록
Opus 5.5 · senkoClaude Code에서 게임 두 개 제작자체 테스트에서 Fable 5.1·Astra와 비슷한 결과로 봤다. 게임당 약 45분, 표시 비용은 $11~14였다.HN 결과 공유
Opus 5.5 · jjcm이미지를 HTML로 구현디자인 재현은 좋았지만 요청한 화면 전환 애니메이션을 빠뜨렸고, 본인의 비교 작업에서는 성능이 가장 낮았다.HN 결과 공유

후기에는 가격에 대한 기대와 함께, Sol·Luna가 이전 세대보다 항상 더 낫지는 않다는 반응이 있다. 독립 평가에서도 Sol·Luna의 일부 전문 업무 점수가 이전 세대보다 내려갔다. Opus 5.5는 완성도에 대한 호평이 있지만 최고 추론 강도가 비용과 출력 길이를 크게 늘리는 사례가 나온다. 출시 직후의 평가는 며칠 이상 사용한 운영 기록으로 다시 확인할 필요가 있다. Artificial Analysis의 이전 세대 비교 · Opus 최고 추론 사례

어떤 작업에 어떤 설정부터 시험할까

일단 누구를 부를까? 숫자는 Artificial Analysis Intelligence Index v4.3.2의 최고 추론 설정 결과다. 작업당 비용은 이 평가에 쓰인 평균이며, 아래 표의 첫 시험 설정은 실제 업무 비용을 고려해 다르게 골랐다.
일단 누구를 부를까? 숫자는 Artificial Analysis Intelligence Index v4.3.2의 최고 추론 설정 결과다. 작업당 비용은 이 평가에 쓰인 평균이며, 아래 표의 첫 시험 설정은 실제 업무 비용을 고려해 다르게 골랐다.
작업첫 시험 모델·설정판단 기준
대량 분류·추출·간단한 코드 보조Luna medium정답률과 재시도율을 포함한 완료 건당 비용
일반적인 코딩 에이전트Sol medium 또는 high테스트 통과율, 수정 요청 횟수, 작업당 비용
긴 코드베이스 조사·복잡한 산출물Opus 5.5 medium요구 사항 누락, 검증 통과율, 출력 토큰 수
최고 수준의 추론이 필요한 어려운 문제Opus 5.5 high·max와 Sol max성공률 개선이 추가 비용을 정당화하는지

위 선택은 벤치마크를 바탕으로 한 시험 시작점이다. 같은 작업 20~30건을 모델별로 실행하고, 성공한 건의 평균 비용과 실패 후 재작업 비용을 함께 계산하면 가격표와 종합 점수보다 실무에 가까운 판단을 할 수 있다. 구독 상품의 사용량 제한은 API 토큰 요금과 별도이므로 Codex·Claude Code 구독끼리 비교할 때도 실제 작업량을 따로 기록해야 한다.

자료와 확인 시점

가격·모델 기능은 2026년 9월 23일 공식 문서를, 작업당 비용·성능은 같은 날 Artificial Analysis의 Intelligence Index v4.3.2를 확인했다. 사용자 평가는 출시 직후 공개된 직접 경험만 포함했다. 벤치마크 수치와 가격은 이후 갱신될 수 있다.

LET'S BUILD

AI 개발 문의.

상담 내용을 보내주시면 확인 후 연락드리겠습니다.

화이트래빗스토리
wrstory.com © 2023 All rights reserved