3줄 요약
- 지능은 여전히 Opus 5.5 쪽이 더 뛰어나다고 느끼지만, 매일 일할 모델로는 내가 선호하는 Codex 안의 GPT-6.1 Sol이 기대됨
- Sol과 Sonnet 5.5는 100만 토큰당 입력 $2·출력 $10으로 같고 Opus의 절반이라, 세 모델을 비교하면 가격만으로 Sol의 승리를 정할 수는 없음
- Codex 작업은 Sol부터 써보고, 범위가 분명한 Claude Code 작업은 Sonnet을 남겨두고, 판단력이 수정 횟수를 줄여주는 일에는 Opus 비용을 내겠음
Opus는 여전히 믿음이 가고 Sol은 다시 궁금해짐
- 전에 쓴 Astra와 Opus 비교에서도 완성된 결과물과 가성비는 Opus 5.5가 더 마음에 들었음
- 지금도 지능적인 부분은 Opus가 더 뛰어나다는 인상임
- GPT-6 Sol은 성능에서 아쉬움이 컸어서 싸다는 이유만으로 다시 쓰고 싶지는 않았음
- 6.1이 궁금한 건 내가 좋아하는 작업 환경 안에서 일상 작업을 맡길 만한 성능이 나올 것 같아서임
- OpenAI는 DeepSWE 1.1에서 이전 Sol의 최고 점수보다 6.4%p 높으면서 effort와 비용은 낮았다고 발표했고, 다시 시험해 볼 이유는 됨 (OpenAI)
- 제조사 측정 결과이며, 이 글은 세 모델을 같은 조건으로 새로 돌린 실험이 아니라 현재 내 선택 기준을 정리한 글임
- 파일 이름 하나 바꾸는 데 최고 지능까지 바라지는 않는데, 어느 파일인지는 알아들었으면 함
Sol과 Sonnet은 기본 단가가 같음

| 모델 | 입력 | 캐시 입력 / 캐시 읽기 | 출력 |
|---|---|---|---|
| GPT-6.1 Sol | $2 | $0.10 | $10 |
| Claude Sonnet 5.5 | $2 | $0.20 | $10 |
| Claude Opus 5.5 | $4 | $0.20 | $20 |
출처: OpenAI 모델 문서, Sonnet 발표, Opus 모델 문서; 텍스트 100만 토큰당 USD, 일반 API 처리 기준, 2026년 9월 29일 확인
- 표의 Sol 요금은 입력 272K 토큰 이하 요청 기준이며, 넘으면 요청 전체에 입력·캐시 2배와 출력 1.5배 요금이 적용됨
- 도구 사용료·캐시 쓰기·처리 옵션 할증은 제외했고 구독 사용량도 별도로 봐야 함
- 캐시 없는 입력 10만 토큰과 출력 2만 토큰을 쓴다고 가정하면 Sol·Sonnet은 $0.40, Opus는 $0.80임
- 토큰 수를 고정한 계산 예시이며 실제 작업에서 측정한 비용은 아님
- $0.40짜리 시도를 똑같이 두 번 하면 이미 $0.80이고, 내가 검수하는 시간은 아직 더하지도 않았음
- 같은 수정에 두 번 돈을 내면 반값 혜택을 꽤 빨리 반납하게 됨
- Sol의 캐시 읽기는 싸지만 적용 가능한 반복 입력 부분의 차이여서 전체 비용이 Sonnet의 절반이 되는 건 아님
Sonnet까지 넣으면 선택이 까다로워짐
- Sonnet 5.5를 쓴 글에서는 High로 일상 작업을 할 때 만족스러웠고, 어려운 일에서 가성비가 떨어졌다고 적었음
- Claude에서 하는 일을 전부 Opus 가격으로 계산하면 이 선택지를 놓치게 됨
- Anthropic도 범위가 분명한 일은 Sonnet, 복잡하고 답이 열려 있는 일은 Opus로 구분하며 Claude Code의 Sonnet 기본값은 Medium임 (공식 설명)
- effort를 올리는 게 무조건 해결책도 아닌데, Anthropic의 FrontierCode 1.1 Main 결과는 Sonnet Xhigh 52.1%, Max 46.2%였음
- 각주에는 살펴본 두 사례에서 코드 리뷰 서브에이전트가 늘면서 시간 초과나 범위 밖 수정에 영향을 줬다고 적혀 있음
- 작은 수정 하나 부탁했다가 리뷰 회의만 커질 수도 있음
- 이 결과는 GPT-6.1 Sol을 측정한 게 아니고, 발표 표의 이전 GPT-6 Sol 점수를 6.1 점수처럼 가져오면 안 됨
- 적절한 설정에서 원하는 결과가 얼마나 나오는지 봐야 작업 하나당 싼 모델을 고를 수 있음
매일 쓸 모델로 Sol이 끌리는 이유는 Codex임
- 작업 환경까지 보면 지금은 Codex가 Claude Code보다 더 강력하고 편하다고 느낌
- 새 기능이 붙는 속도도 좋고, 글·코드·이미지 작업을 오갈 때 흐름을 다시 짜지 않아도 되는 점이 마음에 듦
- 내장 이미지 생성이 그 예이고,
gpt-image-2를 Codex 사용량 안에서 이용하는 구조임 (이미지 생성 문서) - Claude Code도 MCP·스킬·명령 실행·클라우드 작업을 지원해서 기능 유무만 세는 것으로 내 선호를 설명하기는 어려움 (Claude Code 안내)
- 이런 환경까지 묶으면 Sol의 가성비가 상당히 매력적으로 보이지만, Sonnet보다 실제로 얼마나 절약되는지는 같은 작업으로 재봐야 함
| 맡길 일 | 내가 먼저 고를 쪽 | 선택을 바꿀 조건 |
|---|---|---|
| Codex에서 코드·글·이미지를 오가는 일상 작업 | GPT-6.1 Sol | 수정을 반복해서 낮은 단가의 이점이 사라짐 |
| 기존 Claude Code 환경의 범위가 분명한 작업 | Sonnet 5.5 Medium 또는 High | 중간중간 어려운 판단이 계속 필요함 |
| 복잡한 계획이나 답이 열려 있는 어려운 작업 | Opus 5.5 | 더 싼 모델도 같은 수준의 결과를 냄 |
- 직접 비교할 때는 작업·쓸 수 있는 도구·통과 기준을 맞추고 각 모델의 effort를 기록하겠음
- 모든 시도의 API 비용을 합격 작업 수로 나누고, 검수에 쓴 분은 따로 적으면 됨
- 토큰 가격이 같아도 어느 환경에서 일하기 편한지에 따라 내 선택은 달라질 수 있음
커뮤니티 반응
- r/codex의 한 댓글은 그래프 점에 effort 표시가 없다며 High가 Sol의 적정 설정인지 판단하기 전에 각 점의 조건부터 묻고 있음 (Reddit)
- r/ClaudeCode에서는 Sonnet Max의 비용을 비판하는 의견과 Medium·High를 따로 비교해야 한다는 의견이 함께 나옴 (Reddit)
Q&A 또 궁금한 것은?
- Q. Opus가 더 똑똑하면 Codex를 고르는 게 손해 아님?
- 모델 지능에 대한 내 인상과 작업 환경에 대한 선호는 서로 다른 질문이고, 맡길 일에 따라 중요한 쪽이 달라짐
- Q. Sol이 Sonnet의 반값임?
- 표에서 반값인 건 캐시 읽기뿐이며 기본 입력·출력 단가는 같고 실제 사용량은 달라질 수 있음
- Q. Sonnet은 전부 Max로 올리면 됨?
- Medium·High로 이미 통과하는지부터 보고, effort를 더 올리기 전에 Opus와 비교하겠음
- Q. 여기서 세 모델을 같은 작업으로 직접 시험한 것임?
- 아님, 내 선호와 기존 경험에 공식 요금·제조사 평가를 붙인 글이고 제안한 비교 실험은 앞으로 할 일임
