3줄 요약
- Astra에서 Opus 5.5로 옮긴 이유는 결과물은 더 좋고 토큰 단가는 60% 싸기 때문임
- 같은 프롬프트로 게임 두 판을 시켰더니 Opus가 두 판 다 이겼지만 청구서는 1승 1패였음
- 보이는 결과물은 Opus에 맡기되 작업 한 건에 실제로 나간 돈으로 따져야 함
Astra 축하 파티는 짧았음
- Astra가 나왔을 때 첫 반응은 이제 Fable도 긴장해야겠다였음
- Opus 5.5가 나오고 나서는 가성비도 결과물도 Opus로 넘어갔음
- 써보니 사용량도 Opus 쪽이 널널한 느낌임
- 한도를 재본 것도 통제 실험을 한 것도 아니고 직접 써본 체감임
- 알고 보니 긴장해야 할 쪽은 Fable이 아니라 Astra였음
같은 프롬프트, Opus만 신났음
- Moe Lueker가 두 모델에 같은 프롬프트로 게임을 두 번 시켰고 수정은 한 번도 허용하지 않았음 (Moe Lueker, 9월 25일)
- 둘 다 빈 폴더에서 시작했고 Astra는 Codex, Opus는 Claude Code를 썼음
- 1라운드는 러너, 2라운드는 아기자기한 섬 건설 게임임

출처: Moe Lueker — Claude Opus 5.5 vs GPT-6 Astra: Same Prompt, Two Games, Real Cost
- 러너에서 Opus는 다이브·브레이크·질주·체크포인트에 배경음악까지 넣었음
- 이 중에 시킨 건 하나도 없음
- Astra 러너는 아트와 시차 배경이 제대로라 시험자 평가로 GPT-6 결과물 중 최고였음
- 게임 코드는 Opus 2,405줄, Astra 358줄임
- 섬 게임에서 Opus는 지을수록 섬이 넓어지고 밤 모드가 있고 길 옆 집에 점수를 더 줬음
- Astra 섬은 나무와 집 종류가 더 많았고 딱 거기까지였음
- 한 사람이 라운드마다 한 번씩 돌린 결과라 벤치마크가 아니라 사례로 봐야 함
토큰은 60% 싼데 청구서는 두 배
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 |
|---|---|---|
| GPT-6 Astra | $10 | $50 |
| Claude Opus 5.5 | $4 | $20 |
표준 API 요금, Astra는 짧은 컨텍스트 구간, 2026년 9월 28일 확인: OpenAI 가격표, Anthropic
- Opus는 입력·출력 단가 모두 Astra보다 60% 쌈
- Anthropic은 Opus 5.5 medium이 FrontierCode 54.6%로 Astra 최고치 53.3%를 작업당 약 5분의 1 비용으로 넘었다고 발표함
- 채점도 발표도 본인이 한 성적표라 설정 조건까지 같이 읽어야 함
- 같은 페이지 AutomationBench에서는 Astra가 41.4% 대 40.0%로 앞섬
- 자기 페이지에 진 점수까지 올린 건 인정함

데이터: Moe Lueker, 빌드 한 턴을 API 정가로 계산 — HSL 제작 차트
- 러너에서 Opus는 출력 토큰 256K, Astra는 36K를 써서 청구서가 $15.25 대 $7.09였음
- 단가가 60% 싸도 일을 7배 하면 할인은 사라짐
- 섬 게임에서는 Opus $5.40, Astra $6.88로 뒤집혔음
- 두 판 합계는 Opus $20.65, Astra $13.97이라 더 좋은 게임 두 개에 약 $7를 더 낸 셈임
- 안 시킨 배경음악도 출력 토큰으로 꼬박꼬박 청구됨
그래서 뭘 누구한테 시킴?
| 작업 | 먼저 쓸 모델 | 이유 |
|---|---|---|
| 프런트엔드·디자인·게임 | Opus 5.5 | 같은 프롬프트 두 판 모두 결과물이 더 좋았음 |
| 긴 백엔드 디버깅 | Astra와 비교 | 같은 시험자도 백엔드는 Astra에 맡기고 아래 레딧 사례도 비슷함 |
| 예산이 정해진 작업 | 상한부터 설정 | Opus는 시킨 것보다 더 만들 수 있음 |
- 긴 Opus 작업은 시작 전에 토큰이나 비용 상한부터 걸겠음
- 배경음악까지 알아서 넣는 성격이라 예산은 사람이 정해야 함
- 요금표 대신 전체 비용을 통과한 작업 수로 나눠 보겠음
- Opus가 막히는 문제는 Astra한테도 계속 물어보겠음
커뮤니티 반응
- r/codex 글쓴이는 Opus가 생산적이었지만 깊은 비동기 런타임 설계는 Astra·Fable을 더 높게 봤음, "Opus가 다 이김"에 대한 실제 반례임 (레딧 원문)
- 같은 스레드의 다른 댓글은 Astra가 사용량을 많이 쓰고도 못 고친 봇을 Opus가 고쳤다고 했는데 측정한 청구서가 아닌 개인 경험임 (레딧 원문)
Q&A 또 궁금한 것은?
- Q. Opus 5.5가 항상 Astra보다 쌈?
- 토큰은 싸지만 작업당 비용은 Opus가 그 작업에 얼마나 신나느냐에 달렸음
- Q. 시험 하나로 Opus가 낫다고 볼 수 있음?
- 아님, 한 사람이 라운드마다 한 번씩 돌린 거라 내 작업으로 다시 돌려봐야 함
- Q. 똑같은 시험을 재현할 수 있음?
- 원문 프롬프트는 공개되지 않아서 빈 폴더·같은 노력 설정만 맞추고 내 프롬프트로 돌리면 됨
- Q. Astra는 이제 끊어도 됨?
- 긴 백엔드 디버깅을 한다면 시험자와 레딧 사례 모두 아직 Astra를 쓰니 남겨두는 게 나음
