3줄 요약

  • Astra에서 Opus 5.5로 옮긴 이유는 결과물은 더 좋고 토큰 단가는 60% 싸기 때문임
  • 같은 프롬프트로 게임 두 판을 시켰더니 Opus가 두 판 다 이겼지만 청구서는 1승 1패였음
  • 보이는 결과물은 Opus에 맡기되 작업 한 건에 실제로 나간 돈으로 따져야 함

Astra 축하 파티는 짧았음

  • Astra가 나왔을 때 첫 반응은 이제 Fable도 긴장해야겠다였음
  • Opus 5.5가 나오고 나서는 가성비도 결과물도 Opus로 넘어갔음
  • 써보니 사용량도 Opus 쪽이 널널한 느낌임
  • 한도를 재본 것도 통제 실험을 한 것도 아니고 직접 써본 체감임
  • 알고 보니 긴장해야 할 쪽은 Fable이 아니라 Astra였음

같은 프롬프트, Opus만 신났음

  • Moe Lueker가 두 모델에 같은 프롬프트로 게임을 두 번 시켰고 수정은 한 번도 허용하지 않았음 (Moe Lueker, 9월 25일)
  • 둘 다 빈 폴더에서 시작했고 Astra는 Codex, Opus는 Claude Code를 썼음
  • 1라운드는 러너, 2라운드는 아기자기한 섬 건설 게임임

같은 프롬프트로 만든 2라운드 섬 건설 게임, GPT-6 Astra의 Tiny Tides와 더 크고 북적이는 Claude Opus 5.5의 섬

출처: Moe Lueker — Claude Opus 5.5 vs GPT-6 Astra: Same Prompt, Two Games, Real Cost

  • 러너에서 Opus는 다이브·브레이크·질주·체크포인트에 배경음악까지 넣었음
  • 이 중에 시킨 건 하나도 없음
  • Astra 러너는 아트와 시차 배경이 제대로라 시험자 평가로 GPT-6 결과물 중 최고였음
  • 게임 코드는 Opus 2,405줄, Astra 358줄임
  • 섬 게임에서 Opus는 지을수록 섬이 넓어지고 밤 모드가 있고 길 옆 집에 점수를 더 줬음
  • Astra 섬은 나무와 집 종류가 더 많았고 딱 거기까지였음
  • 한 사람이 라운드마다 한 번씩 돌린 결과라 벤치마크가 아니라 사례로 봐야 함

토큰은 60% 싼데 청구서는 두 배

모델 입력 100만 토큰 출력 100만 토큰
GPT-6 Astra $10 $50
Claude Opus 5.5 $4 $20

표준 API 요금, Astra는 짧은 컨텍스트 구간, 2026년 9월 28일 확인: OpenAI 가격표, Anthropic

  • Opus는 입력·출력 단가 모두 Astra보다 60% 쌈
  • Anthropic은 Opus 5.5 medium이 FrontierCode 54.6%로 Astra 최고치 53.3%를 작업당 약 5분의 1 비용으로 넘었다고 발표함
  • 채점도 발표도 본인이 한 성적표라 설정 조건까지 같이 읽어야 함
  • 같은 페이지 AutomationBench에서는 Astra가 41.4% 대 40.0%로 앞섬
  • 자기 페이지에 진 점수까지 올린 건 인정함

같은 프롬프트의 빌드 API 비용, 러너는 Opus 5.5 $15.25 대 Astra $7.09, 섬 게임은 $5.40 대 $6.88

데이터: Moe Lueker, 빌드 한 턴을 API 정가로 계산 — HSL 제작 차트

  • 러너에서 Opus는 출력 토큰 256K, Astra는 36K를 써서 청구서가 $15.25 대 $7.09였음
  • 단가가 60% 싸도 일을 7배 하면 할인은 사라짐
  • 섬 게임에서는 Opus $5.40, Astra $6.88로 뒤집혔음
  • 두 판 합계는 Opus $20.65, Astra $13.97이라 더 좋은 게임 두 개에 약 $7를 더 낸 셈임
  • 안 시킨 배경음악도 출력 토큰으로 꼬박꼬박 청구됨

그래서 뭘 누구한테 시킴?

작업 먼저 쓸 모델 이유
프런트엔드·디자인·게임 Opus 5.5 같은 프롬프트 두 판 모두 결과물이 더 좋았음
긴 백엔드 디버깅 Astra와 비교 같은 시험자도 백엔드는 Astra에 맡기고 아래 레딧 사례도 비슷함
예산이 정해진 작업 상한부터 설정 Opus는 시킨 것보다 더 만들 수 있음
  • 긴 Opus 작업은 시작 전에 토큰이나 비용 상한부터 걸겠음
  • 배경음악까지 알아서 넣는 성격이라 예산은 사람이 정해야 함
  • 요금표 대신 전체 비용을 통과한 작업 수로 나눠 보겠음
  • Opus가 막히는 문제는 Astra한테도 계속 물어보겠음

커뮤니티 반응

  • r/codex 글쓴이는 Opus가 생산적이었지만 깊은 비동기 런타임 설계는 Astra·Fable을 더 높게 봤음, "Opus가 다 이김"에 대한 실제 반례임 (레딧 원문)
  • 같은 스레드의 다른 댓글은 Astra가 사용량을 많이 쓰고도 못 고친 봇을 Opus가 고쳤다고 했는데 측정한 청구서가 아닌 개인 경험임 (레딧 원문)

Q&A 또 궁금한 것은?

  • Q. Opus 5.5가 항상 Astra보다 쌈?
    • 토큰은 싸지만 작업당 비용은 Opus가 그 작업에 얼마나 신나느냐에 달렸음
  • Q. 시험 하나로 Opus가 낫다고 볼 수 있음?
    • 아님, 한 사람이 라운드마다 한 번씩 돌린 거라 내 작업으로 다시 돌려봐야 함
  • Q. 똑같은 시험을 재현할 수 있음?
    • 원문 프롬프트는 공개되지 않아서 빈 폴더·같은 노력 설정만 맞추고 내 프롬프트로 돌리면 됨
  • Q. Astra는 이제 끊어도 됨?
    • 긴 백엔드 디버깅을 한다면 시험자와 레딧 사례 모두 아직 Astra를 쓰니 남겨두는 게 나음