3줄 요약

  • OpenAI·Anthropic 다음 자리는 Artificial Analysis 지수 기준 Meta Muse Spark 1.3(48점)이고, Grok 4.7과 Xiaomi MiMo-V2.6-Pro가 46점으로 뒤따름
  • 중국 AI가 싸다는 말은 Xiaomi와 DeepSeek(과제당 $0.13, $0.27)에만 맞고, Qwen3.8 Max·GLM-5.3·Kimi K3는 과제당 비용이 Opus 5.5(high)보다 비쌈
  • 이 비교에 나온 중국 5곳 모두 Anthropic 9월 보고서에서 Claude 무단 증류 혐의를 받았으니, 가격보다 내 프롬프트가 어디로 가는지부터 확인해야 함

2군 1등이 OpenAI 중간 모델과 동점

Artificial Analysis 지수 막대 차트: Opus 5.5 58, Astra 53, Sol과 Muse Spark 48, DeepSeek V4.1 Flash 39

출처: Artificial Analysis — Intelligence Index v4.3.2 순위표, 2026년 9월 28일 확인 — 차트 HSL

  • Artificial Analysis는 모든 모델을 직접 돌려서 GDPval, Terminal-Bench 4.0, Humanity's Last Exam 등 평가 10개를 지수 하나로 묶음 (방법론)
  • 1위는 Opus 5.5(max) 58점, 2위는 GPT-6 Astra 53점
  • 이 차트에선 나머지 8개 회사 모델 8개가 39~48점 사이에 몰려 있음
  • 그중 1등은 Meta Muse Spark 1.3으로 48점인데, GPT-6 Sol과 같은 점수임
  • Sol은 OpenAI의 중간 등급 모델임
  • 같은 모델도 추론 강도 설정에 따라 3점씩 오르내림(Muse Spark 1.3: xhigh 45, max 48)
  • 그래서 44~46점은 순위보다 한 무리로 보는 게 맞음
  • Google 최고점은 Gemini 3.8 Flash의 41점이고, 최신 Pro가 아직 3.1 Pro 프리뷰(30점)에 머물러 있음 (Google)
  • Google의 반격 카드는 Gemini 4인데 아직 날짜가 없음 (Gemini 4 출시일 정리)

중국 AI, 싼 건 다섯 곳 중 두 곳뿐

지수와 과제당 비용 산점도: Xiaomi MiMo-V2.6-Pro $0.13부터 Claude Opus 5.5 max $5.98까지

출처: Artificial Analysis — 정가 기준 지수 과제당 비용, 2026년 9월 28일 확인 — 차트 HSL

  • 나도 중국 AI는 가성비라고 알고 있었는데, 반만 맞았음
  • Artificial Analysis는 지수 과제 하나를 푸는 데 든 비용도 공개함
  • 추론 토큰과 캐시까지 들어간 값이라 토큰 단가보다 실제 청구서에 가까움
  • 오래 생각하는 모델은 늘어난 토큰만큼 돈을 더 냄
  • Xiaomi MiMo-V2.6-Pro는 과제당 $0.13에 46점이고, Opus 5.5(high)의 $1.82(54점)와 비교하면 14분의 1 수준
  • DeepSeek V4.1 Flash는 과제당 $0.27에 39점으로, 자사 V4 Pro($0.67, 36점)보다 점수도 높음
  • DeepSeek도 Flash가 Pro보다 낫다고 직접 밝혔음 (SiliconANGLE)
  • Qwen3.8 Max는 과제당 $5.41에 45점이라, Opus 5.5(max)의 $5.98(58점)과 비용이 비슷함
  • 토큰 단가는 Grok 4.7과 같은 $2 / $6인데 과제당 비용은 Grok의 두 배라서, 차이는 토큰을 얼마나 쓰느냐에서 나옴
  • GLM-5.3($2.01)과 Kimi K3($2.00)도 Opus 5.5(high)보다 과제당 비싸고, 점수는 9~10점 낮음
모델 회사 100만 토큰당 입력 / 출력 가중치 공개
Claude Opus 5.5 Anthropic $4 / $20 없음
GPT-6 Sol OpenAI $2 / $10 없음
Muse Spark 1.3 Meta $1.25 / $4.25 없음
Grok 4.7 SpaceXAI $2 / $6 (프롬프트 20만 토큰 미만) 없음
Gemini 3.8 Flash Google 12월 31일까지 $0.75 / $3.75, 이후 $1.50 / $7.50 없음
MiMo-V2.6-Pro Xiaomi $0.435 / $0.87 있음, MIT
Qwen3.8 Max Alibaba $2 / $6 (국제 리전) 없음, 작은 Qwen3.8 모델만 공개
GLM-5.3 Z.ai $1.40 / $4.40 있음, 자체 라이선스
Kimi K3 Moonshot $3 / $15 있음, 자체 라이선스
DeepSeek V4.1 Flash DeepSeek 비혼잡 시간 $0.15 / $0.60, 혼잡 시간 두 배 있음, MIT

출처: Anthropic, OpenAI, Meta, SpaceXAI, Google, Xiaomi(OpenRouter), Alibaba Cloud, Z.ai, Moonshot, DeepSeek, Hugging Face 모델 페이지, 모두 2026년 9월 28일 확인

  • Kimi K3 정가는 $3 / $15로 GPT-6 Sol보다 비쌈
  • 대신 가중치가 공개돼 있어서, OpenRouter의 다른 호스팅 업체는 $1 / $9부터 팔고 있음 (OpenRouter)
  • DeepSeek 혼잡 시간은 평일 UTC 01:0004:00, 06:0010:00임
  • 한국 시간으로 10시13시, 15시19시라 딱 근무 시간에 두 배 요금이 붙음

Grok은 단가 반값인데 과제당은 1.5배

  • xAI는 SpaceX에 합병된 뒤 이름을 SpaceXAI로 바꿨고, Grok 4.7을 "비슷한 모델의 절반 가격"이라고 소개함 (SpaceXAI)
  • Opus 5.5($4 / $20)와 비교하면 $2 / $6은 입력이 절반, 출력이 30%임
  • 그런데 과제당 비용은 Grok 4.7(high)이 $2.73으로, Opus 5.5(high)의 $1.82보다 비쌈
  • 점수는 8점 낮은데 비용은 1.5배임
  • 미국 2군에서 가성비가 나은 쪽은 Meta Muse Spark 1.3으로, 과제당 $1.60에 48점임
  • Contributor 요금제는 $0.10 / $0.20까지 내려가는데, Meta는 이 트래픽을 자사 제품 개선에 쓴다고 적어 둠
  • 입력 92% 할인의 대가는 내 프롬프트임
  • Meta는 Muse Spark 가중치를 공개하지 않았고, 공개 계획만 날짜 없이 밝힌 상태임 (Meta)
  • 예전 공개 모델 Llama 4 Maverick은 같은 지수에서 10점이고, 지금 공개 가중치 1위는 Xiaomi 모델임

Anthropic 보고서에 중국 5곳이 전부 나옴

  • Anthropic은 9월 10일 위협 보고서에서 중국 연구소 7곳이 허락 없이 Claude 답변으로 자사 모델을 학습시켰다고 지목함 (Anthropic 보고서 145~153쪽)
  • Alibaba, Moonshot, DeepSeek, Zhipu, Xiaomi가 다 들어 있고, SenseTime과 MiniMax도 포함됨
회사 이 글의 모델 Anthropic이 집계한 대화 수
Alibaba Qwen3.8 Max 2026년 5~7월, 1억 5,100만 건 이상
Moonshot Kimi K3 2026년 5~7월, 2,300만 건 이상
DeepSeek V4.1 Flash 7월 중 14일간 1,210만 건 이상
Zhipu (Z.ai) GLM-5.3 6~7월 중 17일간 340만 건 이상
Xiaomi MiMo-V2.6-Pro 3~4월 중 20일간 40만 건 이상
  • Anthropic에 따르면 Moonshot과 DeepSeek은 자기 사용자 요청을 몰래 Claude로 넘기고 그 답을 자기 모델 답처럼 보여 줬음
  • DeepSeek, Xiaomi, Moonshot은 자기 사용자와 나눈 대화도 Claude에 넣었고, 여기엔 이름·이메일·회사 자료가 섞여 있었다고 함
  • 어디까지나 Anthropic의 조사 결과이고, 지목된 회사들의 공식 반박은 찾지 못했음
  • The Information 보도로는 중국 인터넷 규제 당국이 7곳을 모두 불렀고, DeepSeek과 Moonshot의 사용자 데이터 문제를 조사 중임 (The Next Web)
  • 처벌 여부는 아직 정해지지 않았음
  • Anthropic도 경쟁사이고, 같은 달 CEO가 이런 증류를 단속해야 한다는 글을 썼음 (에세이)
  • 프롬프트에 회사 코드나 고객 데이터가 들어간다면, 과제당 몇 센트보다 어디서 돌리느냐가 더 중요함
  • 가중치가 공개된 MiMo, DeepSeek, GLM, Kimi는 내 서버나 믿을 만한 호스팅에서 돌리면 이 문제를 피할 수 있음

그래서 누구한테 뭘 시킴?

내 상황 내가 할 일
가격이 전부인 대량 작업 MiMo-V2.6-Pro나 DeepSeek V4.1 Flash부터 시험하고, DeepSeek은 비혼잡 시간에 돌림
프롬프트에 회사 코드나 개인정보가 들어감 제조사 API 대신 공개 가중치를 내 서버나 믿을 만한 호스팅에서 돌림
Opus보다 싼 미국 모델이 필요함 GPT-6 Sol(과제당 $1.06, 48점)이나 Muse Spark 1.3 일반 요금제를 시험
Grok 4.7의 $2 / $6에 끌림 작업 하나당 비용부터 비교함, 이 지수에선 Opus 5.5(high)보다 비쌈
아끼려고 Qwen3.8 Max·GLM-5.3·Kimi K3를 씀 실제 청구서를 확인함, 과제당으로는 Opus 5.5(high)보다 비쌈
Google을 기다리는 중 당장은 Gemini 3.8 Flash를 쓰고, Gemini 4는 날짜가 나오면 봄

커뮤니티 반응

  • r/singularity의 한 사용자는 Muse Spark 1.3을 두 서비스에서 써 봤는데 Godot·문서 작업은 무난했고 수학 과외 답변은 불완전했다고 함 (Reddit)
  • r/LocalLLaMA의 한 개발자는 보안용 샌드박스 작업 하나에서 MiMo-V2.6-Pro가 git 제한을 우회하는 경로 여러 개를 놓쳤다고 함 (Reddit)
  • 다른 r/LocalLLaMA 사용자는 작업 하나에서 MiMo-V2.6-Pro로 좋은 결과를 얻었지만, 수정 지시와 토큰을 더 쓴 뒤였음 (Reddit)

Q&A 또 궁금한 것은?

  • Q. OpenAI·Anthropic 다음 3위는 진짜 누구임?
    • 이 지수로는 48점인 Meta지만, 46점인 Grok 4.7과 MiMo-V2.6-Pro도 설정 차이 안쪽이라 한 무리로 보는 게 맞음
  • Q. 여기서 과제당 제일 싼 모델은?
    • Xiaomi MiMo-V2.6-Pro가 $0.13으로 제일 싸고, 2군에서 제일 비싼 건 $5.41인 Qwen3.8 Max임
  • Q. 회사 코드를 중국 모델 API에 보내도 됨?
    • Anthropic은 이 중 세 곳이 사용자 대화를 Claude로 넘겼다고 주장하니, 민감한 코드라면 공개 가중치를 직접 돌리는 쪽을 택하겠음
  • Q. Google이 왜 2군임?
    • 지금 최고 모델이 Flash이고, Pro는 3.1 Pro 프리뷰 이후 새로 안 나왔고, Gemini 4는 날짜가 없음
  • Q. Meta Contributor 요금제면 Muse Spark가 제일 싼 거 아님?
    • $0.10 / $0.20이면 싼 편이지만, Meta가 그 트래픽을 제품 개선에 씀