1:1 컨설팅 ↗

 /  블로그  /  AI 모델 비교 2026

2026. 09. 01 → 09. 03

사흘 만에 AI 모델
3개가 나왔습니다

앤스로픽·구글·오픈AI가 하루 간격으로 새 모델을 냈습니다. 벤치마크 점수 경쟁은 이미 다른 데서 많이 다뤘으니, 이 글은 뭘 써야 일이 되고 돈이 되는지만 정리했습니다.

9.01  Claude Fable 5.1 9.02  Gemini 3.8 Flash 9.03  GPT-6 Astra

여기서 바로 재생됩니다 · 1분 · 아래는 영상에 다 못 담은 내용입니다

결론부터

셋 다 쓸 필요 없습니다. 하는 일에 따라 갈리고, 기준은 아주 단순합니다.

9월 1일 · Anthropic

Claude Fable 5.1

뒤에서 도는
자동화

코드와 에이전트는 여전히 여기가 1등입니다. 블로그 자동 발행, 상품 설명 파이프라인, 코드 리뷰처럼 사람이 안 보는 사이 알아서 굴러가야 하는 일.

주의 — "25~45% 싸졌다"는 건 API 캐시 값을 내린 결과입니다. 구독으로 쓰면 값은 그대로입니다.

9월 2일 · Google

Gemini 3.8 Flash

양 많은 일
+ 실시간 정보

13배 싸고 제일 빠릅니다. 구글 검색에 바로 붙어서 실시간 정보를 출처까지 달아 줍니다. 대량 번역, 상품 설명 리라이트, 리서치용.

주의 — 2027년 1월 1일에 API 가격이 두 배가 됩니다. 아래 "모르고 넘어가면 손해" 참고.

9월 3일 · OpenAI

GPT-6 Astra

만들어서
보여주는 것

말 한마디로 웹사이트를 만들고 챗GPT 안에서 호스팅까지 됩니다. 3D·게임·영상 편집도 여기가 제일 낫습니다. 첫 시도 결과물이 이미 완성품에 가깝습니다.

주의 — 순차 개방 중이고 무료·최저가 플랜은 제외입니다. 보안 관련 질문은 거부하는 제한판입니다.

실력은 조금, 값은 많이

제조사가 아니라 제3자(Artificial Analysis)가 매긴 종합 점수와 실제 API 가격입니다.

종합 지능 점수

Fable 5.1
66
GPT-6 Astra
61
Gemini 3.8 Flash
59
050100

1위와 3위 차이는 7점입니다.

출력 100만 토큰 가격

Fable 5.1
$50.00
GPT-6 Astra
$50.00
Gemini 3.8 Flash
$3.75
$0$25$50

같은 축 위에 그렸습니다. 실제로 그만큼 쌉니다.

실력은 7점 차이인데 값은 13배 차이입니다. 그래서 지금 진짜 질문은 "누가 제일 똑똑하냐"가 아니라 "이 일에 그 값을 낼 필요가 있냐"입니다. 다만 제미나이는 같은 일에 출력 토큰을 중앙값보다 70% 더 쓰기 때문에, 13배가 그대로 13배 절약이 되지는 않습니다.

클로드 vs GPT — 값이 똑같아서 성능으로만 고릅니다

둘 다 100만 토큰당 입력 $10 / 출력 $50. 완전히 같은 가격입니다. 그래서 순수하게 "뭘 더 잘하냐"로만 갈립니다.

Claude Fable 5.1

시키면 끝까지 제대로 합니다

  • 종합 점수 66 — 셋 중 1위 (Astra 61)
  • 코딩 에이전트 지수 70.4 — Astra 67.0
  • 어려운 종합 문제에서 65.0% vs Astra 57.2%. 한 세대 전 클로드도 Astra보다 높습니다
  • 시킨 것만 하고 멈춥니다. 빈칸마다 새 문제를 만들지 않습니다
  • 코드 리뷰 잔소리 70% 감소

VS

GPT-6 Astra

한 방에 보여줄 걸 만듭니다

  • 웹사이트를 만들고 호스팅까지 — ChatGPT Sites
  • 스케치·참고 이미지를 주면 작동하는 화면으로 바꿉니다
  • 영상·모션 편집 테스트에서 Fable 5.1과 Sora를 모두 앞섰습니다
  • 3D·게임 — Blender, three.js를 직접 다룹니다
  • 컴퓨터 대신 조작 약 2배 빠름 (75분 → 40분)
기준은 이거 하나입니다 — 사람 눈에 안 보이는 곳에서 굴러가야 하면 클로드, 남한테 보여줄 결과물이면 GPT.

같은 시험지에 올려본 항목

세 회사가 같은 조건으로 공개한 항목만 남겼습니다. 없는 칸은 억지로 채우지 않았습니다.

항목Fable 5.1Astra3.8 Flash
종합 지능 지수666159
코딩 에이전트 지수70.467.061.1
터미널 코딩 (구버전 시험지)89.4%
터미널 코딩 (어려운 새 시험지)55.8%57.7%19.1%
초고난도 문제, 도구 사용65.0%57.2%
최상위 수학87.8%97.6%
컴퓨터 조작77.9%72.6%59.0%
출력 속도 (초당 토큰)62약 305
첫 글자까지 (짧을수록 좋음)66.3초12~13초

3~4행을 붙여서 보세요. 같은 "터미널 코딩"인데 옛 시험지에서는 제미나이가 1등이고, 어려운 새 시험지에서는 19.1%로 꼴찌입니다. 벤치마크 숫자를 그대로 믿으면 안 되는 이유가 여기 있습니다.

실제로 돈이 되는 쓰임

공개된 실사용 사례에서 반복해서 나온 것들만 골랐습니다.

Fable 5.1

  • 콘텐츠 자동 발행 — 글쓰기부터 업로드까지 파이프라인으로 묶어 굴리기
  • 설문·매출 원자료 → 대시보드와 슬라이드. 형식적 칭찬과 진짜 불만까지 구분해냈습니다
  • 코드 리뷰 자동화 — 외주 대신
  • 손그림을 실제 제작 가능한 CAD 부품으로

Gemini 3.8 Flash

  • 대량 번역 — 다국어 사이트를 굴린다면 여기서 비용이 갈립니다
  • 상품 설명 대량 리라이트 — 물량 많고 품질 요구는 중간인 일
  • 구글 검색 그라운딩 — 실시간 정보에 출처를 달아줍니다. 월 5,000회 무료, 이후 1,000회당 $14
  • 100만 토큰짜리 긴 자료 통째로 읽히기

GPT-6 Astra

  • 판매용 랜딩페이지·웹앱을 프롬프트로 만들고 바로 호스팅
  • 영상 편집·모션 — 채널 운영에 직접 붙습니다
  • 3D·게임 에셋 제작
  • 브라우저 자동화 — CRM 입력, 사이트 점검을 대신 클릭해서 처리

써 본 사람들은 이렇게 말합니다

홍보 문구 말고, 실제로 돌려보고 남긴 말과 공식 발언만 골랐습니다.

"Welcome to the AGI era." 오픈AI 사장이 출시 기자간담회에서 한 말입니다. 같은 날 "자기네 AGI 기준조차 못 넘었다"는 반론 보도가 함께 나왔습니다.

Greg Brockman · OpenAI 사장 / 09.03

일반 용도로는 5~10% 나은데 작업당 비용은 75% 더 든다는 계산이 커뮤니티에 돌았습니다. 논쟁이 "지능"에서 "비용 + 지능"으로 옮겨갔습니다.

AINews 커뮤니티 반응 / 09월

Fable 5.1은 프롬프트를 과하게 해석하지 않습니다. 할 일을 끝내면 멈추지, 빈칸마다 새 문제를 만들어내지 않습니다.

개발자 실사용 리뷰 종합 / 09월

대규모 리팩터링 결과가 구조는 훌륭해 보였는데 실행이 안 됐습니다. 최신 모델이 만든 코드도 사람이 확인해야 한다는 걸 그대로 보여준 사례입니다.

실사용자 보고 · 5만 5천 줄 / 09월

출시 당일 반응이 딱 둘로 갈렸습니다. 속도를 보는 쪽은 극찬했고, 첫 응답이 느린 걸 본 쪽은 실망했습니다.

Artificial Analysis 측정 기반 리뷰 / 09월

구글이 직접 안내합니다 — "효율이 우선이면 3.7 Flash에 머물라." 3.8은 새 기반 모델이 아니라 3.7 위에 얹은 개량판입니다.

Google DeepMind 모델 카드 / 09.02

모르고 넘어가면 손해 보는 것 셋

영상에 다 담지 못한 부분입니다. 특히 첫 번째는 오해가 많습니다.

두 배가 되는 건 “API 가격”입니다

제미나이 3.8 플래시의 API 토큰 가격이 2027년 1월 1일부터 입력 $0.75 → $1.50, 출력 $3.75 → $7.50으로 정확히 두 배가 됩니다. 100만 토큰당 가격이라 개발자·자동화용 API를 쓰는 경우에만 해당됩니다. 제미나이 앱이나 구독 요금이 오르는 게 아닙니다.

싸졌다는 말에 속지 마세요

클로드의 25~45% 절감은 API 캐시 값을 내린 결과입니다($1 → $0.25). 기본 단가는 그대로입니다. 구독으로 쓰는 사람은 바뀐 게 하나도 없습니다.

벤치마크 1등은 시험지에 따라 바뀝니다

제미나이는 옛 코딩 시험지에서 1등(89.4%)인데, 어려운 새 시험지에서는 19.1%로 꼴찌입니다(클로드 55.8%). 어느 회사도 자기가 진 시험지를 앞세우지 않습니다.

1분 영상으로 다시 보기

위 내용을 1분으로 압축한 쇼츠입니다. 이 페이지 안에서 바로 재생됩니다.

내 상황에 맞는 답이 필요하다면

어떤 모델을 어디에 붙일지는 하는 일마다 다릅니다. 글로 다 담기 어려운 건 1:1로 같이 짚어드립니다.