9월 1일 · Anthropic
Claude Fable 5.1
뒤에서 도는
자동화
코드와 에이전트는 여전히 여기가 1등입니다. 블로그 자동 발행, 상품 설명 파이프라인, 코드 리뷰처럼 사람이 안 보는 사이 알아서 굴러가야 하는 일.
주의 — "25~45% 싸졌다"는 건 API 캐시 값을 내린 결과입니다. 구독으로 쓰면 값은 그대로입니다.
앤스로픽·구글·오픈AI가 하루 간격으로 새 모델을 냈습니다. 벤치마크 점수 경쟁은 이미 다른 데서 많이 다뤘으니, 이 글은 뭘 써야 일이 되고 돈이 되는지만 정리했습니다.
여기서 바로 재생됩니다 · 1분 · 아래는 영상에 다 못 담은 내용입니다
셋 다 쓸 필요 없습니다. 하는 일에 따라 갈리고, 기준은 아주 단순합니다.
9월 1일 · Anthropic
Claude Fable 5.1
뒤에서 도는
자동화
코드와 에이전트는 여전히 여기가 1등입니다. 블로그 자동 발행, 상품 설명 파이프라인, 코드 리뷰처럼 사람이 안 보는 사이 알아서 굴러가야 하는 일.
주의 — "25~45% 싸졌다"는 건 API 캐시 값을 내린 결과입니다. 구독으로 쓰면 값은 그대로입니다.
9월 2일 · Google
Gemini 3.8 Flash
양 많은 일
+ 실시간 정보
13배 싸고 제일 빠릅니다. 구글 검색에 바로 붙어서 실시간 정보를 출처까지 달아 줍니다. 대량 번역, 상품 설명 리라이트, 리서치용.
주의 — 2027년 1월 1일에 API 가격이 두 배가 됩니다. 아래 "모르고 넘어가면 손해" 참고.
9월 3일 · OpenAI
GPT-6 Astra
만들어서
보여주는 것
말 한마디로 웹사이트를 만들고 챗GPT 안에서 호스팅까지 됩니다. 3D·게임·영상 편집도 여기가 제일 낫습니다. 첫 시도 결과물이 이미 완성품에 가깝습니다.
주의 — 순차 개방 중이고 무료·최저가 플랜은 제외입니다. 보안 관련 질문은 거부하는 제한판입니다.
제조사가 아니라 제3자(Artificial Analysis)가 매긴 종합 점수와 실제 API 가격입니다.
종합 지능 점수
1위와 3위 차이는 7점입니다.
출력 100만 토큰 가격
같은 축 위에 그렸습니다. 실제로 그만큼 쌉니다.
둘 다 100만 토큰당 입력 $10 / 출력 $50. 완전히 같은 가격입니다. 그래서 순수하게 "뭘 더 잘하냐"로만 갈립니다.
Claude Fable 5.1
시키면 끝까지 제대로 합니다
VS
GPT-6 Astra
한 방에 보여줄 걸 만듭니다
세 회사가 같은 조건으로 공개한 항목만 남겼습니다. 없는 칸은 억지로 채우지 않았습니다.
| 항목 | Fable 5.1 | Astra | 3.8 Flash |
|---|---|---|---|
| 종합 지능 지수 | 66 | 61 | 59 |
| 코딩 에이전트 지수 | 70.4 | 67.0 | 61.1 |
| 터미널 코딩 (구버전 시험지) | — | — | 89.4% |
| 터미널 코딩 (어려운 새 시험지) | 55.8% | 57.7% | 19.1% |
| 초고난도 문제, 도구 사용 | 65.0% | 57.2% | — |
| 최상위 수학 | 87.8% | 97.6% | — |
| 컴퓨터 조작 | 77.9% | 72.6% | 59.0% |
| 출력 속도 (초당 토큰) | — | 62 | 약 305 |
| 첫 글자까지 (짧을수록 좋음) | — | 66.3초 | 12~13초 |
3~4행을 붙여서 보세요. 같은 "터미널 코딩"인데 옛 시험지에서는 제미나이가 1등이고, 어려운 새 시험지에서는 19.1%로 꼴찌입니다. 벤치마크 숫자를 그대로 믿으면 안 되는 이유가 여기 있습니다.
공개된 실사용 사례에서 반복해서 나온 것들만 골랐습니다.
홍보 문구 말고, 실제로 돌려보고 남긴 말과 공식 발언만 골랐습니다.
"Welcome to the AGI era." 오픈AI 사장이 출시 기자간담회에서 한 말입니다. 같은 날 "자기네 AGI 기준조차 못 넘었다"는 반론 보도가 함께 나왔습니다.
Greg Brockman · OpenAI 사장 / 09.03
일반 용도로는 5~10% 나은데 작업당 비용은 75% 더 든다는 계산이 커뮤니티에 돌았습니다. 논쟁이 "지능"에서 "비용 + 지능"으로 옮겨갔습니다.
AINews 커뮤니티 반응 / 09월
Fable 5.1은 프롬프트를 과하게 해석하지 않습니다. 할 일을 끝내면 멈추지, 빈칸마다 새 문제를 만들어내지 않습니다.
개발자 실사용 리뷰 종합 / 09월
대규모 리팩터링 결과가 구조는 훌륭해 보였는데 실행이 안 됐습니다. 최신 모델이 만든 코드도 사람이 확인해야 한다는 걸 그대로 보여준 사례입니다.
실사용자 보고 · 5만 5천 줄 / 09월
출시 당일 반응이 딱 둘로 갈렸습니다. 속도를 보는 쪽은 극찬했고, 첫 응답이 느린 걸 본 쪽은 실망했습니다.
Artificial Analysis 측정 기반 리뷰 / 09월
구글이 직접 안내합니다 — "효율이 우선이면 3.7 Flash에 머물라." 3.8은 새 기반 모델이 아니라 3.7 위에 얹은 개량판입니다.
Google DeepMind 모델 카드 / 09.02
영상에 다 담지 못한 부분입니다. 특히 첫 번째는 오해가 많습니다.
제미나이 3.8 플래시의 API 토큰 가격이 2027년 1월 1일부터 입력 $0.75 → $1.50, 출력 $3.75 → $7.50으로 정확히 두 배가 됩니다. 100만 토큰당 가격이라 개발자·자동화용 API를 쓰는 경우에만 해당됩니다. 제미나이 앱이나 구독 요금이 오르는 게 아닙니다.
클로드의 25~45% 절감은 API 캐시 값을 내린 결과입니다($1 → $0.25). 기본 단가는 그대로입니다. 구독으로 쓰는 사람은 바뀐 게 하나도 없습니다.
제미나이는 옛 코딩 시험지에서 1등(89.4%)인데, 어려운 새 시험지에서는 19.1%로 꼴찌입니다(클로드 55.8%). 어느 회사도 자기가 진 시험지를 앞세우지 않습니다.
작성 2026년 9월 7일. 모델과 가격은 자주 바뀝니다 — 중요한 판단 전에는 위 원문을 직접 확인하세요.
이 글의 모든 수치는 위 출처에서 다시 확인한 값입니다.