요즘IT
위시켓
AIDP - AX
Rise ERP
콘텐츠프로덕트 밸리
요즘 작가들컬렉션물어봐
놀이터
콘텐츠
프로덕트 밸리
요즘 작가들
컬렉션
물어봐
놀이터
새로 나온
인기
개발
AI
IT서비스
기획
디자인
비즈니스
프로덕트
커리어
트렌드
스타트업
서비스 전체보기
위시켓요즘ITAIDP - AXRise ERP
고객 문의
02-6925-4867
10:00-18:00주말·공휴일 제외
yozm_help@wishket.com
요즘IT
요즘IT 소개작가 지원
기타 문의
콘텐츠 제안하기광고 상품 보기
요즘IT 슬랙봇크롬 확장 프로그램
이용약관
개인정보 처리방침
청소년보호정책
㈜위시켓
대표이사 : 박우범
서울특별시 강남구 테헤란로 211 3층 ㈜위시켓
사업자등록번호 : 209-81-57303
통신판매업신고 : 제2018-서울강남-02337 호
직업정보제공사업 신고번호 : J1200020180019
제호 : 요즘IT
발행인 : 박우범
편집인 : 노희선
청소년보호책임자 : 박우범
인터넷신문등록번호 : 서울,아54129
등록일 : 2022년 01월 23일
발행일 : 2021년 01월 10일
© 2013 Wishket Corp.
로그인
요즘IT 소개
콘텐츠 제안하기
광고 상품 보기
AI

Opus 5.5와 GPT-6 Sol 등장: ‘작업당 비용’ 전쟁의 서막

미어캣
7분
1시간 전
195
에디터가 직접 고른 실무 인사이트 매주 목요일에 만나요.
newsletter_profile0명 뉴스레터 구독 중
같은 날 공개된 Claude Opus 5.5와 GPT-6 Sol·Luna. AI 모델 경쟁의 무게중심이 성능에서 비용 효율로 이동하고 있습니다.  <출처: Anthropic과 OpenAI 이미지를 편집함>

 

9월 22일, 앤트로픽이 Claude Opus 5.5를 공개했습니다. 약 90분 뒤에는 OpenAI가 GPT-6 Sol과 Luna를 내놨고요. 하루에 새 모델이 셋 나온 겁니다.

 

그런데 두 발표문을 나란히 놓고 보니, 성능 점수보다 먼저 눈에 들어오는 게 있었습니다. 가격입니다.

 

이번 모델 전쟁의 핵심은 “누가 가장 똑똑한가?”가 아닙니다. “같은 일을 누가 가장 싸게 끝내는가?”에 가깝습니다.


[핵심 관전 포인트]

  • Opus 5.5와 GPT-6 Sol·Luna가 약 90분 간격으로 나왔고, 두 회사 모두 가격 인하를 전면에 내세웠습니다.
  • 세 모델은 같은 체급이 아닙니다. 순위보다 각 회사가 상위 모델의 역량을 어느 가격대까지 내렸는지를 봐야 합니다.
  • 두 회사 모두 벤치마크 점수 옆에 ‘작업당 비용’을 함께 내걸기 시작했습니다.
  • 싼 Luna급과 Sol·Opus급을 업무 난이도에 따라 나눠 쓰는 ‘모델 라우팅’이 중요해졌습니다.
 

새 모델 3종, 핵심만 정리하면

  • Claude Opus 5.5: Claude 5.5 패밀리의 첫 모델입니다. 앤트로픽은 “대부분의 작업에서 Fable 5.1 수준”이라고 주장합니다. 출력 속도는 30% 빨라졌고요. 아모데이 CEO의 ‘프런티어 속도 조절’ 발언 이후 나온 첫 모델이기도 합니다.
  • GPT-6 Sol·Luna: Sol은 복잡한 에이전트 작업을, Luna는 목적이 명확한 대량 작업을 겨냥한 모델입니다.
  • 제공 채널: Opus 5.5는 Claude Platform과 AWS·Google Cloud·Azure에서, Sol·Luna는 API와 ChatGPT Work·Codex에서 바로 쓸 수 있습니다.

 

가격은 100만 토큰 기준입니다.

 

100만 토큰 기준 API 가격표: Claude Opus 5.5 입력 $4·캐시 $0.20·출력 $20, GPT-6 Sol 입력 $2·출력 $10, GPT-6 Luna 입력 $0.10·출력 $0.50, 이전 세대 Claude Opus 5·GPT-5.6 Sol 가격도 함께 비교
Opus 5.5와 GPT-6 Sol·Luna의 API 가격 비교. 세 모델 모두 이전 세대보다 저렴해졌습니다. 단위는 100만 토큰입니다. <출처: 오픈AI·앤트로픽 발표문>

 

앤트로픽은 토큰 가격을 20% 내렸고, 일반 작업 기준으로는 40% 저렴해졌다고 말합니다. OpenAI는 GPT-5.6 대비 50% 인하를 내걸었죠.

 

다만 OpenAI의 “50%”에는 조건이 있습니다. 사이먼 윌리슨(Simon Willison)에 따르면 비교 기준인 GPT-5.6 가격은 11월에 25% 오를 예정인 프로모션가입니다. GPT-6 가격은 정가라고 OpenAI 대변인이 확인했고요. 착시가 조금 섞였지만 인하인 건 분명합니다.

 

그렇다면 셋의 위치는 어떨까요?  

 

OpenAI의 최상위 모델은 9월 3일 먼저 나온 GPT-6 Astra(입력 $10, 출력 $50)입니다. Sol은 그 아래에서 복잡한 코딩과 에이전트 워크플로를, Luna는 대량 작업을 맡죠. OpenAI 개발자 계정의 표현으로는 “Build with Sol. Scale with Luna.”입니다.

 

앤트로픽도 Opus 5.5 위에, Astra와 같은 가격대인 Fable 5.1을 두고 있습니다.

 

결국 이번 출시는 두 회사가 각자 최상위 모델의 역량을 한 단계 아래 가격대로 끌어내린 사건입니다.

 

 

90분 만에 반값이 된 가격표

처음에는 성능 대결처럼 보이지만, 두 발표는 서로를 직접 겨누지 않았습니다.

 

앤트로픽의 벤치마크 표에는 GPT-6 Astra와 GPT-5.6 Sol이, OpenAI의 차트에는 Opus 5가 올라가 있습니다. 두 발표 자료 모두 상대 회사가 같은 날 내놓은 신제품이 아니라 기존 모델을 비교 대상으로 삼은 거죠. Opus 5.5와 GPT-6 Sol을 같은 조건에서 직접 비교한 자료는 양쪽 어디에도 없습니다.

 

재미있는 건 가격표를 겹쳐 볼 때입니다. 사이먼 윌리슨이 짚었듯, Opus 5.5의 새 가격은 공개 시점에 GPT-5.6 Sol과 같았습니다. 그런데 90분 뒤 OpenAI가 Sol을 그 절반 가격에 내놓은 겁니다. 컨텍스트도 Opus 5.5가 1M 토큰, Sol이 1.05M 토큰(272K 초과분은 할증)으로 비슷해졌고요.

 

상위 역량을 아래 가격대로 내리는 출시가 하루에 두 번 나왔습니다. 이건 꽤 큰 변화입니다.

 

가격표 밖에서도 시작된 경쟁

두 회사의 경쟁은 API 가격에서 끝나지 않습니다. OpenAI의 티보 소티오는 Sol과 Luna 출시와 함께 Plus·Pro·Business 사용자 계정에 ‘저장형 리셋’ 1회를 지급한다고 밝혔습니다. 소진한 Codex·ChatGPT Work 사용 한도를 다시 채워, 원하는 시점에 사용할 수 있는 이용권입니다.

 

Anthropic도 대상 사용자에게 5시간 또는 주간 사용 한도를 복구해 주는 ‘무료 리셋’을 도입했습니다. 다만 모든 계정에 상시 제공되는 혜택은 아니며, 대상과 만료일은 계정마다 다릅니다. 이제 경쟁은 모델을 얼마나 싸게 제공하느냐를 넘어, 구독자가 얼마나 오래 사용할 수 있게 하느냐로도 번지고 있습니다.

 

 

관전 포인트 3가지

1. 성능은 제자리인데 가격은 반값?

이번 발표에서 가장 눈에 띈 건 벤치마크 차트의 모양입니다. 두 회사 모두 성능 점수만 보여주지 않고, 정확도와 작업당 비용을 함께 표시했습니다.

 

Anthropic은 기본 추론 강도의 Opus 5.5가 Terminal-Bench에서 GPT-6 Astra와 비슷한 성능을 약 40%의 비용으로 냈다고 주장합니다. OpenAI는 AutomationBench에서 GPT-6 Sol이 xhigh 추론 강도에서 33.2%를 기록했고, 작업당 비용은 $0.27이었다고 밝혔고요.

 

결국 두 회사 모두 “얼마나 높은 점수를 받았는가”뿐만 아니라 “그 점수를 얻는 데 얼마가 들었는가”를 강조하기 시작한 겁니다.

 

독립 평가에서도 비슷한 흐름이 보입니다. Artificial Analysis에서 GPT-6 Sol의 최고 점수는 48점으로, 전작의 47점보다 1점 오르는 데 그쳤습니다. 반면 작업당 비용은 $1.99에서 $1.06으로 거의 절반이 됐습니다.

 

성능이 크게 뛰었다기보다, 비슷한 성능을 훨씬 싸게 제공한 셈입니다. 이번 모델의 핵심이 성능보다 가격에 있다는 가장 선명한 숫자죠.

 

지능 지수 대비 작업당 비용 그래프. Claude Opus 5.5가 지능 지수 최고이자 비용도 가장 높고, GPT-6 Sol·Luna는 왼쪽 아래 저비용 구간에서 Pareto 라인을 그리며 위치
GPT-6 Sol의 지능 지수는 전작보다 1점 높아졌지만, 작업당 비용은 $1.99에서 $1.06으로 약 절반 줄었습니다. 위로 갈수록 성능이 높고, 왼쪽으로 갈수록 비용이 낮습니다. <출처: Artificial Analysis>

 

물론 회사가 공개한 그래프를 그대로 직접 비교하면 안 됩니다. 모델마다 추론 강도와 실행 환경이 다르고, 일부 작업에는 다른 모델로 넘기는 폴백도 적용됩니다. 같은 이름의 벤치마크도 측정 조건에 따라 점수가 5%포인트 넘게 달라지기도 하고요.

 

실제로 공개된 최고점 기준으로 GPT-6 Sol은 일부 코딩과 컴퓨터 조작 평가에서 GPT-5.6 Sol보다 낮았습니다. 완전히 동일한 조건의 비교는 아니지만, 이번 출시가 최고점 상승보다 비용 절감에 초점을 맞췄다는 점은 분명해 보입니다.

 

2. 진짜 눈여겨볼 가격은 ‘캐시’입니다

제가 더 흥미롭게 본 건 가격표의 ‘캐시 입력’ 칸입니다.

 

프롬프트 캐싱은 모델이 한 번 읽은 문맥을 저장해뒀다가, 다시 쓸 때 훨씬 싼 값에 불러오는 기능입니다. 코딩 에이전트는 매 턴 코드베이스와 대화 기록, 도구 설명을 다시 읽거든요. 에이전트 비용은 이 칸이 좌우합니다.

 

앤트로픽은 에이전트·코딩 비용의 대부분이 캐시 읽기라며 캐시 가격을 60% 내려 $0.20으로 만들었습니다.

 

OpenAI는 기존의 90% 캐시 읽기 할인율을 유지하면서 기본 캐시 적중률을 높였습니다. 추론 강도나 사용 도구를 바꿔도 기존 캐시가 유지되도록 했고, 개발자가 캐시할 프롬프트 경계를 직접 지정할 수 있게 했습니다.

 

여기서 계산이 달라집니다. Opus 5.5와 GPT-6 Sol의 캐시 단가가 $0.20으로 같아졌거든요.

 

표면 입력가는 $4 대 $2로 두 배 차이입니다. 하지만 캐시 비중이 높은 에이전트 작업에서는 그 격차가 훨씬 줄어들 수 있습니다.

 

3. 최고 모델 하나만 고르면 될까?

Next.js Agent Evals는 출시 당일 31개 과제를 high effort로, 각자의 하네스(Claude Code/Codex)에서 돌린 결과입니다.

 

Next.js 에이전트 평가표: Claude Opus 5.5·GPT-6 Sol 공동 1위 성공률 97%·과제당 $0.234·$0.244, Claude Fable 5.1 97%·$0.722, GPT-6 Astra 90%·$0.891, GPT-6 Luna 77%·$0.011로 최저 비용
31개 개발 과제에서 Opus 5.5와 GPT-6 Sol은 97%의 성공률을 기록했습니다. Luna는 AGENTS.md를 제공했을 때 성공률이 77%에서 87%로 올랐습니다. <출처: Vercel Next.js Agent Evals>

 

상위권 성공률은 97%로 같습니다. 그런데 같은 결과를 내는 데 Fable 5.1은 Opus 5.5의 3배 비용이 들었습니다. Luna는 77%로 낮지만 비용이 약 20분의 1이고요. AGENTS.md 문서를 함께 주면 Luna의 성공률은 87%까지 올라갔습니다.

 

물론 과제 수가 31개라 한 문제 차이가 약 3%포인트입니다. pass@4는 네 번 중 한 번만 성공해도 통과하는 방식이라, 일반적인 단발성 실사용 성공률과도 다릅니다. 출시 당일 결과인 만큼 여기까지는 지켜봐야 합니다.

 

그래도 방향은 보입니다. 반복적이고 기준이 명확한 작업은 Luna급에 먼저 맡기고, 실패하거나 신뢰도가 낮은 결과만 Sol급으로 올립니다. 장기·고난도 작업만 Opus나 Astra급에 태우는 식이죠.

 

쉬운 일은 저렴한 모델부터 처리하는 모델 라우팅 단계도. 1단계 GPT-6 Luna로 시도해 부족하면 2단계 GPT-6 Sol, 더 어려우면 3단계 Opus 5.5 또는 GPT-6 Astra로 승격, 충분하면 그 단계에서 종료
저렴한 Luna부터 작업을 맡기고, 결과가 부족할 때만 Sol과 Opus 5.5·Astra로 올리는 모델 라우팅 예시입니다. <출처: 작가, gpt로 제작>

 

사이먼 윌리슨도 출시 당일 기본값을 Codex는 GPT-6 Sol로, Claude Code는 Opus 5.5로 바꿨다고 밝혔습니다. 데모용으로는 Luna를 썼는데, SQL 질의와 HTML·자바스크립트 작성에서 “빠르고 유능하다(fast and competent)”고 평했고요.

 

결국 비싼 모델 하나로 모든 일을 시키는 시대가 끝나고 있습니다.

 

 

실사용자에게는 무엇이 달라질까?

가장 먼저 달라지는 건 습관입니다. 작업마다 모델과 추론 강도를 고르는 게 비용을 가릅니다.

 

높은 추론 강도가 늘 나은 것도 아닙니다. 사이먼 윌리슨의 테스트에서 Opus 5.5의 max effort는 생각을 너무 오래 하다 SVG 하나 그리는 데 실패했습니다. 회당 $2.56에 약 20분이 들었죠.

 

제품팀이라면 비용 때문에 미뤄둔 기능 목록을 다시 꺼낼 때입니다. 문서 자동 분류, 고객 문의 요약, 결과물 1차 검수 같은 것들이요. 과제당 $0.011에 도는 모델이 생기면서 “돌려두기엔 비싸다”는 계산이 달라졌습니다.

 

기업이라면 API 단가 말고도 볼 게 늘었습니다. 캐시 적중률, 세이프가드 폴백 정책, 클라우드 제공처와 데이터 저장 지역, 구독 요금제의 사용 한도 같은 것들이죠. 앤트로픽은 이번에 5시간 한도를 상향하고 리셋 기능을 넣었습니다. 폐지가 아니라 상향이고, API 가격과는 별개입니다.

 

단가 한 줄보다 운영 조건 전체가 총비용을 정합니다.

 

 

더 싸진 AI, 총비용도 줄어들까?

모델이 싸지면 AI 지출도 줄어들까요? 저는 오히려 반대일 가능성이 크다고 봅니다.

 

자원이 싸지면 전체 사용량이 늘어난다는 ‘제번스 역설’이 에이전트에도 적용될 수 있거든요. 작업당 비용이 내려가면, 지금까지 비용 때문에 자동화하지 못했던 일도 AI에 맡길 수 있게 됩니다.

 

어디까지나 해석이지만, 양사가 캐시와 경량 모델 가격을 이렇게까지 공격적으로 내린 이유와도 맞아떨어집니다.

 

 

마치며

그렇다고 곧바로 승자를 고를 수 있는 건 아닙니다. 지금 공개된 숫자 대부분은 각 회사가 고른 조건에서 나온 결과이고, 실사용 평가는 이제 막 시작됐으니까요.

 

다만 분명한 건, 이번엔 두 회사 모두 “더 똑똑해졌다”는 말만으로 모델을 설명하지 않았다는 겁니다. 같은 결과를 얼마나 적은 비용으로 만들 수 있는지를 함께 보여줬죠.

 

다음 승자는 벤치마크 1위 모델이 아닐지도 모릅니다. 비용 때문에 맡기지 못했던 일을 가장 많이 자동화하는 모델, 그게 진짜 승자가 될 수 있을 것 같네요. 

 

이 글은 AI의 도움을 받아 작성했습니다.

 

ⓒ요즘IT의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재와 복사, 배포 등을 금합니다.