요즘IT
위시켓
AIDP - AX
Rise ERP
콘텐츠프로덕트 밸리
요즘 작가들컬렉션물어봐
놀이터
콘텐츠
프로덕트 밸리
요즘 작가들
컬렉션
물어봐
놀이터
새로 나온
인기
개발
AI
IT서비스
기획
디자인
비즈니스
프로덕트
커리어
트렌드
스타트업
서비스 전체보기
위시켓요즘ITAIDP - AXRise ERP
고객 문의
02-6925-4867
10:00-18:00주말·공휴일 제외
yozm_help@wishket.com
요즘IT
요즘IT 소개작가 지원
기타 문의
콘텐츠 제안하기광고 상품 보기
요즘IT 슬랙봇크롬 확장 프로그램
이용약관
개인정보 처리방침
청소년보호정책
㈜위시켓
대표이사 : 박우범
서울특별시 강남구 테헤란로 211 3층 ㈜위시켓
사업자등록번호 : 209-81-57303
통신판매업신고 : 제2018-서울강남-02337 호
직업정보제공사업 신고번호 : J1200020180019
제호 : 요즘IT
발행인 : 박우범
편집인 : 노희선
청소년보호책임자 : 박우범
인터넷신문등록번호 : 서울,아54129
등록일 : 2022년 01월 23일
발행일 : 2021년 01월 10일
© 2013 Wishket Corp.
로그인
요즘IT 소개
콘텐츠 제안하기
광고 상품 보기
AI

아니요, 로컬 모델이 승리하진 않을 겁니다

요즘IT의 번역글
7분
2시간 전
280
에디터가 직접 고른 실무 인사이트 매주 목요일에 만나요.
newsletter_profile0명 뉴스레터 구독 중

이 글은 요즘IT가 AI의 도움을 받아, 션 고데크(Sean Goedecke)의 글 <No, local models will not win>를 번역한 글입니다. 필자는 GitHub의 스태프 소프트웨어 엔지니어(Staff Software Engineer)로, GitHub Copilot 관련 개발을 담당하고 있습니다. 수학 학사와 도덕철학 석사라는 이색적인 배경을 지닌 엔지니어로, Zendesk를 거쳐 2021년 GitHub에 합류했으며, 소프트웨어 엔지니어링과 대기업 조직의 역학을 주제로 한 인기 블로그를 운영하고 있습니다.

 

이 글은 새로운 오픈웨이트(open-weight) 모델이 나올 때마다 반복되는 “로컬 모델이 결국 미래다”라는 주장에 정면으로 반박합니다. 필자는 로컬 모델이 아무리 강해져도 대부분의 추론(inference)은 결국 AI 데이터센터에서 이뤄질 것이라고 단언하며, 그 근거로 성능 격차, 비용·효율 구조, 배칭(batching)의 경제학을 차례로 짚습니다.

 

필자에게 허락을 받고 번역했으며, 글에 포함된 링크는 원문에 따라 표시했습니다.

 

새로운 오픈 웨이트(Open Weights), 모델의 가중치를 공개한 형태) AI 모델이 출시될 때마다 사람들은 “로컬 모델이 미래”라고 말합니다. 모두가 노트북이나 휴대폰에서 AI 모델을 실행할 수 있게 된다면, 굳이 수십억 달러를 들여 데이터센터를 구축할 필요가 있겠느냐는 것이죠. 하지만 저는 이런 생각이 결국 실패할 것이라고 봅니다. 오픈 웨이트 모델이 아무리 강력해지더라도 대부분의 AI 작업은 결국 데이터센터에서 이루어질 것입니다.

 

 

로컬 모델은 널리 쓰이기에는 너무 약합니다

로컬 모델*은 최첨단 모델만큼 강력해지기 어려울 겁니다. 이 점은 분명하다고 생각합니다. 현재 존재하는 모든 최첨단 모델은 폐쇄형이든, 오픈 웨이트든 데이터센터의 GPU 클러스터가 아니면, 실행하기에 너무 큽니다. 물론 시간이 지나면서 더 작은 모델도 점점 똑똑해질 겁니다. 1년 뒤에는 지금의 GPT-5.6-Sol 정도의 성능을 내는 모델을 노트북에서 실행할 수 있을지도 모릅니다. 하지만 그때가 되면 여러분은 GPT-5.6-Sol 정도의 성능을 더 이상 유용하다고 생각하지 않을 겁니다.

*로컬 모델: 클라우드 서버 대신 내 개인 컴퓨터나 온프레미스 장비에서 직접 실행하는 인공지능 대형 언어 모델

 

많은 사람이 이 마지막 부분을 부정하지만, 저는 실제로 그렇다고 생각합니다. 사람들은 결국 자신이 지불할 수 있는 범위에서 가장 강력한 모델을 선택합니다. 만약 AI의 발전이 GPT-4에서 멈췄다면, GPT-4를 기반으로 아주 강력한 도구들을 만들 수 있었을 겁니다. 하지만 지금 누가 GPT-4를 쓰고 싶어 할까요?

 

LLM(대규모 언어 모델)이 더 강력해질수록 우리의 기대 수준도 함께 높아졌습니다. 이제 우리는 에이전트 시스템이 점점 더 많은 문제를 스스로 해결하기를 기대합니다. AI가 혼란스러워하거나 작업을 중단하면 굉장히 답답하게 느껴지죠. 선택권이 있다면 사람들은 자신을 덜 답답하게 만드는 모델을 선택할 겁니다. 그리고 그 모델은 결국 더 크고 강력한 모델일 가능성이 높습니다.

 

 

로컬 모델은 더 비싸고 비효율적입니다

게다가 같은 모델을 실행한다면 데이터센터가 항상 더 저렴할 겁니다. 사람들이 왜 계속 로컬 모델이 저렴하다고 말하는지 저는 이해하기 어렵습니다. 마치 우버를 운전하는 것이 ‘공짜 돈’이라고 말하는 것과 비슷한 실수라고 생각합니다. 자동차의 연료비와 유지·감가 비용을 무시하고 있기 때문이죠.

 

집에서 저사양 GPU 서버를 구축하는 데 드는 초기 비용만 생각해도, AI 서비스 몇 가지를 유료 구독하는 데 몇 년은 쓸 수 있는 금액입니다. 전력 비용까지 고려하면, AI를 얼마나 많이 사용하는지에 따라 한 달에 약 50~300달러가 들어갑니다. 역시 유료 AI 서비스 몇 개를 더 구독할 수 있는 돈입니다.

 

그렇다면 왜 데이터센터에서 실행하는 모델이 더 저렴할까요? 데이터센터의 AI 작업 비용이 보조금을 받아서 그런 것이 아닙니다. 실제로 AI 추론(inference, AI가 입력을 받아 결과를 생성하는 과정)은 상당히 저렴한 편입니다. 같은 모델을 로컬과 데이터센터에서 실행한다고 가정하면, 데이터센터에서 실행하는 쪽이 구조적으로 훨씬 효율적입니다.

 

가장 큰 이유는 배칭(batching, 여러 사용자의 요청을 묶어서 한꺼번에 처리하는 방식)입니다.

 

GPU는 수십만 개의 수학 연산을 한 번에 처리할 때나, 하나의 연산을 처리할 때나 거의 비슷한 시간 안에 처리할 수 있습니다. 하지만 한 사용자가 AI를 사용할 때는 이전에 생성한 토큰(token, AI가 텍스트를 생성할 때 사용하는 기본 단위)의 결과가 다음 토큰을 생성하는 데 필요하기 때문에, 한 사용자의 요청을 여러 개로 묶어 처리하기는 어렵습니다.

 

반면 수백 명의 사용자가 동시에 AI를 사용한다면 이들의 작업을 함께 묶어 처리할 수 있습니다. 수백 명의 요청을 한꺼번에 처리해도, 사용자 한 명의 요청을 처리할 때와 비교해 필요한 시간이나 전력 소비가 크게 늘어나지 않습니다.

 

집에서 직접 AI를 실행하면 이런 식으로 묶을 사용자가 없습니다. 많아야 몇 개의 AI 에이전트를 동시에 실행하는 정도죠. 결국 GPU 활용률이 매우 낮아집니다. 비용을 지불하고 있지만 실제로 사용하지 못하고 버려지는 처리 능력이 상당한 것입니다.

 

이를 해결하는 유일한 방법은 친구들과 함께 로컬에서 실행하는 AI 서버를 공유하는 것입니다. 그런데 그렇게 되면 사실상 형편없는 자체 데이터센터를 운영하는 것과 크게 다르지 않습니다.

 

또 다른 이유는 데이터센터가 더 크고 효율적인 GPU를 사용할 수 있다는 점입니다.

 

로컬 모델을 돌릴 때 사용하는 GPU는 RTX 4090 같은 게이밍 GPU인 경우가 많습니다. 반면 AI 작업을 위해 설계된 데이터센터용 B200은 같은 전력량으로 약 3배의 연산 성능과 거의 4배에 달하는 메모리 대역폭(memory bandwidth, GPU가 메모리에 데이터를 읽고 쓰는 속도)을 제공합니다.

 

배칭과 GPU 효율을 모두 고려하면, 같은 모델을 로컬에서 실행하는 데 필요한 자원은 데이터센터보다 대략 30배 더 많다고 볼 수 있습니다.

 

그래서 저는 ‘로컬 모델이 데이터센터의 거대한 자원을 사용하지 않아 친환경적이다’라는 주장에도 의문이 듭니다. LLM을 효율적으로 실행하고 싶다면 오히려 가능한 한 많은 AI 작업을 데이터센터로 보내야 합니다.

 

물론 이 사람들이 말하고 싶은 것은, 자원 사용량이 적은 더 작은 모델을 사용해야 한다는 것일 수도 있습니다. 하지만 그렇다고 해도 직접 작은 모델을 운영하기보다는, 예를 들어 GPT-5.6 Luna API처럼 작은 모델을 제공하는 API를 사용하는 편이 이상적입니다.

 

 

그렇다면 로컬 모델이 이길 가능성은 없을까?

그럴 가능성이 전혀 없는 것은 아닙니다.

 

예를 들어 정부가 AI 데이터센터의 사용 자체를 금지하는 상황이 올 수도 있습니다. AI의 위험성에 대한 우려 때문일 수도 있고, 단순히 대중의 압력에 정부가 굴복하기 때문일 수도 있습니다. 그런 세상에서는 로컬 모델이 유일한 선택지가 될 겁니다.

 

또는 대규모 모델의 AI 발전이 어떤 이유로 정체되고, 작은 모델만 계속 발전하는 상황이 올 수도 있습니다. 이런 일이 어떻게 가능한지는 잘 상상이 되지 않습니다. 정부 개입 같은 특별한 상황을 제외한다면 말이죠. 하지만 파라미터(parameter, 모델이 학습을 통해 조정하는 값)가 300억 개(30B) 정도인 모델이 최첨단 모델이 될 수 있는 세상이라면 로컬 모델도 충분히 경쟁력을 가질 수 있습니다.

 

혹은 모델이 너무나 강력해져서 300억 개의 파라미터를 가진 모델만으로도 모든 일을 처리할 수 있게 될 수도 있습니다. 그렇다면 리만 가설을 풀려고 하는 사람이 아닌 이상 굳이 Opus나 Sol 같은 모델을 사용할 필요가 없겠죠.

 

저는 이것도 별로 믿지 않습니다. 오늘날 모델은 이미 최첨단 수준의 수학 문제를 풀 수 있습니다. 그런데도 대규모 코드베이스를 리팩터링(refactoring, 기존 코드를 유지·보수하기 쉽게 개선하는 작업)하는 일은 저만큼 잘하지 못합니다. 그렇다면 모든 작업에서 가장 똑똑한 모델을 사용하고 싶지 않은 세상이 어떻게 올 수 있을지 상상하기 어렵습니다.

 

 

그렇다고 로컬 모델이 쓸모없는 것은 아닙니다

저는 로컬 모델이 앞으로도 분명 틈새 시장을 차지할 것이라고 생각합니다.

 

Thinking Machines가 제안한 ‘Interaction Models’의 놀라울 정도로 단순한 아이디어가 떠오릅니다. OpenAI도 비슷한 방식을 사용합니다. 핵심은 음성 대화처럼 지연 시간에 민감한 애플리케이션에서는 작고 빠른 모델이 대화를 담당하고, 어려운 사고가 필요한 경우 더 크고 느린 모델에 작업을 넘기는 것입니다.

 

5년 뒤에는 대부분의 AI 사용이 휴대폰이나 노트북의 로컬 모델을 통해 이루어질 수도 있다고 생각합니다. 다만 그런 세상이 오더라도 실제 작업의 대부분은 여전히 AI 데이터센터에서 처리될 것입니다.

 

물론 더 약하고 더 비싸더라도 로컬 모델을 선호하는 사용자도 있을 겁니다. 예를 들어, 모델을 로컬에서 직접 제어할 수 있다는 점이 일부 사용자에게는 결정적인 장점이 될 수 있습니다. 어떤 사람들은 자신의 인프라를 완전히 통제할 수 있다는 점을 중요하게 생각할 수도 있고, 인터넷 연결이 불안정할 수도 있습니다.

 

이런 사람들에게, 특히 AI를 대화하는 정도의 용도로만 사용한다면 로컬 모델은 좋은 선택입니다. 하지만 저는 이런 사람들이 언제까지나 소수일 것이라고 생각합니다. 대부분의 사용자는 계속해서 데이터센터를 통해 AI를 사용할 겁니다.

 

작가의 덧붙임:

이 글에는 Hacker News와 Lobste.rs에서 다양한 의견이 달렸습니다. 일부 댓글에서는 AI 산업이 완전히 붕괴한다면 모든 상황이 달라질 수 있다고 지적했습니다. 물론 그럴 가능성은 있습니다. 하지만 저는 AI 버블이 꺼진다고 해서 AI 제품 산업 자체가 그렇게까지 심각하게 붕괴할 것이라고는 생각하지 않습니다.

 

또 어떤 사람들은 사람들이 항상 더 강력한 모델을 선택할 것이라는 제 가정에 반대하며, 자신들이 직접 로컬 AI를 사용해 본 경험을 공유했습니다. 로컬 모델을 사용하는 것은 전혀 문제가 없다고 생각합니다. 다만 해커 포럼에서는 로컬 모델 사용자가 실제보다 더 많아 보일 가능성이 있다고 생각합니다.

 

마지막으로 일부 독자들은 제가 ‘win(승리한다)’이라는 단어를 사용한 것에 불편함을 표했습니다. 저는 꽤 일반적인 표현이라고 생각합니다. 여기서 제가 말하는 ‘승리’란 사람들이 클라우드에서 AI를 사용하는 대신 모두 로컬에서 AI를 실행하게 되는 상황을 의미합니다.

 

  • 정확히 말하면 병목은 모델의 가중치(weights, 모델이 학습을 통해 갖게 된 값)를 GPU로 옮기는 과정입니다. 이 과정은 한 사용자의 토큰을 처리할 때나 100명의 사용자 토큰을 처리할 때나 수행해야 하며, 걸리는 시간도 동일합니다.
  • 이 수치는 LLM의 도움을 받아 추정한 것이며, NVIDIA의 관련 수치와 GPU 아키텍처 자료를 통해 직접 확인할 수 있습니다.
  • 물론 안정적인 전력 공급이 가능하고, 집에 AI용 GPU 서버를 구축할 만큼 충분한 비용을 감당할 수 있다는 전제하에서 말입니다.

 

*이 글은 AI를 통해 번역한 글입니다. 오역이나 어색한 표현이 있다면 댓글로 알려주시면 감사하겠습니다. 


<원문>

No, local models will not win

 

ⓒ요즘IT의 모든 콘텐츠는 저작권법의 보호를 받는 바, 무단 전재와 복사, 배포 등을 금합니다.