"지금 모든 AI 연구소는 기업에 서비스를 제공하면서 손실을 보고 있습니다. 그들도 이 사실을 알고 있죠. 그리고 의도적으로 그렇게 하고 있습니다."

오픈 인퍼런스(open inference)가 왜 더 이상 선택이 아닌 필수인지 명확히 보여주는 3가지 숫자가 제 인박스에 도착한 바로 그 주, 한 아티클의 첫 문장은 이렇게 시작했습니다.

한 개발자가 주말 동안 오픈소스 코딩 에이전트와 직접 연결된 API 키를 사용해 간단한 메모 앱을 만들었습니다. 단 한 페이지, 단 하나의 기능이었죠. 드는 비용은 50달러였습니다. 하지만 다음 날, 월 20달러짜리 구독 서비스를 이용하자 50배 더 많은 토큰이 제공되었습니다.

저희 추론 팀의 한 엔지니어는 독점 API를 사용했다면 수천 달러가 들었을 작업을 오픈 웨이트 모델을 통해 이틀 만에 3억 개의 토큰을 소비하며 완료했습니다.

앞의 두 숫자는 보조금의 현실을 보여줍니다. 그리고 세 번째 숫자는 헤쳐 나갈 탈출구를 보여주죠. 그리고 우리가 그 탈출구를 필요로 하는 이유는 바로 에이전트 때문입니다.

가격 책정 모델의 전환기

프론티어 모델 제공업체들은 놀라운 성과를 거두었습니다. 이들은 2년 전만 해도 상상할 수 없었던 가격으로 수백만 명의 개발자가 세계적인 수준의 AI를 이용할 수 있게 했습니다. 이러한 접근성 덕분에 도입이 폭발적으로 증가했습니다. 또한 현재의 요율로는 지속 가능하지 않을 수 있는 경제 구조가 형성되었습니다.

AI는 과연 수익성이 있는가? 웹사이트는 AI 산업의 전반적인 재무 현황을 추적하고 있습니다. 이 에 참여한 한 전문가는 2024년 달러 가치를 기준으로 볼 때, 10년간의 총 AI 자본 지출(CapEx)이 미국 전역의 고속도로 시스템 전체 건설 비용의 약 3배에 달한다고 계산했습니다. 현재 AI 기업들은 매출의 약 195%를 지출로 사용하고 있습니다. 논의에 참여한 한 전문가는 2024년 달러 가치를 기준으로 볼 때, 10년간의 총 AI 자본 지출(CapEx)이 미국 전역의 고속도로 시스템 전체 건설 비용의 약 3배에 달한다고 계산했습니다. 이러한 규모의 투자금은 결국 서비스 가격 책정에 반영될 수밖에 없습니다.

이러한 전환의 조짐은 이미 나타나고 있습니다. 토큰 기반 과금이 고정 요금 서브스크립션을 대체하고 엔지니어 1인당 비용이 월 500~2,000달러에 달함에 따라, 일부 대기업이 AI 코딩 툴 라이선스를 재검토하고 있다는 리포트가 전해졌습니다. 최신 프론티어 모델은 태스크당 토큰을 10~25% 더 많이 소비하면서도 벤치마크 성능 향상은 미미한 수준입니다. GPU 공급은 이미 향후 3-4년 동안 예약이 완료되었으며, 여러 GPU 클라우드 제공업체의 용량은 이미 매진되었습니다.

이는 제공업체를 비판하려는 것이 아닙니다. 제공업체들은 미래를 구축하고 도입을 가속화하기 위해 공격적인 가격 정책을 펼치고 있습니다. 토큰당 단위 비용은 계속 하락할 것으로 보이며, Gartner는 2030년까지 90% 감소할 것으로 예측합니다. 하지만 동일한 분석에서 언급했듯이, 에이전틱 워크로드는 태스크당 훨씬 더 많은 토큰을 소비하므로 단위 가격이 저렴해지더라도 기업의 총 추론 지출은 증가할 것으로 예상됩니다. Goldman Sachs는 2030년까지 토큰 소비가 24배 증가할 것으로 전망합니다. 향후 3~5년을 계획하는 기업은 비용 절감이 아닌 총비용 증가에 대비해야 합니다. 자체 관리형 인프라에서 실행되는 오픈소스 모델은 소비 규모가 확장됨에 따라 AI 접근성을 유지하는 데 도움을 주는 릴리스 밸브 역할을 합니다.

Figure 1: The agentic inference cost paradox. Per-token costs fall 90% (Gartner) but total consumption rises 24x (Goldman Sachs), resulting in higher aggregate enterprise spend despite cheaper units.

그림 1: 에이전틱 추론 비용의 역설 토큰당 비용은 90% 감소(Gartner)하지만 총 소비는 24배 증가(Goldman Sachs)하여, 단위 가격 하락에도 불구하고 기업의 총지출은 늘어납니다.

공식을 바꾼 에이전트

서브스크립션 가격 정책은 사람이 입력하는 속도에 맞춰 설계되었습니다. 에이전트는 수만 배 더 많은 API 호출을 생성하며, 기존의 어떤 가격 모델도 이를 고려하여 구축되지 않았습니다.

한 OpenClaw 기여자는 한 달 만에 OpenAI API 토큰으로 130만 달러를 소비했습니다. 이는 3명이 운영하는 약 100개의 Codex 인스턴스에서 발생한 760만 건의 요청을 통해 6,030억 개의 토큰을 사용한 결과입니다. 해당 계정은 단 하루 만에 19,985.84달러의 지출을 기록했습니다.

Jensen Huang은 에이전트의 토큰 소비가 기존 모델 사용량에 비해 약 1,000배 증가했다고 언급했습니다. Marc Andreessen은 Latent Space 팟캐스트에서 자신의 팀이 에이전트 실행을 위한 Claude 토큰에 하루 1,000달러를 지출하고 있으며, 완전히 배포된 개인용 에이전트당 하루 5,000~10,000달러의 잠재적 수요가 있다고 말했습니다. 가격이 10배 개선되더라도 여전히 하루 100달러가 소요됩니다. "여전히 사람들이 지불할 수 있는 수준을 훨씬 뛰어넘는 금액입니다."

일부 제공업체는 컴퓨팅 수요가 가격 모델이 감당할 수 있는 수준을 초과함에 따라, 이미 제3자 에이전트 프레임워크가 고정 요금 서브스크립션에서 실행되지 않도록 제한해야 했습니다. 고정 요금제와 자율 에이전트 워크로드는 구조적으로 일치하지 않습니다.

비용은 문제의 일부분일 뿐입니다. 에이전틱 워크로드에는 독점 API가 제공하도록 설계되지 않은 기술적 요구 사항이 있습니다.

API 단편화. 에이전틱 API 환경에는 여러 표준이 공존하며 경쟁하고 있습니다. Chat Completions(OpenAI의 초기 스테이트리스 형식), Responses API(툴 및 모델 컨텍스트 프로토콜 통합 기능이 내장된 OpenAI의 최신 스테이트풀 형식), Messages API(Anthropic 형식), Interactions API(Google의 에이전틱 프로토콜) 등이 있습니다. 각 API는 툴 호출, 상태 관리, 추론을 서로 다른 방식으로 처리합니다. 각 하네스마다 서로 다른 API를 선택합니다.

또한 각 모델 제품군은 동일한 툴 호출을 완전히 다른 태그로 래핑합니다. 5개의 모델에 get_weather(city="Seattle")를 전송하면 5가지의 서로 다른 형식이 생성됩니다. Llama는 <|python_tag|>를 사용한 Python 문법을, Mistral은 JSON 배열을 포함한 [TOOL_CALLS]을, Gemma는 태그를, Hermes는 XML을 사용합니다. 추론 엔진에는 모든 모델 제품군에 대해 별도의 파서가 필요합니다.

툴 호출. 독점 API를 사용하는 경우 제공업체가 제공하는 파서만 사용할 수 있습니다. 이를 사용자가 직접 정의할 수는 없습니다. 학습된 형식 대신 Python 구문을 출력하는 모델을 수정할 수도 없습니다. 사용자는 수동적인 입장에 머물 수밖에 없습니다.

모델 라우팅. 단일 에이전트 실행은 심층 추론, 빠른 분류, 코드 생성 등 다양한 특성을 가진 하위 태스크를 생성합니다. 이러한 태스크를 각기 다른 모델로 라우팅하려면 서빙 계층을 제어할 수 있어야 합니다. 단일 제공업체의 API를 사용하는 경우 모든 태스크가 동일한 가격으로 동일한 모델에 전달됩니다.

컨텍스트 엔지니어링. 여러 턴에 걸쳐 모델에 전달되는 정보를 관리하는 것은 가장 효과적인 최적화 방법입니다. 잘 조정된 컨텍스트 파이프라인은 출력 품질을 개선하는 동시에 토큰 사용량을 60~80%까지 줄일 수 있습니다. 하지만 효과적인 컨텍스트 엔지니어링을 위해서는 추론 수준에서 모델 동작에 접근할 수 있어야 합니다. 모델이 실제로 무엇에 주목하는지 측정하고, 어떤 컨텍스트 토큰이 출력 품질에 기여하는지 식별하며, 추측이 아닌 실제 어텐션 패턴을 기반으로 요약 및 검색 전략을 조정해야 하기 때문입니다.

회로 차단기. 추론 계층을 제어하지 못하면 모델 서버 수준에서 에이전트별 예산 설정, 이상 징후 감지 또는 자동 종료 기능을 구현할 수 없습니다. 무한 루프가 발생하는 상황을 직접 겪어본 입장에서 말씀드리자면, 제공업체는 이 문제를 해결해 주지 않습니다.

경제학자들은 이를 제번스의 역설(Jevons Paradox)이라고 부릅니다. William Stanley Jevons는 1865년에 이러한 패턴을 발견했습니다. 석탄 엔진의 효율성이 높아질수록 전체 석탄 소비량은 오히려 증가했습니다. AI 토큰 역시 동일한 경로를 걷고 있습니다. 효율성이 개선될 때마다 절감된 비용보다 더 많은 비용을 소비하는 새로운 활용 사례가 등장합니다. 토큰당 성과를 극대화하는 기업은 AI를 적게 쓰는 것이 아니라 더 많이 사용하게 될 것입니다.

에이전틱 작업을 위한 준비를 마친 오픈 모델

앞서 언급했듯이, 저희 추론 팀은 오픈 웨이트 모델을 사용하여 이틀 만에 3억 개의 토큰을 처리했습니다. Nemotron 3 Super, Gemma 4, Qwen 3.6은 모두 Red Hat AI 추론 스택에서 실행됩니다. 그 결과는 풀 요청(PR) 검토, 1차 구현, 타겟 조사 등에 충분히 활용될 수 있을 만큼 강력했으며, 프론티어 모델에 집중되어 토큰 비용이 누적되었을 작업의 부담을 덜어주었습니다.

비용 격차는 무시할 수 없는 수준입니다. 소비자용 Blackwell GPU 벤치마크에 따르면, 오픈 웨이트 모델을 실행하는 500달러짜리 GPU는 하루에 3,000만 개의 토큰을 처리할 수 있습니다. 이 정도 규모라면, 100만 토큰당 약 0.20달러인 저가형 API 제공업체를 이용할 때와 비교해 3개월 이내에 하드웨어 비용을 회수할 수 있습니다. 프론티어 API 가격과 비교하면 투자 회수 기간(ROI)은 며칠 단위로 단축됩니다.

한 연구원은 토큰당 40억 개의 매개변수만 활성화하는 모델을 사용하여 벤치마크에서 87%를 달성한 코딩 에이전트를 구축했습니다. 140억 개의 매개변수 모델을 사용하는 에이전트의 점수는 75%였습니다. 이러한 차이를 만든 것은 모델이 아니라 복합 툴과 오류 피드백 루프였습니다. 모델의 크기가 아니라 하네스가 핵심적인 역할을 수행했습니다.

에이전틱 시나리오에서 오픈 모델이 원활하게 작동하도록 하려면 실제 엔지니어링이 필요하며, 오픈소스는 바로 이러한 엔지니어링을 가능하게 합니다. OpenCode 및 Claude Code와 함께 실행되는 Gemma 4의 최근 데모는 맞춤형 채팅 템플릿 조정, 모델 제품군별 툴 호출 파서 튜닝, 여러 API 표준에 걸친 프롬프트 형식 지정을 통해 이것이 실제로 어떻게 구현되는지 보여줍니다. 40억 개의 매개변수 모델은 260억 개의 매개변수 양자화 버전과 다른 처리가 필요했고, 이는 다시 310억 개의 매개변수 모델과도 다른 방식이어야 했습니다.

이러한 작업이 벤치마크 성능과 실제 에이전틱 성능 사이의 격차를 좁혀줍니다. 여기에는 채팅 완료, 메시지 및 응답 API 간의 변환과 퍼지 로직을 사용한 모델 출력 구문 분석이 포함됩니다. 모델이 툴 호출 시작 토큰을 놓치거나 하네스의 시스템 프롬프트 영향으로 예기치 않은 구문을 생성하는 경우가 있기 때문입니다.

이러한 작업은 vLLM의 업스트림, 모델 벤더의 채팅 템플릿, 하네스 버그 리포트 등을 통해 진행되고 있습니다. 그리고 이는 개방형 환경에서만 가능합니다. 독점 추론 서버를 사용하면 채팅 템플릿 수정 사항을 제출하거나 툴 호출 파서를 조정할 수 없으며, 에이전트의 출력이 실패하는 이유조차 파악하기 어렵습니다. 오픈소스를 사용하면 모든 수정 사항이 모든 사용자에게 혜택을 주며, 파서 업그레이드는 영구적인 자산이 됩니다. 전체 서빙 스택에서 에이전틱 워크로드를 위해 오픈 웨이트 모델의 신뢰성을 확보하는 이러한 업스트림 통합 작업은 Red Hat AI의 핵심 집중 분야입니다.

에이전틱 추론 스택

엔터프라이즈 규모의 에이전틱 추론이 가능하려면 8개의 계층이 유기적으로 작동해야 합니다. 모든 계층은 서로 상호 작용합니다.

Figure 2: The agentic inference stack, from agent and harness at the top through API translation, gateway, guardrails, disaggregated serving, model server configuration, inference engine, and finally hardware at the bottom. Red borders highlight the 2 layers where most agentic compatibility work lives. The dashed sandbox boundary wraps the agent layer where code execution and security controls are tightest.

그림 2: 에이전틱 추론 스택은 최상단의 에이전트와 하네스부터 API 변환, 게이트웨이, 가드레일, 분산 서빙, 모델 서버 구성, 추론 엔진을 거쳐 최하단의 하드웨어에 이르기까지 구성됩니다. 빨간색 테두리는 대부분의 에이전틱 호환성 작업이 이루어지는 두 계층을 나타냅니다. 점선으로 표시된 샌드박스 경계는 코드 실행 및 보안 제어가 가장 엄격하게 이루어지는 에이전트 계층을 감싸고 있습니다.

개별 오픈소스 프로젝트에서 이러한 계층을 직접 조합하는 것은 가능하지만 운영 비용이 많이 듭니다. Red Hat AI와 같은 자체 관리형 추론 플랫폼의 가치는 사용자의 인프라에서 실행되는 검증된 지원 스택에 통합되어 있다는 점에 있습니다. 이를 통해 데이터가 보안 경계를 벗어나지 않으며, 업그레이드 주기, 모델 선택, 라우팅 정책을 직접 제어할 수 있습니다.

에이전틱 API 계층

API 다양성 문제는 실제로 존재합니다. 하네스는 Chat Completions, Responses, Messages, Interactions API 등을 사용하지만, 하단의 모델 서버가 이 모든 것을 지원하지는 않을 수 있습니다. 에이전틱 API 계층은 하네스와 인프라 사이에 위치하여 이러한 격차를 해소하는 데 도움을 줍니다. OGX(이전 명칭: Llama Stack)와 같은 프로젝트는 에이전틱 API의 오픈 구현을 제공합니다. 이러한 프로젝트는 사용자가 실행하는 모든 모델 서빙 계층 위에서 Chat Completions, Responses, Messages, Interactions API뿐만 아니라 벡터 저장소, 파일 관리, 툴 실행과 같은 보조 기능도 제공합니다.

일부 API의 선점 효과에도 불구하고, 현재로서는 단일 API 표준이 승리할 것으로 단정할 수 없습니다. 중요한 것은 이 모든 것을 오픈소스로 구현하여 필요할 때마다 모든 하네스를 모든 모델에 맞출 수 있도록 하는 것입니다. 변환 계층이 개방되어 있으면 전체 툴 호출 계약이 유지되므로 요청이 어떻게 처리되는지 정확히 확인할 수 있습니다. 독점 제공업체가 변환을 처리하면 어떤 정보가 손실되는지 알 수 없습니다.

llm-d: 에이전틱 추론 확장

단일 인스턴스 vLLM은 에이전트를 실행하는 한 명의 엔지니어에게는 적합하지만, 100명의 엔지니어가 동일한 모델에 동시에 접속하는 환경에는 맞지 않습니다. llm-d는 추론을 별도의 프리필(prefill) 및 디코딩 단계로 분할하여 각기 다른 하드웨어에서 독립적으로 확장할 수 있게 해주는 분산 서빙 계층입니다. 수많은 짧은 요청이 긴 추론 체인과 교차하는 에이전틱 워크로드에서 이러한 아키텍처는 점점 더 필수적인 요소가 되고 있습니다.

가드레일과 샌드박싱

콘텐츠 안전 기능 역시 이 스택에 포함되며 에이전트를 인식할 수 있어야 합니다. 프록시로 작동하는 가드레일 프레임워크는 툴 정의, 툴 선택, 추론 매개변수를 포함한 전체 에이전틱 API 계약을 유지해야 합니다. 그렇지 않으면 에이전트의 동작이 알 수 없는 이유로 저하될 위험이 있습니다.

효과적인 에이전틱 가드레일을 위해서는 단순한 텍스트 필터링 이상의 추론 수준 데이터에 접근해야 합니다. 여기에는 최종 출력 전 모델의 생각 사슬(CoT)에 안전하지 않은 단계가 있는지 평가하기 위한 추론 추적, 호출된 툴과 인수가 정책 내에 있는지 확인하기 위한 툴 호출 매개변수, 환각 위험 및 낮은 신뢰도의 출력을 감지하기 위한 토큰 수준의 로그 확률(logprobs), 그리고 감사 추적 및 컴플라이언스 로깅을 위한 생성 메타데이터 등이 포함됩니다. 이것이 추론 계층이 개방되어야 하는 또 다른 이유입니다. 입출력되는 텍스트만 볼 수 있는 가드레일은 에이전틱 워크로드에 충분하지 않습니다. 

가드레일 프록시가 툴 호출 매개변수를 제거하는 블랙박스라면, 에이전트가 실패했을 때 그 원인을 진단할 수 없습니다. 오픈소스 가드레일(예: NVIDIA NeMo Guardrails의 비프록시형 /v1/guardrails/checks 엔드포인트)은 에이전틱 API 계약을 유지하면서 콘텐츠 안전을 보장합니다.

샌드박싱 또한 중요한 요소입니다. 에이전트는 코드를 실행하고 파일을 작성하며 툴을 호출합니다. 심층 방어를 위해서는 컨테이너 수준의 격리, 네트워크 정책, 파일 시스템 제한, 런타임 강제 적용 등 계층화된 격리 조치가 필요합니다. 에이전트를 단순히 컨테이너에 배치하는 것만으로는 충분하지 않습니다. 스택 다이어그램에서 샌드박스 경계가 에이전트와 하네스를 감싸고 있는 이유는 그곳이 임의의 코드가 실행될 수 있는 지점이자 보안 제어가 가장 엄격해야 하는 곳이기 때문입니다.

오픈소스가 승리하는 이유

계층의 절반이 어떻게 작동하는지 알 수 없다면 8개 계층으로 구성된 스택을 제대로 테스트할 수 없습니다. 파서를 볼 수 없다면 실패한 툴 호출을 디버깅할 수 없습니다. 가드레일 프록시가 에이전트에게 필요한 매개변수를 임의로 삭제한다면 안전을 보장할 수 없습니다. 스택의 각 계층은 서로 밀접하게 결합되어 있어 어느 한 계층이라도 불투명해서는 안 됩니다. 이러한 계층을 통합하고 강화하여 기업이 직접 스택을 구성할 필요가 없도록 돕는 것이 바로 Red Hat AI가 해결하고자 하는 과제입니다.

기술적인 논거 외에도, 오픈 추론은 비용 이상의 구조적인 이유로 인해 필연적입니다.

Figure 3: Open inference vs. proprietary APIs for agentic workloads. Proprietary APIs lead on ease of setup and frontier model quality. Open inference leads on the 7 capabilities agentic workloads depend on in production: model routing, tool call debugging, domain customization, per-agent budgets, data residency, provider independence, and inference-level guardrails.

그림 3: 에이전틱 워크로드를 위한 오픈 추론과 독점 API 비교 독점 API는 설정의 간편함과 프론티어 모델의 품질 면에서 앞서 있습니다. 오픈 추론은 모델 라우팅, 툴 호출 디버깅, 도메인 맞춤화, 에이전트별 예산 관리, 데이터 레지던시, 제공업체 독립성, 추론 수준 가드레일 등 실제 운영 환경의 에이전틱 워크로드가 의존하는 7가지 기능 면에서 우위에 있습니다.

교육은 분야 전체의 발전을 가속화합니다. 오픈소스는 무료 소프트웨어와 자유로운 지식이라는 두 가지 가치를 제공합니다. DeepSeek R1이 이를 명확히 보여주었습니다. 추론 기능은 광범위한 커뮤니티에서 이를 복제하기 수개월 전부터 독점 모델에 존재했습니다. DeepSeek가 코드와 논문을 공개하자, 모든 주요 연구소는 3개월 이내에 추론 기능을 확보했습니다. 지식의 확산 효과는 모델 그 자체보다 더 큰 가치를 지닙니다. 에이전틱 추론에 적용된 모든 툴 호출 파서 수정, 채팅 템플릿 개선, 하네스 패치는 전체 생태계에 걸쳐 시너지를 내는 공유 인프라가 됩니다.

신뢰를 위해서는 투명성이 필요합니다. 모든 조직이 소수의 클라우드 모델 제공업체에 모든 데이터와 워크플로우를 맡기려 하지는 않습니다. 어떤 조직에게는 이것이 엄격한 컴플라이언스의 문제입니다. 의료 및 금융과 같은 산업은 데이터 프라이버시와 레지던시와 관련된 엄격한 규제 요건에 직면해 있습니다. 또한 벤더 종속성을 피하고 지적 재산에 대한 완전한 소유권을 유지하기 위한 전략적 선택이기도 합니다.

오픈소스는 조직이 시스템 작동 방식을 완전히 파악한 상태에서 자신들의 보안 경계 내에 원하는 조건으로 모델을 실행할 수 있는 옵션을 제공합니다. 규제 대상 산업, 정부 기관, 보안에 민감한 워크로드의 경우 이는 필수 사항입니다. 규제 역시 같은 방향으로 움직이고 있습니다. 2026년 8월부터 시행되는 EU AI 법의 투명성 의무에 따라 모델 아키텍처, 학습 절차, 성능 특성을 포함한 기술 문서화가 요구됩니다. 이러한 정보를 이미 공개하고 있는 오픈소스 모델은 폐쇄형 모델과 달리 면제 대상이 될 수 있습니다.

맞춤화에 필요한 자체 가중치 소유 폐쇄형 API 환경에서는 모든 조직이 동일한 모델을 사용합니다. 자체 인프라에서 가중치를 소유하면 독점 데이터를 외부로 전송하지 않고도 도메인, 내부 툴링, 코드베이스 규칙에 맞게 모델을 미세 조정할 수 있습니다. 의료 기관은 임상 용어와 환자 기록 형식에 맞춰 모델을 미세 조정합니다. 법무 팀은 관할 지역의 언어와 계약 구조에 맞게 모델을 조정합니다. 금융 기관은 자체 리스크 모델과 컴플라이언스 프레임워크를 기반으로 모델을 학습시킵니다. 에이전틱 워크로드에서 이는 범용 에이전트와 사용자의 시스템 작동 방식을 이미 이해하고 있는 에이전트 사이의 결정적인 차이를 만듭니다.

오픈소스는 생태계의 중력을 형성합니다. 하드웨어 벤더가 오픈소스 추론 소프트웨어에 투자하면 모델에 대한 접근성이 높아져 하드웨어 채택이 더욱 광범위해집니다. vLLM(추론 런타임) 최적화 및 오픈소스 서빙 스택 개선에 대한 투자는 모든 GPU가 에이전틱 워크로드를 더 효율적으로 처리하게 하며 하드웨어 재사용성을 높여줍니다. 그 결과 오픈소스 소프트웨어의 개선 사항이 생태계 전반에 시너지를 일으키는 선순환이 발생합니다.

다음 단계에서는 분산형 모델이 유리해질 것입니다. 새롭게 등장하는 패턴은 수많은 모델이 공유 지식 그래프와 컨텍스트 저장소에서 작동하는 '공유 컨텍스트 중심' 방식입니다. 이는 단일 거대 모델에서 지능형 하네스에 의해 조정되는 전문화된 모델 생태계로 초점을 전환합니다. 모든 것을 할 수 있는 하나의 모델이 반드시 필요한 것은 아닙니다. 오히려 각자의 분야를 잘 수행하는 여러 전문화된 모델이 복합 시스템(compound system)으로 함께 작동하는 방식이 더 자주 필요하게 될 것입니다. 이러한 아키텍처는 본질적으로 더 개방적이고 분산된 구조를 가집니다.

Pi와 OpenClaw와 같은 새로운 에이전트 아키텍처는 이미 이러한 방식으로 구축되어 있습니다. 이들의 설계는 최소한의 구조를 지향하며, 주로 대규모 언어 모델(LLM), Bash 셸, 파일 시스템, 마크다운 상태 파일, cron 루프 등을 포함합니다. 상태 정보는 가중치가 아닌 파일에 저장되므로 에이전트의 메모리 손실 없이 LLM을 교체할 수 있습니다. 이러한 에이전트는 폐쇄형이든 개방형이든 모든 모델과 호환됩니다. 하지만 모델 가중치부터 서빙 인프라까지 전체 스택이 개방되면 모든 구조적 이점이 극대화됩니다. 즉, 도메인에 맞게 미세 조정하고, 직접 제어하는 모델 간에 라우팅하며, 소유한 툴로 관찰하고, 다른 부분에 영향을 주지 않고 모든 계층을 교체할 수 있습니다. 이러한 점 때문에 오픈 추론은 에이전틱 AI의 자연스러운 토대가 되며, Red Hat AI는 이를 지원하는 강력한 플랫폼이 됩니다. 

준비 방법

가격 정책이 변경되기 전에 지금 바로 실행해야 할 3가지 사항은 다음과 같습니다.

Figure 4: 3 actions to prepare for open agentic inference, each with specific tools from the Red Hat AI stack. The timeline shows a 12-month ramp from API portability to full self-managed agentic infrastructure.

그림 4: 오픈 에이전틱 추론을 준비하기 위한 3가지 작업으로, 각각 Red Hat AI 스택의 특정 툴을 활용합니다. 이 타임라인은 API 이식성 확보부터 완전한 자체 관리형 에이전틱 인프라 구축까지 12개월간의 단계적 전환 과정을 보여줍니다.

하네스에 구애받지 않는 빌드. 에이전틱 하네스와 에이전트를 어떻게 엔지니어링하느냐는 어떤 모델을 실행하느냐만큼, 혹은 그보다 더 중요합니다. 에이전트가 단일 제공업체의 API에 하드코딩되어 있다면, 가격 정책이 바뀌기 전에 이미 해당 업체에 종속된 것입니다. 따라서 모델 및 API 이식성을 고려하여 빌드해야 합니다. Red Hat AI를 통해 제공되는 OGX와 같은 프로젝트가 여기에 적합합니다. 이 프로젝트는 Chat Completions, Responses, Messages, Interactions API 전반에 개방형 번역 계층을 제공하여, 하단의 모델이나 제공업체에 관계없이 에이전트의 이식성을 유지해 줍니다.

관리형 인프라 내 대량 워크로드 자체 호스팅. 양자화된 Gemma 4 또는 Qwen 모델을 실행하는 단일 GPU만으로도 풀 요청 검토, 문서화, 코드 요약 작업을 충분히 처리할 수 있습니다. 프론티어급 추론이 반드시 필요하거나 프론티어 모델의 품질 우위가 명확한 워크로드에는 API 서브스크립션을 사용하고, 나머지는 직접 제어하는 인프라에서 자체 호스팅하세요. 자체 관리형 추론 플랫폼은 모델 서빙, 확장, 라우팅, 관측성의 운영 복잡성을 해결해 주므로, 팀은 서빙 스택 유지 관리보다 에이전트 구축에 더 집중할 수 있습니다. 

오픈소스 모델이 프론티어 모델과의 격차를 계속 좁혀감에 따라 자체 호스팅이 가능한 워크로드의 비중은 더욱 커질 것입니다. 지금 시작하면 오픈 모델이 전체 스택을 지원하게 될 때 필요한 운영 준비 역량을 갖출 수 있습니다. 모델 라우팅 연구에 따르면 대부분의 요청을 소형 또는 자체 호스팅 모델로 보내고 복잡한 태스크만 프론티어 API로 에스컬레이션할 경우, 품질 저하를 최소화하면서 비용을 60~85% 절감할 수 있습니다.

에이전틱 스택 전반의 엔드 투 엔드 테스트. 벤치마크를 통과한 모델이라도 하네스가 잘못된 프롬프트를 주거나, 툴 파서가 출력을 오독하거나, 게이트웨이가 태스크를 잘못 라우팅하면 실패할 수 있습니다. 따라서 '모델-하네스-구성'의 삼중 조합을 테스트하는 것이 올바른 접근 방식입니다.

또한 프로세스에 토큰 예산 관리 기능을 포함하세요. 에이전트별 제한 설정, 기능별 비용 귀속, 그리고 이상 징후 감지 기능까지 포함해야 합니다. Red Hat AI 스택의 일부인 MLflow Tracing은 완전한 OpenTelemetry 호환성을 바탕으로 프롬프트, 추론 단계, 툴 호출, 토큰 비용을 캡처합니다. 예산 문제가 발생하기 전에 미리 알림을 받을 수 있는 체계를 갖추는 것이 좋습니다.

미래를 위한 구축

일반적으로 하드웨어의 가치는 시간이 지남에 따라 하락합니다. 하지만 오픈 추론을 위한 GPU는 그 반대의 행보를 보이고 있습니다. 칩 자체는 변하지 않지만 그 위에서 실행되는 소프트웨어가 끊임없이 개선되기 때문입니다. vLLM의 향상된 배치 및 어텐션 커널은 동일한 하드웨어에서 초당 더 많은 토큰을 처리할 수 있게 해줍니다. 양자화 기술의 비약적인 발전으로 과거에 80GB가 필요했던 모델을 비슷한 품질로 20GB에 담을 수 있게 되었습니다. 분산 서빙은 워크로드를 분할하여 동일한 클러스터에서 더 많은 에이전트를 동시에 처리할 수 있게 합니다. 3년 전에 구입한 엔터프라이즈 GPU는 설치 당시보다 오늘날 더 유용한 추론 결과를 만들어냅니다. 그동안 이를 뒷받침하는 오픈소스 스택이 계속 발전해 왔기 때문입니다.

이러한 복합적인 발전이야말로 이 글의 전체 논지를 관통하는 핵심입니다. 개방형 툴 호출 파서의 개선은 모든 사용자에게 혜택으로 돌아갑니다. 개방형 채팅 템플릿은 호환성 문제를 단번에 영구적으로 해결합니다. 에이전틱 API 계약을 유지하는 개방형 가드레일은 특정 벤더의 고객뿐만 아니라 모든 배포 환경을 보호합니다. 오픈 분산 서빙은 이미 소유하고 있는 하드웨어에서 확장 가능합니다.

이것이 바로 오픈소스 AI 플랫폼이 존재하는 이유입니다. 단순히 모델을 서비스하는 것을 넘어, 하네스와 모델 간 변환을 담당하는 API 계층부터 라우팅 및 미터링을 수행하는 게이트웨이, 서빙 엔진, 그리고 하드웨어에 이르기까지 자체 인프라에서 전체 에이전틱 추론 스택을 소유하는 것, 이것이 바로 저희가 말하는 '메탈 투 에이전트(metal to agents)'입니다. 데이터는 보안 경계 내에 안전하게 유지됩니다. 모델은 사용자가 원하는 위치에서 실행됩니다. 모든 계층을 직접 제어하므로 비용을 예측할 수 있습니다. 모든 계층이 개방되어 있습니다. 모든 계층을 디버깅할 수 있습니다. 모든 개선 사항은 공유됩니다.

모델은 이미 충분히 훌륭하며 나날이 발전하고 있습니다. 스택이 점차 구체화되고 있습니다. 경제적 이점은 명확합니다. 문제는 오픈 에이전틱 추론의 실현 여부가 아니라(이미 실현되고 있습니다), 비용 청구서가 도착했을 때 여러분이 준비되어 있는가 하는 점입니다.

리소스

AI 추론 시작하기

더욱 스마트하고 효율적인 AI 추론 시스템을 구축하는 방법을 알아보세요. Red Hat AI를 통해 양자화와 희소성, 그리고 vLLM 같은 고급 기술에 대해 배울 수 있습니다.

저자 소개

Adel Zaalouk is a product manager at Red Hat who enjoys blending business and technology to achieve meaningful outcomes. He has experience working in research and industry, and he's passionate about Agentic AI and how it can be used to address real problems.

UI_Icon-Red_Hat-Close-A-Black-RGB

채널별 검색

automation icon

오토메이션

기술, 팀, 인프라를 위한 IT 자동화 최신 동향

AI icon

인공지능

고객이 어디서나 AI 워크로드를 실행할 수 있도록 지원하는 플랫폼 업데이트

open hybrid cloud icon

오픈 하이브리드 클라우드

하이브리드 클라우드로 더욱 유연한 미래를 구축하는 방법을 알아보세요

security icon

보안

환경과 기술 전반에 걸쳐 리스크를 감소하는 방법에 대한 최신 정보

edge icon

엣지 컴퓨팅

엣지에서의 운영을 단순화하는 플랫폼 업데이트

Infrastructure icon

인프라

세계적으로 인정받은 기업용 Linux 플랫폼에 대한 최신 정보

application development icon

애플리케이션

복잡한 애플리케이션에 대한 솔루션 더 보기

Virtualization icon

가상화

온프레미스와 클라우드 환경에서 워크로드를 유연하게 운영하기 위한 엔터프라이즈 가상화의 미래