에이전틱 AI는 단순히 AI 기술을 진보시키는 데 그치지 않고, 기존 추론을 위해 구축된 인프라 패러다임을 완전히 바꿉니다. 자율적으로 추론, 계획, 툴 사용, 다단계 작업을 수행하는 시스템인 에이전틱 AI는 연구 단계에서 프로덕션 환경으로 빠르게 전환되고 있습니다.
이러한 전환은 단순히 컴퓨팅 성능을 늘리는 것에 그치지 않고, 지속적인 다단계 추론 워크플로우를 위해 인프라가 작동하고 확장하며 최적화되어야 하는 방식을 근본적으로 변화시킵니다.
하지만 에이전트는 근본적으로 다른 워크로드입니다. 모델을 반복해서 호출하고, 다양한 툴과 데이터 소스로 확장하며, 지속적이면서도 비용 효율적으로 작동해야 합니다.
이를 위해서는 복잡한 추론을 위한 고성능 GPU, 추론 작업을 위한 CPU, 그리고 이 모든 요소를 통합하는 오케스트레이션과 지능형 스케줄링을 아우르는 새로운 종류의 인프라가 필요합니다.
AMD와 Red Hat은 긴밀히 협력하여 이러한 전환을 지원하며, 기업이 대규모로 에이전틱 AI를 운영할 수 있도록 설계된 개방형 고성능 인프라 기반을 제공하고 있습니다.
AMD Instinct MI355X와 Red Hat AI 3.4를 통한 고처리량 AI 추론
에이전틱 워크로드는 본질적으로 추론 집약적입니다. 에이전트가 수행하는 모든 추론 단계와 툴 호출, 그리고 모든 의사 결정은 모델 추론입니다. 에이전트가 문서를 검색하고 코드를 생성하며 출력을 검증하는 등 복잡한 워크플로우를 조정할 때, 작업당 수십 개의 추론 호출을 실행할 수 있습니다. 이 때문에 GPU 처리량과 메모리 용량이 매우 중요해집니다.
Red Hat AI 3.4는 이제 AMD CDNA™ 4 아키텍처를 기반으로 구축된 AMD의 플래그십 데이터 센터 GPU인 AMD Instinct™ MI355X에서의 추론을 지원합니다. 288GB의 HBM3E 메모리와 8TB/s의 대역폭을 갖춘 AMD Instinct™ MI355X는 고급 에이전트 추론을 지원하는 핵심 프론티어 모델과 오늘날 가장 규모가 큰 오픈소스 모델을 더 적은 수의 가속기로 서비스하고 총소유비용(TCO)을 낮출 수 있게 해줍니다. TSMC 3nm 공정 기술을 기반으로 구축되어 최대 5PF의 FP16 성능을 제공하는 이 GPU는 에이전틱 워크로드를 효율적으로 확장하는 데 필요한 높은 처리량을 보장합니다.
ROCm 7이 완전히 통합된 Red Hat AI를 지원하므로, 기업은 AMD GPU Operator를 사용하여 Day-0 구성을 간소화하고 Red Hat OpenShift에 AMD Instinct MI355X로 가속화된 추론 환경을 배포할 수 있습니다. MXFP6와 MXFP4에 대한 데이터 유형 지원이 확장되어 더욱 효율적인 양자화 모델 서빙이 가능해졌습니다. 이를 통해 에이전트의 유용성을 결정하는 추론 품질을 타협하지 않으면서 GPU당 더 많은 에이전트를 실행할 수 있습니다.
이는 실제로 기업이 더 적은 수의 가속기로 더 대규모의 모델을 구동할 수 있음을 의미하며, 인프라 공간을 줄이고 전력 소비를 낮추며 추론당 비용을 개선할 수 있게 해줍니다. 작업당 수십 개의 모델 호출을 생성할 수 있는 에이전틱 AI 워크플로우의 경우, 이러한 효율성은 응답 속도 향상과 상호 작용당 비용 절감으로 직결됩니다.
AMD Instinct MI350P PCIe 카드를 활용한 AI 배포 유연성 확장(프리뷰)
Red Hat AI는 AMD Instinct MI350P PCIeⓇ 카드 가속기에 대한 프리뷰 지원을 추가하여, 표준 데이터 센터 서버 인프라에 AMD CDNA™ 4 아키텍처를 도입합니다. 구성 가능한 600W TBP(총 보드 전력)와 패시브 공랭식 기능을 갖춘 듀얼 슬롯 PCIe 폼 팩터로 설계된 이 카드는 전력과 쿨링 시스템을 크게 개편하지 않고도 엔터프라이즈 데이터 센터에 원활하게 통합할 수 있습니다.
AMD Instinct MI350P PCIe 카드는 기존 16비트와 8비트 형식뿐만 아니라 효율적인 모델 서빙을 위한 MXFP6와 MXFP4를 지원하며, 최대 4.0TB/s의 피크 메모리 대역폭을 지원하는 144GB의 HBM3E 메모리를 탑재했습니다. 이를 통해 OAM(Open Accelerator Module) 기반 시스템을 활용하기 어려운 환경에서도 고성능 추론이 가능합니다. 이를 통해 규모에 관계없이 모든 기업이 인프라에 최첨단 GPU 기술을 탑재하고, 소규모부터 대규모 모델 기반 워크로드까지 손쉽고 효율적으로 실행할 수 있습니다.
기업은 AMD Instinct MI350P PCIe 카드를 활용해 관리하기 쉬우면서도 비용 효율적이고 확장 가능한 방식으로 다양한 워크로드 전반에 AI 도입을 확장할 수 있습니다. 이러한 가속기 카드는 에이전틱 AI의 배포 유연성을 향상하여, 기업이 기존 인프라를 다시 설계하지 않고도 데이터와 더 가까운 곳에서 추론을 실행하고 대기 시간을 줄이며 실시간 분산 에이전트 워크플로우를 지원할 수 있게 해줍니다.
AMD Instinct MI350P PCIe 카드
에이전틱 AI를 위한 분산 추론과 워크로드 배치
에이전틱 AI는 워크플로우의 각 부분에 적합한 인프라를 조정하는 과정을 포함합니다. Red Hat AI는 가속기 지원 인프라와 CPU 기반 인프라 전반에서 AI 워크로드를 배포, 확장, 모니터링, 관리할 수 있는 쿠버네티스 네이티브 기능을 제공합니다. 플랫폼 팀은 가속기 프로필 구성, AMD GPU 기반 모델 서빙 활성화, 프로젝트 수준의 하드웨어 리소스 정의가 가능합니다. 또한, OpenShift 스케줄링, 대기열 할당량, 워크로드 관리 기능을 사용해 적절한 인프라에 워크로드를 배치할 수 있습니다.
모델 서빙을 위해 Red Hat AI는 AMD Instinct 가속기를 비롯한 AMD GPU에서 KServe와 vLLM 기반 런타임을 지원합니다. 반면, CPU 기반 인프라는 오케스트레이션, 검색, 전처리, 라우팅, 그리고 더 가벼운 추론 작업에 사용할 수 있습니다. OpenShift AI에는 대규모 분산 AI 추론을 위한 llm-d도 포함되어 있습니다. llm-d는 사전 채우기와 디코딩 분리, 또는 KV 캐시 인식 라우팅과 같은 쿠버네티스 네이티브 분산 추론 기능으로 vLLM 기반 서빙을 확장합니다. AMD Instinct GPU 및 AMD EPYC™ CPU와 함께 사용할 때, OpenShift AI와 llm-d는 GPU 가속 추론과 효율적인 CPU 기반 워크플로우 실행을 결합할 수 있는 에이전틱 AI 플랫폼용 실용적인 기반을 기업에 제공합니다.
그 결과 효율성이 향상되고 불필요한 GPU 소비를 줄이며, 선형적인 비용 증가 없이 AI 서비스를 확장할 수 있는 더욱 효율적인 시스템이 구축됩니다.
AMD EPYC와 AMD ZenDNN을 활용한 고성능 vLLM CPU 추론
모든 에이전트 호출에 GPU가 필요한 것은 아닙니다. 에이전틱 시스템은 본질적으로 구성 가능합니다. 예를 들어 단일 워크플로우 내에서 복잡한 추론은 GPU 상의 대형 모델로 라우팅하는 한편, 분류, 추출, 라우팅 같은 단순한 작업은 소형 모델에 배정할 수 있습니다. CPU가 지연 시간이 짧은 단계를 효과적으로 처리할 수 있는데도 모든 호출에 GPU를 사용하는 것은 비효율적입니다. 현대적인 AI 시스템에서 CPU는 더 이상 단순한 지원 인프라에 머무르지 않고, 확장 가능한 추론을 위한 핵심 엔진 역할을 합니다.
Red Hat AI 3.4는 ZenDNN 백엔드가 탑재된 vLLM-CPU를 도입하여 AMD EPYC 프로세서에 고성능 CPU 추론 기능을 제공합니다. ZenDNN은 PyTorch와 같은 프레임워크가 AMD EPYC CPU에서 효율적으로 실행될 수 있도록 조정된 커널과 최적화된 프리미티브를 제공하여, 확장 가능한 AI 워크로드를 처리하는 강력한 엔진을 실현합니다.
결합 패턴, 벡터화된 실행, AMD AOCL(Optimizing CPU Libraries) DLP 마이크로커널 등 AMD EPYC에 최적화된 그래프와 오퍼레이터 개선 사항으로 네이티브 프레임워크를 확장함으로써, vLLM에 업스트림된 ZenDNN을 통해 코드 변경 없이 가속화를 달성할 수 있습니다. 그 결과, PyTorch torch.compile를 통한 광범위한 호환성과 vLLM 0.18.0의 업스트림 지원을 활용하여 기존 인프라에서 높은 처리량의 추론을 수행할 수 있는 플러그 앤 플레이 경로를 확보할 수 있습니다.
INT8/INT4 양자화와 최적화된 vLLM 통합을 통해 생성형 AI(gen AI) 모델을 CPU 인프라에서 효율적으로 실행할 수 있으며, 이는 지연 시간이 크게 제한되지 않는 하이브리드 워크로드를 위한 저비용, 저전력 솔루션을 제공합니다. 이를 통해 기존 AMD EPYC CPU 제품군에서 범용 컴퓨팅과 함께 AI 추론을 실행할 수 있어, 인프라 활용도를 높이고 모든 배포 환경에서 전용 가속기를 도입해야 할 필요성을 줄여 줍니다.
CPU 추론은 사용량이 적은 시간대의 배치 처리, AI가 전체 컴퓨팅의 일부분만 차지하는 하이브리드 워크로드, 그리고 기존 인프라, 기술 및 공랭식 환경을 활용하여 진입 장벽을 낮추는 AI 도입과 같은 엔터프라이즈 시나리오에 특히 유용합니다.
AMD 9005 시리즈 프로세서는 에이전틱 AI가 요구하는 병렬 및 상시 가동형 컴퓨팅에 맞춰 특별히 설계되었습니다. 최대 192개의 코어(384 SMT 스레드), 높은 메모리 대역폭, 대용량 캐시 성능, 더욱 강력해진 코어 성능, 그리고 광범위한 I/O를 갖춘 이 프로세서는 대규모 환경에서 오케스트레이션, 검색, 전처리, 툴 호출, 라우팅, 모델 추론을 처리하는 데 필요한 강력한 CPU 성능을 제공합니다.
곧 출시될 차세대 AMD EPYC 프로세서(코드명 "Venice")는 최대 256개 코어(512 스레드), 최대 12.8 MT/s의 메모리 속도와 최대 1.64 TB/s의 대역폭을 제공하는 MRDIMM 지원, 그리고 높은 처리량의 I/O를 위한 PCIe Gen 6 등을 통해 이러한 성능을 더욱 확장할 것입니다.
실제로 이를 통해 GPU는 복잡한 추론에 전념하고, AMD EPYC CPU는 주변 에이전트 워크플로우를 효율적으로 관리하여 수많은 동시 요청을 처리하며, 낮은 지연 시간을 유지하고 전반적인 인프라 활용도를 높일 수 있습니다.
성능: AMD EPYC 9R45의 실제 성능
ZenDNN 백엔드의 성능을 검증하기 위해 AMD EPYC 9R45 96코어 프로세서를 사용하여 성능 벤치마킹을 수행했습니다. 이번 평가는 짧은 컨텍스트 128:128 워크로드를 사용하는 "chat_lite" CPU 추론 벤치마크를 기반으로 진행되었습니다.
테스트 구성
이 환경에서는 AWS m8a.metal-48xl 인스턴스를 활용했습니다. 이 아키텍처는 5개의 개별 Red Hat AI Inference 3.4 인스턴스를 활용했으며, 처리량을 최적화하기 위해 각 인스턴스에 접두사 캐싱이 활성화된 코어 32개를 할당했습니다. GuideLLM은 기본 평가 도구로서 NGINX 로드 밸런서를 통해 라우팅되어 vLLM-CPU 성능 평가를 조율했습니다.
높은 처리량 확장성
동시성이 증가할수록 AMD EPYC는 뛰어난 확장성을 보여줍니다.
- 양자화 효율성: 양자화된 W8A8 모델은 동시성 160에서 초당 약 2,421토큰의 평균 처리량을 달성했습니다.
- 최고 성능: 동일한 동시성 수준에서 양자화된 모델의 P95 처리량은 초당 3,260토큰 이상으로 치솟았으며, 이는 급증하는 에이전틱 워크로드를 처리하는 프로세서의 성능을 잘 보여줍니다.
- 기본 성능: 표준 FP16 Llama-3.1-8B 모델도 동시성 160에서 초당 약 1,500토큰의 안정적인 평균 처리량을 유지했습니다.
에이전틱 워크플로를 위한 예측 가능한 지연 시간
AI 에이전트가 신속하게 반응하려면 첫 번째 토큰 생성 시간(TTFT)과 토큰 간 지연 시간(ITL)이 매우 중요합니다.
- 반응성: 양자화된 모델은 현저히 낮은 평균 TTFT를 유지하며, 동시성 160에서도 2초 임계값을 훨씬 밑돕니다.
- 매끄러운 흐름: 양자화된 모델의 평균 ITL은 테스트 전반에서 약 100ms~130ms 수준으로 매우 일관되게 유지됩니다.
- 엔드투엔드 효율성: 양자화된 모델에서 전체 생성의 평균 엔드투엔드(E2E) 지연 시간은 최대 동시성에서 약 16.8초로, 양자화되지 않은 버전의 27초 이상에 비해 크게 단축되었습니다.
Red Hat은 Red Hat AI Inference에 통합된 vLLM과 ZenDNN을 기반으로 AMD EPYC 프로세서의 성능을 추가로 조율하고 최적화하기 위해 향후 릴리스에서도 AMD와 지속적으로 긴밀히 협력하고 있습니다. 이러한 최적화가 제공됨에 따라 이어질 추가 업데이트를 기대해 주시기 바랍니다.
에이전틱 AI가 요구하는 인프라
Red Hat Summit 2026에서 AMD와 Red Hat은 에이전틱 AI를 위한 엔터프라이즈에 적합한 통합 기반을 발표했습니다. 이미 AMD Instinct GPU와 AMD EPYC CPU를 Red Hat AI의 핵심부로 도입한 전략적 협업을 바탕으로, 양사는 엔터프라이즈 에이전틱 AI를 위한 컴퓨팅 기반을 함께 구축했습니다.
추론에서 에이전트로의 전환은 단순한 소프트웨어 변경을 넘어 인프라의 중요한 변곡점입니다. 에이전트에는 복잡한 추론을 위한 고처리량 GPU, 경량 태스크를 위한 CPU, 다양한 배포를 위한 유연한 폼 팩터, 그리고 실시간으로 수요에 컴퓨팅을 맞추는 지능형 스케줄링이 필요합니다.
AMD와 Red Hat은 프론티어 모델 추론을 위한 MI355X, 비용 효율적인 경량 호출을 위한 AMD EPYC vLLM-CPU, 그리고 새로운 환경에 GPU 가속을 지원하는 MI350P를 통해 이러한 인프라 기반을 제공합니다. 모두 오픈소스 기반으로 구축되었습니다. 모두 엔터프라이즈 환경에 즉시 적용 가능합니다. 모두 Red Hat AI에서 사용하실 수 있습니다.
에이전틱 AI는 기업의 운영 방식을 재정의하고 있으며, 인프라는 이제 전략적 차별화 요소가 되었습니다. Red Hat AI에 긴밀하게 통합된 AMD Instinct 액셀러레이터와 AMD EPYC 프로세서를 통해 조직은 실질적인 성과를 창출할 수 있도록 설계된 확장 가능하고 효율적인 개방형 AI 플랫폼을 배포할 수 있습니다. AMD와 Red Hat은 협력을 통해 단순히 에이전틱 시대를 지원하는 데 그치지 않고, 기업이 이 새로운 시대를 실제 운영 환경에 도입할 수 있도록 돕고 있습니다.
리소스
적응형 엔터프라이즈: AI 준비성은 곧 위기 대응력
저자 소개
Erwan Gallen is Senior Principal Product Manager, Generative AI, at Red Hat, where he follows Red Hat AI Inference Server product and manages hardware-accelerator enablement across OpenShift, RHEL AI, and OpenShift AI. His remit covers strategy, roadmap, and lifecycle management for GPUs, NPUs, and emerging silicon, ensuring customers can run state-of-the-art generative workloads seamlessly in hybrid clouds.
Before joining Red Hat, Erwan was CTO and Director of Engineering at a media firm, guiding distributed teams that built and operated 100 % open-source platforms serving more than 60 million monthly visitors. The experience sharpened his skills in hyperscale infrastructure, real-time content delivery, and data-driven decision-making.
Since moving to Red Hat he has launched foundational accelerator plugins, expanded the company’s AI partner ecosystem, and advised Fortune 500 global enterprises on production AI adoption. An active voice in the community, he speaks regularly at NVIDIA GTC, Red Hat Summit, OpenShift Commons, CERN, and the Open Infra Summit.
Priya Vasudevan is a Senior AI Product Manager focused on AI solutions, CPU-based AI inference, and Agentic AI. She works at the intersection of AI infrastructure, hardware, and enterprise software, helping bring scalable and efficient AI capabilities to real-world deployments.
유사한 검색 결과
빠르게 진화하는 AI 위협, 더 빠른 대응
AI의 미래를 위한 하이브리드 기반
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
채널별 검색
오토메이션
기술, 팀, 인프라를 위한 IT 자동화 최신 동향
인공지능
고객이 어디서나 AI 워크로드를 실행할 수 있도록 지원하는 플랫폼 업데이트
오픈 하이브리드 클라우드
하이브리드 클라우드로 더욱 유연한 미래를 구축하는 방법을 알아보세요
보안
환경과 기술 전반에 걸쳐 리스크를 감소하는 방법에 대한 최신 정보
엣지 컴퓨팅
엣지에서의 운영을 단순화하는 플랫폼 업데이트
인프라
세계적으로 인정받은 기업용 Linux 플랫폼에 대한 최신 정보
애플리케이션
복잡한 애플리케이션에 대한 솔루션 더 보기
가상화
온프레미스와 클라우드 환경에서 워크로드를 유연하게 운영하기 위한 엔터프라이즈 가상화의 미래