소프트웨어를 최대한 효율적이고 신속하게 개발하는 것은 경쟁력을 확보하기 위한 필수 과제입니다. 신제품을 시장에 더 빠르게 출시할수록 고객을 대상으로 더 큰 경쟁 우위를 확보할 수 있습니다. 최근 몇 년 동안 AI 코딩은 지루하고 반복적인 작업을 처리하고 디버깅 및 테스트를 더욱 신속하게 수행함으로써 이러한 과제를 해결하는 매우 유용한 방법으로 자리 잡았습니다. 이를 통해 귀중한 시간을 확보하여 더 가치가 높은 개발 작업에 집중할 수 있습니다.
그러나 생성형 AI 기반 코딩이 빠르게 도입되면서 엔터프라이즈 수준의 새로운 과제들이 발생하고 있습니다. 조직에서 AI 툴의 사용을 확장함에 따라 다음과 같은 중요한 질문에 직면하게 됩니다. 장기적인 비용 효율성을 어떻게 확실히 보장할 수 있을까요? 코드베이스 내부와 그 주변에서 지적 재산 및 민감한 데이터를 어떻게 보호할 수 있을까요? 그리고 데이터 및 규제 준수 요건을 어떻게 충족할 수 있을까요?
대부분의 조직은 호스팅 모델 서비스로 AI 여정을 시작하며, 이는 대개 매우 훌륭한 출발점입니다. 하지만 사용량이 증가함에 따라 토큰 수량을 기준으로 요금이 청구되는 외부 호스팅 엔드포인트에 의존하게 되면 예측하기 어렵고 높은 운영 비용이 발생할 수 있습니다. 또한 전체 스택의 인프라, 보안 및 거버넌스에 대한 제어력이 매우 제한적입니다. 이러한 제어력 부족은 엔터프라이즈 조직에 큰 과제를 안겨주며, 오랫동안 확립되어 온 타당한 정책에 대한 예외를 적용해야 하는 상황을 초래하기도 합니다. NVIDIA와 Red Hat은 Red Hat AI Factory with NVIDIA와 같은 플랫폼을 통해 이러한 과제를 극복할 수 있도록 협력하고 있으며, 기업이 보안, 액세스 정책, GPU 사용량을 자체적으로 제어하면서 하이브리드 클라우드 인프라에서 고성능 추론 및 튜닝을 실행할 수 있도록 지원합니다.
서비스로서의 모델(MaaS): 기업 맞춤형 엔터프라이즈 AI
이러한 과제를 해결하는 데 바로 Red Hat AI 기반의 서비스로서의 모델(MaaS)이 활용됩니다.
MaaS는 Red Hat AI에 완전히 통합된 기능으로, 기업이 AI를 관리하는 방식을 근본적으로 변화시킵니다. 이를 통해 중앙 IT 팀은 전적으로 조직의 요구 사항에 맞춰 자체 멀티테넌트 인프라에서 자체 모델을 직접 호스팅하고 관리할 수 있습니다. 이렇게 구축된 모델은 제어된 API 토큰 액세스를 통해 조직 내부의 다양한 활용 사례와 팀을 지원하는 데 활용됩니다.
자체 프라이빗 호스팅 모델 서비스를 운영하는 이러한 방식은 전례 없이 높은 수준의 거버넌스와 제어력을 제공합니다. 관리자는 사용자 등급을 정의 및 설정하고 각 팀 또는 프로젝트별로 구체적인 사용 제한을 규정할 수 있습니다. 이를 통해 각 내부 사용자가 필요한 리소스를 원활하게 확보하는 동시에, 고비용 리소스가 사용되지 않고 방치되어 불필요하게 낭비되는 현상을 방지할 수 있습니다. 이를 통해 모델 액세스를 간소화하고 사용량을 효율적으로 관리할 수 있습니다. 또한 중앙 IT 팀은 메트릭을 모니터링하고 컴퓨팅 및 용량 요구 사항을 예측하며, 높은 제어력과 예측 가능성을 바탕으로 차지백을 수행할 수 있습니다.
새로운 AI 퀵스타트를 통해 지금 바로 자체 프라이빗 AI 코드 어시스턴트 시작
실용적이고 안전하며 비용 제어가 가능한 AI 코딩 환경의 필요성을 반영하여, 다음 항목을 새롭게 추가했습니다. AI 퀵스타트 카탈로그에 "NVIDIA 및 MaaS를 통한 엔터프라이즈 소프트웨어 개발 가속화" AI 퀵스타트를 추가했습니다. 이 AI 퀵스타트는 심플하면서도 즉각적인 활용이 가능한 솔루션을 통해 Red Hat AI를 신속하게 시작할 수 있도록 설계된 즉시 실행 가능한 배포 패키지입니다.
이 AI 퀵스타트는 Red Hat AI 환경에서 NVIDIA Nemotron 오픈 모델과 NVIDIA 가속 컴퓨팅의 성능을 활용하여 자체 프라이빗 AI 코드 어시스턴트를 배포할 수 있는 간단하고 반복 가능한 경로를 제공합니다.
AI 빠른 시작 구성 요소
AI 빠른 시작은 고성능의 안전한 AI 코드 어시스턴트 구축에 필요한 모든 필수 구성 요소를 제공합니다.
플랫폼: Red Hat AI는 Red Hat OpenShift를 기반으로 하며, 모든 모델과 AI 워크로드를 위한 오케스트레이션 계층을 제공합니다.
추론: KServe를 탑재한 vLLM과 llm-d는 대규모 모델을 실행할 때 필요한 분산 추론 성능을 제공하여, 최상의 성능과 최적의 리소스 활용을 가능하게 합니다.
대규모 언어 모델(LLM): AI 빠른 시작은 NVIDIA Nemotron 3 Nano 30B A3B 모델을 비롯한 주요 LLM을 사용합니다. 이 모델은 FP8 정밀도로 양자화되었으며, 효율적인 추론, 채팅, 에이전틱 AI 애플리케이션을 위해 설계되었습니다.
서비스로서의 모델(MaaS): Red Hat AI 대시보드에 완전히 통합되어 사용량 추적, 거버넌스, 그리고 여러 팀 간의 간편한 비용 회수(chargeback)에 필요한 데이터를 지원하는 API 게이트웨이를 제공합니다.
Red Hat OpenShift Dev Spaces: OpenShift Dev Spaces는 개발팀이 동일한 클러스터 내에서 개발하고 배포할 수 있도록 클라우드 네이티브 IDE 인스턴스를 제공합니다.
참고: OpenShift Dev Spaces는 OpenShift 서브스크립션에 포함되어 제공됩니다.
옵저버빌리티: OpenShift의 Prometheus Operator를 통해 여러 팀의 모델 사용량과 성능을 파악하는 데 필요한 추론 메트릭과 GPU 텔레메트리 데이터를 수집할 수 있습니다.
GPU 가속: 이 AI 빠른 시작은 NVIDIA GPU Operator를 통해 활성화된 NVIDIA AI 인프라에서 실행되며, NVIDIA AI Enterprise 서브스크립션을 통해 NVIDIA의 기술 지원을 받습니다. 이 오퍼레이터는 GPU를 활성화하고 필요한 드라이버, NVIDIA Data Center GPU Manager(DCGM), 컨테이너 툴킷, 그리고 지원되는 가속기 분할을 위한 MIG 기능을 관리합니다.
주요 이점
코드 어시스턴트 AI 빠른 시작은 세 가지 주요 비즈니스 이점을 제공합니다.
1. 예측 가능한 비용과 예산 관리
자체적으로 인프라를 운영하면 사용 제한과 할당량을 구현하고 상세한 사용량을 모니터링할 수 있는 내장 기능을 활용하여 제어력을 확보할 수 있습니다. 이러한 방식을 통해 예산 추적을 간소화하고 비용 확장 시의 예측력을 높일 수 있습니다.
2. 빌트인 보안과 컴플라이언스
거버넌스 요구 사항이 엄격한 조직의 경우 보안은 결코 타협할 수 없는 요소입니다. AI 빠른 시작은 코드를 조직 내부의 경계 안에 안전하게 보관할 수 있는 온프레미스 또는 프라이빗 클라우드 배포 사례를 제시합니다. 자체적으로 관리하는 인프라에 모델을 호스팅하므로, 외부 API를 호출하거나 데이터가 유출될 우려가 없습니다.
3. 최고 수준의 개발자 경험
Red Hat은 개발자가 더 빠르고 효율적으로 작업하는 데 필요한 고성능 환경의 기반을 제공합니다. 이 플랫폼은 NVIDIA GPU와 Red Hat의 vLLM과 llm-d 추론 스택을 통해 엔터프라이즈 규모에서 고속 추론 성능을 제공합니다. 이러한 고성능 환경은 OpenShift Dev Spaces 환경과 통합되어 개발자가 동일한 클러스터에서 함께 협업하며 생산성을 높일 수 있도록 지원합니다.
지금 시작하기
AI 코딩에 서비스로서의 모델(Models-as-a-Service)과 NVIDIA 모델을 사용할 준비가 되셨나요?
- 다음 NVIDIA와 MaaS를 활용한 엔터프라이즈 소프트웨어 개발 가속화 AI 퀵스타트를 확인해 보세요.
- 이 AI 퀵스타트는 전체 배포 코드가 포함된 GitHub 리포지토리로 연결됩니다.
- 하드웨어와 소프트웨어 요구 사항을 검토해 보세요.
- AI 퀵스타트 사용과 관련하여 질문이 있거나 지원이 필요한 경우 GitHub 이슈를 등록하거나 Red Hat 팀에 문의해 주세요.
추가 리소스
- AI 퀵스타트 카탈로그를 확인해 보세요.
- NVIDIA Nemotron에 대해 자세히 알아보세요.
- NVIDIA 기반 Red Hat AI Factory의 이점을 살펴보세요.
저자 소개
Taylor specializes in helping global enterprises transition Generative AI from experimental pilots to production-scale deployments. A specialist in large-scale inference and agentic systems, Taylor bridges the gap between complex infrastructure and practical application development. She is a dedicated advocate for open-source ecosystems, leveraging projects such as vLLM, llm-d and MLflow to build sovereign, secure, and observable AI stacks. Her work is centered on empowering organizations to reclaim control over their AI lifecycle through transparent and scalable open-source solutions.
유사한 검색 결과
빠르게 진화하는 AI 위협, 더 빠른 대응
메탈에서 에이전트로: 에이전틱 AI가 애플리케이션의 진화인 이유
Technically Speaking | Defining sovereign AI with open source
Technically Speaking | Inside open source AI strategy
채널별 검색
오토메이션
기술, 팀, 인프라를 위한 IT 자동화 최신 동향
인공지능
고객이 어디서나 AI 워크로드를 실행할 수 있도록 지원하는 플랫폼 업데이트
오픈 하이브리드 클라우드
하이브리드 클라우드로 더욱 유연한 미래를 구축하는 방법을 알아보세요
보안
환경과 기술 전반에 걸쳐 리스크를 감소하는 방법에 대한 최신 정보
엣지 컴퓨팅
엣지에서의 운영을 단순화하는 플랫폼 업데이트
인프라
세계적으로 인정받은 기업용 Linux 플랫폼에 대한 최신 정보
애플리케이션
복잡한 애플리케이션에 대한 솔루션 더 보기
가상화
온프레미스와 클라우드 환경에서 워크로드를 유연하게 운영하기 위한 엔터프라이즈 가상화의 미래