티스토리 뷰
AI 도입이 본격화되면서 기업 인프라 환경도 빠르게 복잡해지고 있습니다. GPU 서버 수는 늘어나고, 연구·개발팀은 대규모 학습 작업을 요청하며, 서비스팀은 안정적인 추론 환경을 요구합니다. 여기에 Kubernetes, Slurm, Docker 등 서로 다른 도구와 운영 방식까지 더해지면, AI 인프라 관리는 단순히 서버를 증설하는 문제를 넘어섭니다.
클루닉스의 NovaTier(노바티어)는 이러한 복잡성을 줄이기 위해 등장한 AI·GPU 인프라 통합 플랫폼입니다. AI 모델 개발부터 학습, 배포, 운영까지 이어지는 전체 흐름에서 GPU 자원과 워크로드를 효율적으로 관리하는 것을 목표로 합니다.
AI 서버공간 호스팅 소개 : https://www.globalhost.co.kr/ai_hosting
AI 인프라 운영이 어려워지는 이유
전통적인 서버 운영에서는 CPU, 메모리, 스토리지 같은 자원을 중심으로 관리했다면, AI 환경에서는 GPU가 핵심 자원이 됩니다. GPU는 비용이 높고 수요가 많기 때문에, 단순히 서버에 장착해 두는 것만으로는 효율적인 운영이 어렵습니다.
특히 다음과 같은 문제가 자주 발생합니다.
- 특정 팀이 GPU를 점유해 다른 프로젝트가 대기하는 상황
- 학습 작업은 Slurm, 서비스 배포는 Kubernetes로 나뉘어 관리되는 문제
- 서로 다른 세대와 모델의 GPU가 혼재되면서 자원 배정이 복잡해지는 문제
- 유휴 GPU가 존재하지만 이를 다른 작업에 빠르게 할당하지 못하는 문제
- 부서별 또는 프로젝트별 자원 사용량과 권한을 통제하기 어려운 문제
AI 인프라가 커질수록 운영팀은 GPU 사용률, 작업 우선순위, 사용자 권한, 컨테이너 환경, 스케줄링 정책을 함께 관리해야 합니다. 이 지점에서 통합 운영 플랫폼의 필요성이 커집니다.
NovaTier로 해결
NovaTier는 클루닉스가 제공하는 AI 인프라 통합 관리 플랫폼입니다. AI와 GPU 오케스트레이션 환경을 단순화하고, 분산된 인프라 자원을 하나의 운영 체계 안에서 관리할 수 있도록 설계됐습니다.
핵심은 Kubernetes, Docker, Slurm 같은 기술 요소를 통합해 AI 워크로드의 실행과 자원 배정을 효율화하는 데 있습니다.
쉽게 말하면, 개발자는 필요한 학습이나 추론 작업을 제출하고, 운영자는 미리 정의한 정책에 따라 GPU와 컴퓨팅 자원을 배정·관리하는 구조를 지향합니다.
개발팀이 인프라 구성의 복잡한 세부 사항을 모두 이해하지 않아도 되고, 인프라팀도 요청마다 수동으로 GPU를 배정하는 부담을 줄일 수 있습니다.
주요 기능
1. Docker·Kubernetes·Slurm 통합 운영
AI 워크로드는 한 가지 방식으로만 실행되지 않습니다. 대규모 모델 학습이나 HPC 작업에는 Slurm이 적합할 수 있고, API 기반 추론 서비스나 MLOps 환경에는 Kubernetes가 많이 사용됩니다.
NovaTier는 이러한 환경을 분리된 도구로만 운영하는 대신, 통합 자원 관리 관점에서 접근합니다. 학습, 추론, 배치 처리 등 서로 다른 유형의 워크로드에 맞춰 GPU 자원을 배정하고 운영 정책을 적용할 수 있습니다.
2. 이기종 GPU 클러스터 관리
실제 기업 환경에서는 GPU 구성이 단일하지 않은 경우가 많습니다. 기존에 운영하던 GPU 서버와 새로 도입한 고성능 GPU 서버가 함께 존재할 수 있으며, 개발 환경과 운영 환경의 하드웨어도 다를 수 있습니다.
NovaTier는 이러한 이기종 GPU 환경을 하나의 클러스터 관점에서 운영할 수 있도록 지원합니다. 작업 특성과 정책에 맞춰 적절한 GPU 자원을 배정하는 방식으로, GPU 서버가 늘어날수록 커지는 운영 복잡도를 줄이는 데 초점을 둡니다.
3. 멀티테넌시 기반 자원 분리
여러 부서나 프로젝트가 동일한 GPU 인프라를 공유한다면, 자원 격리와 권한 관리가 중요합니다. 연구개발팀, 데이터분석팀, 서비스개발팀이 모두 GPU를 사용하더라도 각 조직의 우선순위와 사용 한도는 다를 수 있습니다.
NovaTier는 멀티테넌시 기반 운영을 통해 조직, 부서, 프로젝트 단위로 자원과 권한을 분리하는 환경을 제공합니다. 이를 통해 공용 GPU 인프라를 운영하면서도 사용자별 접근 범위와 자원 소비를 관리하기 쉬워집니다.
4. 정책 기반 스케줄링과 자동화
GPU는 고가의 자원이기 때문에, 사용률을 높이는 것이 중요합니다. NovaTier는 작업 우선순위, 자원 할당 기준, 사용자 또는 프로젝트 정책 등을 기반으로 워크로드를 스케줄링하는 운영 방식을 지향합니다.
예를 들어 긴급한 서비스 운영 작업에는 우선순위를 높이고, 장시간 학습 작업은 대기열에서 관리하며, 사용하지 않는 자원은 다른 작업에 재할당하는 형태의 정책 설계가 가능합니다.
이러한 방식은 운영자가 매번 수동으로 서버와 GPU를 배정하는 업무를 줄이고, 인프라 활용률을 높이는 데 도움이 됩니다.
NovaTier는 단순히 GPU 서버를 관리하는 도구라기보다, AI 개발과 서비스 운영 환경을 하나의 인프라 체계로 연결하려는 플랫폼에 가깝습니다.
AI 워크로드가 늘어날수록 Kubernetes, Slurm, Docker, GPU 클러스터, 사용자 권한, 자원 정책을 각각 따로 관리하는 방식은 한계에 부딪힐 수 있습니다. NovaTier는 이런 복잡한 운영 요소를 통합하고, GPU 자원의 활용률과 운영 효율을 높이려는 기업에 하나의 선택지가 될 수 있습니다.
AI 인프라를 준비하거나 확장하는 단계라면, 현재 GPU 자원 사용 방식과 워크로드 유형을 먼저 분석한 뒤 NovaTier 같은 통합 플랫폼이 실제 운영 문제를 얼마나 줄일 수 있는지 PoC를 통해 검증해보는 것이 좋습니다.
AI 서버공간 호스팅 소개 : https://www.globalhost.co.kr/ai_hosting
- Total
- Today
- Yesterday
- winscp
- 리눅스
- 서버
- 웹호스팅
- 제온
- IDC
- 윈도우서버
- 구글메일
- 가상화
- 홈페이지제작
- CPU
- MS라이센스
- 웹방화벽
- 코로케이션
- 웹해킹
- 보안
- 해외호스팅
- 구글메일호스팅
- 가비아
- 서버호스팅
- 네할렘
- 누리호스팅
- 호스팅
- 델서버
- 도메인
- HP서버
- 호스트웨이
- CentOS
- M/M
- sql injection
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |