본문 바로가기

Simple AI Training

코드와 데이터 입력만으로 즉시 학습이 가능한
No-Ops AI/ML 트레이닝 서비스

Simple AI Training은 사용자가 데이터와 학습 코드만 준비하면 AI 인프라를 직접 구축할 필요없이 대규모 모델을 학습할 수 있는 완전관리형 AI Training 서비스입니다. 데이터 과학자와 머신러닝 엔지니어는 인프라 구축/관리의 부담 없이 즉시 필요한 리소스를 할당 받아 모델 학습에만 전념할 수 있습니다.

서비스 특징

01

04

서비스 구성도

번호가 매겨진 7단계의 단순 AI 교육 프로세스를 보여주는 워크플로우 다이어그램. 왼쪽에는 사용자(데이터 과학자 또는 ML 엔지니어)가 프로세스를 시작합니다. 단계 1: 교육 데이터 준비는 사용자 도메인 내의 파일 저장소, 컨테이너 레지스트리 및 개체 저장소에 데이터를 저장하는 것을 포함합니다. 2단계: 교육 스크립트 준비. 3단계: Configure Training은 Training Service Portal 및 Multi Cluster Scheduler가 포함된 Master Cluster에 연결합니다. 4단계: 데이터 마운트 및 복사는 사용자 도메인에서 교육 인프라로 데이터를 전송합니다. 단계 5: 시작 훈련은 훈련 연산자, 혼합 워크로드 컨트롤러 및 개별 GPU로 여러 GPU 노드를 관리하는 GPU 장애 조치가 포함된 GPU 클러스터로 프로세스를 지시합니다. 단계 6: 실행 훈련 GPU 자원에 대한 작업 부하를 처리합니다. 단계 7: 교육 완료 및 결과 저장 처리된 결과를 사용자 도메인 스토리지 시스템으로 다시 반환합니다

주요 기능

  • 모델 훈련 편의성
    1. 서버리스 환경 제공 : 인프라 설정, 데이터 로딩, 모델 학습, 결과물 저장까지 모든 과정을 자동화하여 학습에만 집중 가능
    2. 분산 학습 : 대규모 모델이나 대용량 데이터셋은 여러 인스턴스에 학습을 자동으로 분산 처리
    3. 커스텀 컨테이너 : 사용자의 Docker 컨테이너 이미지를 가져와 학습(BYOC: Bring Your Own Container) ※ 26년 9월 제공 예정
    4. Warm Pool : 연속적인 훈련 작업 시 인스턴스를 즉시 재사용하여 인프라 프로비저닝 시간 단축
  • 모델 훈련 가용성/보안성
    1. GPU Failover : 학습 도중 GPU 오류 발생 시 시스템이 자동으로 장애를 탐지/복구하여 중단 없는 학습 지원
    2. Checkpointing : 학습 중간 결과물을 Object Storage에 저장하여 장애 발생 시 체크포인트부터 학습 재개 가능
    3. 안전한 데이터 접근 : 클라우드 내 데이터 저장소(Object Storage)와 연동되어 데이터를 외부 유출 걱정없이 보안이 유지된 상태로 처리
  • 다양한 요금제 선택
    1. Spot Training 요금제 : 우선 순위가 낮은 학습에 대해 유휴 GPU를 사용하여 비용 절감 가능. Spot Training 중단/재개를 자동으로 관리하여 비용 효율적인 학습 가능
    2. On-demand 요금제 : 필요시 언제든 서버를 선점하여 중단없이 안정적으로 학습 가능
    3. 약정 요금제 : GPU 우선 확보가 필요한 경우, 약정 요금을 통해 무약정 대비 저렴하게 이용 가능