OPERATION

AI DATA CENTER · 03

서버 한 대부터 GPU 클러스터까지,
멈춤 없이 운영해 왔습니다

운영 역량은 말이 아니라 규모로 증명됩니다. 에임투지는 x86 서버와 스토리지부터 최신 GPU 클러스터까지, 도입한 인프라를 실제로 가동시키고 유지보수하는 전 과정을 책임져 왔습니다.

  • 20만대+

    x86 · 스토리지 · GPU 누적 공급

  • 2,000대+

    누적 관리 GPU

  • 99.9%

    SLA 준수율

  • 상주운영

    고객사 IDC 내 전담 엔지니어 상주

OPERATION SCOPE

인프라 구축부터 유지보수까지 책임집니다

에임투지는 서버와 스토리지 도입부터 GPU 클러스터 구축, 그리고 이 모두를 멈추지 않게 하는 유지보수까지 인프라의 전 주기를 하나의 체계로 운영합니다.

  • 01

    컴퓨팅 인프라

    x86 서버 · GPU 서버

    범용 x86 서버부터 고성능 GPU 서버까지, 워크로드에 맞는 컴퓨팅 자원을 공급하고 설치합니다. 20여 년간 누적 20만 대 이상을 다뤄 온 영역입니다.

  • 02

    스토리지 · 데이터

    All-Flash · HCI

    연산에 데이터를 공급하는 스토리지 계층을 구성합니다. All-Flash 고성능 스토리지와 HCI 통합 인프라로 대용량 데이터 파이프라인을 뒷받침합니다.

  • 03

    유지보수 · 운영

    전담 상주 · 유상 유지보수

    도입으로 끝나지 않습니다. 전담 유지보수 계약과 현장 상주 운영으로 서버부터 GPU 클러스터까지 안정적인 가동을 지속적으로 책임집니다.

국내 기술지원 체계

전국 어디든 닿는 기술지원 거점

장애는 위치를 가리지 않습니다. 에임투지는 수도권을 중심으로 국내 3곳의 기술지원 거점을 운영하며, 전국 데이터센터를 고려한 신속한 현장 대응 체계를 갖추고 있습니다.

  • SUPPORT HUBS

    본사 · 수도권 거점
    기술지원 조직의 중심. 전 거점을 총괄하고 긴급 대응을 지휘합니다.
    춘천 거점
    네이버 춘천 IDC 등 고밀도 GPU 클러스터 현장 상주 지원.
    세종 거점
    네이버 세종 IDC 등 중부권 데이터센터 현장 대응.

BUILD & STABILIZE

구축부터 안정화까지 수행한 사례

단순 납품이 아니라 구축과 안정화까지 직접 수행해 왔습니다. 서로 다른 규모와 워크로드의 클러스터를 설계·구축하고, 성능 검증을 거쳐 안정 가동 상태로 인계한 경험을 축적했습니다.

  • NAVER HyperCLOVA X

    초대형 언어모델 인프라
    InfiniBand

    초대형 언어모델 인프라 구축 · 표준화 및 안정화 지원

  • Kakao Brain

    AI 연구 클러스터
    InfiniBand

    코어 인프라 구축 · NVLink-IB 토폴로지 연동 및 최적화

  • Coupang AI

    커머스 AI 인프라
    RoCE

    400GbE RoCE v2/RDMA 튜닝 · GDS 연계 데이터 전송 최적화

  • 김앤장 법률사무소

    LLM · RAG · AI 개발
    GDS · RoCE

    LLM · RAG · AI 개발 인프라 구축 · SW 스택 최적화

  • NC AI

    게임 AI 플랫폼
    InfiniBand

    NDR InfiniBand 기반 고성능 클러스터 네이티브 구성

HOW WE OPERATE

무엇을 수행하는가

운영은 장애가 났을 때 대응하는 것이 아니라, 장애가 나지 않게 하는 일입니다. 선제적 관리와 정밀 진단이 상주 운영의 핵심입니다.

  • 선제적 운영 안정화

    • 전담 유지보수 체계 가동 및 선제적 장애 대응
    • 제조사 기술 핫라인 연계를 통한 고도화 지원
    • 서버 · GPU Driver · Firmware 최적 버전 표준화 관리
    • Deep-dive 장애 분석을 통한 운영 안정화
  • 성능 검증 및 진단

    • NCCL 기반 통신 성능 검증
    • GPU Stress Test 및 시스템 부하 검증
    • DCGM 활용 시스템 상시 진단
    • 인터커넥트 대역폭 · 지연 시간 검증

운영 중인 GPU 환경의 안정화 방안을 함께 검토해 드립니다