KT Cloud AI Nexus 플랫폼 공식 매뉴얼 요약 (출처: NIPA·KT Cloud·Lablup 저작물 — 전문 전사 금지, 원문 링크 아래).
우리 상황 기준: 사교원 exaone-train 프로젝트 / H200 1장 / Interactive 세션 / 7개월(~12월)
2026-08-12 개정판 반영
㈜콘텐츠브릿지(kt cloud 운영관리)가 8/11 배포한 8/10 수정본 5종 + 사용자 교육 녹화본 2편을 반영했다. 6월판 대비 달라진 것:
| 구분 | 내용 |
|---|---|
| 🔴 신설 | 월간 GPU 사용시간·가동률 산정 공식이 매뉴얼에 명문화됨 (아래 첫 절). 사용률 85% 의무와 직결 |
| 🔴 정정 | NAS 실수 삭제 → 6월판 정리는 “복구 불가”였으나 snapshot으로 복구 가능이 맞다 |
| 🔴 정정 | NFS filelock 우회 → “캐시 경로를 NAS 외부로”가 아니라 huggingface_hub 코드를 SoftFileLock으로 수정이 원문 안내다 |
| 추가 | 필수 서비스 종료 주의(pkill 금지), 예약 포트 목록, 세션 상태 전이, 보정 프로세스 주기, 커스텀 이미지 UID 1100 이슈, NCCL 환경변수, 멀티노드 Infiniband 구성 |
| 분량 | 1번 가이드 52p → 56p |
| 🔴 신규 | 교육 녹화본 2편(총 2시간 22분)을 넥서스 H200으로 전사해 반영(6번 절). PDF에 없는 운영 기준·정책 발언이 다수 — 특히 회수 위험 3단계의 실제 수치와 지원 범위 해석 |
0. 🔴 GPU 사용시간·가동률 산정 기준 (8/10 신설)
사용률이 평가 지표인 우리에게 가장 중요한 신규 절이다. 2026 HPC GPU 운영계획의 월 85% 목표가 어떻게 계산되는지가 여기 나온다.
| 항목 | 기준 |
|---|---|
| 월간 GPU 사용시간 | nvidia-smi 상 GPU Util이 0을 초과한 시간. 사용자별로 1분 단위 수집 |
| 월간 GPU 가동률 | GPU 사용시간 ÷ (자원 제공일수 × 24시간) |
| 자원 회수 판정 | 세션 기준 최근 6시간 평균 GPU Util < 1% |
🔴 가동률과 회수 판정의 분모가 다르다. 가동률은 Util > 0인 시간만 세지만, 회수 기준 평균값은 Util 0 구간을 포함해 산출한다. 즉 “가끔 짧게 돌리는” 패턴은 가동률도 못 채우고 회수 위험도 높다.
회수 예외·안전장치:
- 최근 6시간 평균 CPU Util이 1% 이상이면 GPU 기준에 걸려도 회수 대상에서 제외된다.
- 세션 목록에서 자기 세션의 회수 위험을 안전 / 경고 / 위험 3단계로 볼 수 있다.
- 세션 생성 후 최초 6시간은 판단 최소 시간이라 삭제되지 않는다.
→ 우리 실천 수칙: 학습 잡이 끝나면 다음 실험(하이퍼파라미터 탐색·평가·증강)을 이어 큐에 올려 GPU Util을 끊지 않는다. 유휴가 불가피하면 최소한 CPU 작업(전처리·토크나이즈)이라도 돌려 CPU Util 1% 선을 지킨다.
1. AI Nexus 사용자 가이드 GUI (56p, v1.0 260810 수정)
원문: 구글 드라이브
이 문서가 다루는 범위: AI Nexus 웹UI 전체 기능 — 대시보드·계정 설정·데이터 폴더·세션 생성·이미지 커밋·기술지원 연결까지.
서비스 구조 핵심
- 컨테이너(Docker) 기반 — VM·베어메탈 아님. Docker-in-Docker·Kubernetes·Slurm 불가.
- 세션 내 앱(JupyterLab, VSCode 등)은 하위도메인 Proxy를 통해 접근(
https://<앱><uuid>.ainexus.ktcloud.com형태). 별도 포트 포워딩 불필요. - 추가 포트 필요 시 세션 시작 전 Preopen Ports 설정(1025–65535 범위).
- 앱을 외부에 공개해도 세션에 직접 접근은 불가하고 반드시 Proxy를 경유한다.
- 외부 SSH 접속: 세션 앱 다이얼로그 → SSH/SFTP 아이콘 클릭 후 접속 정보·키 확인 → 하위도메인 기반 주소로 접속.
계정 보안 설정
- 2FA(이중 인증) 활성화 가능 — Google OTP 등 사용.
- 허용된 클라이언트 IP 설정으로 특정 IP 대역에서만 로그인 허용 가능. ⚠️ 잘못 입력하면 본인도 접근 불가.
자원 회수 규칙 (핵심)
| 항목 | 기준 |
|---|---|
| 회수 조건 | 최근 6시간 GPU Cuda Util 평균 1% 미만 |
| 예외 | 순간 0% 구간이 있어도 6시간 평균 1% 이상이면 유지 / CPU Util 1% 이상이면 제외 |
| 세션당 최대 컨테이너 | 2개 |
| 최대 동시 세션 | 5개 (사용자 1인 기준) |
| 데이터 폴더 | 최대 10개 |
| 커밋 이미지 | 최대 3개 |
| 로그인 타임아웃 | 기본 8시간 (새로고침으로 연장) |
데이터 폴더 (NAS) — 영속 스토리지
- 세션의 기본 파일시스템(
/home/work로컬 디스크, Scratch)은 세션 삭제 시 사라짐. - 모든 체크포인트·데이터·코드는 데이터 폴더(vFolder/NAS)에 저장해야 유지됨.
- 세션 생성 시 폴더를 마운트하면
/home/work/폴더명에 접근. Alias를 주면/model처럼 다른 경로로 마운트 가능(시스템 경로와 겹치지 않게). - 🔴 세션 생성 이후에는 폴더 마운트가 불가능하다. 반드시 생성 시점에 마운트할 것.
- 자동 마운트 폴더: 이름이
.(점)으로 시작하는 폴더는 세션 생성 시 자동 마운트됨 →.local폴더로 pip 사용자 설치 패키지를 영속화하는 방식 활용 가능. - 파일 업로드 방법: 드래그앤드롭(4GB 미만), 파일 브라우저(웹앱), SFTP 서버(대용량).
- ⚠️ 파일 브라우저·SFTP 서버도 세션을 하나 소모한다. 자원·세션 수 여유가 없으면 실행되지 않는다.
- NAS 80% 이상 사용 시 1TB 무상 추가 가능(6월 안내 기준). 쿼터 부족 시 기술지원 게시판으로 증설 요청.
- 폴더 삭제는 휴지통 이동 → 영구 삭제 2단계. 휴지통에서 복구 가능.
컨테이너 커밋 (환경 저장)
| 저장되는 데이터 | 저장 안 되는 데이터 |
|---|---|
sudo pip install / sudo apt install한 패키지 | /home/work (Scratch), 일반 폴더, 자동 마운트 폴더 |
/home/work 외 특정 디렉토리 | 사용자 레벨 pip install (단, .local을 자동마운트 폴더로 설정하면 재사용 가능) |
| 설정 파일·소스코드 | 별도 mount한 NAS 폴더의 실제 데이터 |
- 💡 PyPI 패키지를 새 이미지에 포함하려면 반드시
sudo pip install. - 커밋 이미지 최대 3개. 초과 시 기존 삭제 후 커밋. 커밋 이미지는 본인에게만 보인다.
- 커밋 이미지로 세션 만드는 법: 좌측 “나의 실행 환경” → 해당 이미지의 경로 복사 → 세션 생성 시 “환경 이름(수동)“에 붙여넣기. (
bai user태그로 식별)
🔴 필수 서비스 종료 주의 (8/10 신설)
세션 컨테이너 안에는 사용자 작업 외에 시스템 필수 서비스가 함께 돈다. 이름 기반 일괄 종료(pkill, killall)는 이것들까지 죽인다.
| 명령 | 결과 |
|---|---|
pkill -f python | Jupyter, SFTP 등 python 기반 서비스 동반 종료 |
pkill -f bai-krunner | 세션 제어 서비스 종료 → 해당 세션 사용 불가 |
pkill -f dropbear | SSH·SFTP 접속 끊김 |
자기가 띄운 프로세스 외에는 종료 명령을 쓰지 말 것. 실수로 죽였으면 기술지원 게시판으로 조치 요청.
GPU·CUDA 호환성
| GPU | 아키텍처 | Compute Capability | 최소 CUDA | 권장 CUDA |
|---|---|---|---|---|
| H200 | Hopper | 9.0 (sm_90) | 11.8 | 12.4 이상 |
| H100 | Hopper | 9.0 (sm_90) | 11.8 | 12.x |
| A100 | Ampere | 8.0 (sm_80) | 11.0 | 11.8 이상 |
- 제공 NVIDIA Driver: 580.126.20 (PB 라인). 사용자별 Driver 변경은 지원하지 않는다.
- 제공 이미지: NGC PyTorch(CUDA 12.6 / 12.8 / 13.0), vLLM, Rebellions Ubuntu 계열.
- A100 기반 코드를 H200으로 이전 시 CUDA Extension·Custom Kernel·NCCL·PyTorch Binary·서드파티 라이브러리에서 호환성 이슈 발생 가능 → CUDA 12 이상 + 최신 PyTorch로 재빌드 권장.
- 커스텀 이미지 필요 시: Docker Hub에 push 후 기술지원 게시판에 이미지 URL 문의 → AI Nexus 전용 Harbor에 등록(매주 취합 후 제공).
사업 종료 시 데이터 백업
- 사업 종료 후 모든 자원 회수됨. SFTP 서버를 이용해 로컬 백업 권장.
- SFTP 세션도 세션 개수·자원 소모 → 여유 확인 후 실행.
2. GPU 사용자 Workflow (15p)
원문: 구글 드라이브
이 문서가 다루는 범위: NIPA HPC 사업 기준 GPU 학습 4단계 워크플로우 — 데이터 업로드 → 환경 구성 → 학습 수행 → 백업.
H200 스펙 참고 (문서 실측값)
| 항목 | H200 SXM | H100 SXM | A100 SXM |
|---|---|---|---|
| GPU 메모리 | HBM3e 141GB | HBM3 80GB | HBM2e 80GB |
| 메모리 대역폭 | 4.8 TB/s | 3.35 TB/s | 2.04 TB/s |
| FP16/BF16 Tensor | 1,979 TFLOPS | 1,979 TFLOPS | 624 TFLOPS |
| FP8 Tensor | 3,958 TFLOPS | 3,958 TFLOPS | 미지원 |
| NVLink 대역폭 | 900 GB/s | 900 GB/s | 600 GB/s |
| 최대 소비전력 | 700W | 700W | 400W |
지원하지 않는 것 (명문화)
- Docker-in-Docker — 이미 컨테이너 내부라 권한·네트워크·보안 이슈.
- NVIDIA Driver 커스텀 버전 — 호스트 노드 단위 PB 라인 운영.
- Kubernetes / Slurm 클러스터 구축 — 대신 커스텀 이미지·멀티노드·Batch 세션·FastTrack으로 분산학습·잡 스케줄링을 대체 제공.
- Host Level 권한 — root, 커널 모듈, PCI Device 직접 제어, OS 재설치, systemd 서비스 구성.
워크플로우 4단계
STEP 1. 데이터 및 모델 업로드
- NAS 데이터 폴더에 SFTP 또는 파일 브라우저로 학습 데이터·베이스 모델 업로드.
- 대용량 파일은 SFTP 방식 사용.
STEP 2. GPU 개발 환경 구성
- 기본 NGC 이미지 선택(PyTorch + CUDA 사전 검증됨) → 즉시 사용 가능. OS는 Ubuntu 24.04 LTS 등 (Windows 미제공).
- TensorFlow 등 다른 프레임워크가 필요하면 별도 문의 후 이미지 배포 가능.
- 세션 생성 시 이미지, 자원(CPU·GPU·메모리), vFolder 마운트, Preopen Ports 설정.
STEP 3. GPU 학습 수행 및 모델 저장
- 세션 접속 후
nvidia-smi로 GPU 인식·스펙 검증. - 학습 완료 모델은 즉시 NAS 폴더에 저장.
- Multi-GPU 사용 시
CUDA_VISIBLE_DEVICES명시적 지정 권장.
STEP 4. 모델 및 데이터 백업
- NAS 쿼터 부족 시 기술지원 게시판을 통해 스토리지 증설 요청.
- 사업 종료 전 SFTP로 로컬 백업.
3. VoC QnA 모음집 ver2.1 (31p)
원문: 구글 드라이브
이 문서가 다루는 범위: AI Nexus 사용자 VoC 기반 5개 카테고리 Q&A — GPU 자원 사용, 서비스/기술, 세션, 도커 이미지, 데이터 디스크.
우리 상황(Interactive 세션·H200 1장)에 해당하는 핵심 Q&A
자원 회수 상세
- 회수 로직: 세션 생성 시점부터 Cuda Util 수집 → 최근 6시간 평균 1% 미만이면 유휴 판정 → 자원 회수. 세션 로그에
idle-utilization으로 기록됨. - 예외: 순간 0%라도 6시간 평균 1% 이상이면 회수 안 함 → 전처리·코드 수정 등 간헐적 작업 중 갑작스런 회수 방지.
- 회수된 자원은 스케줄러가 즉시 공유 Pool로 환수해 대기자에게 재할당(무중단 구조).
- 1% 기준은 사업·정책별로 협의 변경 가능. 추론(Serving) 기능 이용 시에는 회수 정책 미적용.
nvidia-smi에서 GPU가 쪼개져 보이는 현상
- 요청한 GPU 자원량을 온전한 device로 못 채울 때 fraction 할당이 일어난다. 예: 1장 요청 시 0.5장 × 2로 보일 수 있음. 오류 아님. 원치 않으면 별도 문의.
- 1장을 의도적으로 슬라이싱해 한 세션에 주는 것과 세션 내 MIG 슬라이싱은 불가능.
멀티노드 구성
- 대규모 요청 시 자동으로 Main 1 + Sub N 구조가 된다. 예: 24장 = 8장 × 3세션.
- 세션 간 Infiniband 고속 연결. Main → Sub로
ssh sub1형태 접근 가능. all-smi로 Main에서 전체 노드 GPU 상태 통합 모니터링.- 분산학습용 rank·master address 환경변수는 자동 설정된다.
- 8장을 4노드로 만들면 노드당 2장씩 보이는 게 정상.
NCCL 튜닝 (컨테이너 환경 hang 대응)
accelerate.prepare단계 무한 대기는/dev/shm부족 또는--ipc=host미적용 때문. GUI 세션은 Docker 옵션을 직접 못 주므로 공유 메모리 크기를 늘리고 NCCL 환경변수로 우회한다.- 자주 쓰는 것:
NCCL_DEBUG=INFO,NCCL_ASYNC_ERROR_HANDLING=1,NCCL_P2P_DISABLE=1,NCCL_SHM_DISABLE=1,NCCL_IB_DISABLE=1. - accelerate 분산이 안 되면 GPU index 꼬임 →
export CUDA_VISIBLE_DEVICES=0,1명시.
세션이 Pending에서 안 넘어갈 때
- 정상 전이:
Pending → Scheduled → Preparing → Prepared → Creating → Running. no-available-instances= 요청 스펙만큼 여유 자원이 없음. 기다리면 자원이 나는 대로 생성된다.failed-to-start+ Assertion Error = 대개 예약 포트를 preopen port로 지정한 경우. 예약 포트: 2000, 2001, 3000, 5000, 6006, 8080, 8090, 8091, 8180.failed-to-start+ Insufficient Error = 자원 부족. 자원이 충분한데도 나면 보정 프로세스(15~20분 주기) 타이밍 문제일 수 있으니 잠시 후 재시도.
세션 복구·로그
- 종료된 세션은 복구 불가. 환경을 남기려면 종료 전 이미지 커밋.
- 세션 생성 후에는 포트 개방 추가·변경 불가. 새 세션을 만들어야 한다.
- 컨테이너 로그는 저장된다. 실행중/종료 탭의 “컨테이너 로그 보기”로 확인.
SSH 접속
- 세션 앱 다이얼로그 → SSH/SFTP 아이콘 클릭 → 접속 주소·
id_container키 파일 다운로드. - ⚠️ 아이콘을 클릭해야 데몬이 활성화된다. 클릭 전에는 접속 자체가 안 된다. 끊겼으면 다시 클릭.
- 키는 세션 재생성 때마다 바뀐다. 비밀번호는 쓰지 않고 키 파일 권한은 600.
- 연결 끊김 방지:
ssh -o ServerAliveInterval=60 -o ServerAliveCountMax=5 ...(영구 적용은 로컬~/.ssh/config).
VSCode 관련
- 세션 재생성 후 연결 실패 → 로컬
~/.ssh/known_hosts(윈도우:C:\Users\<사용자>\.ssh\known_hosts)에서 이전 세션 정보 삭제 후 재시도. - VSCode 종료 시 학습 동반 종료 → 터미널에서
/opt/kernel/tmux로 tmux 환경에서 실행하거나 백그라운드로 돌릴 것.
커스텀 이미지의 sudo: you do not exist in the passwd database
- AI Nexus는 UID 1100의
work계정을 쓰는데, 커스텀 이미지에 UID 1000짜리work계정이 이미 있으면 충돌한다. - 해결: 커스텀 이미지 빌드 시 work 계정 UID/GID를 1100으로 맞추거나, work 외 다른 이름을 쓴다.
apt 설치 시 tzdata 오류
/etc/localtime이 read-only 마운트라 충돌. 우회:export DEBIAN_FRONTEND=noninteractive export TZ=Asia/Seoul sudo apt install --no-install-recommends -y <패키지>
CUDA out of memory
- H200은 141GB HBM3e. 배치 크기·시퀀스 길이가 이 범위를 초과하면 발생. 배치 스윕으로 안전 구간 확인 후 운영.
CUDA uncorrectable ECC error
- GPU 카드 자체 문제. 세션명·현상을 기술지원 게시판에 문의 후, 해당 세션 삭제하고 새 세션 생성. 문제 GPU는 점검 후 재투입된다.
shared memory (shm) 오류
- worker thread 과다 또는 공유 메모리 부족. 세션 생성 시 공유 메모리를 비율로 늘려 재시도. 단 공유 메모리는 메인 메모리를 나눠 쓰는 것이라 과하게 잡으면 역효과.
데이터 디스크 관련
- 🔴 Scratch(
/home/work)와 NAS vFolder는 다르다. 할당 2TB는 NAS 쿼터이고, Scratch는 호스트 GPU 노드 로컬 디스크를 마운트한 것으로 세션당 10GB~100GB로 제한된다. 대용량은 반드시 NAS에. No space left on device: 임시 파일이 Scratch를 채우는 경우. HuggingFace는 기본적으로/home/work/.cache/huggingface/downloads에 받으므로 캐시 경로를 NAS로 돌린다(HF_DATASETS_DOWNLOADED_DATASET_PATH등).- 🔴 NFS filelock 문제(정정): NAS(NFS v3)를
cache_dir로 지정하면 HuggingFace의 filelock이 멈춘다. 라이브러리에 우회 옵션이 없어, 원문은huggingface_hub/utils/_fixes.py를 직접 수정해FileLock→SoftFileLock으로 바꾸라고 안내한다. 수정 전 기존 lock 파일(.cache)은 지운다.-from filelock import BaseFileLock, FileLock +from filelock import BaseFileLock, SoftFileLock - lock = FileLock(lock_file) + lock = SoftFileLock(lock_file) - 🔴 NAS 데이터 삭제 복구(정정): 6월 정리본의 “복구 불가”는 틀렸다. 원문은 snapshot으로 복구 가능하며 기술지원 게시판·테크센터로 문의하라고 안내한다. 단 세션 종료 후 데이터가 사라진 것처럼 보이는 경우는 대개
mv로 마운트 경로 밖으로 옮긴 것이 원인이다. tar: cannot open: file too large→ 수만 개 파일을 한 번에 묶지 말고 50만 개 또는 5~10GB 단위로 분할.scp/rsync: Channel 0: rcvd too much data→scp -o MaxPacketSize=16384 ...(안 되면 8192로 더 줄인다).Caught signal 11 (Segmentation fault)→ulimit -s unlimited후 재시도.
4. VM → AI Nexus 환경 전환 가이드 (7p)
원문: 구글 드라이브
이 문서가 다루는 범위: 기존 VM/베어메탈 환경을 AI Nexus 컨테이너 환경으로 이전하는 단계별 가이드.
VM vs AI Nexus 핵심 차이
| 항목 | VM / BM 환경 | AI Nexus |
|---|---|---|
| 실행 단위 | 서버 인스턴스 (상시 가동) | 세션 — 필요 시 생성/종료 |
| 환경 설치 | OS에 직접 패키지 설치 | 컨테이너 이미지 선택 후 pip 설치 |
| 데이터 저장 | 서버 로컬 디스크 | vFolder — 세션에 마운트하여 사용 |
| 소프트웨어 영속성 | 설치하면 유지 | 세션 종료 시 초기화 (vFolder 내 데이터는 유지) |
| GPU 할당 | 서버에 고정 | 세션 생성 시 동적 할당 |
핵심 원칙: AI Nexus 컨테이너 세션은 “일시적 실행 환경”. 영속할 데이터와 코드는 반드시 vFolder에 저장.
이전 전 체크리스트
- 현재 OS·CUDA·드라이버·Python 버전,
pip freeze > requirements.txt,conda env export > environment.yml - 데이터셋·체크포인트 위치와 용량, Git 원격 연동 여부, 로컬에만 있는 스크립트·크론잡
- 외부 API 키·환경변수, 사내 NFS/SMB 마운트 정보, 방화벽·포트 목록
vFolder 권장 구조
my-datasets ← 학습 데이터셋 (대용량, 읽기 전용 공유 가능)
my-checkpoints ← 모델 체크포인트
my-code ← 소스 코드 (Git 연동 또는 직접 업로드)
my-outputs ← 실험 결과, 로그
이미지 선택 예시 (원문 표기)
| 기존 환경 | 권장 AI Nexus 이미지 |
|---|---|
| CUDA 12.8 + PyTorch 2.7 | bai-repo:7080/bai/ngc-pytorch:25.03-pytorch2.7-py312-cuda12.8 |
| CUDA 13.0 + vLLM 0.19.0 | bai-repo:7080/bai/vllm:0.19.0-cuda13.0-ubuntu24.04@x86_64 |
| 커스텀 환경 | 관리자 문의 |
패키지 설치 전략 3가지
| 방법 | 설명 | 적합 상황 |
|---|---|---|
| A. 세션 시작 시 자동 설치 스크립트 | vFolder에 setup.sh 저장 → 세션마다 실행 | 패키지 수가 적을 때 |
| B. 커스텀 컨테이너 이미지 | 관리자에게 등록 요청 | 패키지 많거나 빌드 필요할 때 |
| C. Conda 환경을 vFolder에 저장 | /my-code/envs/에 Conda 환경 생성 → 재사용 | Python 환경 격리 필요할 때 |
VM 방식 → AI Nexus 대응 방법
| 기존 VM 방식 | AI Nexus 대응 |
|---|---|
~/ 홈에 파일 저장 | vFolder(/home/work/폴더명/)에 저장 |
nohup python train.py & 백그라운드 실행 | Batch 세션으로 제출 (세션 종료돼도 작업 유지) |
screen / tmux로 세션 유지 | AI Nexus 터미널 세션이 동일 역할 |
/etc/environment에 환경변수 | 세션 생성 시 환경변수 지정 또는 .env를 vFolder에 저장 |
df -h로 용량 확인 | WebUI vFolder 탭에서 확인 |
이전 후 검증 체크리스트
vFolder 업로드 확인 → 세션 내 경로 접근 확인 → requirements.txt 설치 후 import 오류 확인 → nvidia-smi / torch.cuda.is_available() → 소규모 시범 학습 → 체크포인트가 vFolder에 기록되는지 → 세션 재시작 후 vFolder 데이터 유지 확인.
5. WEBUI 기술지원 게시판 접속 가이드 (6p)
원문: 구글 드라이브
이 문서가 다루는 범위: AI Nexus 로그인 후 기술지원 게시판 접속·이용 절차.
접속 절차
- AI Nexus 웹UI에 로그인 (초기 비밀번호 → 즉시 변경 필수).
- 좌측 메뉴 NIPA 기술지원 탭 클릭.
- 게시판 전용 비밀번호 입력 (AI Nexus 로그인 비밀번호와 별개 — 발급 메일 참조).
게시판 구성
| 메뉴 | 내용 |
|---|---|
| 홈 | 최근 공지사항·기술지원 내역 확인 |
| 공지사항 | 관리자 공지 확인 |
| 기술지원 | 서비스 이용 관련 문의 등록 |
- 우측 상단 고객 정보에서 참여 중인 사업·회원 정보 확인, 마이페이지에서 사용자 정보 변경(변경 시 초기 비밀번호 입력 필요).
기술지원 문의 작성 시
- 분류: 중분류·소분류 선택 (해당 없으면 기타/기타).
- 파일 첨부 가능.
- 링크 첨부 시
http://또는https://포함 URL로 작성.
문의 채널 정리
| 구분 | 연락처 |
|---|---|
| NIPA 기술지원 (서비스 환경 문제) | AI Nexus 내 기술지원 게시판 |
| 공급사 운영 문의 (㈜콘텐츠브릿지) | nipa-gpu@conbridge.co.kr / 070-4291-7005 |
| 운영기관 정책·진행 문의 (KAIT) | 02-580-0216 / kaitcloud@kait.or.kr |
| 사업관리시스템(PMS) 오류 | 담당자 휴대폰 — 발급 메일 및 2026 HPC GPU 운영계획 참조 |
6. 🔴 사용자 교육 녹화본에서만 나온 것 (2026-08-10)
PDF 5종에는 없고 말로만 전달된 내용이다. 녹화본 2편(NIPA 총괄 신동필 수석 / kt cloud 윤민용 / 래블업 김종민·이승원)을 전사해 뽑았다.
6-1. 회수 위험 3단계 — 실제 수치
PDF는 “안전 / 경고 / 위험 3단계로 표시된다”까지만 적혀 있고 기준값이 없다. 교육에서 공개된 값:
| 표시 | 기준 (CPU 또는 GPU Utilization) |
|---|---|
| 위험 | 2% 미만 |
| 경고 | 2 ~ 8% |
| 안전 | 10% 이상 |
- 회수 판정에서 CPU와 GPU는 AND 조건이다. 둘 다 낮아야 회수 대상이 된다(kt cloud 윤민용).
- 이 3단계 표시는 1차 교육에서 “회수될지 UI로 알기 어렵다”는 요청을 받아 이번에 새로 넣은 기능이다.
6-2. 사용률 판정 — 사업 쪽 기준
- 분모는 월 720시간(30일 × 24h). 예: 300시간 사용 → 가동률 약 40%.
- 사용자 유형 구분: 우수 80% 이상 / 월별 50% 이상 / 저사용 10% 미만 / 미사용.
- 우수 사용자는 심의를 거쳐 자원을 추가로 받을 수 있다. 반대로 저·미사용은 회수·심의 대상.
- 10월경 만족도 조사와 중간점검 예정. 서면 제출 → 전문가 점검 → 실적 평가.
6-3. 🔴 지원 범위 — 학습이지 추론 서비스가 아니다
NIPA 총괄의 발언이 공고 문구보다 구체적이다.
- “지원 범위는 AI 모델 학습입니다. 추론 및 상용 서비스 지원은 불가합니다.”
- 단, 마지막 Q&A에서 스스로 범위를 좁혔다 — “추론 서비스가 안 된다는 건 맞지만, 학습할 때 검증에 필요한 것들은 가능합니다. 추론을 목적으로 하면 안 된다는 뜻이지, 데이터 검증까지 안 된다는 건 아닙니다.”
- 즉 경계는 **“추론이 목적인가”**다. 학습·검증에 딸린 추론은 허용, 상시 서비스 운영은 불가.
- 🔴 “이용신청서에 적은 목적과 무관하게 자원을 쓰는 사례가 발견됐다. 그런 경우 자원을 회수할 수밖에 없다.”
- 🔴 “인터페이스 세션이나 서비스 엔드포인트 등 자원 이용 현황을 지속적으로 모니터링하고 있습니다.”
- 공급사 답변도 같은 방향 — 상시 vLLM 서빙을 하고 싶다는 질문에 “요청이 없을 때 Util이 떨어져 회수된다. 상시 운영해야 하는 추론 서비스로는 구조적으로 적합하지 않다”고 답했다.
6-4. 중도 포기·제재
- 중도 포기 시 자부담금은 반환되지 않는다. 다만 미사용분은 환불 가능.
- 자원심의위원회가 차년도 사업 참여 제한을 심의한다. 작년에 실제 심의 이력이 있다.
- 심의 범위: 중도 포기, 중간·결과 성과보고서 미제출, 우수 사용자(자원 추가), 이의 제기.
6-5. 그 밖에 확인된 사실
- 스토리지: 배정 용량의 80% 이상을 쓰면 1TB 무상 증설, 그 이후는 유상. 기술지원 게시판으로 요청.
- SSH 접속 정보: 세션이 떠 있는 동안은 불변. 삭제·회수 후 재생성하면 도메인·포트가 바뀐다. 방화벽에 등록하려면 운영 도메인 3개 + 랜덤 포트 범위 전체를 넣어야 한다.
- 커밋 이미지는 자체 Harbor 레지스트리에 프라이빗으로 올라가고 사용자 본인에게만 노출된다(토큰을 이미지에 넣어도 외부 공개 안 됨 — 다만 권장할 일은 아니다).
- 8장 이상 멀티노드 생성 시 Infiniband 연결. NVLink도 지원.
- 허용된 클라이언트 IP는 꼭 필요한 경우가 아니면 비워두는 것을 권장(잘못 넣으면 본인이 잠긴다).
- 사전 개방 포트 외에 시스템이 점유 중인 포트가 따로 있어 지정할 수 없다.
- 사업은 단년도(1/1~12/31). 내년은 다시 공고·모집·선정 절차를 밟는다. 예산은 증액 예정이라는 언급.
- 사업 종료 시 자원 전량 회수 — 백업 기간 내 데이터 반출 필수.
- 영문 가이드는 별도 확인 후 제공하기로 함(현장 질의).
전사 원문:
_work/hpc_edu_20260812/edu1.txt(1시간 53분·1,309세그먼트),edu2.txt(29분·354세그먼트). 넥서스 H200 + faster-whisper large-v3로 전사(실시간 대비 약 13배속). 자동 전사라 고유명사·수치에 오인식이 섞여 있을 수 있어, 위에 옮긴 항목은 PDF·공고와 교차 확인한 것만 남겼다.
원본 자료 (2026-08-11 배포분)
㈜콘텐츠브릿지가 8/11 메일로 공유한 구글 드라이브 폴더.
| 녹화본 | 길이 | 내용 | 링크 |
|---|---|---|---|
| NIPA 고성능 컴퓨팅 사업 추가모집 사용자 교육 (2026-08-10) | 1시간 53분 | 사업 운영·관리 설명(NIPA) + AI Nexus 실습 + 사전질의 Q&A | 영상 |
| 고성능 컴퓨팅 사업(GPU) 사용자 교육 | 29분 27초 | AI Nexus 서비스 구조 + 멀티노드 세션 핸즈온 | 영상 |
드라이브 메타데이터에는 1번 영상 길이가 0으로 기록돼 있으나 실제 1시간 53분이다. 두 편 모두 전사해 6번 절에 반영했다.
6월 배포분 폴더(이전 버전): HPC 2026 매뉴얼 폴더