콘텐츠로 이동

프로젝트

개인 클라우드 — 이 사이트가 돌아가는 곳

집 PC 를 공유기 포트포워딩·공인 IP·DDNS 없이 인터넷에 공개하는 셀프호스팅 기반. 지금 보고 있는 이 페이지가 그 위에서 서빙되고 있습니다.

스택 — Docker Compose · Traefik v3 · Cloudflare Tunnel · PostgreSQL · Redis · nginx

  • 아웃바운드 터널로만 공개 → 호스트 포트 개방 0개, 집 IP 비노출
  • Traefik 이 도커 라벨을 실시간 감시 → 앱을 추가해도 코어 재시작 불필요
  • 도커 소켓은 읽기전용 프록시로만 노출, 전 컨테이너 cap_drop: ALL + read_only
  • 논리 덤프 + 볼륨 아카이브 이중 백업, 보안 자가 점검 스크립트

구축기 읽기 →


연구실 공유 H100 GPU 워크스페이스 운영

학내 쿠버네티스 기반 GPU 클라우드(AIPub) 위 H100 80GB 워크스페이스를 연구실 공용으로 구축·운영. 계정 하나·GPU 한 대를 여럿이 사고 없이 쓰기 위한 환경 설계와 규칙 만들기까지.

스택 — Kubernetes 기반 GPU 클라우드 · Ubuntu 컨테이너 · NAS 볼륨 · PyTorch/CUDA · SFTP

  • 휘발성 컨테이너 환경에서 NAS 볼륨 위 공용 venv 구조 설계 → 재시작 후 복구를 수십 분에서 수십 초로 단축
  • 파일 전송 장애를 네트워크 계층(망 차단)과 권한 계층(사용자 불일치)으로 분리 진단·해결
  • 공유 계정의 리소스 충돌(Pause 사고) 방지 운영 규칙을 설계하고 랩 세미나에서 합의·도입
  • 비전공 동료도 따라 하는 사용 매뉴얼 작성·배포 (v1→v2.2, 검증 기반 개선)

운영기 읽기 → · 매뉴얼 PDF (마스킹판) →


진행 예정

ML 모델 서빙 API

FastAPI 로 학습한 모델을 api.salmonpoke.org 에 공개하고, 요청 로깅·입력 검증·버전 관리까지 붙이는 것이 목표.

CI/CD 파이프라인

GitHub Actions 로 이미지를 빌드하고 이 클라우드에 자동 배포. "push 하면 몇 분 뒤 서비스에 반영"을 직접 구현.

실험 추적과 모니터링

MLflow 로 실험·모델 레지스트리를 관리하고, Prometheus + Grafana 로 서빙 지표를 관측.