본문으로 바로가기

RTX 3060 12GB 홈서버로 가능한 로컬 AI 작업

결론부터 말하면, 이 홈서버의 RTX 3060 12GB에서는 Ollama로 9.7B Q4 양자화 언어모델을 GPU에 전부 배치해 한 번에 한 편의 출처 기반 초안을 만드는 작업이 가능했다.

검증 실행에서 qwen3.5:9b Q4_K_M 모델의 GPU 배치는 100%였고 관측된 최대 VRAM은 7,255MiB였다. 12,288MiB 전체를 다 쓴 것은 아니며 OOM은 발생하지 않았다. 이 수치는 현재 서버와 해당 요청 조건의 관측값이지 모든 9B 모델과 컨텍스트 길이에 대한 보장은 아니다.

반대로 대형 모델 학습, 여러 사용자의 긴 요청 동시 처리, 영상 생성과 언어모델의 동시 GPU 사용은 이 증거만으로 가능하다고 말할 수 없다. 홈서버에서는 모델 크기보다 VRAM, 컨텍스트 길이, 동시성, 발열·전력과 실패 시 대기열을 함께 봐야 한다.

이 글로 해결할 수 있는 것

  • RTX 3060 12GB에서 실제 확인한 로컬 LLM 범위를 안다.
  • 모델 파일 크기와 실행 중 VRAM이 같은 숫자가 아닌 이유를 이해한다.
  • 구매 전에 모델·동시성·전력 조건을 어떻게 검증할지 안다.

검증 환경

GPUNVIDIA GeForce RTX 3060
VRAM12,288MiB
드라이버550.163.01
GPU 전력 제한180W
런타임Docker의 Ollama
검증 모델qwen3.5:9b, 9.7B, Q4_K_M

2026-08-22 UTC에 Docker 호스트 네임스페이스에서 읽기 전용 nvidia-smi 질의를 실행했다. 관련 증거는 content/evidence/rtx3060_runtime_20260822.json에 기록했다.

확인된 가능 작업

  • 여러 공식 출처를 입력으로 한 한국어 블로그 초안 한 편 생성
  • 초안 상태로 Ghost에 전달하고 사람 검수 대기
  • 모델 전체 GPU 배치 상태에서 단일 bounded 요청 실행

현재 콘텐츠 엔진은 스케줄러와 공개 발행 메서드가 없고, 생성 결과를 draft로만 보낸다. GPU가 충분하다는 이유로 무검수 공개 범위를 넓히지 않는다.

VRAM 숫자를 읽는 법

모델 파라미터를 4비트로 양자화하면 가중치 저장량은 줄지만, 실행 중에는 컨텍스트용 KV cache, 런타임 버퍼와 다른 GPU 프로세스가 메모리를 더 사용한다. 따라서 모델 파일 크기만 보고 12GB에 들어간다고 단정하지 않고 실제 컨텍스트 길이와 요청으로 측정해야 한다.

확인되지 않은 작업

  • 여러 명이 동시에 쓰는 서비스의 안정 처리량
  • 긴 컨텍스트에서의 최대 VRAM과 지연
  • 파인튜닝 또는 본격적인 모델 학습
  • 이미지·영상 생성과 LLM의 동시 실행
  • 벽전력계로 측정한 월 전기료

특히 월 전기료는 GPU의 180W 전력 제한을 24시간 소비전력으로 곱해 만들면 안 된다. 실제 벽전력과 하루 사용시간, 유휴시간, 지역 요금표가 필요하다.

구매 전 체크리스트

  1. 실행할 모델의 정확한 양자화와 컨텍스트 길이를 정한다.
  2. 동시 요청 수와 최대 응답 시간을 정한다.
  3. 실제 요청 중 VRAM·전력·온도·OOM을 측정한다.
  4. 실패 시 CPU fallback, 요청 제한과 대기열을 준비한다.
  5. 전기료는 벽전력계와 실제 요금표로 계산한다.

한계와 변경 이력

이 글은 현재 서버 한 대의 관측 기록이며 제품 전체의 벤치마크나 구매 추천이 아니다. 모델·드라이버·Ollama 버전이 바뀌면 다시 측정한다.

  • 최종 검토: 2026-08-22
  • 2026-08-22: GPU, 드라이버, VRAM과 실제 초안 생성 피크 기록