“내 컴퓨터에서 직접 AI를 돌리고 싶다.” 프라이버시, 비용, 커스터마이징 때문에 로컬 LLM에 관심 갖는 분이 늘었습니다. 그런데 하드웨어를 잘못 고르면 돈만 쓰고 제대로 못 돌립니다. 핵심은 하나. VRAM입니다.

왜 VRAM이 전부인가

LLM은 모델 크기(파라미터)에 비례해 메모리를 먹습니다. 그리고 모델이 그래픽카드 메모리(VRAM)에 다 올라가야 빠르게 돌아갑니다. 넘치면 느린 시스템 메모리로 밀려나 속도가 급락하죠.

💡 핵심: 로컬 LLM에서는 '연산 성능'보다 'VRAM 용량'이 먼저입니다. VRAM이 "어떤 크기의 모델을 돌릴 수 있나"를 결정합니다.

VRAM별 돌릴 수 있는 모델 (양자화 기준)

  • 7~8B 소형 → 8GB (입문·가벼운 작업)
  • 13~14B 중형 → 12~16GB
  • 30B급 → 24GB 이상
  • 70B급 이상 → 통합 메모리 큰 맥, 또는 다중 GPU

선택지 3가지

1) NVIDIA RTX 50 시리즈 (범용·게임 겸용)

가장 무난한 선택. 게임·영상·AI를 두루 쓰기 좋습니다.

카드VRAM성향
RTX 509032GB큰 모델까지 여유, 최상위
RTX 508016GB중형 모델·게임 균형
RTX 5070 Ti16GB가성비 중형
RTX 5060 Ti (16GB)16GB입문 중형

로컬 LLM에서는 VRAM 숫자를 먼저 보세요. 같은 세대라도 VRAM이 크면 더 큰 모델을 돌립니다.

2) 맥(통합 메모리 큰 모델) — 저소음·대용량

맥은 CPU·GPU가 메모리를 공유하는 통합 메모리 구조라, 메모리를 크게 구성하면 큰 모델을 조용하고 전력 효율 좋게 올릴 수 있습니다. 게임보다 AI·작업 중심이면 매력적입니다.

3) 미니PC(대용량 RAM) — 저전력 상시용

내장 그래픽 기반이라 빠르진 않지만, RAM을 크게(32~64GB) 두면 중형 모델까지 ‘느리지만’ 돌릴 수 있습니다. 저전력으로 상시 켜두고 가볍게 쓰기 좋습니다.

용도별 추천

우선순위추천
속도·게임 겸용RTX 5090(여유) / 5070 Ti(가성비)
큰 모델·저소음통합 메모리 큰 맥
저전력 상시용대용량 RAM 미니PC
⚠️ 짚고 넘어갈 점: 가끔 쓸 거면 로컬보다 클라우드 API가 더 쌉니다. 로컬은 '데이터 보안', '대량 상시 사용', '오프라인·커스터마이징'처럼 목적이 분명할 때 값어치를 합니다. 이유 없이 고사양부터 지르지 마세요.

정리

로컬 LLM 하드웨어의 정답은 “돌리려는 모델 크기에 맞는 VRAM”입니다. 게임 겸용이면 RTX 50 시리즈에서 VRAM 큰 모델을, 큰 모델·저소음이면 통합 메모리 큰 맥을, 저전력 상시용이면 대용량 RAM 미니PC를 고르세요. 그리고 구매 전, 정말 로컬이 필요한지부터 자문해 보길 권합니다.

※ 제품 스펙·가격은 시기·유통에 따라 다릅니다. 구매 전 최신 사양과 가격을 확인하세요. 본문 VRAM 기준은 양자화 적용 시의 일반적 권장치입니다.