로컬 AI 모델 추천|PC 사양별 고르는 3단계
VRAM 숫자 하나만 알면 더 이상 헤매지 않습니다
- 로컬 AI 모델 추천의 기준은 CPU·RAM이 아니라 그래픽카드의 VRAM 용량입니다.
- 8GB는 3B급, 12~16GB는 14~20B급, 24GB는 32~35B급이 실질적인 마지노선입니다.
- Q4 양자화를 쓰면 같은 VRAM으로 원래보다 훨씬 큰 모델을 돌릴 수 있습니다.
- 맥은 통합 메모리 전체가 VRAM처럼 동작해 노트북치고 유리한 편입니다.
- Ollama·LM Studio 둘 다 설치 후 5분 안에 첫 모델 실행이 가능합니다.
그래픽카드 사양표만 보고 로컬 AI 모델 추천을 검색해봤지만, 8GB와 24GB 사이에서 뭘 돌릴 수 있는지 감이 안 잡히셨을 겁니다.
모델 이름은 매달 쏟아지고, 파라미터 숫자는 3B부터 70B까지 제각각입니다. 하지만 결국 답을 정하는 건 딱 하나, 내 그래픽카드의 VRAM 용량입니다.
이 글에서는 VRAM 구간별로 실제 돌아가는 모델을 구체적인 이름과 함께 정리했습니다. 8GB 노트북부터 맥 통합 메모리까지, 내 사양에 맞는 답을 바로 찾아보세요.
1. 로컬 AI 모델 추천 전에 꼭 봐야 할 지표, VRAM
로컬 AI 모델 추천에서 가장 먼저 확인할 건 CPU 성능이 아닙니다. 그래픽카드에 달린 VRAM(비디오 메모리) 용량입니다.
모델 파일 전체가 VRAM 안에 올라가야 빠르게 답변이 나옵니다. VRAM이 부족하면 일부를 시스템 RAM으로 넘기는데, 이걸 CPU 오프로딩이라고 부릅니다.
문제는 속도입니다. 20B급 모델이 VRAM에 완전히 들어가면 초당 140토큰 가까이 나오지만, 같은 GPU에서 120B급 모델을 CPU 오프로딩으로 돌리면 초당 12토큰대로 떨어집니다. 11배 넘게 느려지는 셈입니다.
내 그래픽카드 VRAM 확인법은 간단합니다. 윈도우는 작업관리자 → 성능 탭 → GPU에서 “전용 GPU 메모리”를 보면 됩니다. 맥은 About This Mac에서 통합 메모리 용량이 그대로 VRAM 역할을 합니다.
2. 8GB VRAM대 로컬 AI 모델 추천, 입문자용
노트북 내장 GPU나 RTX 4060, RTX 3070처럼 8GB급 그래픽카드를 쓰고 있다면 3B~7B급 모델이 정답입니다.
Llama 3.2 3B는 Q4 양자화 기준으로 약 2GB밖에 안 됩니다. 8GB VRAM에서 여유 있게 돌아가고, 답변 속도도 체감상 빠릅니다.
조금 더 똑똑한 답변을 원한다면 Qwen2.5 7B나 Mistral 7B도 8GB에서 무리 없이 실행됩니다. 다만 컨텍스트(대화 기억) 창을 너무 크게 잡으면 VRAM이 부족해질 수 있으니 기본값에서 시작하는 걸 추천합니다.
8GB대에서 로컬 AI 모델 추천을 고를 때 실수는 “일단 제일 큰 모델부터”입니다. 14B급을 8GB에 억지로 넣으면 CPU 오프로딩이 걸려 체감 속도가 뚝 떨어집니다. 3B~7B로 시작해서 답변 품질이 부족할 때만 한 단계씩 올리는 게 낫습니다.
3. 12~16GB VRAM대 로컬 AI 모델 추천, 균형형
한국에서 가장 많이 추천되는 조합은 RTX 3060 12GB에 시스템 램 32GB입니다. 중고가가 안정적이고, 실사용 성능도 충분합니다.
이 구간이면 Qwen2.5 14B를 Q4로 무리 없이 돌릴 수 있습니다. 같은 가격대의 RTX 4060 8GB는 VRAM이 작아 모델 선택 폭이 좁다는 평이 많아, 로컬 AI 모델 추천 목적이라면 3060 12GB 쪽이 더 유리합니다.
16GB로 올라가면 선택지가 확 넓어집니다. gpt-oss 20B가 VRAM에 완전히 들어가면서 대화형 사용에 적합한 속도를 냅니다. Qwen3.5 9B나 Mistral Small 3.2도 이 구간에서 좋은 균형을 보여줍니다.
VRAM 용량을 살짝 넘는 모델을 억지로 돌리면 일부가 시스템 RAM으로 넘어가는 CPU 오프로딩이 걸립니다. 이 경우 응답 속도가 3~10배까지 느려질 수 있어, 채팅처럼 실시간 대화가 필요한 용도에는 답답하게 느껴집니다.
4. 24GB VRAM대 로컬 AI 모델 추천, 고성능형
RTX 4090이나 RTX 3090처럼 24GB급 그래픽카드를 쓰고 있다면 로컬 AI 모델 추천의 선택지가 크게 넓어집니다.
Qwen3.5 27B, Qwen3.6 27B는 Q4 양자화 기준으로 24GB에 여유 있게 들어가면서 코딩·추론 성능이 상당히 좋습니다. Mistral Small 3.2 24B도 24GB에서 안정적으로 돌아갑니다.
70B급 모델(Llama 3.3 70B 등)도 4-bit 양자화라면 24GB 한 장에 RAM 오프로드를 조금 섞어 돌릴 수 있습니다. 다만 완전히 VRAM에만 올리는 것보다 속도가 확실히 떨어진다는 점은 감안해야 합니다.
5. 40GB 이상 & 맥 통합메모리, 로컬 AI 모델 추천 끝판왕
40GB 이상은 듀얼 GPU나 워크스테이션급 카드가 필요한 구간입니다. 이 정도면 70B급 모델을 양자화 없이도 편하게 돌릴 수 있습니다.
재밌는 건 맥입니다. Apple Silicon은 CPU와 GPU가 통합 메모리를 함께 씁니다. 그래서 램 용량 전체가 곧 VRAM처럼 동작합니다. 32GB 통합 메모리 맥북이면 7B~14B급 모델을 큰 무리 없이 돌릴 수 있습니다.
Ollama와 LM Studio 모두 Metal 가속을 지원해서, 맥에서도 별도 그래픽카드 없이 준수한 속도를 냅니다. 다만 CPU 모드보다는 느려서, 실시간 대화보다는 배치 작업에 더 잘 맞는 경우가 많습니다.
맥으로 로컬 AI 모델 추천을 고민 중이라면 통합 메모리 용량이 곧 예산입니다. 16GB 맥북보다 32GB 이상 모델을 고르면 같은 가격이라도 실행 가능한 모델 범위가 확 늘어납니다. 그래픽카드를 따로 사는 대신 메모리 옵션에 투자하는 셈입니다.
6. 양자화(Q4/Q5/Q8), 로컬 AI 모델 추천에서 빠지면 안 되는 개념
양자화는 모델의 가중치를 낮은 정밀도 숫자로 압축하는 기술입니다. 원본(FP16)을 그대로 쓰면 용량이 두 배 이상 커져서, 대부분은 양자화 버전을 씁니다.
Q4는 용량 대비 품질 균형이 가장 좋아서 로컬 AI 모델 추천에서 사실상 기본값입니다. Q5는 품질이 조금 더 좋은 대신 용량도 늘고, Q8은 원본에 가까운 품질이지만 VRAM을 많이 씁니다.
Ollama에서는 모델 이름 뒤에 태그만 붙이면 양자화 버전을 바로 받을 수 있습니다. 예를 들어
ollama run qwen2.5:14b-instruct-q4_K_M처럼 입력하면 됩니다. 태그를 생략하면 기본 양자화(대개 Q4)가 자동으로 받아집니다.7. 로컬 AI 모델 추천 시 자주 하는 실수와 해결법
VRAM을 확인하지 않고 무작정 큰 모델부터 받는 경우가 가장 흔합니다. 다운로드에 시간만 쓰고 결국 CPU 오프로딩으로 느리게 돌리게 됩니다.
컨텍스트 길이를 기본값보다 무리하게 키우는 것도 자주 하는 실수입니다. 컨텍스트가 길어질수록 VRAM 사용량이 함께 늘어나서, 모델은 들어갔는데 대화가 길어지면 갑자기 느려지거나 멈추는 일이 생깁니다.
양자화를 너무 낮게(Q2 등) 잡아 억지로 큰 모델을 우겨넣는 것도 피해야 합니다. 답변 품질이 눈에 띄게 떨어지기 때문에, 차라리 한 단계 작은 모델을 Q4로 쓰는 편이 낫습니다.
모델을 처음 받을 땐 기본 컨텍스트·기본 양자화로 먼저 실행해보고, 속도와 품질을 확인한 다음 필요할 때만 설정을 조정하는 순서를 권장합니다. 처음부터 최대치로 설정하면 원인 파악이 어려워집니다.
❓ 자주 묻는 질문
가능합니다. CPU만으로도 3B급 소형 모델은 돌아갑니다. 다만 속도가 GPU 대비 크게 느려서, 실시간 대화보다는 간단한 테스트 용도에 적합합니다.
실행은 되지만 일부가 시스템 RAM으로 넘어가는 CPU 오프로딩이 걸립니다. 답변 속도가 3~10배까지 느려질 수 있습니다.
내장 GPU는 VRAM을 따로 두지 않고 시스템 램을 공유하는 경우가 많아 속도가 아쉽습니다. 그래도 3B급 모델 정도는 테스트해볼 만합니다.
아닙니다. 같은 크기라도 모델마다 코딩·다국어·추론 강점이 다릅니다. 용도를 먼저 정하고 그 안에서 VRAM에 맞는 모델을 고르는 순서를 권장합니다.
둘 다 설치 후 5분 안에 첫 모델을 실행할 수 있습니다. 터미널이 편하면 Ollama, GUI가 편하면 LM Studio를 추천합니다. 자세한 비교는 아래 관련 글을 참고하세요.
📚 함께 보면 좋은 글
로컬 AI 모델 추천을 정했다면, 설치부터 실전 활용까지 이어지는 글들도 함께 보세요.
🔗 공식 자료
📖 출처
Ollama 공식 모델 라이브러리(ollama.com/library) · NVIDIA 지포스 공식 사이트 · Qwen 공식 Hugging Face 페이지 · Apple 공식 Metal 개발자 문서 · LM Studio 공식 모델 카탈로그 · Rost Glukhov 개인 기술 블로그의 RTX 4080 16GB Ollama 벤치마크 자료
로컬 AI 모델 추천은 결국 내 그래픽카드의 VRAM 용량이 답을 정합니다. 8GB는 3B급, 16GB는 20B급, 24GB는 32B급을 기준으로 삼고, Q4 양자화로 시작해서 필요할 때만 단계를 올리면 실패 없이 첫 모델을 실행할 수 있습니다.






