LM Studio 사용법|로컬 LLM 3단계로 쉽게 쓰기
설치부터 첫 대화까지, 코딩 몰라도 따라오면 끝
- LM Studio 사용법은 설치 → 모델 다운로드 → 로드, 딱 3단계로 끝난다.
- 최소 사양은 RAM 16GB, VRAM 4GB 이상 권장이며 8GB RAM에서도 가벼운 모델은 돌아간다.
- GGUF 형식과 양자화(Q4_K_M 등)만 이해하면 모델 선택이 훨씬 쉬워진다.
- 내장 로컬 서버로 API 비용 없이 나만의 AI 도구를 만들 수 있다.
- 초보자가 자주 겪는 로딩 실패·속도 저하 문제와 해결법까지 함께 정리했다.
ChatGPT는 잘 쓰고 있는데, 회사 문서나 개인정보가 담긴 파일을 외부 서버에 올리기는 꺼려질 때가 있습니다. 인터넷이 끊긴 곳에서도 AI를 쓰고 싶을 때도 마찬가지입니다.
이럴 때 필요한 게 내 컴퓨터 안에서 돌아가는 AI, 즉 로컬 LLM입니다. 이 글의 LM Studio 사용법을 따라가면 코드 한 줄 없이 설치부터 첫 대화까지 끝낼 수 있습니다.
준비물은 컴퓨터 한 대뿐입니다. 최소 사양 확인, 설치, 모델 다운로드, 대화 시작까지 순서대로 설명합니다.
1. LM Studio 사용법을 배우기 전에: 로컬 LLM이 뭔가요
로컬 LLM은 ChatGPT 같은 대형 언어 모델을 클라우드 서버가 아니라 내 컴퓨터에서 직접 실행하는 방식입니다. 질문을 입력하면 인터넷 어딘가로 전송되는 게 아니라, 내 하드디스크에 저장된 모델 파일이 내 GPU나 CPU로 답을 계산합니다.
LM Studio는 이 과정을 그래픽 인터페이스로 감싼 데스크톱 앱입니다. 터미널 명령어를 몰라도 모델을 검색하고, 다운로드하고, 클릭 한 번으로 대화를 시작할 수 있습니다.
Windows, macOS, Linux를 모두 지원합니다. Apple Silicon 맥에서는 MLX 백엔드를, 그 외 환경에서는 llama.cpp 백엔드를 사용해 모델을 구동합니다.
로컬 LLM의 가장 큰 장점은 두 가지입니다. 첫째, API 사용료가 들지 않습니다. 모델을 한 번 받아두면 몇 번을 질문해도 추가 비용이 없습니다. 둘째, 데이터가 컴퓨터 밖으로 나가지 않습니다. 계약서나 코드처럼 민감한 문서를 다룰 때 특히 유용합니다. 다만 클라우드 모델만큼 똑똑하길 기대하면 실망할 수 있습니다. 내 하드웨어가 감당할 수 있는 크기의 모델만 돌릴 수 있기 때문입니다.
2. 설치 전 확인할 최소 사양: RAM과 VRAM
LM Studio 자체는 가벼운 프로그램입니다. 설치 용량은 300MB가 안 되고, 대기 상태에서 쓰는 메모리도 200~400MB 수준입니다. 문제는 모델 파일입니다.
공식 문서 기준 CPU는 x64에서 AVX2 명령어 세트를 지원해야 합니다. RAM은 최소 16GB를 권장하며, GPU는 최소 4GB 전용 VRAM을 권장합니다. 8GB RAM에서도 실행은 되지만 작은 모델로 제한됩니다.
모델 크기별로 필요한 메모리가 다릅니다. 처음 시작한다면 아래 표로 내 컴퓨터에 맞는 모델 크기를 먼저 가늠해 보세요.
노트북에 내장 그래픽만 있다면 7B급부터 시작하세요. RTX 4060처럼 8GB VRAM급 그래픽카드라면 8B 모델을 4비트 양자화로 여유 있게 돌릴 수 있습니다.
3. LM Studio 사용법 3단계: 설치부터 첫 실행까지
사양 확인이 끝났다면 이제 실제로 설치할 차례입니다. LM Studio 사용법의 첫 단계는 어렵지 않습니다. 공식 사이트에서 내 운영체제에 맞는 설치 파일을 받으면 끝입니다.
3-1. 설치 파일 다운로드
lmstudio.ai에 접속하면 자동으로 내 운영체제를 감지해 맞는 버전을 안내합니다. Windows는 exe 설치 파일, macOS는 dmg, Linux는 AppImage 형태로 배포됩니다.
3-2. 설치 및 첫 실행
Windows와 macOS는 다운로드한 파일을 실행하고 안내를 따라가면 됩니다. Linux는 AppImage에 실행 권한을 준 뒤 바로 실행하면 됩니다. 별도 회원가입 없이 바로 앱이 열립니다.
처음 실행하면 홈 화면에 추천 모델 목록이 뜹니다. 초보자라면 이 목록에서 바로 하나를 받아도 되지만, 다음 섹션에서 설명할 양자화 개념을 먼저 알아두면 내 사양에 맞는 모델을 더 정확히 고를 수 있습니다.
3-3. 인터페이스 둘러보기
왼쪽 사이드바에 채팅, 모델 검색(Discover), 개발자 서버(Developer) 탭이 있습니다. 개발자 탭에서는 로컬 포트 1234에서 OpenAI API와 호환되는 서버를 켤 수 있어, 다른 프로그램에서도 내 로컬 모델을 불러 쓸 수 있습니다.
Linux에서는 Ubuntu 22 기준으로 테스트가 이뤄지고 있어, 그보다 최신 배포판에서는 예상치 못한 오류가 나올 수 있습니다. 문제가 생기면 공식 GitHub 저장소에 이슈로 남기는 것이 가장 빠른 해결 경로입니다.
4. GGUF 모델과 양자화, 헷갈리는 용어 정리
모델 검색 화면에 들어가면 같은 모델인데도 파일명 끝에 Q4_K_M, Q8_0 같은 표기가 여러 개 붙어 있어 당황하기 쉽습니다. 이건 압축 방식, 즉 양자화 수준을 뜻합니다.
원래 모델은 매우 크고 정밀한 숫자로 이루어져 있습니다. 양자화는 이 숫자를 더 적은 비트로 근사해 파일 크기와 필요 메모리를 줄이는 기술입니다. 대신 정확도가 아주 조금 떨어집니다.
GGUF는 이런 양자화 모델을 저장하는 파일 형식입니다. LM Studio는 Hugging Face에 올라온 대부분의 GGUF 모델을 그대로 검색하고 받을 수 있습니다.
모델을 고를 때 LM Studio는 다운로드 전에 예상 RAM·VRAM 사용량을 미리 표시해 줍니다. 설치 후 실행이 안 되는 낭패를 미리 막아주는 유용한 기능입니다.
5. 모델 로드하고 AI와 첫 대화 시작하기
모델을 받았다면 이제 실제로 불러올 차례입니다. Discover 탭에서 모델 이름을 검색하고 Download를 누르면 자동으로 다운로드가 시작됩니다.
다운로드가 끝나면 채팅 탭 상단에서 방금 받은 모델을 선택합니다. 몇 초에서 몇십 초 정도 로딩 시간이 지나면 대화창이 활성화됩니다.
이제 궁금한 걸 그냥 입력하면 됩니다. 문서를 첨부하고 싶다면 PDF나 텍스트 파일을 채팅창으로 끌어다 놓으면, 모델이 그 내용을 참고해 답합니다.
대화 속도가 마음에 안 든다면 오른쪽 설정 패널에서 GPU 오프로드 레이어 수를 조절해 보세요. 값을 높일수록 GPU가 더 많이 계산을 맡아 속도가 빨라지지만, VRAM이 부족하면 오히려 오류가 납니다. 처음엔 자동 설정을 쓰고, 느리다 싶을 때만 조금씩 올려가며 테스트하는 게 안전합니다.
6. 자주 하는 실수와 문제 해결법
LM Studio 사용법을 처음 익힐 때 많이 겪는 문제 세 가지를 정리했습니다.
모델이 로드되지 않는 경우: 대부분 RAM이나 VRAM 부족입니다. 더 낮은 양자화(Q4 등) 버전이나 더 작은 파라미터 모델로 바꿔보세요.
답변 속도가 너무 느린 경우: GPU 오프로드가 꺼져 있거나 낮게 설정된 경우가 많습니다. 설정에서 GPU 레이어 수를 확인하세요.
다른 프로그램에서 로컬 모델을 못 찾는 경우: Developer 탭에서 서버가 꺼져 있진 않은지, 포트 1234가 다른 프로그램과 충돌하진 않는지 확인하세요.
자주 묻는 질문
개인 사용은 무료입니다. 모델 파일도 대부분 무료로 공개된 오픈소스 모델을 받아 쓰는 방식이라 별도 결제가 필요 없습니다.
가능합니다. CPU만으로도 작동하지만 속도가 느립니다. GPU 오프로드를 쓰면 응답 속도가 크게 빨라집니다.
모델을 한 번 받아두면 이후에는 완전 오프라인으로 작동합니다. 비행기나 인터넷이 불안정한 곳에서도 문제없습니다.
Ollama는 명령줄 중심, LM Studio는 그래픽 인터페이스 중심입니다. 터미널이 낯설다면 LM Studio가 더 편합니다.
네, 용도별로 여러 모델을 받아두고 필요할 때마다 바꿔가며 로드할 수 있습니다. 다만 디스크 용량은 미리 확인하세요.
📚 함께 보면 좋은 글
로컬 AI와 AI 코딩 도구를 더 깊게 다뤄본 글들입니다. 함께 보면 도움이 됩니다.
🔗 공식 자료
📖 출처
LM Studio 공식 문서(lmstudio.ai/docs) · Hugging Face GGUF 문서(huggingface.co/docs/hub) · ITWorld “LM 스튜디오 첫인상” · PromptQuorum LM Studio 설치 가이드 · LocalLLM.in VRAM 요구사항 가이드
LM Studio 사용법은 설치, GGUF 모델 다운로드, 로드 세 단계면 충분합니다. 내 사양에 맞는 양자화만 골라도 대부분의 문제는 해결됩니다.






