Zero to MVP가 ZimaCube 2에서 2~4GB AI 모델을 24시간 내내 실행하는 방법

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

소형 언어 모델을 바라보는 실용적인 관점을 보여 준 Zero to MVP에게 감사드립니다. 그의 전체 영상에서 그는 2~4GB 모델을 가장 큰 AI 모델의 성능이 낮은 대체재가 아니라 특화된 상시 실행 도구로 다룰 때 훨씬 유용해진다고 설명합니다.

그의 설정에서는 ZimaCube 2를 조용한 홈 서버로 사용합니다. 이 서버는 로컬 모델을 24시간 사용할 수 있도록 유지하는 동시에 해당 모델이 처리하는 문서도 저장할 수 있습니다. 시연에는 OCR, 자동 기사 요약, 건강 관련 정보의 비공개 처리, 파일 기반 번역이 포함됩니다. 이러한 작업에서는 최대 모델 성능보다 예측 가능한 입력, 반복적인 요청, 개인정보 보호, 낮은 오버헤드가 더 중요할 수 있습니다.

협업 공개: 이 글은 Zero to MVP가 시연한 워크플로와 모델 예시를 바탕으로 작성되었습니다. 모델 버전, 파일 크기, 런타임 메모리 사용량, 하드웨어 요구 사항, 소프트웨어 호환성, 추론 성능은 시간이 지나면서 변경될 수 있습니다. 여기에서 다루는 건강 관련 AI 도구는 전문적인 의학적 조언, 진단 또는 치료를 대신하는 수단으로 간주해서는 안 됩니다.

결과: 소형 모델은 반복 실행이 필요한 좁은 범위의 작업을 맡길 때 매력적입니다. 하나의 거대한 모델에 모든 일을 맡기는 대신, 홈 서버에서 OCR, 요약, 번역 또는 기타 특화된 백그라운드 작업을 위해 여러 개의 컴팩트한 모델을 항상 사용할 수 있게 유지할 수 있습니다.

소형 AI 모델을 24시간 실행하는 이유는 무엇일까요?

로컬 AI에 관한 논의는 흔히 머신에서 불러올 수 있는 가장 큰 모델에 초점을 맞춥니다. Zero to MVP는 다른 접근 방식을 취합니다. 항상 실행되는 워크플로에서는 모델이 백그라운드에서 계속 사용 가능할 만큼 하나의 정해진 작업을 안정적으로 수행할 수 있는지가 더 중요한 질문입니다.

2~4GB 모델은 모든 유형의 추론에서 최첨단 대규모 모델과 경쟁할 필요가 없습니다. 대신 더 큰 워크플로 내에서 전담 구성 요소가 될 수 있습니다. 문서에서 텍스트를 인식하거나, 기사를 요약하거나, 파일을 번역하거나, 다른 애플리케이션이 결과를 사용하기 전에 정보를 로컬에서 처리하는 식입니다.

이렇게 하면 모델의 역할이 가끔 사용하는 챗봇에서 하나의 서비스로 바뀝니다.

2~4GB 로컬 모델은 실제로 어떤 모습일까요?

Zero to MVP의 Ollama 환경에 설치된 모델은 이 접근 방식이 얼마나 컴팩트할 수 있는지 보여줍니다. 터미널에는 약 2.1GB부터 3.4GB까지 다양한 네 개의 모델이 표시되며, 각 모델은 서로 다른 유형의 작업에 적합합니다.

2.1GB에서 3.4GB 사이의 MedGemma 1.5, Granite 4.1 3B, GLM-OCR 및 Qwen 3.5 4B 모델을 나열한 Ollama 터미널 화면

Zero to MVP의 Ollama 라이브러리에는 MedGemma 1.5, Granite 4.1 3B, GLM-OCR 및 Qwen 3.5 4B가 포함되어 있으며, 표시된 모델 파일의 크기는 2.1GB에서 3.4GB까지입니다.

표시된 모델 표시된 크기 워크플로에서의 역할
MedGemma 1.5 3.3GB 건강 관련 정보의 로컬 처리.
Granite 4.1 3B 2.1GB 로컬 모델 라이브러리에서 사용할 수 있는 컴팩트한 범용 모델입니다.
GLM-OCR 2.2GB 스캔한 문서를 기계 판독이 가능한 텍스트와 Markdown으로 변환합니다.
Qwen 3.5 4B 3.4GB 기사 요약과 번역을 비롯한 작업에 사용됩니다.

중요한 점은 실행 중인 모든 모델이 정확히 동일한 양의 메모리를 사용하는 것이 아니라는 것입니다. 이 수치는 Ollama에 표시된 모델 파일을 설명합니다. 런타임 메모리, 컨텍스트, 캐시, 운영 체제 및 기타 활성 서비스에도 각각 추가 리소스가 필요합니다.

소형 모델은 단순히 축소한 대형 모델이 아니라 다른 도구입니다

로컬 AI는 대개 데스크톱 워크스테이션과 대형 외장 GPU와 관련이 있습니다. 워크로드에 더 큰 모델, 높은 처리량 또는 고부하 생성 작업이 필요할 때는 이러한 하드웨어가 적합합니다.

AMD Radeon Pro W7800 그래픽 카드가 설치된 데스크톱 워크스테이션

AMD Radeon PRO W7800이 장착된 데스크톱 워크스테이션은 로컬 AI 하드웨어에서 더 익숙한 고성능 접근 방식을 보여 줍니다.

하지만 간단하고 반복적인 요청을 받는 백그라운드 서비스는 요구 사항이 다릅니다. OCR 작업, 번역 요청 또는 짧은 요약을 처리할 때마다 강력한 워크스테이션을 예약하는 것보다, 성능이 modest한 하드웨어에서 소형 특화 모델을 준비해 두는 편이 더 합리적일 수 있습니다.

키보드 옆 책상 위에 방열판이 장착된 컴팩트 컴퓨팅 장치 두 대

컴팩트 컴퓨팅 하드웨어는 로컬 AI 스펙트럼의 다른 측면을 보여 줍니다. 특화된 소형 모델을 사용하면 모든 작업에 데스크톱급 워크스테이션을 전용으로 할당하지 않고도 유용한 AI 서비스를 구현할 수 있습니다.

대형 범용 모델 소형 특화 모델
범위가 넓고 정해지지 않은 다양한 프롬프트를 처리하도록 설계되었습니다. 더 좁고 예측 가능한 작업을 할당할 수 있습니다.
더 많은 메모리와 가속기 리소스의 이점을 얻는 경우가 많습니다. 더 적은 하드웨어와 메모리로 운영할 수 있습니다.
복잡한 추론이나 폭넓은 기능이 중요할 때 유용합니다. 동일한 간단한 작업을 반복해서 실행해야 할 때 유용합니다.
단순한 백그라운드 처리에는 과도할 수 있습니다. 더 적은 오버헤드로 지속적인 서비스로 상시 실행할 수 있습니다.

소형 모델이라고 해서 리소스 비용이 전혀 없는 것은 아닙니다

파일 크기가 작다고 해서 런타임 오버헤드가 없다는 뜻은 아닙니다. Ollama가 활성화된 동안 Zero to MVP의 시스템 모니터는 이를 현실적으로 확인할 수 있게 해 줍니다.

로컬 AI 모델이 실행되는 동안 Ollama llama-server의 CPU 및 메모리 사용량을 보여 주는 htop 터미널

실시간 시스템 모니터에는 실행 중 Ollama의 llama-server가 CPU와 수 기가바이트의 메모리를 사용하는 모습이 표시됩니다. 이는 파일 크기가 작은 모델에도 추가 런타임 리소스가 필요하다는 것을 보여 줍니다.

측정된 워크로드에서 시스템은 전체 메모리 약 7.8GB를 보고하며 그중 수 기가바이트가 사용 중입니다. 한편 Ollama llama-server 프로세스가 상주 메모리와 CPU 시간의 상당 부분을 차지합니다.

항상 켜 두는 서버를 계획할 때는 이 차이가 중요합니다. 모델 파일이 3.4GB라고 해서 시스템 RAM 3.4GB만으로 전체 시스템이 충분하다는 뜻은 아닙니다. 운영체제, 추론 런타임, 컨텍스트, 캐시, 스토리지 서비스 및 기타 자체 호스팅 애플리케이션이 작동할 공간도 필요합니다.

따라서 소형 모델의 장점은 리소스가 전혀 필요하지 않다는 것이 아니라, 관리 가능한 리소스 요구량입니다.

항상 켜 두기 좋은 소형 모델의 네 가지 작업

Zero to MVP는 중요한 특징을 공유하는 네 가지 워크플로를 보여 줍니다. 이러한 워크플로는 범위가 정해지지 않은 범용 어시스턴트보다 경계가 명확합니다. 따라서 홈 서버에서 계속 실행할 수 있는 특화 모델에 적합합니다.

1. GLM-OCR로 스캔한 PDF를 Markdown으로 변환하기

첫 번째 워크플로에서는 GLM-OCR을 사용해 스캔한 PDF를 Markdown으로 변환합니다. OCR은 목표가 명확한 유용한 예시입니다. 시각적 문서 콘텐츠를 저장, 검색, 색인, 요약하거나 다른 애플리케이션에서 처리할 수 있는 기계 판독 가능 텍스트로 변환하는 작업이기 때문입니다.

OCR이 서버 측 서비스가 되면 워크플로를 수동 챗봇 대화로 시작할 필요가 없습니다. 문서를 폴더에 넣으면 자동으로 처리되고, OCR 단계가 끝난 뒤 구조화된 텍스트로 출력할 수 있습니다.

홈 서버에 원본 PDF가 이미 저장되어 있을 때 특히 유용합니다. 파일을 외부 서비스에 반복해서 업로드하는 대신, 동일한 로컬 환경에서 저장과 문서 처리를 수행할 수 있습니다.

2. Qwen 3.5 4B로 기사 자동 요약하기

두 번째 예제에서는 Qwen 3.5 4B를 사용해 기사를 요약합니다. 요약 작업은 일부 워크로드에서 최대한의 지능보다 반복 실행 능력이 더 중요한 이유를 보여 줍니다.

들어오는 기사를 지속적으로 더 짧은 메모로 바꾸는 것이 목표라면, 소형 모델을 자동화된 파이프라인의 한 단계로 활용할 수 있습니다.

  • 기사를 받거나 저장합니다.
  • 텍스트를 추출합니다.
  • 텍스트를 로컬 모델로 보냅니다.
  • 더 짧은 요약을 생성합니다.
  • 나중에 읽거나 색인하거나 검색할 수 있도록 결과를 저장합니다.

이러한 유형의 워크플로에서는 가용성이 중요합니다. 이미 로컬에서 실행 중인 소형 모델은 누군가 모든 문서마다 AI 인터페이스를 수동으로 열 필요 없이 반복 작업을 처리할 수 있습니다.

3. MedGemma로 건강 관련 정보를 로컬에 보관

Zero to MVP는 MedGemma를 건강 관련 정보를 위한 비공개 로컬 어시스턴트로 사용하는 방법도 보여줍니다. 여기서 중요한 이점은 단순히 모델의 크기가 아닙니다. 데이터가 처리되는 위치입니다.

사용자가 제어하는 하드웨어에서 추론을 실행하면 일상적인 정리, 추출 또는 요약 작업을 위해 개인 문서를 원격 챗봇으로 보내야 할 필요성을 줄일 수 있습니다.

그렇다고 로컬 모델이 의사가 되는 것은 아닙니다. 모델의 출력은 불완전하거나 부정확하거나 오해를 불러일으킬 수 있으며, 건강 관련 의사 결정은 여전히 자격을 갖춘 의료 전문가가 내려야 합니다. 로컬 모델의 유용한 역할은 정보 처리 도구이며, 특히 개인정보 보호가 워크플로의 중요한 부분일 때 더욱 그렇습니다.

4. Qwen 3.5 4B로 자동 번역 실행

이 번역 데모는 소형 모델이 백그라운드 서비스로 작동하는 모습을 가장 명확하게 보여주는 예일 수 있습니다. 번역을 채팅 세션으로 취급하는 대신, 파일과 폴더를 중심으로 워크플로를 구성할 수 있습니다.

Zero to MVP의 예시에서는 로컬 서버의 번역 디렉터리에 입력 폴더와 출력 폴더가 별도로 마련되어 있습니다. 그런 다음 이 처리 파이프라인의 결과로 일본어 텍스트 파일을 확인할 수 있습니다.

zimacube2-local 홈 서버의 번역 폴더에 표시된 일본어 텍스트 파일

다음 위치에서 번역된 일본어 텍스트 파일을 엽니다: zimacube2-local 파일 기반 번역 워크플로의 일부로, 별도의 입력 및 출력 디렉터리가 뒤에 보이는 서버입니다.

입력과 예상 출력이 모두 제한되어 있으므로 번역은 전문화에 매우 적합합니다. 문서를 알려진 대상 언어로 반복해서 번역하는 것이 목적이라면, 모든 요청에 가장 폭넓은 추론 모델이 필요하지 않을 수 있습니다.

이러한 백그라운드 AI에 ZimaCube 2가 적합한 이유

모델은 상시 가동 워크플로의 한 계층일 뿐입니다. 서버는 원본 파일을 저장하고, 애플리케이션을 계속 실행하며, 다른 기기에서 해당 서비스에 접근할 수 있도록 하고, 장시간 운영하기에도 실용적이어야 합니다.

Zero to MVP는 ZimaCube 2를 낮은 전력 소비, 모델이 처리하는 데이터를 저장하기에 충분한 드라이브 용량, 지속적인 사용에 적합한 조용한 작동을 갖춘 상시 가동 시스템으로 소개합니다.

이 조합은 AI 서비스가 필요한 파일과 같은 곳에 있을 수 있기 때문에 소형 모델 워크플로에 특히 적합합니다. OCR을 기다리는 PDF, 요약을 기다리는 기사, 비공개 문서, 번역 작업을 모두 모델이 실행되는 동일한 홈 서버 환경에 보관할 수 있습니다.

ZimaCube 2는 나중에 AI 워크로드가 증가하는 사용자를 위한 확장 경로도 제공합니다. 따라서 더 큰 모델이나 더 빠른 처리량을 위해 추가 전력과 비용을 들일 가치가 생겼을 때, 더 가벼운 로컬 추론으로 시작한 뒤 가속기 하드웨어를 추가할 수 있습니다.

이러한 확장 방식에 대해 자세히 알아보려면 ZimaCube 2 로컬 AI에 관한 ZimaSpace 가이드를 참조하세요. 이 가이드에서는 Ollama, PCIe 확장, CPU 기반 워크로드에서 GPU 지원 추론으로 전환하는 업그레이드 경로를 살펴봅니다.

소형 모델은 백그라운드 작업자로 가장 잘 작동합니다

네 가지 데모는 더 넓은 설계 패턴을 보여 줍니다. 사용자가 소형 모델에 범용 어시스턴트처럼 행동하도록 요구하는 대신 특정 프로세스 안에 배치할 때, 소형 모델은 특히 큰 가치를 발휘합니다.

이 과정은 다음과 같은 형태일 수 있습니다.

  • 감시: 새 입력이 들어오는지 폴더나 애플리케이션을 모니터링합니다.
  • 처리: 해당 작업에 맞게 선택한 모델로 입력을 보냅니다.
  • 검증: 결과가 예상한 구조나 품질을 갖추었는지 확인합니다.
  • 저장: 결과를 로컬 서버에 다시 저장합니다.
  • 반복: 다음 요청을 위해 서비스를 계속 사용할 수 있는 상태로 유지합니다.

“24/7 AI”라는 표현이 토큰을 계속 생성한다는 뜻은 아닌 이유가 바로 여기에 있습니다. 새로운 문서, 기사 또는 번역 작업이 나타날 때마다 사용할 수 있도록 여러 경량 서비스를 준비해 둔다는 의미일 수 있습니다.

소형 언어 모델은 언제 선택해야 할까요?

영상 후반부에 Zero to MVP는 소형 모델이 특히 유용한 여섯 가지 조건을 요약합니다. 이 조건들은 컴팩트한 로컬 모델과 더 큰 대안 중 무엇을 선택할지 판단하는 데 유용한 기준을 함께 제공합니다.

개인정보 보호, 오프라인 사용, 저전력 하드웨어, 간단한 요청, 낮은 비용, 전문화를 포함한 소형 AI 모델의 여섯 가지 이점을 나열한 슬라이드

Zero to MVP는 소형 모델이 특히 유용한 여섯 가지 상황을 요약합니다. 로컬 및 비공개 처리, 오프라인 작동, 저전력 하드웨어, 간단한 요청 다수 처리, 비용 최소화, 전문화입니다.

소형 모델이 특히 유용한 경우... 중요한 이유
로컬 및 비공개 처리가 중요합니다. 데이터는 모든 요청마다 원격 모델로 전송되는 대신 셀프 호스팅 워크플로 내부에 남아 있을 수 있습니다.
인터넷 연결이 없습니다. 로컬에서 사용할 수 있는 모델은 클라우드 추론 엔드포인트에 의존하지 않고 지원되는 작업을 계속 처리할 수 있습니다.
하드웨어 리소스가 제한되어 있습니다. 더 작은 모델 파일과 낮은 런타임 요구 사항 덕분에 성능이 낮은 시스템에서도 로컬 추론을 실용적으로 사용할 수 있습니다.
간단한 요청이 많습니다. 상시 실행되는 모델은 각 작업마다 훨씬 더 큰 모델을 사용하지 않고도 좁은 범위의 작업을 반복적으로 처리할 수 있습니다.
비용을 최소화해야 합니다. 반복적인 작업에 로컬 하드웨어를 사용하면 요청별 호스팅 추론 서비스에 대한 의존도를 줄일 수 있지만, 전기와 하드웨어에는 여전히 비용이 듭니다.
작업을 특화할 수 있습니다. 특정 작업 하나를 위해 선택된 모델이 모든 유형의 추론을 똑같이 잘 수행할 필요는 없습니다.

이 실험이 보여 주는 것과 보여 주지 않는 것

시연에서 보여 주는 것 보장하지 않는 것
유용한 로컬 모델은 디스크에서 몇 기가바이트만 차지할 수 있습니다. 2~4GB 모델은 실행 중 총 시스템 메모리 2~4GB만 필요로 하는 것이 아닙니다.
소형 모델은 OCR, 요약, 번역 및 기타 특정 작업을 수행할 수 있습니다. 소형 모델이 모든 복잡하거나 개방적인 프롬프트에서 훨씬 더 큰 모델과 같은 성능을 낼 수 있는 것은 아닙니다.
여러 특화 모델을 하나의 로컬 서버에서 함께 실행할 수 있습니다. 모든 모델을 동시에 메모리에 로드해 둬야 하는 것은 아닙니다.
파일 기반 AI 워크플로는 지속적인 수동 프롬프트 입력 없이 실행할 수 있습니다. 생성된 모든 출력은 검토 없이 사용해도 충분히 정확합니다.
로컬 처리는 불필요한 외부 데이터 노출을 줄일 수 있습니다. 집에서 실행된다는 이유만으로 로컬 배포가 자동으로 안전해지는 것은 아닙니다.
소형 모델은 유용한 로컬 AI를 실행하는 데 필요한 하드웨어 기준을 낮출 수 있습니다. 이제 까다로운 작업에서 대형 GPU와 대형 모델이 더 이상 필요하지 않습니다.

모델 순위가 아닌 작업을 생각하세요

Zero to MVP의 실험에서 얻을 수 있는 가장 유용한 교훈은 소형 모델이 대형 모델보다 낫다는 것이 아닙니다. 모델 선택은 작업에서 시작해야 한다는 것입니다.

작업에 익숙하지 않은 여러 분야를 넘나드는 어려운 추론, 복잡한 코딩 또는 매우 개방적인 상호작용이 필요하다면 더 큰 모델이 추가 리소스를 사용할 만한 가치가 있을 수 있습니다. 하지만 작업이 OCR, 예측 가능한 요약, 일상적인 번역, 분류, 추출 또는 반복적으로 수행되는 작업이라면 더 작은 특화 모델이 더 실용적인 도구일 수 있습니다.

핵심 질문은 “내가 실행할 수 있는 가장 지능적인 모델은 무엇인가?”에서 “이 특정 작업을 안정적으로 완료하는 가장 작은 모델은 무엇인가?”로 바뀝니다.

이 접근 방식은 항상 켜져 있는 홈 서버를 훨씬 더 유용하게 만들 수 있습니다. 사용자가 AI 세션을 시작하기를 기다리는 대신, 서버는 이미 실행 중인 인프라의 일부로 파일과 요청을 조용히 처리할 수 있습니다.

항상 켜져 있는 로컬 AI 작업 공간 구축

Zero to MVP의 설정은 스토리지와 AI가 서로를 어떻게 보완할 수 있는지 보여줍니다. NAS가 정보를 보관하는 동안, 소형 로컬 모델은 해당 데이터 가까이에서 특화된 처리를 제공합니다.

ZimaCube 2와 같은 시스템을 사용하면 하나의 장치가 홈 스토리지 플랫폼, 셀프 호스팅 애플리케이션 서버, 지속적인 AI 워크플로의 기반 역할을 모두 수행할 수 있습니다. 사용자는 더 작은 모델로 시작한 다음, 요구 사항이 더 큰 모델이나 더 빠른 GPU 지원 추론을 필요로 하게 되면 나중에 하드웨어를 확장할 수 있습니다.

스토리지와 로컬 인텔리전스를 함께 활용하는 방법을 알아보고 있다면, AI NAS 워크플로에 관한 ZimaSpace 가이드에서 ZimaCube 2에서 문서 스토리지, 인덱싱, 로컬 AI 처리를 결합하는 또 다른 접근 방식을 확인할 수 있습니다.

워크로드가 컴팩트 모델의 범위를 넘어 확장되고 ZimaCube 2가 GPU 지원 추론으로 어떻게 확장될 수 있는지 이해하고 싶다면 로컬 AI GPU 설정 가이드도 읽어보세요.

Zero to MVP의 전체 영상을 시청하면 OCR, 요약, MedGemma, 번역 워크플로를 실제 맥락에서 확인하고, 소형 모델이 적합한 도구인지 판단하는 기준도 들을 수 있습니다.

로컬 AI 워크플로, 모델 선택, 셀프 호스팅 서버 구축에 대해 다른 사용자들과 비교해 보고 싶으신가요? ZimaSpace Discord 커뮤니티에 참여하여 더 많은 홈 서버 및 로컬 AI 프로젝트를 살펴보세요.

지마 캠페인 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.