On-Premise AI Lab · 실측 기록
Mac mini M4 두 대로
어디까지 가능한가
16GB짜리 가장 작은 Mac mini 2대로 로컬 AI의 한계선을 실측하는 실험실. MLX 분산 추론, YOLO 컴퓨터 비전, 오픈 모델 구동 — 되는 것과 안 되는 것을 수치와 함께 기록합니다.
2×16GB통합 메모리
10+10코어CPU+GPU / 노드
40Gb/sThunderbolt 4
~5W유휴 전력
라이브 데모
서비스 전체 →로컬 LLM 채팅 — 라이브 데모
Mac mini에서 실제로 돌고 있는 로컬 모델과 브라우저에서 직접 대화. 클라우드를 거치지 않는다.
지금 써보기 →VLM 이미지 이해 — 라이브 데모카메라·업로드·샘플 이미지를 Mac mini의 Gemma 3 12B에 보여주고 자연어로 질문. "정량은 YOLO, 정성 판단은 VLM"의 그 VLM.
지금 써보기 →YOLO 객체 검출 — 라이브 데모사무실·교통·보안 등 시나리오별로 YOLO26 실시간 객체 검출을 테스트. 카메라·업로드·샘플 지원, 검출 박스를 그대로 시각화.
지금 써보기 →산업안전보건법 RAG 채팅 — 라이브 데모법령 555개 조문을 pgvector에 임베딩하고, 질문마다 근거 조문을 찾아 로컬 LLM이 답한다. 근거가 화면에 그대로 보이는 RAG.
지금 써보기 →산업안전보건법 위키 RAG — 라이브 데모벡터 DB 대신, LLM이 만든 555페이지 법령 위키를 검색하고 링크를 따라가며 답한다. 탐색 경로가 그대로 보이는 에이전틱 RAG.
지금 써보기 →최근 로그
전체 보기 →
2026-07-23
산업안전보건법 RAG 두 가지 — 벡터로, 그리고 위키로같은 법령 555개 조문, 같은 로컬 LLM으로 RAG를 두 방식으로 구현했다. pgvector 임베딩 검색과, LLM이 만든 위키를 링크 따라 탐색하는 방식.
2026-07-23
벡터 RAG vs 위키 RAG — 동일 질문 10문 대결같은 법령, 같은 로컬 LLM, 같은 질문 10개. 검색 적중률은 둘 다 10/10 — 그러나 순위 정밀도와 속도, 투명성에서 성격이 갈렸다.
2026-07-22
로컬 LLM 채팅 데모 구축 — 브라우저에서 Mac mini의 모델과 대화하기벤치마크로 확인한 4개 모델을 브라우저에서 직접 써볼 수 있게 만들었다. 스트리밍, 동적 모델 전환, 그리고 삽질 두 개의 기록.
2026-07-22
단일 노드 LLM 벤치마크 — 대역폭 병목과 MoE의 승리4bit 모델 4종을 실측했다. dense는 크기에 반비례해 느려지고, 총 21B짜리 MoE가 14B dense보다 3배 빠르다.
2026-07-22
RDMA over Thunderbolt 조사 — 기본형 M4에서는 불가 확정macOS에 RDMA 도구는 들어 있지만, 기본형 Mac mini M4의 Thunderbolt 4로는 하드웨어적으로 불가능함을 실기기에서 확인했다.