서비스
VLM 이미지 이해 — 라이브 데모
카메라·업로드·샘플 이미지를 Mac mini의 Gemma 3 12B에 보여주고 자연어로 질문. "정량은 YOLO, 정성 판단은 VLM"의 그 VLM.
실험실 Mac mini에서 상시 서빙 중인 Gemma 3 12B(4bit, 비전 겸용)에 이미지를 보여주고 자연어로 질문하는 데모입니다. 이미지는 추론에만 사용되고 서버에 저장되지 않습니다. 다만 공개 데모이므로 개인정보가 담긴 이미지는 올리지 마세요.
샘플을 클릭하면 입력 이미지로 선택됩니다. 뒤쪽 5장은 YOLO 데모와 같은 이미지 — 검출기가 못 하는 판정(착용 품질, 적재 상태)을 VLM이 하는지 비교해 보세요. (앞 3장: 자체 생성 AI 이미지 / 뒤 5장: Wikimedia Commons·출처는 YOLO 데모 참고)
무엇을 보여주나
브라우저가 이미지를 최대 896px JPEG로 축소해 이 사이트의 프록시를 거쳐 노드 1의
mlx_vlm.server(OpenAI 호환)로 보냅니다. VLM의 강점(장면 해석·상황 서술·텍스트 읽기)과
약점(정밀 카운팅·좌표)을 직접 확인해 보세요 — 배경 설명은
VLM 자세히 참고.
모델을 Gemma 3 12B로 정한 이유: 처음 올린 Qwen3-VL 4B·8B(4bit)는 영어 답변은 훌륭했지만 한국어 답변에서 같은 문장을 맴도는 반복과 환각이 심했습니다. 같은 조건에서 Gemma 3 12B는 한국어가 유창하고 정확했습니다. 대신 12B라 생성 속도는 ~14 tok/s로 느린 편 — 품질과 속도의 트레이드오프에서 품질을 택했습니다.
검출기와의 비교 시나리오: 마스크·안전모·트럭 샘플은 YOLO 데모와 공유하는 이미지입니다. 실측에서 이 VLM은 YOLOE 제로샷이 놓친 어두운 마스크를 잡았고, "마스크를 코까지 안 가렸다" 같은 착용 품질과 트럭 적재 상태처럼 검출 클래스가 아닌 판단을 해냅니다 — 대신 인원수 같은 정량은 자주 틀립니다. 방법 비교의 전체 그림은 마스크·안전모 검출 — YOLO 밖의 방법들 참고.