2026-07-22 로그
YOLO 객체 검출 데모 — 시나리오별로 세는 눈
YOLO26-nano를 상시 서빙하고, 사무실·교통·보안·동물 시나리오별 클래스 필터와 샘플로 테스트하는 데모를 공개했다. 추론은 프레임당 수백 ms.
VLM 데모가 "말로 이해하는 눈"이라면, 이번엔 "정확히 세는 눈" — YOLO 검출 데모를 서비스 섹션에 공개했다.
구성
- 모델: YOLO26-nano — NMS-free 엔드투엔드 세대의 최신 나노 모델. 노드 2에서 FastAPI 서버(PyTorch MPS)로 상시 서빙.
- 입력 3종: VLM 데모와 동일하게 카메라·업로드·샘플. 업로드/촬영 즉시 검출한다.
- 시나리오 5종: 전체 / 사무실(사람·의자·모니터) / 교통(차종별) / 보안(사람+가방류) / 동물. 서버가 COCO 클래스를 시나리오별로 필터링하고, 같은 이미지를 시나리오만 바꿔 재검출해 비교할 수 있다. 시나리오마다 맞는 샘플 이미지를 배치했다.
- 시각화: 서버는 박스 좌표(JSON)만 돌려주고, 브라우저가 캔버스에 클래스별 색상으로 박스·라벨·카운트를 그린다. 이미지를 다시 내려받지 않아 가볍다.
실측
| 항목 | 값 |
|---|---|
| 추론 시간 (1024px 이미지) | ~370ms / 프레임 |
| 거리 샘플 검출 | bus 91% + person 4명 — 차종별 카운팅 시나리오 그대로 |
| 무대 단체 샘플 | person 다수 각 84~92% — 인원 카운팅 |
LLM·VLM과 자릿수가 다른 속도다. 나노 모델 기준 초당 2~3프레임이면 CCTV 폴링·카운팅 용도로 충분하고, 이것이 "정량은 YOLO"인 이유다.
정직한 샘플 하나
호랑이 샘플을 일부러 넣었다. COCO 80클래스에 호랑이가 없어 아무것도 검출되지 않는다. 사전학습 모델의 경계를 보여주는 샘플 — 이 지점부터가 오픈 보캐뷸러리(YOLOE) 프롬프트 검출이나 커스텀 파인튜닝의 영역이다. 다음 실험 후보.