서비스
로컬 LLM 채팅 — 라이브 데모
Mac mini에서 실제로 돌고 있는 로컬 모델과 브라우저에서 직접 대화. 클라우드를 거치지 않는다.
이 채팅은 실험실의 Mac mini 두 대에서 지금 실제로 돌고 있는 로컬 모델에 연결됩니다. 입력한 내용은 실험실 장비에서만 처리되며 외부 AI 서비스로 나가지 않습니다. 다만 공개 데모이므로 개인정보나 민감한 내용은 입력하지 마세요. 대화 기록은 브라우저 안에만 있고 새로고침하면 사라집니다.
모델을 바꾸면 노드가 새 모델을 메모리에 올리느라 첫 응답이 수십 초 걸릴 수 있습니다. 이후 응답부터는 제 속도가 납니다.
안녕하세요! 어떤 모델과 대화할지 위에서 고르고 메시지를 보내보세요.
모델을 바꾸면 새 대화가 시작됩니다.
어떻게 동작하나
브라우저 → 이 사이트의 프록시 → 실험실 Mac mini의 mlx_lm.server(OpenAI 호환 API)로
이어지는 경로입니다. 노드 1에는 Qwen3-4B(+ 별도 포트의 VLM), 노드 2에는 Qwen3-8B·14B·gpt-oss-20b가 준비되어 있고,
요청의 model 필드로 동적으로 전환합니다(전환 직후 첫 응답은 모델 로딩 때문에 느림).
Qwen3 계열은 thinking을 끄고 권장 샘플링(temperature 0.7, top-p 0.8)으로, gpt-oss는 추론 과정을
"생각 과정"으로 표시합니다. 속도 수치의 배경은
벤치마크 로그 참고.