2026-07-22 로그
RDMA over Thunderbolt 조사 — 기본형 M4에서는 불가 확정
macOS에 RDMA 도구는 들어 있지만, 기본형 Mac mini M4의 Thunderbolt 4로는 하드웨어적으로 불가능함을 실기기에서 확인했다.
왜 RDMA를 조사했나
여러 대의 Mac으로 하나의 LLM을 나눠 돌리는 텐서 병렬은 레이어마다 노드 간 동기화가 일어난다. 일반 TCP/IP(Thunderbolt 브리지)의 왕복 지연이 약 300µs인데, RDMA(Remote Direct Memory Access)를 쓰면 커널을 우회해 약 3µs — 100배 차이다. 토큰 하나에 수십~수백 번 동기화가 쌓이므로, RDMA 여부가 사실상 텐서 병렬의 성립 조건이 된다.
Apple은 macOS 26.2부터 RDMA over Thunderbolt를 커널 수준에서 지원하기 시작했고 (기술문서 TN3205), MLX는 이를 쓰는 JACCL 분산 백엔드를 제공한다. 4노드 Mac Studio로 1조 파라미터급 모델을 돌린 시연도 공개돼 있다. 그래서 "우리 장비에서도 되는가?"를 직접 확인했다.
실기기 검증 절차와 결과
두 노드(macOS 26.5.2) 모두에서 확인했다.
| 확인 항목 | 방법 | 결과 |
|---|---|---|
| RDMA 도구 존재 | /usr/bin/rdma_ctl, /usr/bin/ibv_devices |
있음 OS에 기본 포함 |
| RDMA 디바이스 인식 | ibv_devices 실행 |
0개 디바이스 없음 |
| Thunderbolt 세대 | 시스템 리포트 포트 속도 | 40Gb/s = TB4 (TB5는 120Gb/s) |
OS는 준비되어 있다. 문제는 하드웨어다. macOS의 RDMA는 Thunderbolt 5 컨트롤러 전용인데, 기본형 Mac mini M4는 TB4까지만 탑재한다. 소프트웨어 업데이트로 해결될 문제가 아니다.
결론
- 기본형 M4 mini 2대로는 RDMA(JACCL) 불가 — 확정.
- 현실적 구성은 Thunderbolt 4 브리지(IP over TB) + MLX ring 백엔드 + 파이프라인 병렬. 속도 향상이 아니라 메모리 풀링(합산 32GB로 한 대에 안 들어가는 모델 돌리기)이 목적이다.
- RDMA + 텐서 병렬은 TB5 탑재 기기(M4 Pro급 이상 Mac mini, Mac Studio 등)를 추가하는 시점에 열리는 업그레이드 경로로 남겨둔다. 그때도 모든 노드 쌍을 TB5 케이블로 직결하는 풀메시 연결이 요구된다.
배경 지식은 정보 섹션의 MLX 분산 추론의 구조 참고.