Rapid-MLX는 Apple Silicon Mac에서 MLX 기반 모델을 로컬로 실행하고 OpenAI·Anthropic 호환 API로 제공하는 AI 엔진이다. 터미널 채팅, 로컬 HTTP 서버, 에이전트 CLI 자동 설정, 데스크톱 앱, 오디오·비디오 옵션까지 한 패키지로 묶으려는 방향의 도구다.
왜 흥미로운가
Mac 로컬 LLM 도구는 보통 편의성 중심 앱(LM Studio), 간단한 데몬(Ollama), 저수준 런타임(llama.cpp), MLX 실험 코드로 나뉜다. Rapid-MLX는 MLX 네이티브 성능을 전면에 두면서도 /v1/chat/completions, /v1/responses, /v1/messages, /v1/audio/*, /v1/videos 같은 호환 API를 제공해 기존 클라이언트가 그대로 붙게 한다.
README 기준 핵심 포인트는 다음과 같다.
| 항목 | 내용 |
|---|---|
| 플랫폼 | Apple Silicon M1~M4 Mac |
| 설치 | brew install rapid-mlx, pip, uv, 검증 가능한 릴리스 installer |
| 기본 서버 | http://localhost:8000, OpenAI 호환 /v1 |
| 에이전트 | Codex CLI, Claude Code, OpenCode, Qwen Code, Aider 등 연동 템플릿 |
| 모델 선택 | Mac RAM을 감지해 권장 모델 alias 제안 |
| 확장 | 텍스트 기본, 오디오·비디오·embeddings·speculative decoding은 extras |
| 라이선스 | Apache 2.0 |
사용 방식
brew install rapid-mlx
rapid-mlx chat
rapid-mlx serve qwen3.5-4b-4bit서버를 띄운 뒤 OpenAI SDK를 로컬 endpoint로 향하게 할 수 있다.
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
response = client.chat.completions.create(
model="default",
messages=[{"role": "user", "content": "Say hello"}],
)에이전트 백엔드로 쓸 때는 rapid-mlx launch claude-code 또는 rapid-mlx agents codex --setup처럼 클라이언트별 설정을 생성하는 흐름을 제공한다.
모델 선택의 실무 포인트
Rapid-MLX는 설치 시 RAM 기준 추천 모델을 제안한다. 예를 들어 8~15GB Mac은 2.6B급 4bit, 16~23GB는 27B 2bit, 24~31GB는 Gemma 4 26B 4bit, 32GB 이상은 Qwen 35B 계열처럼 단계가 나뉜다.
이 추천은 “돌아간다”와 “빠르게 쓸 만하다”의 절충이다. 로컬 코딩 에이전트나 RAG 백엔드로 쓰려면 모델 품질뿐 아니라 tool call 안정성, context 길이, KV cache 메모리, 장시간 실행 중 발열·메모리 압박도 함께 봐야 한다.
Rapid-MLX와 TurboFieldfare
| 구분 | Rapid-MLX | turbo-fieldfare |
|---|---|---|
| 목표 | 범용 로컬 AI 엔진과 호환 API | Gemma 4 26B-A4B를 초저메모리로 실행 |
| 모델 범위 | 다수 text/audio/video alias | 특정 Gemma 모델 중심 |
| 구현 방향 | MLX 네이티브 런타임과 서버 | Swift·Metal 모델 특화 런타임 |
| 적합 케이스 | 여러 앱·에이전트를 로컬 endpoint에 붙일 때 | 8GB Mac에서 대형 MoE 실행 구조를 실험할 때 |
둘은 경쟁이라기보다 설계 선택지가 다르다. Rapid-MLX는 “로컬 API 서버와 생태계 호환”이 강하고, TurboFieldfare는 “모델 구조를 이용한 극단적 메모리 절감”이 강하다.
관련 문서
- local-llm-tips-ollama-lm-studio-llama-cpp — 로컬 LLM 도구 선택 기준
- nativ — Apple Silicon Mac용 로컬 AI 앱
- mlx-tutorial-fine-tuning-apple-silicon — MLX 기반 모델 파인튜닝
- unified-memory — Apple Silicon 로컬 추론의 메모리 구조
- turbo-fieldfare — Swift·Metal 기반 Gemma 4 26B 초저메모리 런타임
참고 자료
- raullenchai/Rapid-MLX — GitHub 공식 저장소