AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Rapid-MLX – Apple Silicon용 OpenAI 호환 로컬 AI 엔진

Rapid-MLX는 Apple Silicon Mac에서 MLX 기반 모델을 로컬로 실행하고 OpenAI·Anthropic 호환 API로 제공하는 AI 엔진이다. 터미널 채팅, 로컬 HTTP 서버, 에이전트 CLI 자동 설정, 데스크톱 앱, 오디오·비디오 옵션까지 한 패키지로 묶으려는 방향의 도구다.

왜 흥미로운가

Mac 로컬 LLM 도구는 보통 편의성 중심 앱(LM Studio), 간단한 데몬(Ollama), 저수준 런타임(llama.cpp), MLX 실험 코드로 나뉜다. Rapid-MLX는 MLX 네이티브 성능을 전면에 두면서도 /v1/chat/completions, /v1/responses, /v1/messages, /v1/audio/*, /v1/videos 같은 호환 API를 제공해 기존 클라이언트가 그대로 붙게 한다.

README 기준 핵심 포인트는 다음과 같다.

항목내용
플랫폼Apple Silicon M1~M4 Mac
설치brew install rapid-mlx, pip, uv, 검증 가능한 릴리스 installer
기본 서버http://localhost:8000, OpenAI 호환 /v1
에이전트Codex CLI, Claude Code, OpenCode, Qwen Code, Aider 등 연동 템플릿
모델 선택Mac RAM을 감지해 권장 모델 alias 제안
확장텍스트 기본, 오디오·비디오·embeddings·speculative decoding은 extras
라이선스Apache 2.0

사용 방식

brew install rapid-mlx
rapid-mlx chat
rapid-mlx serve qwen3.5-4b-4bit

서버를 띄운 뒤 OpenAI SDK를 로컬 endpoint로 향하게 할 수 있다.

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
response = client.chat.completions.create(
    model="default",
    messages=[{"role": "user", "content": "Say hello"}],
)

에이전트 백엔드로 쓸 때는 rapid-mlx launch claude-code 또는 rapid-mlx agents codex --setup처럼 클라이언트별 설정을 생성하는 흐름을 제공한다.

모델 선택의 실무 포인트

Rapid-MLX는 설치 시 RAM 기준 추천 모델을 제안한다. 예를 들어 8~15GB Mac은 2.6B급 4bit, 16~23GB는 27B 2bit, 24~31GB는 Gemma 4 26B 4bit, 32GB 이상은 Qwen 35B 계열처럼 단계가 나뉜다.

이 추천은 “돌아간다”와 “빠르게 쓸 만하다”의 절충이다. 로컬 코딩 에이전트나 RAG 백엔드로 쓰려면 모델 품질뿐 아니라 tool call 안정성, context 길이, KV cache 메모리, 장시간 실행 중 발열·메모리 압박도 함께 봐야 한다.

Rapid-MLX와 TurboFieldfare

구분Rapid-MLXturbo-fieldfare
목표범용 로컬 AI 엔진과 호환 APIGemma 4 26B-A4B를 초저메모리로 실행
모델 범위다수 text/audio/video alias특정 Gemma 모델 중심
구현 방향MLX 네이티브 런타임과 서버Swift·Metal 모델 특화 런타임
적합 케이스여러 앱·에이전트를 로컬 endpoint에 붙일 때8GB Mac에서 대형 MoE 실행 구조를 실험할 때

둘은 경쟁이라기보다 설계 선택지가 다르다. Rapid-MLX는 “로컬 API 서버와 생태계 호환”이 강하고, TurboFieldfare는 “모델 구조를 이용한 극단적 메모리 절감”이 강하다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)