HART OS는 로컬 추론, OpenAI 호환 API, 기기 간 P2P 페더레이션을 하나의 시스템 서비스처럼 제공하려는 오픈소스 AI 런타임이다. 사용자는 Nunba 데스크톱 앱으로 접근할 수 있고, 개발자는 HART 런타임을 :6777/v1/chat/completions 엔드포인트나 hart CLI로 다룰 수 있다.
무엇을 OS라고 부르는가
HART OS의 주장은 “모든 앱이 모델을 직접 번들링하는 대신, 운영체제의 Model Bus에 추론을 요청한다”는 구조에 있다. 앱은 API 키와 모델 로딩을 직접 관리하지 않고, OS가 하드웨어·VRAM·사용 가능한 peer를 보고 어떤 모델이 답할지 결정한다.
실제 형태는 세 가지로 나뉜다.
| 형태 | 설명 |
|---|---|
| HART 런타임 | Python 서비스로 실행되는 로컬 추론·에이전트 엔진 |
| Nunba | Windows, Linux, Android용 소비자 앱 |
| HART OS | NixOS 기반으로 부팅 가능한 전체 OS 구상 |
저장소 문서도 OS 주장이 아직 완전히 검증된 제품 상태는 아니라고 명시한다. Smithay compositor와 NixOS 테스트 정의는 있으나, 일부 VM 테스트는 manual dispatch 상태이며 부팅 완성도는 별도 확인이 필요하다.
주요 기능
| 기능 | 설명 |
|---|---|
| OpenAI 호환 API | OpenAI SDK, LangChain, LiteLLM, Aider, Continue 등을 같은 엔드포인트에 연결 |
| 로컬 모델 실행 | llama.cpp와 GGUF 기반으로 CUDA, ROCm, Metal, Vulkan, CPU 경로 지원 |
| 하드웨어 티어링 | VRAM과 RAM에 따라 모델 배치, CPU offload, speculative decoding 여부 결정 |
| PeerLink | broker 없이 WebSocket으로 노드가 직접 capability를 광고하고 작업을 넘김 |
| GUI 조작 | 로컬 vision model과 pyautogui로 실제 데스크톱을 보고 조작 |
| Claude Code copilot | 읽기 전용 Nix store 경계 안에서 별도 브랜치 작업을 수행하는 resident copilot 설계 |
설치와 실행
런타임을 직접 실행하려면 Python 3.10 또는 3.11이 필요하다. 저장소 문서는 Python 3.12에서 일부 패키지 wheel 부재로 설치가 실패할 수 있다고 경고한다.
git clone https://github.com/hertz-ai/HARTOS.git
cd HARTOS
python3.10 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
python hart_intelligence_entry.py실행 후 OpenAI 호환 요청은 다음처럼 보낼 수 있다.
curl -X POST http://localhost:6777/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "hevolve", "messages": [{"role": "user", "content": "Hello"}]}'실용적 평가
HART OS는 self-hosted-llm과 local-slm의 흐름에 가깝지만, 단순 로컬 채팅 앱보다 운영체제 서비스 계층을 지향한다. 장점은 앱이 하나의 로컬 추론 버스를 공유하고, 작은 기기가 큰 peer에게 작업을 넘길 수 있다는 점이다. 단점은 설치 의존성이 크고, “OS” 수준의 완성도는 저장소 설명만으로는 검증이 필요하다는 점이다.
관련 문서
- self-hosted-llm — 로컬·온프레미스 LLM 운영의 한계와 해결책
- local-slm — 로컬 소형 언어모델 활용
- openenv — AI 에이전트 실행 환경 설계
- agent-macos — 데스크톱을 조작하는 개인용 AI 에이전트
참고 자료
- hertz-ai/HARTOS — GitHub 공식 저장소
- hertz-ai/Nunba — GitHub 공식 저장소