Gemma4
Gemma 4에서 뉴런 수천 개를 지웠더니 이름이 Bard로 돌아왔다
Gemma 4에게 이름을 물으면 Gemma 4라고 답합니다. 그런데 한 레이어에서 MLP 뉴런 수천 개를 지우자 “내 이름은 Bard”로 바뀌었죠. 2024년에 사라진 이름이 몇 년 뒤 모델 안에 잠들어 있었다는 얘기, 그리고 그게 모델 내부 구조에 대해 알려주는 것을 정리했습니다.
Written by

맥에서 로컬 LLM 돌리는 법이 갈라졌다, 속도냐 메모리냐
같은 맥북에서 같은 모델을 돌려도 접근법이 갈립니다. Rapid-MLX는 Ollama보다 2~4배 빠른 속도를 내세우고, TurboFieldfare는 26B 모델을 2GB 메모리로 밀어 넣죠. 하나는 램이 넉넉한 사람을 위한 속도 최적화고, 다른 하나는 8GB 맥북에서도 큰 모델을 돌리려는 시도입니다. 지금 내 맥에서 무엇을 고를지 정리했습니다.
Written by

13년 된 서버에서 AI 모델 돌리기, 진짜 실력은 구독료가 아니었다
13년 된 구형 서버에서 26B 모델을 돌리려다 실행조차 안 됐던 문제를, Claude가 CPU 세대 차이를 진단하고 고쳐낸 사례를 짚어봅니다.
Written by

Gemma 4부터 DeepSeek V4까지, 최신 LLM 아키텍처가 풀려는 하나의 문제
Gemma 4, Laguna XS.2, DeepSeek V4 등 최신 오픈웨이트 LLM들이 공통적으로 풀려는 문제, KV 캐시와 어텐션 비용 절감의 설계 철학을 정리했습니다.
Written by

Gemma 4 추론 속도 3배 높인 MTP 드래프터, 작동 원리는
Google이 Gemma 4에 MTP 드래프터를 추가해 품질 손실 없이 최대 3배 추론 속도를 달성했습니다. Speculative Decoding의 작동 원리와 개발자에게 갖는 의미를 설명합니다.
Written by

Gemma 4가 증명한 것, AI 모델은 이제 하나의 설계로 모든 곳을 커버할 수 없다
Google Gemma 4가 엣지와 서버를 아예 다른 아키텍처로 설계한 이유. 하드웨어 제약이 AI 모델 설계를 어떻게 바꾸고 있는지 분석합니다.
Written by

Gemma 4, 로컬 에이전틱 코딩의 문턱을 넘다, 실험 결과로 확인
Gemma 4가 에이전틱 tool calling 벤치마크 6.6%→86.4%를 달성하며 로컬 에이전틱 코딩이 실용 단계에 진입했습니다. M4 맥북 실험 결과를 소개합니다.
Written by

API 없이 Claude Code 쓴다, LM Studio 헤드리스 CLI와 Gemma 4 실전기
LM Studio 헤드리스 CLI로 Gemma 4를 로컬에서 실행하고 Claude Code와 연결하는 실전기. API 비용 없이 초당 51토큰, 데이터는 기기 밖으로 나가지 않습니다.
Written by

Gemma 4, 스마트폰에서 돌아가는 에이전트 오픈 모델 출시
Google DeepMind가 공개한 Gemma 4는 스마트폰과 라즈베리파이에서 자율 에이전트를 실행하는 오픈 모델 패밀리입니다. Apache 2.0 라이선스로 상업적 활용이 자유롭습니다.
Written by
