온디바이스 초소형 LLM 배포 전략: 구글 엣지 AI팀의 로봇·모바일 양자화·파인튜닝
구글 AI 엣지팀의 컨퍼런스 발표를 정리했다. 로봇·모바일처럼 기기에서 직접 도는 소형·초소형 언어모델의 메모리(DRAM) 제약, 2·4·8비트 양자화, 합성 데이터 파인튜닝, 음성→함수호출 같은 실제 배포 전략을 쉽게 풀었다.
핵심 내용 읽기 →AI TOPIC
Gemma 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

구글 AI 엣지팀의 컨퍼런스 발표를 정리했다. 로봇·모바일처럼 기기에서 직접 도는 소형·초소형 언어모델의 메모리(DRAM) 제약, 2·4·8비트 양자화, 합성 데이터 파인튜닝, 음성→함수호출 같은 실제 배포 전략을 쉽게 풀었다.
핵심 내용 읽기 →
구글이 오픈소스 로봇 Reachy Mini에서 온디바이스 Gemma 모델을 구동하는 시연을 공개했다. 로컬 실행의 프라이버시·속도 이점과 로봇·IoT 활용 가능성을 보여줬다.
핵심 내용 읽기 →
구글이 70개 이상 언어를 실시간 음성으로 통역하는 Gemini 3.5 라이브 번역, 기기에서 도는 Gemma 4 12B, Xcode용 젬미니를 공개했다. 세 발표를 한눈에 정리했다.
핵심 내용 읽기 →
구글 클라우드 생성형 AI 리더(Generative AI Leader) 자격증 대비 강의의 핵심을 정리했습니다. 프롬프트 기법, 토큰과 연산 비용, 그라운딩과 RAG, Gemma와 Gemini의 차이, 에이전트 활용까지 시험에 나오는 개념을 짚습니다.
핵심 내용 읽기 →
유료 클로드 코드·코덱스 대신 구글의 오픈소스 모델 Gemma를 Ollama로 로컬 설치해 오프라인에서 쓰는 무료 AI 코딩 어시스턴트 구축법을 정리했다.
핵심 내용 읽기 →
엔비디아 DGX 스파크의 사양과 설치 과정, Ollama로 젬마 모델을 로컬에서 구동하고 클로드 코드까지 연결하는 과정을 정리했습니다.
핵심 내용 읽기 →
구글 AI 엣지 팀이 온디바이스 소형·초소형 LLM 전략과, 합성 데이터 파인튜닝으로 함수 호출 정확도를 46%에서 90% 이상으로 끌어올린 사례를 공유했다.
핵심 내용 읽기 →