AI 인프라 정리: IBM 추론 클러스터, 메타 온디바이스 오픈 모델, 오픈AI 아스트라 출시 보류
IBM 전문가 패널이 자사 클라우드의 대규모 추론 클러스터 구축, 메타가 공개한 온디바이스 오픈 모델, 사이버 보안 우려로 출시를 미룬 오픈AI 모델 소식을 놓고 AI 인프라와 개방 전략의 방향을 짚었다.
핵심 내용 읽기 →AI TOPIC
온디바이스 AI 관련 핵심 뉴스와 활용 인사이트 37편을 최신순으로 모았습니다.

IBM 전문가 패널이 자사 클라우드의 대규모 추론 클러스터 구축, 메타가 공개한 온디바이스 오픈 모델, 사이버 보안 우려로 출시를 미룬 오픈AI 모델 소식을 놓고 AI 인프라와 개방 전략의 방향을 짚었다.
핵심 내용 읽기 →
애플이 3세대 온디바이스 모델 AFM3에서 200억 파라미터 전체를 낸드 플래시에 저장해 두고 필요한 부분만 D램으로 올리는 구조를 택했다. IFP 방식과 2비트 양자화, 메모리 가격 급등, 스마트폰 기본 저장 용량 변화까지 함께 짚었다.
핵심 내용 읽기 →
오픈BMB가 아파치 2.0으로 공개한 13억 파라미터 비전 모델 MiniCPM-V 4.6을 직접 돌려본 리뷰다. 벤치마크 점수보다 출력 토큰을 수십 배 적게 쓴다는 점이 로컬 에이전트에 중요한 이유를 짚는다.
핵심 내용 읽기 →
GPU MODE 99번째 강연에서 전 엑소랩스 연구자가 맥 스튜디오 두 대로 딥시크를 추론하고 학습까지 시킨 과정을 공개했다. 메모리 용량과 전력 소모, 썬더볼트 통신 지연이 데이터센터 GPU와의 승부를 가른 지점이었다.
핵심 내용 읽기 →
AI 연구자가 레이밴 메타 스마트 글래스를 직접 쓰며 온디바이스 AI가 필요한 네 가지 이유와 수혜가 예상되는 산업을 짚고, 한국어 인식률과 무게, 킬러 앱 부재에서 드러난 한계를 함께 정리했다. 협찬 없이 진행한 리뷰다.
핵심 내용 읽기 →
구글이 상업적 이용까지 허용해 공개한 젬마 4와 함께 나온 초소형 모델을 폰과 PC에서 직접 돌려 본 내용을 정리했다. 오프라인 동작, 에이전트 연결 방법, 그리고 작은 모델의 명확한 한계까지 다뤘다.
핵심 내용 읽기 →
생성형 AI에 가려졌던 타이니ML이 다시 주목받고 있다. 메타 엔지니어들이 파이토치 콘퍼런스에서 공개한 ExecuTorch의 마이크로컨트롤러 지원 현황과, 램이 10MB도 안 되는 기기에서 쓰는 실전 용량 절감 요령을 정리했다.
핵심 내용 읽기 →
허깅페이스 연구자가 올해 주목하는 세 가지 AI 흐름을 짚었다. 세계를 압축해 담는 월드 모델, 자연어 지시를 행동으로 옮기는 비전-언어-행동 모델, 그리고 휴대폰 화면을 직접 조작하는 온디바이스 에이전트다.
핵심 내용 읽기 →
마이크로소프트가 빌드 행사에서 자체 개발 AI 모델 7종과 상시 대기형 개인 에이전트 스카우트를 공개했다. 무스타파 술레이만이 밝힌 자급자족 전략과 엔비디아의 로컬 추론 칩까지 한 주의 발표를 정리했다.
핵심 내용 읽기 →
느리고 비싼 오프라인 음성 합성에서 개인화된 실시간 상호작용으로 무게중심이 옮겨가고 있다. 카이타이 랩스에서 분사한 그라디움이 CPU에서 도는 음성 합성 모델과 비행기 모드 실시간 번역 데모로 보여준 음성 AI의 전환점을 정리했다.
핵심 내용 읽기 →
AI 에이전트가 업무에 들어오면 생산성은 오르지만 그 증폭 배율은 사람마다 다르다. AGI 5단계와 에이전트 워크플로, 온디바이스 AI를 짚으며 앞으로 벌어질 격차와 대응을 함께 다룬 대담을 정리했다.
핵심 내용 읽기 →
AI로 일을 줄이려다 오히려 일이 늘었다는 사람이 많다. 업무를 세로축·가로축 매트릭스로 쪼개 12가지 AI 스킬에 매핑하는 방법과, 1GB 미만 로컬 LLM 및 VDI 환경 대안으로 보안 제약을 넘는 실무 방법을 정리했다.
핵심 내용 읽기 →
2.8조 파라미터 Kimi K3가 오픈웨이트로 공개돼 프런트엔드 코드 아레나 1위에 올랐다. Fable 5의 구독제 편입, grok-build의 저장소 통째 업로드 논란 등 주요 AI 소식을 정리했다.
핵심 내용 읽기 →
박영선 전 중기부 장관과 딥엑스 김녹원 대표가 AI 반도체 패권 경쟁을 짚었다. 시스템 반도체 점유율 3%, 미중 전략 차이, 온디바이스 AI라는 승부처를 정리했다.
핵심 내용 읽기 →
국내 AI 반도체 기업 디픽스(DeepX) 대표와 정책 전문가가 짚은 온디바이스 AI 승부처. 5W 미만 NPU, 특허 400건, 제조 데이터라는 한국의 무기를 정리했다.
핵심 내용 읽기 →
구글 AI 엣지팀의 컨퍼런스 발표를 정리했다. 로봇·모바일처럼 기기에서 직접 도는 소형·초소형 언어모델의 메모리(DRAM) 제약, 2·4·8비트 양자화, 합성 데이터 파인튜닝, 음성→함수호출 같은 실제 배포 전략을 쉽게 풀었다.
핵심 내용 읽기 →
1억 3500만 파라미터 모델을 내 문서 전용 일꾼으로 바꾸는 전 과정을 따라간다. 로컬 모델과 제약 디코딩으로 합성 데이터를 만들고, 학습과 평가를 거쳐 하네스로 감싸 실제 서비스에 쓰는 방법까지 정리했다.
핵심 내용 읽기 →
뉴욕타임스 게임팀 엔지니어가 클라우드 대신 휴대폰에서 직접 도는 에이전트 AI로 지연·프라이버시 문제를 줄이고, 장애가 있는 플레이어까지 배려하는 접근성 게임을 설계하는 방법을 설명한다.
핵심 내용 읽기 →
AI Engineer 컨퍼런스 발표에서 아마드 오스만은 오픈소스 모델이 같은 성능을 훨씬 적은 파라미터로 내는 흐름을 짚고, 18개월 뒤 개인용 그래픽카드 한 장에서 돌아갈 지능의 수준을 전망하며 하드웨어 소유의 의미를 따졌다.
핵심 내용 읽기 →
안드레이 카파시가 말한 '인지 코어'는 지식을 욱여넣는 대신 추론과 도구 사용에 집중한 초소형 모델이다. 샘 위트빈이 1B급 MiniCPM-5를 직접 돌려보며 그 가능성과 한계를 짚는다.
핵심 내용 읽기 →
노후한 셀을 획일적으로 다루는 기존 배터리 관리의 한계를, 약 5달러짜리 ESP32 위에서 온라인 학습하는 물리 기반 신경망(PINN)으로 넘어서려는 학생 프로젝트의 설계와 실시간 경고·실측 성능을 정리했다.
핵심 내용 읽기 →
macOS 27에 조용히 들어온 내장 LLM 도구 FM을 직접 벤치마크한 결과다. 저렴한 맥 미니와 고가의 맥 스튜디오 속도가 같았고, 그 원인이 세대 간 동일한 뉴럴 엔진에 있음을 추적 과정과 함께 설명한다.
핵심 내용 읽기 →
13년간 64비트로 고정됐던 아이폰 메모리 버스가 96비트로 넓어진다는 루머를 짚는다. 용량과 대역폭의 차이, LPDDR6·WMCM 패키징, 그리고 엔비디아 HBM처럼 온디바이스 AI가 대역폭을 요구하는 이유까지.
핵심 내용 읽기 →
NDC 코펜하겐 2026 강연에서 마이크로소프트 제럴드 베르슬라위스가 텍스트·음성·이미지로 동작하는 음식 알레르기 도우미 앱을 예로, 앱에 AI를 통합하는 방법과 원칙을 정리했다.
핵심 내용 읽기 →
구글 AI 엣지 스택으로 기기 안에서 소형 LLM을 실행하고, 에이전트 스킬로 새 기능을 더하는 방법을 구글 I/O Connect 워크숍 발표를 통해 정리했습니다.
핵심 내용 읽기 →
구글 안드로이드 책임자 사미르 사마트가 밝힌 안드로이드 17의 방향을 정리했다. "AI"라는 말 대신 이익을 앞세우는 전략, 온디바이스 사기 탐지, 앱 자동화, 슈퍼필과 램블러, 제미나이 지능, 그리고 자동차 속 제미나이까지 살펴본다.
핵심 내용 읽기 →
구글이 오픈소스 로봇 Reachy Mini에서 온디바이스 Gemma 모델을 구동하는 시연을 공개했다. 로컬 실행의 프라이버시·속도 이점과 로봇·IoT 활용 가능성을 보여줬다.
핵심 내용 읽기 →
구글이 70개 이상 언어를 실시간 음성으로 통역하는 Gemini 3.5 라이브 번역, 기기에서 도는 Gemma 4 12B, Xcode용 젬미니를 공개했다. 세 발표를 한눈에 정리했다.
핵심 내용 읽기 →
구글이 공개한 오픈 모델 젬마 4는 인터넷 연결 없이 스마트폰 등 기기에서 직접 실행되며, 다국어 미세조정과 에이전트 기능으로 AI 접근성을 넓힌다.
핵심 내용 읽기 →
모든 작업에 거대 모델을 쓰는 '한 사이즈로 다 맞추기'의 비용을 짚고, 작업에 맞는 소형·특화 모델을 골라 온디바이스로 돌리는 '크게 프로토타입, 작게 배포' 전략과 평가 방법을 정리했다.
핵심 내용 읽기 →
구글 안티그래비티와 온디바이스 모델 젬마를 활용해 VS Code 스타일의 개인 웹사이트를 만들고, 서버 없이 벡터 임베딩으로 관련 글 추천까지 구현한 실제 제작 과정을 소개한다.
핵심 내용 읽기 →
구글 AI 엣지 팀이 온디바이스 소형·초소형 LLM 전략과, 합성 데이터 파인튜닝으로 함수 호출 정확도를 46%에서 90% 이상으로 끌어올린 사례를 공유했다.
핵심 내용 읽기 →
기기에서 직접 돌아가는 소형 언어 모델을 만드는 이유와 방법을 실제 사례로 풀었다. 파인튜닝·양자화·데이터셋 제작과 프라이버시·비용 이점까지.
핵심 내용 읽기 →
서버 대신 기기에서 직접 모델을 돌리는 온디바이스 AI의 장점(지연·프라이버시·비용)과 한계(모델 크기·다운로드·연산), 그리고 로컬과 원격을 함께 쓰는 하이브리드 접근을 정리했습니다.
핵심 내용 읽기 →
AI 모델 크기는 파라미터 수로 측정된다. 대형 모델의 강점과 비용, 빠르게 똑똑해지는 소형 모델의 장점, 그리고 용도별로 어느 쪽을 골라야 하는지 IBM 설명으로 정리했다.
핵심 내용 읽기 →
구글 딥마인드가 젬마 4를 공개하며 '오픈 모델 소유권'을 강조했다. 휴대폰에서 도는 소형부터 31B까지, 데이터 주권과 비용 통제, 온디바이스 활용법을 정리했다.
핵심 내용 읽기 →
애플 WWDC 2026의 핵심은 시리가 똑똑해졌느냐가 아니다. 네이트 B 존스는 AI를 클라우드에서 빌리는 것에서 내가 산 컴퓨터 안의 기능으로 바꾸려는 애플의 전략을 분석한다.
핵심 내용 읽기 →