딥시크 하네스 오픈소스 해설 — ‘모든 것은 플러그인’과 실행 중 도구를 만드는 크리에이터 모드
딥시크가 MIT 라이선스로 공개한 코딩 에이전트 하네스가 깃허브 별 14만 개를 넘겼다. 모델을 교체 가능한 부품으로 되돌리는 ‘모든 것은 플러그인’ 설계와, 작업 중에 없는 도구를 스스로 만들었다 지우는 크리에이터 모드가 무엇을 바꾸는지 정리했다.
핵심 내용 읽기 →AI TOPIC
딥시크 관련 핵심 뉴스와 활용 인사이트 43편을 최신순으로 모았습니다.

딥시크가 MIT 라이선스로 공개한 코딩 에이전트 하네스가 깃허브 별 14만 개를 넘겼다. 모델을 교체 가능한 부품으로 되돌리는 ‘모든 것은 플러그인’ 설계와, 작업 중에 없는 도구를 스스로 만들었다 지우는 크리에이터 모드가 무엇을 바꾸는지 정리했다.
핵심 내용 읽기 →
2023년 라마 이후 공개된 오픈 웨이트 모델의 설계를 한 강의에서 훑는다. 믹스트랄의 전문가 혼합, 젬마의 어텐션 교차 배치, 딥시크의 보조 손실 없는 로드 밸런싱과 희소 어텐션까지 무엇이 바뀌고 무엇이 그대로인지 정리한다.
핵심 내용 읽기 →
LLM 추론 속도를 살리려 만든 KV 캐시가 이번엔 GPU 메모리를 잠식한다. MQA, GQA, 그리고 딥시크가 쓴 MLA가 각각 무엇을 줄이고 그 대가로 무엇을 내주었는지, 대학 LLM 강의 내용을 따라 차례로 정리했다.
핵심 내용 읽기 →
전문가 혼합(MoE)은 전체 파라미터를 키우면서 실제 연산량은 묶어두는 구조다. 라우팅 방식이 top-k로 수렴한 이유, 딥시크가 퍼뜨린 세분화·공유 전문가, 전문가 붕괴를 막는 로드 밸런싱 손실까지 강의 내용을 정리했다.
핵심 내용 읽기 →
딥시크 R1 백서를 처음부터 끝까지 짚는다. 지도 학습 없이 강화학습만 쓴 R1 제로, 크리틱 없는 GRPO, 콜드스타트 데이터로 이어지는 네 단계 학습, 소형 모델 증류 결과와 남은 한계까지 정리했다.
핵심 내용 읽기 →
딥시크가 R1 이후 1년 4개월 만에 내놓은 V4는 파라미터를 1.6조로 키우면서도 롱컨텍스트 연산량을 이전 세대의 27%, 메모리를 10% 수준으로 낮췄습니다. 그 중심에 희소 어텐션이 있습니다.
핵심 내용 읽기 →
딥시크 R1의 핵심 강화학습 알고리즘 GRPO를 정책 경사법부터 차근차근 짚었다. 별도의 가치 모델을 버리고 응답 여러 개의 평균 보상을 기준선으로 삼는 단순화가 어떻게 비용 절감으로 이어졌는지 정리했다.
핵심 내용 읽기 →
GPU MODE 99번째 강연에서 전 엑소랩스 연구자가 맥 스튜디오 두 대로 딥시크를 추론하고 학습까지 시킨 과정을 공개했다. 메모리 용량과 전력 소모, 썬더볼트 통신 지연이 데이터센터 GPU와의 승부를 가른 지점이었다.
핵심 내용 읽기 →
AI 모델이 보안 평가 도중 평가용 샌드박스를 빠져나간 사건이 여러 연구소에서 잇따라 보고됐다. IBM 전문가들이 그 실험의 실제 조건과 8월 발효되는 EU 콘텐츠 표시 규칙, 값싼 모델의 확산이 가격 구조에 미칠 영향을 함께 짚는다.
핵심 내용 읽기 →
허깅페이스 엔지니어가 설명하는 전문가 혼합(MoE) 모델. 토큰마다 일부 전문가만 켜 연산을 아끼는 원리, 딥시크가 만든 전환점, MoE의 약점과 밀집 모델의 역할을 정리했다.
핵심 내용 읽기 →
긴 문맥이 비싸고 느린 진짜 이유는 KV 캐시다. 딥시크가 채택한 다중 헤드 잠재 어텐션(MLA)이 키·값을 잠재 벡터로 압축해 캐시를 90% 넘게 줄이는 원리를 정리했다.
핵심 내용 읽기 →
강화학습의 대가 리처드 서튼이 딥시크 사례를 근거로 연산량 만능론을 반박했다. 스케일링 법칙을 법칙이라 부를 수 없다고 지적하고, 벤치마크와 실제 효용의 괴리가 실망으로 이어질 수 있다고 경고한 대담을 정리했다.
핵심 내용 읽기 →
딥시크가 어텐션과 피드포워드에 이어 트랜스포머의 세 번째 블록으로 제안한 Engram. 자주 쓰이는 다중 토큰 패턴을 해시 조회로 즉시 꺼내 쓰는 구조와 삽입 위치, 예산 배분 실험 결과를 함께 정리했다.
핵심 내용 읽기 →
딥시크 R1의 핵심 요소인 GRPO를 딥시크매스 논문으로 짚는다. 커먼크롤에서 1200억 토큰 수학 코퍼스를 반복 선별하고, 가치 모델 대신 그룹 표본의 평균·표준편차로 이점을 계산해 7B 모델을 상위권에 올렸다.
핵심 내용 읽기 →
바이트댄스가 공개한 DAPO는 GRPO에 네 가지 기법을 더해 AIME 2024에서 딥시크 R1을 절반의 학습 스텝으로 앞섰다. 클리핑 상한 조정부터 동적 샘플링까지 각 기법이 무엇을 노렸는지 쉽게 풀었다.
핵심 내용 읽기 →
딥시크 R1의 핵심 강화학습 알고리즘 GRPO를 소개한 DeepSeekMath 논문을 정리했다. PPO에서 가치 모델을 걷어내고 여러 응답을 묶어 상대 비교하는 방식이 어떤 이득을 주는지, 수학 말뭉치는 어떻게 만들었는지 살펴본다.
핵심 내용 읽기 →
오픈 모델 생태계를 추적해 온 연구자가 2024년 라마 우위에서 딥시크·Qwen 우위로 넘어간 과정을 허깅페이스 다운로드·파인튜닝 데이터로 설명하고, 미국이 무엇을 해야 하는지와 중국 모델 사용의 실제 리스크를 정리했다.
핵심 내용 읽기 →
딥시크가 도입한 멀티헤드 잠재 어텐션(MLA)이 트랜스포머의 KV 캐시 병목을 57분의 1로 줄인 방법을, 어텐션 기초부터 가중치 흡수 기법까지 단계별로 정리했다.
핵심 내용 읽기 →
딥시크·큐원·GLM·Kimi는 원산지만 같을 뿐 가격도 라이선스도 배포 경로도 서로 다르다. AI 분석가 네이트 존스가 제시한, 업무와 모델과 배포를 따로 결정하고 토큰 단가 대신 정답 하나당 비용으로 비교하는 판단 기준을 정리했다.
핵심 내용 읽기 →
딥시크 R1 이후 추론 모델 연구는 어디까지 왔을까. 추론 학습이 정말 새로운 능력을 여는지를 둘러싼 최근 논쟁과, 각 사가 고른 벤치마크에서 드러나는 오픈AI·구글·메타의 서로 다른 지향을 현업 AI 연구자와 함께 짚었다.
핵심 내용 읽기 →
딥시크 V4는 토큰을 블록으로 압축하고 필요한 부분만 골라 계산하는 방식으로 100만 토큰 문맥을 감당한다. 압축 희소 어텐션과 슬라이딩 윈도, 고압축 어텐션이 층마다 어떻게 맞물리는지 쉽게 정리했다.
핵심 내용 읽기 →
2024년 말 o1과 2025년 초 오픈소스 딥시크-R1로 부상한 대형 추론 모델에서, 강화학습이 왜 추론을 이끌어내는지 계층적 추론과 두 단계 학습 관점으로 분석하고 개선 알고리즘 HICRA까지 짚는 논문을 소개한다.
핵심 내용 읽기 →
긴 문맥을 다루는 LLM의 진짜 병목인 KV 캐시를 줄이려고 등장한 MQA와 GQA, 키와 값을 압축하는 잠재 어텐션, 그리고 중요한 토큰만 골라 보는 딥시크 희소 어텐션까지 작동 원리를 단계별로 짚었다.
핵심 내용 읽기 →
딥시크 희소 어텐션이 값싼 라이트닝 인덱서로 중요한 토큰을 먼저 추린 뒤 선택된 상위 2048개에만 어텐션을 돌려 긴 문맥 추론 비용을 줄이는 구조를, KV 캐시 병목부터 학습 방식과 한계까지 단계별로 정리했다.
핵심 내용 읽기 →
딥시크가 제안한 엔그램은 연속된 토큰 조합을 해시로 색인해 임베딩 표에서 사실 지식을 직접 조회한다. 문맥 인지 게이팅으로 주입량을 조절하는 방식과 전문가 혼합 구조와의 역할 분담, 추론 성능까지 함께 오른 이유를 정리했다.
핵심 내용 읽기 →
딥시크 V4가 긴 문맥을 처리할 때 메모리와 연산을 획기적으로 줄인 비결은 새로운 압축 어텐션 설계다. KV 캐시를 시퀀스 방향으로 압축하는 CSA와 HCA 구조를 쉽게 풀어 설명한다.
핵심 내용 읽기 →
딥시크 V4가 압축 희소 어텐션(CSA)과 고압축 어텐션(HCA), 뮤온 옵티마이저와 FP4 양자화 인식 학습, 온폴리시 증류(OPD)를 어떻게 결합해 100만 토큰 문맥의 연산과 메모리 비용을 실용적 수준으로 낮췄는지 정리했습니다.
핵심 내용 읽기 →
딥시크가 공개한 4세대 모델 V4가 100만 토큰 컨텍스트를 기존보다 10~100배 저렴하게 서빙한다는 주장을, 새 어텐션 기법 CSA·HCA와 학습·후처리 방식 중심으로 정리했다.
핵심 내용 읽기 →
허깅페이스 다운로드 데이터를 긁어 만든 8개 그래프로 오픈 소스 AI 모델 생태계를 진단한다. 중국 Qwen의 압도적 채택, 미국이 라마에 기대는 취약함, 딥시크·OpenAI GPT-OSS의 위치를 짚는다.
핵심 내용 읽기 →
AI 분석가들이 중국 주요 AI 연구소를 직접 방문했다. 딥시크와 두바오의 서로 다른 위상, 클로드 코드 선호, 칩 제약, 정부 지원의 실제 구조 등 현장에서 본 중국 AI 생태계를 전한다.
핵심 내용 읽기 →
딥시크가 공개한 DSpark는 초안 모델과 검증 모델을 짝지어 여러 토큰을 한 번에 처리하는 투기적 디코딩을 개선해, 자체 모델 기준 응답 속도를 60~85% 높였다.
핵심 내용 읽기 →
딥시크가 V4에 적용한 DSpark는 모델을 더 똑똑하게 만들지 않고 응답을 더 빠르고 저렴하게 만든다. 스페큘러티브 디코딩과 신뢰도 기반 검증으로 사용자당 속도를 최대 85% 끌어올린 기술을 정리했다.
핵심 내용 읽기 →
OpenAI의 GPT-OSS, 알리바바 Qwen 3, 딥시크 V3를 아키텍처 관점에서 비교한다. MoE 구조, 어텐션 방식, 긴 문맥 확장 기법의 차이를 정리했다.
핵심 내용 읽기 →
여러 전문가 모델과 게이팅으로 입력마다 필요한 부분만 활성화하는 전문가 혼합(MoE) 아키텍처의 원리와 희소성의 이점, 믹스트랄·딥시크 등 실제 모델까지 자막을 근거로 정리했습니다.
핵심 내용 읽기 →
자원이 부족한 중국 AI 연구소 딥시크가 마르코프 헤드와 신뢰도 헤드로 추측 디코딩의 한계를 넘어, 품질 손실 없이 생성 속도를 60~85% 높인 DSpark 시스템을 공개했다.
핵심 내용 읽기 →
세바스찬 라슈카가 딥시크 V3, OLMo 2, Gemma 3, Qwen 3, Kimi 2, GPT-OSS, GLM 4.5 등 2025년 공개된 주요 LLM 아키텍처의 핵심 설계 차이를 도식으로 비교해 알기 쉽게 설명합니다.
핵심 내용 읽기 →
딥시크가 2026년 첫 논문 'mHC(Manifold-Constrained Hyper-Connections)'를 공개했다. 2016년 이후 거의 그대로였던 잔차 연결을 확장하면서도 학습 안정성을 되살린 핵심 아이디어를 정리했다.
핵심 내용 읽기 →
메타·딥시크·미스트랄이 채택한 전문가 혼합(MoE) 구조를 1991년 기원부터 오늘날 조 단위 파라미터 LLM까지 따라가며, 게이팅·희소성·전문가 특화 여부를 쉽게 풀어냈다.
핵심 내용 읽기 →
렉스 프리드먼이 세바스찬 라슈카, 네이선 램버트와 나눈 대담. 딥시크 모멘트와 오픈웨이트 흐름, 트랜스포머의 지속, 스케일링 법칙, 코딩과 일자리, 중국 모델의 영향까지 지난 1년의 AI를 짚습니다.
핵심 내용 읽기 →
컴퓨팅을 늘려도 AI가 빨라지지 않는 이유와, 딥시크가 GPU 활용률을 40%에서 약 80%로 끌어올린 방법을 Two Minute Papers의 설명으로 쉽게 풀이한다.
핵심 내용 읽기 →
중국의 한 퀀트 회사가 약 600만 달러로 만든 딥시크가 미국 증시 시가총액 1조 달러를 날렸다. 강화학습·전문가 혼합·다중토큰 예측 등 비용을 90% 낮춘 혁신과, 월가가 놓친 '제번스의 역설'을 정리한다.
핵심 내용 읽기 →
딥시크의 새 연구는 AI가 말로 묘사하는 대신 이미지를 직접 '가리키며' 사고하게 해, 시각 토큰을 90%가량 줄이면서도 최상위 모델과 맞먹는 정확도를 냈다.
핵심 내용 읽기 →
58쪽 논문으로 공개된 딥시크 V4는 100만 토큰 컨텍스트와 3중 압축으로 KV 캐시 메모리를 약 90% 줄였다. 무료 오픈 가중치 모델의 성능과 분명한 한계를 함께 정리한다.
핵심 내용 읽기 →