언어 모델이 스스로 질문하게 만들기: MIT 연구가 보여준 사용자 의도 파악과 능동 학습 방법
예시나 프롬프트만으로는 사람의 의도가 제대로 전달되지 않는다. MIT 제이컵 안드레아스 교수가 카네기멜런대 로보틱스 세미나에서 소개한, 언어 모델이 스스로 좋은 질문을 던지게 만드는 연구들을 정리했다.
핵심 내용 읽기 →AI TOPIC
로보틱스 관련 핵심 뉴스와 활용 인사이트 61편을 최신순으로 모았습니다.

예시나 프롬프트만으로는 사람의 의도가 제대로 전달되지 않는다. MIT 제이컵 안드레아스 교수가 카네기멜런대 로보틱스 세미나에서 소개한, 언어 모델이 스스로 좋은 질문을 던지게 만드는 연구들을 정리했다.
핵심 내용 읽기 →
카네기멜런대 추모 강연에서 앤키 공동창업자이자 전 웨이모 임원인 보리스 소프먼이 히트 상품을 내고도 회사가 무너진 이유, 자율주행의 기술 전환점, 그리고 건설 중장비 자율화에 걸고 있는 승부를 직접 설명했다.
핵심 내용 읽기 →
MIT 레슬리 켈블링 교수가 CMU 로보틱스 연구소 세미나에서 데이터로만 배우는 로봇의 한계를 짚고, 믿음과 세계 모델을 갖춘 로봇이 시연 세 번만 보고 시연자의 의도를 추론해 새로운 장면에서 작업을 해내는 연구 결과를 소개했다.
핵심 내용 읽기 →
미시간대 연구자가 리군 대칭성을 활용한 로봇 상태 추정과 제어, 모드를 스스로 찾아 스케이트보드를 타는 사족보행 로봇 학습, 일반선형군까지 확장한 등변 신경망 연구를 버클리 세미나에서 차례로 정리했다.
핵심 내용 읽기 →
엔비디아 기어랩 연구원이 UC버클리 세미나에서 휴머노이드 제어용 행동 파운데이션 모델 두 가지를 비교했다. 보상 함수를 그대로 넣는 제로샷 프롬프팅과 700시간 모션 캡처를 밀어붙인 규모 확장이 각각 어디까지 왔는지 짚는다.
핵심 내용 읽기 →
KAIST 심현철 교수가 UC버클리 세미나에서 30년간의 자율 드론 레이싱과 자율주행 경주 경험을 정리하고, 기체를 개조하는 대신 기존 조종석을 그대로 쓰는 휴머노이드 로봇 파일럿 연구를 소개했다.
핵심 내용 읽기 →
프린스턴 하이메 페르난데스 피삭 교수가 UC 버클리 세미나에서 설명한 자율 시스템 안전 보장법을 정리했다. 운영 설계 영역, 안전 필터의 세 구성요소, 적대적 강화학습으로 차원의 저주를 우회하는 방법을 다룬다.
핵심 내용 읽기 →
스탠퍼드 앨리슨 오카무라 교수가 UC버클리 EMBER 세미나에서 소개한 동심관 로봇 기반 심장 3D 프린팅, 피부를 늘려 감각을 전하는 웨어러블 햅틱, 환자 이송용 덩굴 로봇 연구와 AI 설계 도구에 필요한 조건을 정리했다.
핵심 내용 읽기 →
CVPR 2026에서 발표된 단안 SLAM 연구를 정리했다. 보정 정보 없는 카메라 한 대로 지도를 만들며 위치를 추정하되, 지도 점을 시간과 공간 양쪽으로 골라 오는 방식으로 초당 80프레임을 넘긴 파이프라인이다.
핵심 내용 읽기 →
MERL 세미나에서 잭 맨체스터가 수년간 쌓아 올린 복합 최적화 연구를 돌아본 뒤, 무작위 샘플링과 선형 모델 하나 같은 단순한 방법이 실제 로봇 보행에서 어디까지 통하는지 보여준 발표를 정리했다.
핵심 내용 읽기 →
미쓰비시전기 연구소가 CVPR 2026에서 발표한 어셈블리벤치를 정리했다. 산업용 물체 2000종의 자동 생성 설명서와 조립 경로를 담고, 물리 엔진으로 조립의 실현 가능성까지 따지는 데이터셋과 모델을 소개한다.
핵심 내용 읽기 →
걷기와 기어가기, 등반과 구르기를 상황에 따라 갈아타는 이족 로봇 모비우스를 정리했다. 경로와 지형, 이동 모드를 한 번에 푸는 상위 계획기와 자동 튜닝 힘 제어, 강화학습 보행 정책, 넘어지면 사족으로 전환하는 복구 방식까지 살펴본다.
핵심 내용 읽기 →
워싱턴대·Ai2의 디터 폭스가 ETH 취리히 강연에서 로봇 학습의 병목은 모델이 아니라 데이터라고 짚었다. 시연으로 배운 로봇의 한계와, 시뮬레이션으로 조작 능력을 넓히는 '파운데이션 월드' 구상을 정리했다.
핵심 내용 읽기 →
스탠퍼드 제어 강의가 모방학습을 다루며 행동 복제가 실패하는 두 원인인 복합 오차와 다봉 행동, 그리고 DAgger와 데이터 증강, 디퓨전 정책과 액션 청킹, 역강화학습까지 해법을 차례로 정리했다.
핵심 내용 읽기 →
스탠퍼드 AA203 강의가 모델 예측 제어의 두 축을 정리했다. 종단 집합을 제어 불변 집합으로 잡으면 매 제어 주기마다 해의 존재가 보장되고, 최적 비용 함수를 리아푸노프 함수로 삼으면 안정성 증명이 따라온다.
핵심 내용 읽기 →
스탠퍼드 AA203 강의가 해밀턴-야코비-아이작스 방정식으로 충돌 회피용 안전 집합을 계산하는 방법과, 개루프의 속도와 폐루프의 강점을 절충하는 모델예측제어의 구조 및 세 가지 튜닝 손잡이를 함께 정리한다.
핵심 내용 읽기 →
스탠퍼드 AA203 13강은 동역학을 안다는 가정을 내려놓는 자리다. 불확실성에 대응하는 세 갈래 전략, 최소자승 시스템 식별의 성질과 한계, 그리고 리아푸노프 안정성으로 전개되는 적응 제어의 논리를 정리했다.
핵심 내용 읽기 →
확산 정책 논문 저자인 선데이 로보틱스 CTO 청 치가 ETH 취리히 강의에서 밝힌 현실. 로봇을 제품으로 만드는 건 알고리즘이 아니라 부품 공급망, 조립 검사, 그리고 수천 명의 데이터 수집 인력을 다루는 운영 능력이었다.
핵심 내용 읽기 →
허깅페이스 르로봇 세미나에서 공개된 오픈소스 비전-언어-행동 모델 OpenVLA를 정리했다. 행동을 토큰으로 바꾼 설계, 기존 모델과의 성능 비교, LoRA 미세조정과 4비트 양자화, 그리고 남은 한계까지 차례로 짚는다.
핵심 내용 읽기 →
스탠퍼드 AA203 8강은 상태를 원점으로 되돌리는 제어기인 LQR을 편차 변수로 바꿔 궤적 추종에 쓰고, 이를 뒤집어 궤적 자체를 개선하는 iLQR과 벨만 방정식을 직접 근사하는 DDP까지 한 시간에 정리한다.
핵심 내용 읽기 →
스탠퍼드 AA203 6강이 다룬 직접법을 정리했다. 시간을 먼저 이산화해 일반 최적화 문제로 바꾸는 슈팅과 콜로케이션, 그리고 비선형 문제를 볼록 문제의 반복으로 푸는 순차 볼록 계획법이 핵심이다.
핵심 내용 읽기 →
스탠퍼드 AA203 7강 정리. 개루프 제어와 폐루프 정책의 차이, 최적성 원리와 역방향 재귀, 차원의 저주, LQR이 리카티 방정식으로 정리되는 과정을 한국어로 차근차근 풀어 설명한다.
핵심 내용 읽기 →
딥러닝 논문읽기 모임이 다룬 엔비디아 GR00T N1을 정리했다. 느린 추론과 빠른 행동 생성을 나눈 듀얼 시스템 구조, 웹·합성·실제 로봇 데이터를 쌓은 데이터 피라미드, 그리고 제로샷 성공률과 남은 한계를 짚는다.
핵심 내용 읽기 →
제네시스 AI의 로봇 손 Gene 26.5는 요리와 피펫 조작을 사람 속도로 해냈다. 진짜 관전 포인트는 하드웨어가 아니라 사람 손의 힘과 촉각을 기록하는 데이터 장갑, 그리고 20만 시간 규모의 멀티모달 데이터였다.
핵심 내용 읽기 →
구글 딥마인드에서 로봇 학습을 이끌던 테드 샤오가 취리히 공대 초청 강의에서 지난 10년을 세 시대로 나눠 정리했다. 로봇 팔 농장 실험과 파운데이션 모델 도입, 그리고 지금의 데이터·평가 스케일 경쟁까지 짚는다.
핵심 내용 읽기 →
네이처에 실린 소니 AI의 탁구 로봇 에이스는 실제 시합 데이터 없이 시뮬레이터에서만 학습한 정책으로 엘리트 선수를 이겼다. 카메라와 이벤트 비전으로 짠 인지 구조, 공식 규칙 아래 치른 승패 기록, 프로에게 진 이유를 정리했다.
핵심 내용 읽기 →
스탠퍼드 AA203 최적·학습 기반 제어 5강 요약. 제어 입력에 상한이 있을 때 최적성 조건이 폰트랴긴 최소 원리로 어떻게 강화되는지, 최소 시간·연료·에너지 문제에서 나오는 제어 형태와 수치 해법을 정리했습니다.
핵심 내용 읽기 →
버클리 연구진이 로봇 파운데이션 모델의 내부 뉴런을 개념 단위로 묶어 행동을 조절한 첫 해석가능성 연구를 소개했다. 똑같은 자연어 명령에도 로봇의 움직임이 달라지는 실험과 물리 AI 안전이라는 새 과제를 함께 다룬다.
핵심 내용 읽기 →
서울대 AI연구원 컴퓨터비전 센터 킥오프 발표를 정리했다. 로봇이 현실에서 넘어지고 부딪히는 상황을 스스로 만들어 학습하는 자가 진화형 피지컬 AI의 구상과, 인지 AI와 추론 AI 두 축으로 나뉜 연구 계획, 그리고 안전성 확보 방안을 짚는다.
핵심 내용 읽기 →
코스모스 3는 장면을 이해하는 추론기와 미래를 만들어 내는 생성기를 한 아키텍처에 담은 개방형 세계 모델입니다. VLA와 세계 모델이 각각 놓쳤던 지점을 어떻게 메우려 하는지, Genie 3나 V-JEPA 2와는 무엇이 다른지 정리했습니다.
핵심 내용 읽기 →
피지컬 인텔리전스 공동창업자 첼시 핀이 범용 로봇 모델 개발 과정을 공개했다. 빨래 개기에서 3개월간 성공률 0%를 겪은 뒤 찾아낸 사전학습·사후학습 조합과, 처음 가보는 집에서도 작동한 비결을 짚는다.
핵심 내용 읽기 →
엔비디아 젠슨 황 CEO가 서울대 강연에서 코드와 운영체제의 시대가 LLM과 하네스의 시대로 바뀌었다고 말했다. 에이전트와 스킬, 로봇, 새 개인용 AI 컴퓨터 계획, 한국에 대한 평가까지 정리했다.
핵심 내용 읽기 →
트랜스포머와 월드 모델은 경쟁 관계가 아니다. 엔비디아 AI 연구 부사장 산야 피들러가 자율주행 시뮬레이션의 세대 교체, 촉각 데이터의 부재, 그리고 범용 로봇의 챗GPT 순간이 언제 올지를 이야기했다.
핵심 내용 읽기 →
사람의 행동 영상은 넘쳐나는데 로봇은 왜 그것으로 배우지 못할까. 더 큰 VLA와 월드 모델만으로는 범용 로봇에 닿을 수 없다며 네 가지 인터페이스를 제안한 2026년 포지션 페이퍼를 따라가 본다.
핵심 내용 읽기 →
로봇이 세계를 이해하려면 영상 생성만으로는 부족하다. 구글 딥마인드의 지니와 엔비디아 코스모스 프레딕트 2.5가 월드 모델에 접근하는 서로 다른 방식과 피지컬 AI 학습에서의 역할 분담을 정리했다.
핵심 내용 읽기 →
허깅페이스 연구자가 올해 주목하는 세 가지 AI 흐름을 짚었다. 세계를 압축해 담는 월드 모델, 자연어 지시를 행동으로 옮기는 비전-언어-행동 모델, 그리고 휴대폰 화면을 직접 조작하는 온디바이스 에이전트다.
핵심 내용 읽기 →
ETH 취리히 연구진이 RGB-D 궤적에서 사람 개입 없이 의미 라벨을 만드는 파이프라인 LabelMaker를 공개했다. 여러 모델의 예측을 합의 투표로 통합하고 2D 라벨을 3D로 올려 잡음을 줄이는 구조를 정리했다.
핵심 내용 읽기 →
평가 도구는 왜 전부 무료일까. 허깅페이스 파리 본사를 찾아간 개발자 채널이 세 직원에게 벤치마크 조작을 막는 게이팅과 롤링 데이터, 로봇 센서 데이터 수집, 회사의 수익 모델과 일하는 방식을 물었다.
핵심 내용 읽기 →
카메라 25대가 필요하던 동적 3D 장면 복원을 3~5대로 줄인 대학 수업 팀 프로젝트 발표. 가우시안마다 속도와 가속도를 안정적으로 학습시키는 단계별 최적화, 정규화, 점진적 물리 학습 방법을 설명한다.
핵심 내용 읽기 →
앤스로픽의 피지컬 인텔리전스 인수설을 계기로 π0부터 π0.7까지 로봇 파운데이션 모델의 계보를 짚고, LLM이 로봇을 제어하는 네 가지 방법과 각각의 실제 성공률이 어땠는지를 살펴본 대담을 정리했다.
핵심 내용 읽기 →
오픈AI 차세대 모델의 수학 난제 해결부터 GPT-5.6 가격 인하, MIT 라이선스로 풀린 DeepSeek-V4-Flash, Seedance 2.5와 Gemini Robotics 2까지 이번 주 AI 소식을 한 번에 정리했다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 서밋에서 로보틱스와 의료 AI, 멀티모달 추론 연구자들이 발표와 토론을 진행했다. 지각 오류와 사실 회상의 한계, 개념 증명과 실제 배치 비용 사이에서 벌어진 간극 등 현재 지점을 정리했다.
핵심 내용 읽기 →
엔비디아가 GTC에서 공개한 코스모스 3를 AI 연구자 두 명이 기술 보고서를 놓고 직접 뜯어봤다. 리즈너와 제너레이터로 나뉜 실제 구조, 로봇 공통 액션 스페이스, 옴니모델의 계보와 한계까지 정리했다.
핵심 내용 읽기 →
30×32 픽셀 이미지로 조향을 배운 1980년대 신경망 ALVINN의 개발자가 5분 실시간 학습과 초기 합성 데이터 실험, 160킬로미터 고속도로 주행, 차선이탈경고 상용화까지의 과정을 직접 들려줬다.
핵심 내용 읽기 →
행동을 직접 예측하는 대신 목표를 이루는 미래 영상을 먼저 만들고 그 영상에서 실제 제어 신호를 뽑아내는 UniPi 논문을, 딥러닝논문읽기모임 발표를 따라가며 확산 모델 구조와 실험 결과, 남은 한계까지 정리했다.
핵심 내용 읽기 →
무작위 장애물 환경에서 여러 에이전트를 동시에 학습시킨 실험을 따라가며, 관측·행동·보상 설계부터 각자도생 방식 IPPO의 한계와 중앙집중 크리틱을 쓰는 MAPPO의 해법, 협력의 창발까지 정리했다.
핵심 내용 읽기 →
구글 딥마인드가 제미나이 로보틱스 2를 공개했다. 로봇의 온몸을 함께 제어하는 전신 지능, 지퍼백을 닫는 수준의 손재주, 로봇끼리의 협업이 핵심이다. 연구진은 보행은 거의 풀렸지만 손의 조작은 여전히 미해결이라고 말한다.
핵심 내용 읽기 →
그래비티 제트 슈트, 제트팩 에이비에이션, 전기 덕티드 팬 자작 프로젝트의 비행 원리를 뜯어보고, 두 손이 조종에 묶이는 한계를 의도 추정 AI와 모델 예측 제어, 잔차 강화학습으로 푸는 구상을 정리했다.
핵심 내용 읽기 →
구글 딥마인드가 제미나이 로보틱스 2를 공개하며 로봇의 '손재주'를 전면에 내세웠다. 포도를 지퍼백에 담고 전구를 돌려 빼고 쓰레기봉투를 묶는 과제로 정밀도와 협응, 3차원 공간 이해를 시험했다. 지향점은 유해 폐기물 처리처럼 위험한 일의 대체다.
핵심 내용 읽기 →
엔비디아가 GTC 타이베이에서 코스모스 3을 공개했다. 텍스트·이미지·영상·행동을 아우르는 다섯 양식을 입력과 출력 양쪽에서 처리하며, 예전에는 여러 모델을 이어 붙여야 했던 일을 하나의 모델로 접었다.
핵심 내용 읽기 →
1961년 성냥갑으로 만든 학습 기계에서 시뮬레이션으로 훈련된 휴머노이드 로봇까지, 실패를 벌하고 성공을 보상하는 단순한 원리가 어떻게 오늘의 AI와 로보틱스를 만들어 왔는지 차근차근 정리한 영상이다.
핵심 내용 읽기 →
소프트웨어정책연구소(SPRi) 포럼 발표를 토대로 피지컬 AI의 정의와 네 가지 유형, 핵심 기술과 시장 전망, 그리고 기술 한계·비용·노동시장·법제 공백·보안·지정학 경쟁이라는 여섯 쟁점과 정책 과제를 정리했다.
핵심 내용 읽기 →
구글 딥마인드가 제미나이 로보틱스 2의 전신 제어를 공개했다. 체화 추론 모델이 상황을 이해하고 비전-언어-행동 모델이 관절을 움직이는 구조를 설명한다.
핵심 내용 읽기 →
부품난으로 로봇 키트 생산이 막히자 제작자는 안 쓰는 스마트폰을 로봇의 뇌로 삼았다. 폰의 센서와 신경망으로 걷고 대화하는 로봇을 만드는 방법과, 소수 기업이 아닌 개인이 통제하는 로봇이 더 안전하다는 그의 주장을 정리했다.
핵심 내용 읽기 →
도어대시 공동창업자들이 자체 개발한 자율배달 로봇 DOT, 대화형 주문 기능이 만든 소비 행동 변화, 그리고 현실 세계에서 로봇을 규모 있게 굴릴 때 부딪히는 운영·양산 문제와 데이터 우위를 설명한다.
핵심 내용 읽기 →
ICML 현장에서 직접 플레이해 본 멀티 에이전트 월드 모델과, 오픈AI의 5억 달러 데이터 매입 제안을 거절하고 창업한 제너럴 인튜이션의 전략을 짚는다. 이들이 진짜 노리는 것은 영상 생성이 아니라 에이전트다.
핵심 내용 읽기 →
가정용 로봇 스타트업 선데이 로보틱스가 공개한 빨래 접기 99% 성과를 국내 연구자들이 뜯어봤다. 성공의 정의, 사전학습 스케일링, 시간당 30~60달러 데이터 수집 인력, 엣지 추론 전환까지 짚는다.
핵심 내용 읽기 →
말을 배운 AI 모델이 단어 대신 행동을 직접 출력하면 무슨 일이 벌어질까. 100달러짜리 자작 로봇에 최신 AI를 심은 실험을 통해 강화학습, 세계 모델, 소뇌의 원리와 로보틱스의 방향을 짚는다.
핵심 내용 읽기 →
엔비디아가 제시한 휴머노이드 레퍼런스 플랫폼(Isaac Sim·GR00T·Jetson Thor)과 여기에 올라탄 한국 기업들, 즉 삼성 레인보우 로보틱스·WIRobotics·홀리데이 로보틱스의 기술과 과제를 정리했습니다.
핵심 내용 읽기 →
엔비디아 GPU 없이 훈련한 롱캣 2.0, 더 제한된 채 돌아온 클로드 페이블 5, 수술 없이 생각을 글로 바꾸는 메타의 프로젝트 등 이번 주 공개된 AI 모델과 도구를 한 번에 정리했다.
핵심 내용 읽기 →
챗봇처럼 디지털에 머물던 AI가 원자의 세계로 넘어온다. 물리 AI의 개념, VLA 모델, 시뮬레이션 학습과 sim-to-real 격차를 IBM 설명으로 풀어본다.
핵심 내용 읽기 →