AI VIDEO BRIEFING
YOLO v1 완벽 정리 — 객체 탐지를 회귀 문제로 바꾼 2015년의 발상 전환과 실시간 비전의 시작
이미지 한 장을 분석하는 데 40초가 걸리던 객체 탐지를 초당 45장 수준으로 끌어올린 YOLO v1을 정리했습니다. 분류를 회귀로 바꾼 발상, 7×7 그리드 구조, 배경 오류가 줄어든 이유와 남은 한계까지 짚습니다.

핵심 메시지
쉽게 이해하기
자율주행차가 도로에 튀어나온 장애물을 즉시 피하고, 의료 영상에서 작은 병변을 실시간으로 짚어내는 일은 지금은 당연해 보입니다. 그러나 2015년 이전까지 이런 응용은 이론 속 이야기에 가까웠습니다. 당시 최고 성능으로 평가받던 R-CNN 계열 모델은 이미지 한 장을 분석하는 데 40초를 썼기 때문입니다.
개발자들은 늘 같은 딜레마에 갇혀 있었습니다. 정확도를 챙기면 속도가 무너지고, 속도를 올리면 정확도가 무너졌습니다. R-CNN이 이미지 구석구석을 수천 번 들여다보는 꼼꼼한 탐정이었다면, DPM 같은 모델은 빠르게 훑고 지나가는 대신 중요한 단서를 놓치는 쪽이었습니다. 둘을 동시에 잡는 일은 불가능해 보였습니다.
YOLO 연구진이 던진 질문은 '어떻게 더 잘 볼까'가 아니라 '왜 여러 번 봐야 하는가'였습니다. 기존 방식은 이미지의 각 부분을 놓고 '이건 차인가, 사람인가'를 수천 번 묻는 분류 문제였습니다. YOLO는 이를 하나의 회귀 문제로 바꿨습니다. 길을 물어 물어 찾아가는 대신 좌표를 한 번에 찍어주는 GPS에 가까운 접근입니다.
구현은 의외로 단순합니다. 여러 단계로 쪼개진 파이프라인 대신 하나의 통합 신경망을 쓰고, 이미지를 바둑판처럼 7×7, 즉 49개 격자로 나눕니다. 각 격자 칸은 자기 구역 안에 물체의 중심점이 있는지 확인하고, 있다면 그 물체의 위치와 크기를 예측한 뒤 종류까지 판단합니다. 중요한 것은 이 판단이 49개 칸에서 동시에 일어난다는 점입니다.
결과는 성능 개선이라기보다 범주의 변화에 가까웠습니다. 당시 가장 빠른 경쟁 모델보다 90배, 경량화한 Fast YOLO는 300배 이상 빨랐습니다. 속도만 얻은 것도 아니어서, 이미지 전체를 한 번에 보며 맥락을 활용한 덕분에 배경을 물체로 잘못 인식하는 오류가 R-CNN 대비 3분의 1로 줄었습니다. 나무 한 그루가 아니라 숲을 보기 때문에 생기는 이점입니다.
주요 인사이트
- 속도 향상의 원인을 연산 최적화가 아니라 문제 정의의 변경에서 찾은 사례다. 같은 하드웨어에서 두 자릿수 배수의 차이가 났다는 것은 병목이 계산량이 아니라 파이프라인 구조에 있었다는 뜻이다.
- 전체 이미지를 한 번에 처리한다는 선택이 속도와 정확도를 동시에 개선했다는 점이 중요하다. 배경 오류가 줄어든 이유는 모델이 더 똑똑해서가 아니라, 지역 조각만 보던 기존 방식이 맥락 정보를 버리고 있었기 때문이다.
- 작고 밀집한 물체에 약하다는 한계는 7×7 격자에서 각 칸이 담당하는 물체 수가 제한된다는 구조적 제약에서 자연스럽게 따라 나온다. 후속 버전이 앵커 박스와 다중 스케일 탐지를 도입한 이유도 여기에 있다.
- YOLO v1이 완벽했기 때문에 표준이 된 것이 아니다. 명확한 약점을 남겼기 때문에 다음 세대가 무엇을 고쳐야 하는지 알 수 있었고, 그것이 계열 전체가 빠르게 진화한 배경이 됐다.
자주 묻는 질문
YOLO 이전 객체 탐지 모델은 얼마나 느렸나요?
영상에서는 당시 최고 성능으로 꼽히던 R-CNN 계열이 이미지 한 장을 분석하는 데 40초가 걸렸다고 설명합니다. 같은 40초 동안 YOLO는 1,800장을 처리했습니다.
YOLO의 핵심 아이디어를 한 문장으로 말하면 무엇인가요?
이미지를 수천 번 들여다보며 '이 영역이 무엇인지' 반복해 묻는 분류 문제를, 이미지를 한 번만 보고 모든 물체의 위치와 종류를 한꺼번에 내놓는 회귀 문제로 바꾼 것입니다.
7×7 그리드는 정확히 어떻게 동작하나요?
이미지를 49개 격자로 나눈 뒤, 각 칸이 자기 구역 안에 물체의 중심점이 있는지 확인하고 있으면 위치와 크기를 예측한 다음 종류를 판단합니다. 이 과정이 49개 칸에서 동시에 진행됩니다.
YOLO v1의 약점은 무엇이었나요?
새떼처럼 작고 빽빽하게 모여 있는 물체나 형태가 특이한 물체를 잘 찾아내지 못했습니다. 이 한계는 이후 앵커 박스, 다중 스케일 탐지 같은 개선으로 이어졌습니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗