터미널 벤치로 본 AI 에이전트 평가의 현재 실력과 앞으로 5년의 핵심 과제 정리
AI 평가의 관심사는 무엇을 아는가에서 무엇을 할 수 있는가로 옮겨갔다. 과제마다 전용 도커 환경을 주고 에이전트를 시험하는 터미널 벤치의 설계와, 최고 모델도 50%를 넘지 못하는 이유를 정리했다.
핵심 내용 읽기 →AI TOPIC
코딩 에이전트 관련 핵심 뉴스와 활용 인사이트 118편을 최신순으로 모았습니다.

AI 평가의 관심사는 무엇을 아는가에서 무엇을 할 수 있는가로 옮겨갔다. 과제마다 전용 도커 환경을 주고 에이전트를 시험하는 터미널 벤치의 설계와, 최고 모델도 50%를 넘지 못하는 이유를 정리했다.
핵심 내용 읽기 →
딥시크가 MIT 라이선스로 공개한 코딩 에이전트 하네스가 깃허브 별 14만 개를 넘겼다. 모델을 교체 가능한 부품으로 되돌리는 ‘모든 것은 플러그인’ 설계와, 작업 중에 없는 도구를 스스로 만들었다 지우는 크리에이터 모드가 무엇을 바꾸는지 정리했다.
핵심 내용 읽기 →
깃허브 이슈를 그대로 문제로 삼는 평가 도구 SWE-bench를 만든 연구자가 벤치마크 제작 과정과 에이전트 도구 설계, 학습용 문제의 대량 생성까지 3년간의 작업을 직접 설명한 온라인 세미나의 내용을 정리했다.
핵심 내용 읽기 →
AI 코딩 도구를 쓰면 빨라진 느낌이 들지만 실제로는 느려진다는 조사가 있다. 규칙과 스킬, MCP 연결과 계획·구현·검증 절차로 개발 주기 전체를 AI에 맞춰 바꾸는 2시간 실전 워크숍 내용을 정리했다.
핵심 내용 읽기 →
엔비디아 GTC 2026 현장 인터뷰를 정리했다. 클라우드 인프라 기업 모달의 찰스 프라이가 베라 루빈 세대에 추론 전용 칩이 들어간 의미와 자체 모델 배포, 코딩 에이전트 활용, AI 여론 격차를 이야기했다.
핵심 내용 읽기 →
한 개발자가 30년 가까이 된 실시간 전략 게임의 내장 스크립트 언어로 AI 모델들에게 전략을 짜게 하고 서로 붙였다. 라운드를 거듭하며 나아진 결과와 밤새 돌린 자동 토너먼트 실험의 한계까지 정리했다.
핵심 내용 읽기 →
명세만 넣으면 코딩 에이전트가 계획·구현·검증·배포까지 스스로 처리하는 AI 다크 팩토리. AI 코딩 자율성 5단계와 이를 굴리는 다섯 부품, 그리고 신뢰성의 열쇠인 빌더·검증자 분리 구조를 정리했다.
핵심 내용 읽기 →
랭체인이 공개한 오픈위키는 사람이 아니라 코딩 에이전트가 읽을 저장소 문서를 만들고 스스로 갱신하는 오픈소스 도구다. 설계 원칙과 초기 평가 결과, 그리고 팀이 스스로 틀렸다고 인정한 전제까지 정리했다.
핵심 내용 읽기 →
앤드류 응이 코딩 에이전트 확산 이후 조직의 병목이 제품 기획을 넘어 마케팅과 법무로 옮겨간 과정, 기업의 AI 도입이 점진적 효율 개선에 머무는 이유, 비정형 데이터 아키텍처 재설계라는 과제를 차례로 짚는다.
핵심 내용 읽기 →
도어대시 공동창업자가 클로드 코드를 회사 전체에 확산시킨 과정을 이야기했다. 토큰 예산을 아끼지 않은 초기 전략, 코드 리뷰와 보안이라는 새 병목, 제품·디자인 리뷰 등 크로스펑셔널 프로세스의 재설계까지 짚는다.
핵심 내용 읽기 →
AI·ML·Quant 스터디 운영자가 화면을 공유하며 코딩 에이전트로 상세 리포트와 발표 자료를 만들어 깃허브 페이지에 올리는 전 과정을 시연하고, 저작권과 저장소 권한 문제를 어떻게 풀었는지 설명했다.
핵심 내용 읽기 →
NDC 코펜하겐 강연에서 한 개발자가 코딩 에이전트로 실제 코드를 만들며 정착시킨 다섯 가지 원칙을 정리했다. 스펙 우선, 작업자와 검토자의 권한 분리, 완료의 객관적 정의, 질문 강제, 컨텍스트 창 관리다.
핵심 내용 읽기 →
앤트로픽에서 클로드 코드 플러그인과 에이전트 팀을 설계한 데이지 홀먼이 NDC 코펜하겐에서 대규모 소프트웨어 엔지니어링을 위한 커스터마이징 원칙을 설명했다. 컨텍스트 창을 유한한 상자로 보고 무엇을 넣을지 고르는 일이 핵심이라는 것이다.
핵심 내용 읽기 →
아마존 AGI 랩의 아디티야 칸델왈이 10명 규모 팀에 코딩 에이전트를 정착시킨 과정을 AI 엔지니어 콘퍼런스에서 공개했다. 개인의 요령이 아니라 코드베이스 구조와 공용 설정을 바꿔야 하는 리더십 과제라는 것이 핵심이며, 잘못된 설정의 증상도 함께 짚었다.
핵심 내용 읽기 →
휴대폰에서 코딩 에이전트에 말을 걸고 싶어 한 시간 만에 만든 도구가 8개월 만에 3천 명이 커밋하는 오픈소스가 됐다. 창시자가 직접 밝힌 바이럴 이후의 성장통과 설정 폭발, 의존성 문제, 그리고 세 가지 교훈을 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나를 바탕으로 코딩 에이전트를 채점하는 SWE-bench·Terminal-Bench·RExBench의 설계와 한계, 벤치마크가 1년도 못 버티고 포화되는 이유, 그리고 모델과 실행 하네스를 분리해 측정해야 하는 까닭을 정리했다.
핵심 내용 읽기 →
휴먼레이어 창업자 덱스터 호시가 코딩 에이전트를 실제 대규모 코드베이스에 적용한 경험을 공유했다. 컨텍스트 사용률 40% 유지, 조사·계획·구현 3단계 분리, 의도적 압축과 서브에이전트 활용법을 정리했다.
핵심 내용 읽기 →
AI 코딩 에이전트는 매 턴마다 대화 전체를 다시 보내기 때문에 비용이 급격히 불어난다. 허깅페이스가 프롬프트 캐싱이 실제로 무엇을 저장하는지, 제공자별 만료 시간 차이와 캐시를 무효화하는 설계 실수를 정리했다.
핵심 내용 읽기 →
대규모 코드베이스에서 grep 기반 에이전트 검색이 시간과 토큰을 잡아먹는 지점, 그리고 코드 그래프를 미리 구축해 검색 비용은 물론 변경의 영향 범위와 위험도 분석까지 대체해 본 실험 결과를 정리했다.
핵심 내용 읽기 →
코딩 에이전트를 개인 도구가 아니라 팀 전체의 작업 방식으로 바꾼 스타트업이 모델 중립성, 세션 공유, 격리된 실행 환경, 자체 벤치마크까지 1년간 실제로 부딪히며 정리한 여섯 가지 교훈을 콘퍼런스에서 공개했다.
핵심 내용 읽기 →
같은 모델을 써도 감싸는 하네스에 따라 코딩 에이전트의 성능이 크게 갈린다. 검색 전략과 컨텍스트·메모리 3계층, 루프 설계와 안전장치, 멀티 에이전트의 조정 비용까지 실험 근거와 함께 하나씩 정리했다.
핵심 내용 읽기 →
팩토리 CTO 에노 레예스가 랭체인 팟캐스트에서 코딩 에이전트를 감싸는 하네스가 같은 모델의 성능과 비용을 어떻게 바꾸는지, 기업에서 폭증한 토큰 비용을 자동 모델 라우팅으로 줄이는 방법은 무엇인지 설명했다.
핵심 내용 읽기 →
깃허브 최고제품책임자 마리오 로드리게스가 모델 역량 도약 이후 벌어진 폭발적 부하 증가와 인프라 대응, 낮은 문턱과 높은 천장이라는 설계 방향, 개발자라는 말의 확장과 인간 중심 원칙까지 차례로 이야기한다.
핵심 내용 읽기 →
CMU 연구팀이 공개한 PithTrain은 약 1만 줄의 순수 파이썬 코드만으로 MoE 모델 학습 처리량을 메가트론 수준으로 맞추면서, 코딩 에이전트가 같은 작업을 끝내는 데 드는 턴 수는 최대 70%까지 줄였다고 밝혔다.
핵심 내용 읽기 →
스탠퍼드 연구팀이 만든 터미널벤치는 실무자가 직접 겪은 문제 80개를 각각 독립된 도커 환경에 담은 고난도 에이전트 벤치마크다. 공개 당시 최고 성적 50%, 반복되는 실패 유형과 스캐폴드가 점수에 미치는 영향을 정리했다.
핵심 내용 읽기 →
음성 AI 빌더 챌린지 1위 데모. 코딩 에이전트가 사소한 수정은 스스로 처리하고, 되돌리기 어려운 설계 결정 앞에서만 개발자 휴대폰으로 전화를 걸어 선택을 받아낸 뒤 그 결정을 그대로 코드에 반영한다.
핵심 내용 읽기 →
프롬프트에서 컨텍스트, 하네스를 거쳐 루프와 그래프까지. sudoremove 채널 대담을 토대로 AI 에이전트 용어가 3년간 바뀌어온 흐름과 각 단계가 실제로 풀려 했던 문제를 정리했다.
핵심 내용 읽기 →
연구 하나에 에이전트 100여 개를 붙이면 무엇이 달라질까. 커서와 베이스텐 엔지니어가 병렬 에이전트 운영, 완료를 판정하는 검증 루프, 모델 교차 리뷰, 컨텍스트 압축 과제를 두고 나눈 대담을 정리했다.
핵심 내용 읽기 →
AI를 만드는 속도가 그것을 재는 속도를 앞질렀다. 스노클 AI 연구자가 버클리 에이전틱 AI 서밋에서 밝힌, 오래 쓰이는 에이전트 벤치마크의 설계 원칙과 과제 품질 관리 방법, 다음 세대 평가의 방향을 정리했다.
핵심 내용 읽기 →
자율 코딩 에이전트가 기업 안으로 빠르게 들어오면서 기존 보안 통제가 흔들리고 있다. 권한 최소화 원칙이 왜 무너지는지, 에이전트를 감시하는 소형 모델이 왜 필요한지, 이스라엘 보안 스타트업 대표의 설명을 정리했다.
핵심 내용 읽기 →
AI 코딩 도구 커서가 첫 자체 콘퍼런스 기조연설에서 모바일 앱 베타, 에이전트를 전제로 설계한 깃 플랫폼 '오리진', 그리고 처음부터 학습 중인 대형 모델 세 가지를 공개했다. 이용자 95%가 이미 에이전트로 쓴다는 지표와 함께 발표 내용을 정리했다.
핵심 내용 읽기 →
코드를 한 줄도 읽지 않고 AI에게 전부 맡기는 '바이브 코딩'을 10년차 개발자가 직접 실험했다. 어떤 작업에서 잘 통하고 어디서 무너지는지, 그리고 터미널 권한을 쥔 코딩 에이전트가 만드는 보안 위험까지 정리했다.
핵심 내용 읽기 →
커서가 공개한 사용 데이터를 자사 엔지니어가 화면에서 직접 해설했다. PR당 추가 코드 2.5배 증가, 1000줄짜리 대형 PR 확산, 입력 토큰 비중 급등 등 코딩 에이전트 시대의 변화를 짚는다.
핵심 내용 읽기 →
코딩 에이전트가 코드를 대신 쓰는 시대에 소프트웨어 팀이 겪는 세 가지 병목과, MCP·스킬·훅으로 클로드 코드를 팀의 도구로 길들이는 하네스 엔지니어링 방법을 정리했다. 팀 공용 설정과 개인 설정을 가르는 기준도 함께 담았다.
핵심 내용 읽기 →
클로드 코드를 만든 개발자의 발언에서 시작된 루프 엔지니어링 논쟁을 정리했다. 목표 설정과 실행, 검증과 재시도로 이어지는 루프의 구조, 생성자와 검증자를 나눠야 하는 이유, 그리고 루프를 돌릴 때의 비용 문제까지 짚는다.
핵심 내용 읽기 →
커서 연구팀이 자사 코딩 모델 Composer 2의 학습 과정을 공개했다. 오픈 베이스 모델 선택부터 추가 사전학습, 20만 토큰 규모의 장기 강화학습, 자체 벤치마크 설계까지의 판단 근거를 정리했다.
핵심 내용 읽기 →
허깅페이스 내부에서 개발 중인 코딩 하네스 타우(Tau)를 소개하는 크래시 코스 영상 정리. 세션 트리, 스킬, 커스텀 프롬프트, 익스텐션 구조와 파이(Pi)와의 차이를 짚는다.
핵심 내용 읽기 →
SWE-bench를 만든 존 양이 새 벤치마크 프로그램벤치를 내놨다. 구현 과정 대신 완성된 실행 파일만 평가하는 설계, 출시 당시 0%였던 성적, 인터넷을 열었을 때 드러난 보상 해킹 문제까지 인터뷰에서 짚은 내용을 정리했다.
핵심 내용 읽기 →
동일한 클로드 코드 환경에서 같은 프롬프트로 GLM 5.2와 Opus 4.8을 비교했다. 프론트엔드 디자인은 구분이 어려웠지만 외부 연동이 얽힌 복잡한 작업과 소요 시간에서는 차이가 났고, 출력 토큰 단가는 약 6배 벌어졌다.
핵심 내용 읽기 →
1인당 토큰 지출이 인건비를 넘어서는 조직이 나오는 지금, 코그니션 사장 러셀 캐플런이 지능 포화와 병합 가능성 중심의 새 평가, 그리고 1,000만 달러 생산성 보증을 내건 인센티브 설계의 배경을 설명했다.
핵심 내용 읽기 →
크루AI 창업자 주앙 모우라가 사내 코딩 에이전트 운영 경험과 대기업 도입 사례를 정리했다. 재사용 가능한 빌딩블록, 이메일 기반 인간 개입, 지표를 넓게·좁게 보는 법, 도입을 가로막는 것이 기술이 아니라는 결론까지 짚는다.
핵심 내용 읽기 →
스탠퍼드 디지털경제연구소 세미나에서 시카고대 수프로팀 사카르 교수가 1천 개 기업 10만 명의 코딩 에이전트 사용 데이터를 분석했다. 주간 머지 39% 증가와 경력이 길수록 더 잘 쓴다는 역전 현상을 정리했다.
핵심 내용 읽기 →
코딩 에이전트는 문제를 풀면서도 코드베이스를 망가뜨린다. 체크포인트마다 기능을 덧붙이게 하며 복잡도가 어디로 쌓이는지 측정하는 SlopCodeBench 제작자의 문제의식과 실험에서 드러난 모델의 실패 양상을 정리했다.
핵심 내용 읽기 →
AI 기업들이 앞다퉈 뽑는 포워드 디플로이드 엔지니어는 실제로 무슨 일을 할까. 팩토리 공동창업자 에노 레예스가 '소프트웨어 공장' 개념과 코드베이스의 에이전트 준비도, 검증 루프가 자율성을 결정하는 이유를 설명했다.
핵심 내용 읽기 →
구글 클라우드 테크가 시니어 엔지니어들과 나눈 코딩 에이전트 활용 원칙. 생성된 코드를 선별해 커밋하는 법, 아키텍처 중심으로 옮겨가는 개발자 역할, 훅과 권한으로 에이전트 환경을 만드는 법을 정리했다.
핵심 내용 읽기 →
같은 테트리스 과제를 다섯 가지 모델 조합으로 시켜 본 결과, 가장 저렴한 모델에게 혼자 맡겼을 때 비용이 가장 많이 나왔다. 역할을 나누는 어드바이저 전략의 실측 데이터를 정리했다.
핵심 내용 읽기 →
출시 2주 만에 깃허브 스타 5만 개를 넘긴 코딩 에이전트용 스킬 Ponytail을 직접 적용해, 같은 프롬프트로 만든 컴포넌트의 코드 라인 수와 생성 속도, 토큰 사용량이 어떻게 달라지는지 비교한 실험 결과를 정리했습니다.
핵심 내용 읽기 →
Y Combinator 강연에서 클로드 코드를 만든 개발자가 밝힌 것들. 새 모델이 나올 때마다 프롬프트를 지우고, 모델에 조금 어려운 일을 맡기며, 검증 수단을 함께 주라는 조언을 정리했다.
핵심 내용 읽기 →
2022년 이후 AI 모델 토큰 단가는 100분의 1 수준으로 떨어졌지만 에이전트 운영비는 오히려 늘고 있다. 비용을 결정하는 것은 모델이 아니라 '루프'라는 분석을 정리했다.
핵심 내용 읽기 →
AI 엔지니어 컨퍼런스 강연에서 프롬프트레이어 창업자가 클로드 코드의 내부 구조를 분석했다. 단순한 while 루프, bash 중심 도구, 컨텍스트 관리가 핵심이라는 설명이다.
핵심 내용 읽기 →
프롬프트와 루프만 연결하면 아무도 읽지 않는 4만 줄짜리 PR이 쌓인다. HumanLayer의 카일 미스텔레가 제어이론(센서·컨트롤러·액추에이터)으로 실제 팀·규제 환경에서 통하는 코딩 에이전트 루프를 설계하는 법을 정리했다.
핵심 내용 읽기 →
오픈AI의 제이슨 리우가 AI 엔지니어 콘퍼런스 워크숍에서 코덱스를 실제로 쓰는 방식을 공개했다. 오래된 스레드를 팀원처럼 고정해 두고 스킬과 하트비트 자동화로 업무를 위임하는 구체적인 방법을 정리했다.
핵심 내용 읽기 →
오픈소스 코딩 에이전트 오픈코드의 창업자가 월간 사용자 1,300만 명, 하루 7조 토큰에 이르기까지의 성장 배경과 오픈소스 모델 생태계에 베팅한 이유, 신흥국 중심 사용자 분포가 만든 원가 경쟁력을 설명한다.
핵심 내용 읽기 →
안드레이 카파시가 팟캐스트 No Priors에서 코드 에이전트를 여러 개 병렬로 굴리는 개발 방식과 사람을 루프에서 빼는 오토리서치, 오픈소스 모델의 위치, AI 시대의 일자리 전망까지 폭넓게 이야기했다.
핵심 내용 읽기 →
AI 개발 컨퍼런스 발표에서 코딩 에이전트 개발자가 벤치마크 점수 맹신과 감(vibe) 의존을 모두 비판했다. 남의 평가를 해석하는 법, 평가로 에이전트를 개선하는 법, 직접 평가를 만드는 법까지 3단계로 정리했다.
핵심 내용 읽기 →
질문에 답만 하던 에이전트가 코드를 쓰고 실행하기 시작하면서, 에이전트마다 격리된 일회용 컴퓨터를 붙여 주는 샌드박스가 필수 인프라로 떠올랐다. 왜 컨테이너만으로 부족한지, 어떤 조건을 갖춰야 하는지 정리했다.
핵심 내용 읽기 →
휴먼레이어의 덱스 호슬리가 AI 코딩 에이전트만으로 코드 리뷰 없이 개발하는 방식이 왜 무너지는지, 모델 학습 구조와 유지보수성 관점에서 설명하고 대안을 제시한다.
핵심 내용 읽기 →
베이스 URL 한 줄만 바꾸면 공식가의 10분의 1이라는 AI API 중계 서버들이 성행한다. 연구진이 400여 곳을 조사하자 모델 바꿔치기와 악성코드 주입, 클라우드 자격증명 탈취 사례가 무더기로 확인됐다.
핵심 내용 읽기 →
루프 엔지니어링에 이어 등장한 '그래프 엔지니어링'이 무엇이고 왜 개념 자체는 새롭지 않은지 짚는다. 에이전트를 여러 개 엮을 때 생기는 집단 착각 문제, 그래프 바깥에 결정적 검증을 남겨야 하는 이유, 현실적인 시작 방법을 정리했다.
핵심 내용 읽기 →
코딩 에이전트를 매번 프롬프트로 붙잡고 있는 대신 스스로 돌게 만드는 '루프 엔지니어링'이 무엇인지, 트리거와 검증 가능한 목표라는 전제 조건부터 다섯 가지 구성 요소, 그리고 모호한 목표와 비용 폭주라는 두 함정까지 정리했다.
핵심 내용 읽기 →
Claude Code·Cursor·Codex 같은 코딩 에이전트를 허가 없이 실행하는 'YOLO 모드'의 실제 위험과, 샌드박스로 파일·네트워크·프로세스를 격리해 안전하게 자율 실행하는 방법을 정리했다.
핵심 내용 읽기 →
LangChain이 공개한 오픈소스 코딩 에이전트의 /goal 명령 시연 정리. 수용 기준을 먼저 합의하고 실행 도중에도 조건을 고쳐가며 네 시간짜리 대형 작업을 사람 개입 없이 완주시키는 방식을 살펴본다.
핵심 내용 읽기 →
코딩 에이전트가 무엇을 했는지 사후에 확인하기 어렵다면 추적이 답이다. LangChain 제품팀이 시연한 Cursor 연동 절차와, 모델 실행 아래 도구 호출이 붙는 LangSmith 트레이스 구조를 정리했다.
핵심 내용 읽기 →
프롬프트가 아니라 문제 자체를 AI가 고르게 한 실험의 결과를 정리했다. 한쪽은 안전하게 범위를 좁힌 문제를, 다른 한쪽은 전략적이지만 정의가 좁은 문제를 골랐고, 그 차이는 두 도구를 어떻게 나눠 쓸지까지 바꾼다.
핵심 내용 읽기 →
AI 에이전트에게 자율성을 더 줄수록 커지는 보안 위험을, 에이전트가 만드는 코드·사용하는 도구·취하는 행동 세 축으로 나눠 방어하는 방법을 정리했다.
핵심 내용 읽기 →
실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →
코덱스를 1000시간 넘게 써 본 진행자가 모델·사고 강도 선택, 스레드 위임, 루프(goal), 모바일 제어, 위험 명령 차단 등 실전 팁을 정리했습니다.
핵심 내용 읽기 →
한 개발자에게 날아온 251억원짜리 결제 오류 메일을 계기로, 코딩 에이전트의 성능·비용·신뢰를 짚었다. GPT 5.6과 페이블 5의 벤치마크 차이, 하네스의 역할, 그리고 “언제 멈춰야 하는가”라는 새 평가 기준을 정리했다.
핵심 내용 읽기 →
Tech With Tim이 정리한 OpenAI Codex 입문 강의. 데스크톱 앱 설치와 모델 선택, 컴퓨터·브라우저 제어 플러그인, 프로젝트와 워크트리, /goal·/plan·/compact·/review 명령, agents.md 메모리 파일까지 초보자 관점에서 핵심 기능을 짚습니다.
핵심 내용 읽기 →
MIT가 제안한 재귀 언어모델(RLM) 개념을 코딩 에이전트 관점에서 정리했습니다. 저장소를 데이터로 두고 코드를 실행해 필요한 문맥만 뽑아내는 방식과 실제 활용 사례를 소개합니다.
핵심 내용 읽기 →
프런티어 모델이 소프트웨어 취약점을 더 잘 찾고 악용하면서 취약점이 폭증하고 있다. 코리도 창업자 잭 케이블이 왜 근본적 '보안 설계'와 메모리 안전 언어 전환이 답인지 설명한다.
핵심 내용 읽기 →
로베르토 스타지는 AI가 애플리케이션 계층으로 내려오면서 에이전트 개발의 기본 언어가 타입스크립트로 옮겨가고 있다고 주장한다. 그 근거와 반론을 짚어본다.
핵심 내용 읽기 →
코그니션의 재러드 조너레이치가 좋은 AI 에이전트를 만드는 원칙을 설명한다. 과도한 프롬프트를 피하고 도구 설계에 집중하며, 클라우드 에이전트 팬아웃으로 대규모 작업을 병렬화하는 법을 다룬다.
핵심 내용 읽기 →
한 컨퍼런스의 상반된 두 발표를 'Z/L 연속선'으로 정리했다. 코드는 공짜라는 주장과 중요한 코드는 다 읽으라는 주장, 그리고 생산량 폭증 뒤 품질 문제를 짚는다.
핵심 내용 읽기 →
Y Combinator 디자인 총괄이 코딩 에이전트로 디자인하는 방식을 공개했다. 자신만의 도구를 만드는 '소모품 디자인', 맥락을 모아 둔 soul.md, 무드보드 원샷 반복까지 실전 과정을 정리했다.
핵심 내용 읽기 →
코딩 에이전트를 예로 하네스 엔지니어링을 제1원리로 풀어낸다. 프롬프트·컨텍스트 엔지니어링을 감싸는 상위 개념이 왜 하네스인지, LLM 면접 답변까지 정리했다.
핵심 내용 읽기 →
엔지니어가 아닌 홋카이도의 브로콜리 농부가 OpenAI Codex로 온실 환기를 자동화하고 작업 진행을 디지털로 관리하게 된 과정을 소개한다.
핵심 내용 읽기 →
테오 브라운은 AI 엔지니어 무대에서 모델 발전을 '시대'로 구분하고, 개발자가 오래된 습관을 버리고 예전엔 불가능했던 넓은 범위의 제품에 도전해야 한다고 말했다.
핵심 내용 읽기 →
랭체인이 소개한 오픈 모델 Nemotron 3 Ultra와 모델 독립형 코딩 에이전트 dcode(Deep Agents Code)로 에이전트를 구성하고 LangSmith로 추적하는 방법을 정리했다.
핵심 내용 읽기 →
LangChain이 공개한 OpenWiki는 명령어 하나로 저장소 문서를 만들고 Git 커밋을 추적해 매일 자동으로 갱신한다. 코딩 에이전트가 참고할 문서를 손 안 대고 최신으로 유지하는 방식을 정리했다.
핵심 내용 읽기 →
같은 AI 코딩 도구를 써도 결과가 극과 극인 이유는 무엇일까. Poolside의 엔지니어는 그 차이가 '에이전트가 자기 작업을 검증할 수 있는가'에 달려 있다고 말한다.
핵심 내용 읽기 →
AI 코딩 에이전트는 ‘완료’라고 말하지만 결과가 어긋나는 경우가 많다. 한 AI 엔지니어 강연을 통해 지시가 아닌 결정론적 검증으로 신뢰를 확보하는 접근을 정리했다.
핵심 내용 읽기 →
여러 대의 머신에서 AI 코딩 에이전트를 매일 동시에 운영하며 겪은 병목과 다섯 가지 붕괴, 그리고 계층형 조직 구조와 파일 기반 상태 관리, 리뷰 게이트웨이로 이를 풀어낸 KRAFTON 엔지니어의 실전 경험을 정리했다.
핵심 내용 읽기 →
AI 코딩 에이전트가 엑셀을 다루기 어려운 이유와, 15개 도구를 하나의 Node.js REPL로 바꿔 재무 분석 정확도를 50%에서 92%로 올린 위탄랩스의 4개월 실험을 정리했다.
핵심 내용 읽기 →
에시(Etsy) 엔지니어가 제안하는 발상의 전환. 좋은 하네스가 있으면 약한 오픈소스 모델로도 최신 모델급 성능을 낼 수 있다는 주장과, 코딩 에이전트를 단계별로 개선하는 방법을 정리했다.
핵심 내용 읽기 →
Pi는 서브에이전트·MCP·할 일 목록을 기본 탑재하지 않고 사용자가 직접 확장하도록 비워 둔 코딩 에이전트다. 자기 코드를 스스로 고쳐 하네스를 넓히는 방식과 세션 트리·모델 전환 기능을 살펴본다.
핵심 내용 읽기 →
버그 수정을 넘어 프로젝트 전체를 맡기는 시대, 코딩 에이전트를 수 시간·수억 토큰 규모로 평가하는 SWE-Marathon 벤치마크와 검증(verification)의 중요성을 정리했다.
핵심 내용 읽기 →
허깅페이스가 코딩 에이전트의 작동 원리를 직접 배우도록 설계한 미니멀 오픈소스 프로젝트 'Tau'를 공개했다. 세 계층 구조와 설치·모델 선택·세션 사용법, 그리고 앞으로 이어질 튜토리얼 계획까지 정리했다.
핵심 내용 읽기 →
AI 코딩 도구를 쓰는 방식을 자율주행 5단계에 빗대 정리한다. 코드를 참고만 하는 스파이시 자동완성부터 명세서를 넣으면 코드가 자동 배포되는 다크 팩토리까지, 각 레벨의 특징과 지금 머물러야 할 지점, 이를 뒷받침하는 시스템을 짚는다.
핵심 내용 읽기 →
Claude Code, Codex, Cursor를 각각 따로 쓰던 개발자를 위해 나온 무료 오픈소스 앱 Tracer. 에이전트끼리 계획·구현·검토를 주고받는 A2A 워크플로와 실제 사용법, 요금제를 정리했다.
핵심 내용 읽기 →
Y컴비네이터가 소개한 컨덕터 CEO 찰리 홀츠의 AI 코딩 셋업. 음성으로 여러 코딩 에이전트를 동시에 지휘하고, 코드는 직접 짜지 않으며 “지휘자”처럼 일하는 워크플로를 공개한다.
핵심 내용 읽기 →
개발자 테오가 클라우드 프레임워크를 직접 만들며 겪은 AI 코딩 방식의 대전환을 공개한다. 하니스 선택, 원격 코딩, 컨텍스트 관리와 에이전트 MD 활용법을 짚는다.
핵심 내용 읽기 →
제미나이 3.5 플래시로 UI를 디자인하고 오퍼스 4.8로 기획·통합을 맡기는 멀티 프로바이더 코딩 워크플로. 각 단계를 분리된 에이전트 세션과 핸드오프 문서로 연결하는 방법을 정리했다.
핵심 내용 읽기 →
토큰이 무엇인지부터 코딩 에이전트가 파일을 반복해 읽으며 토큰을 폭증시키는 구조, 캐싱과 구독료 개편까지 AI 비용의 실체를 풀어봅니다.
핵심 내용 읽기 →
AI로 코드를 거의 다 짜고 사람은 검토만 하는 2026년식 개발 워크플로를 정리했습니다. 페어 프로그래밍부터 작업 위임, PR 관리, 자동 코드리뷰까지 실제로 매일 쓰는 도구 조합과 선택 이유를 소개합니다.
핵심 내용 읽기 →
데이터브릭스가 오픈소스로 공개한 옴니전트는 클로드 코드·코덱스·파이 등 여러 AI 코딩 에이전트를 한 세션에서 조율하는 ‘메타 하니스’다. 구현과 리뷰를 다른 에이전트로 나누는 워크플로를 쉽게 만든다.
핵심 내용 읽기 →
중국 Z.ai가 공개한 오픈웨이트 모델 GLM-5.2를 웹사이트·API·에이전트 하니스에서 직접 테스트한 결과를 정리했다. 값싼 비용과 100만 토큰 컨텍스트, 코딩·에이전트 성능이 왜 주목받는지 실제 활용 사례와 함께 살펴본다.
핵심 내용 읽기 →
AI 코딩 에이전트는 왜 취약한 코드를 만들까? NDC 콘퍼런스의 OWASP 발표에서 제시된, 사후 수정 대신 계획 단계에서 보안 지침을 스킬과 훅으로 주입해 방어적 코드를 처음부터 쓰게 하는 접근법을 자세히 정리했다.
핵심 내용 읽기 →
앤트로픽 클로드 코드와 OpenAI 코덱스를 기능과 가격, 그리고 세 가지 실전 과제로 직접 비교한 리뷰입니다. 어떤 작업에 어느 도구가 유리한지 실제 토큰 사용량과 속도 데이터를 근거로 정리했습니다.
핵심 내용 읽기 →
AI 코드 에디터 Cursor가 모바일 앱을 출시했다. 클라우드에서 에이전트를 돌려 영상 데모를 받고, 긴 음성 메모로 작업을 지시하며, UI 스크린샷에 직접 표시해 피드백하는 세 가지 활용법을 정리했다.
핵심 내용 읽기 →
3주간 토큰 7천만 개를 쓴 개발자가 설계 문서 작성, 하위 작업 분해, git 워크트리 병렬 에이전트, PR 리뷰로 이어지는 클로드 코드 워크플로우와 트레이드오프를 공개한다.
핵심 내용 읽기 →
Y Combinator 행사에서 투자자들이 AI 시대에 인도가 글로벌 거대 기업의 산실이 될 수 있는 이유와, 젊은 창업가를 위한 구체적 조언을 나눈 대담을 정리했습니다.
핵심 내용 읽기 →
Nearform의 테크 리드가 골든 데이터셋과 평가(evals), 코딩 에이전트를 활용해 AI 에이전트의 환각·비결정성 문제를 반복적으로 개선하는 방법과 실제 정확도 향상 사례를 공유한다.
핵심 내용 읽기 →
코딩 에이전트는 코드만 쓰는 도구가 아니다. 슬라이드·문서·영상 같은 시각 자료를 잘 만들려면 파워포인트 캔버스가 아니라 AI의 모국어인 HTML로 작업하게 하라는 발표를 정리했다.
핵심 내용 읽기 →
블록의 앤지 존스가 3,500명 엔지니어 조직을 AI 에이전트 중심으로 전환한 과정을 공유한다. 성숙도 모델, AI 챔피언 1% 전략, 그리고 자율 조직이 남긴 질문까지 정리했다.
핵심 내용 읽기 →
1인 개발자가 클로드 코드 인스턴스 여러 개를 동시에 돌리며 일하는 실제 방식. 플랜 모드, 음성 받아쓰기, 권한 건너뛰기 등 멀티 에이전트 코딩의 현실적인 노하우를 정리했다.
핵심 내용 읽기 →
엔지니어 빅터 사브킨이 설명하는 AI 코딩 에이전트의 근본 한계 — 한 번에 한 레포만 보는 ‘공간’ 제약과 세션마다 초기화되는 ‘시간(기억)’ 제약. 멀티레포 변경을 한 레포처럼 다루는 메타 하니스 접근을 소개한다.
핵심 내용 읽기 →
AI 엔지니어 컨퍼런스 강연 정리. 재귀 언어 모델(RLM)의 아이디어를 코딩 에이전트에 적용해, 지능이 아니라 작업의 명세·관리·검증으로 신뢰성을 높이는 접근을 소개한다.
핵심 내용 읽기 →
Cursor·Claude Code 같은 코딩 에이전트의 작동 원리를, 파이썬과 무료 Gemini Flash API로 직접 만들며 배운다. 네 가지 도구 호출과 에이전트 루프, 작업 디렉터리 가드레일까지 정리한다.
핵심 내용 읽기 →
개발자가 직접 만든 MCP 서버에 소스 정리·검색 기능을 더하고, 에이전트가 임시 DB를 띄워 안전하게 테스트하게 한 과정을 소개한다. 코딩 에이전트·터미널·IDE·스킬로 구성한 최신 AI 개발 스택도 함께 공유한다.
핵심 내용 읽기 →
지난해 8월 이후 코드를 직접 쓰지 않는다는 개발자가 NDC에서 공유한 AI 코딩 실전 노하우. 맥락 관리부터 스킬, 검증, 병렬 에이전트까지 정리했다.
핵심 내용 읽기 →
UiPath가 Claude Code 같은 코딩 에이전트 위에서 거버넌스·보안·휴먼 인 더 루프를 더해 기업용으로 배포하는 방식을, 워크플로 생성과 실행 데모로 정리했습니다.
핵심 내용 읽기 →
앤트로픽 팀이 ‘효과적인 에이전트 만들기’ 블로그를 두고 나눈 대담. 워크플로우와 에이전트의 구분, 도구 설명의 중요성, 검증 가능한 코딩 에이전트, 과대·과소평가된 활용처를 정리했다.
핵심 내용 읽기 →
스탠퍼드 강연에 선 버셀 창업자 기예르모 라우치가 코딩 에이전트의 부상으로 소프트웨어 창작 시장이 폭발적으로 커지는 흐름, 페이지에서 에이전트로 옮겨가는 클라우드, 토큰 경제와 에이전트 인프라의 세 축, 그리고 가치가 어디에 쌓일지를 설명한다.
핵심 내용 읽기 →
모시 하메다니가 클로드 코드로 인증·티켓 관리·AI 기능을 갖춘 풀스택 지원 시스템을 만들어 배포하는 과정을 가르칩니다. '바이브 코딩'이 아니라 모든 코드를 검토하는 공학 중심 강의입니다.
핵심 내용 읽기 →
복잡한 실무 코드베이스에서 Antigravity 2.0 같은 AI 코딩 에이전트를 단순 자동완성이 아니라 '코치'처럼 다루는 7가지 실전 전략 — 커스텀 스킬, 자가 수정 루프, 비동기 테스트, 사전 리뷰까지 한 번에 정리했다.
핵심 내용 읽기 →
코덱스 CLI를 진짜 코딩 에이전트로 다루는 다섯 가지 기법을 정리했다. agents.md 설정, 플랜 우선, 단축키, 깃 워크트리 병렬 작업, 모델 전환과 스킬 시스템을 다룬다.
핵심 내용 읽기 →
AI 코딩 에이전트가 개발 속도를 높여 주지만, 검증 없는 생산성은 빚이 된다. 인지 부채와 '인지적 항복'을 경계하고 사람이 판단의 마지막 20~30%를 책임져야 한다는 조언을 정리했다.
핵심 내용 읽기 →