SWE-bench 개발자가 직접 말하는 코딩 AI 평가의 현재: 통과율 10%에서 80%까지의 3년
깃허브 이슈를 그대로 문제로 삼는 평가 도구 SWE-bench를 만든 연구자가 벤치마크 제작 과정과 에이전트 도구 설계, 학습용 문제의 대량 생성까지 3년간의 작업을 직접 설명한 온라인 세미나의 내용을 정리했다.
핵심 내용 읽기 →AI TOPIC
소프트웨어 공학 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

깃허브 이슈를 그대로 문제로 삼는 평가 도구 SWE-bench를 만든 연구자가 벤치마크 제작 과정과 에이전트 도구 설계, 학습용 문제의 대량 생성까지 3년간의 작업을 직접 설명한 온라인 세미나의 내용을 정리했다.
핵심 내용 읽기 →
AI로 코드 산출량은 늘었는데 조직 성과는 그대로인 이유는 무엇일까. 젯브레인스 개발자 옹호자가 AI Dev 26 강연에서 제시한 '에이전틱 엔지니어링'의 정의와 평가·스펙·테스트 등 현장 실천 항목을 정리했다.
핵심 내용 읽기 →
프롬프트와 루프만 연결하면 아무도 읽지 않는 4만 줄짜리 PR이 쌓인다. HumanLayer의 카일 미스텔레가 제어이론(센서·컨트롤러·액추에이터)으로 실제 팀·규제 환경에서 통하는 코딩 에이전트 루프를 설계하는 법을 정리했다.
핵심 내용 읽기 →
구글 클라우드 개발자들이 LLM의 비결정성을 실무에서 다루는 법을 설명한다. 온도를 0으로 내리는 대신, 단계마다 평가를 넣고 도구 호출을 로깅하는 익숙한 소프트웨어 공학 원칙으로 접근하라고 조언한다.
핵심 내용 읽기 →
휴먼레이어의 덱스 호슬리가 AI 코딩 에이전트만으로 코드 리뷰 없이 개발하는 방식이 왜 무너지는지, 모델 학습 구조와 유지보수성 관점에서 설명하고 대안을 제시한다.
핵심 내용 읽기 →
AI가 자연어 프롬프트로 코드를 짜는 시대, 소프트웨어 공학을 배울 가치가 있을까. TEDx 강연은 AI의 능력과 한계를 짚고 개발자가 코드 작성을 넘어 비전을 세우는 오케스트레이터로 진화해야 한다고 말한다.
핵심 내용 읽기 →
AI 코딩에서 주목받는 '명세 기반 개발'을 IBM이 설명합니다. 구현이 아니라 동작과 제약을 먼저 명세로 정의하고, 이를 계약처럼 삼아 요구사항·설계·구현으로 이어 가는 방식입니다.
핵심 내용 읽기 →