SlopCodeBench: 코딩 에이전트가 반복 작업에서 코드를 망가뜨리는 과정을 측정하는 벤치마크
코딩 에이전트는 문제를 풀면서도 코드베이스를 망가뜨린다. 체크포인트마다 기능을 덧붙이게 하며 복잡도가 어디로 쌓이는지 측정하는 SlopCodeBench 제작자의 문제의식과 실험에서 드러난 모델의 실패 양상을 정리했다.
핵심 내용 읽기 →AI TOPIC
코드 품질 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

코딩 에이전트는 문제를 풀면서도 코드베이스를 망가뜨린다. 체크포인트마다 기능을 덧붙이게 하며 복잡도가 어디로 쌓이는지 측정하는 SlopCodeBench 제작자의 문제의식과 실험에서 드러난 모델의 실패 양상을 정리했다.
핵심 내용 읽기 →
확률적 추측 기계인 LLM이 실서비스 코드를 고쳐도 안전할까. IBM이 AI 코드 리팩터링의 인라인·에이전틱 방식과 계획·검증 루프, 결정적 기법을 설명한다.
핵심 내용 읽기 →
AI에게 테스트 작성을 통째로 맡기면 버그까지 함께 굳어진다. 모던 소프트웨어 엔지니어링 채널의 대담을 통해 AI를 '대체'가 아닌 '증강' 도구로 쓰는 테스트 전략을 정리한다.
핵심 내용 읽기 →