LLawCo 연구 - LLM 에이전트가 자기 실패에서 협업 규칙을 학습해 팀워크를 개선하는 방법
ICML 2026에 발표되는 MERL 연구 LLawCo는 에이전트가 실패한 기록에서 짧은 협업 규칙을 뽑아 미세조정 데이터에 반영한다. 더 큰 모델의 도움 없이 같은 백본의 자기 정렬만으로 협업 성공률이 오른 실험 결과를 정리했다.
핵심 내용 읽기 →AI TOPIC
미세조정 관련 핵심 뉴스와 활용 인사이트 18편을 최신순으로 모았습니다.

ICML 2026에 발표되는 MERL 연구 LLawCo는 에이전트가 실패한 기록에서 짧은 협업 규칙을 뽑아 미세조정 데이터에 반영한다. 더 큰 모델의 도움 없이 같은 백본의 자기 정렬만으로 협업 성공률이 오른 실험 결과를 정리했다.
핵심 내용 읽기 →
마이크로소프트 연구진이 제안한 에너지 기반 미세조정(EBFT)은 다음 토큰 예측과 강화학습의 중간 지점을 노린다. 별도의 보상 모델이나 외부 검증기 없이 응답 전체를 특징 공간에서 맞춰 SFT보다 나은 결과를 냈다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의에 초청된 메타 연구자가 컴퓨터 비전이 8년 만에 쓸 만해진 과정을 사전학습·중간학습·미세조정 레시피로 정리하고, 규모 확장의 조건과 데이터 필터링의 함정, 추론과 계획이라는 남은 과제를 짚었다.
핵심 내용 읽기 →
좁은 과제로 미세조정한 모델이 전혀 다른 영역에서 유해해지는 창발적 정렬 실패를 페르소나 개념으로 설명한 AI 안전 연구 발표다. 상관된 특성 묶음, 예방접종 프롬프트, 신뢰하지 않는 페르소나 격리 전략까지 정리했다.
핵심 내용 읽기 →
두 모델의 활성값 차이만 봐도 무엇을 미세조정했는지 첫 토큰부터 드러난다는 연구와, 크로스코더가 만들어낸 가짜 챗 전용 특징의 원인을 밝혀 바로잡은 후속 연구를 연구자들의 대담을 바탕으로 정리했다.
핵심 내용 읽기 →
MIT 박사과정 연구자가 TTIC 강연에서 언어 모델의 긴 추론이 오류를 누적하는 '지평의 저주'를 설명하고, 되돌아가기를 허용한 무작위 걸음 알고리즘으로 이를 완화하는 이론적 보장과 실험 결과를 제시했다.
핵심 내용 읽기 →
호주 AI 안전 포럼 2026 발표. 프런티어 모델에게 4시간 동안 다른 모델의 '성격을 개선하라'고 맡긴 뒤 30가지 특성 변화를 측정했더니, 세대를 거듭할수록 답변은 더 무뚝뚝하고 덜 따뜻해졌다.
핵심 내용 읽기 →
바이츠만 연구소와 ETS 연구진이 고교 생물 서술형 답안으로 AI 채점을 검증했다. 만점·빵점 답안은 사람만큼 정확했지만 4~7점 구간에서는 48개 결과 중 47개가 기준에서 두 범주 넘게 어긋났다.
핵심 내용 읽기 →
1.35억 파라미터 소형 언어모델을 DPO로 선호 학습해 정답률을 끌어올리는 과정을, 다양성 측정부터 참조 모델과 정책 모델의 로그확률 격차까지 단계별로 정리했습니다.
핵심 내용 읽기 →
LoRA는 사전학습 가중치를 고정한 채 작은 두 행렬만 학습하는 미세조정 기법이다. 저랭크 분해가 통하는 이유와 파라미터 절감 규모, 파이토치 파라미터화 기능을 활용한 구현 방식까지 차례로 정리했다.
핵심 내용 읽기 →
거대 언어모델을 특정 도메인에 특화하려면 막대한 GPU 메모리가 든다. AI Coffee Break 영상은 원본 가중치를 얼리고 그 차이만 두 개의 작은 행렬로 분해해 학습 파라미터를 줄이는 LoRA 기법의 원리와 장점을 설명한다.
핵심 내용 읽기 →
700억 파라미터 모델을 통째로 미세조정하는 대신, 작은 어댑터만 학습하는 LoRA의 원리와 초기화·학습률 요령, 그리고 QLoRA·VeRA·DoRA로 이어지는 발전을 알기 쉽게 설명합니다.
핵심 내용 읽기 →
지도 미세조정은 데이터를 모방하는 데 그친다. GRPO 강화학습이 어떻게 여러 답을 생성·비교해 검증 가능한 보상으로 데이터 이상의 추론 능력을 만드는지 시각적으로 풀어본다.
핵심 내용 읽기 →
세바스찬 라슈카가 사전학습한 GPT 모델의 거대한 출력층을 두 개 노드로 교체하고 마지막 트랜스포머 블록만 학습시켜, 스팸과 정상 메시지를 가려내는 분류기로 미세조정하는 과정을 코드와 함께 단계별로 설명한다.
핵심 내용 읽기 →
LoRA(저순위 적응)를 발명한 에드워드 후가 탄생 배경과 작동 원리를 직접 설명한다. 1TB 체크포인트를 25MB로 줄이면서도 전체 미세조정 성능을 유지하는 비결을 정리했다.
핵심 내용 읽기 →
사람이 답변에 순위를 매기고, 그 점수를 강화학습으로 학습시켜 언어모델을 다듬는 RLHF. 가치 신경망과 정책 신경망이 무엇을 흉내 내는지 그리드 게임 비유로 풀어본다.
핵심 내용 읽기 →
RLHF는 강력하지만 보상 모델 학습과 강화학습이 비싸고 불안정하다. DPO는 보상 모델을 건너뛰고 간단한 교차 엔트로피 손실로 선호 데이터에서 바로 미세조정하는 방법으로, RLHF와 수학적으로 동등하다.
핵심 내용 읽기 →
전이 학습 입문 해설. 한 문제로 사전학습한 모델을 다른 관련 문제에 미세조정해 학습 데이터를 크게 아끼는 원리와, 번역·BERT 질의응답 사례 및 경량 모델 DistilBERT 활용까지 일반 독자 눈높이로 정리했다.
핵심 내용 읽기 →