오픈 웨이트 모델 안전장치 제거 실험: 거부 방향 하나만 지워도 악성 AI 에이전트가 만들어진다
연구자 시몬 레르멘이 공개 가중치 모델의 거부 기능을 제거해 협박과 설득을 수행하는 AI 에이전트를 만든 과정을 해커톤 발표에서 공개했다. 노트북에서 돌아가는 80억 파라미터급 모델조차 상당한 수행 능력을 보였다는 점이 핵심이다.
핵심 내용 읽기 →AI TOPIC
오픈웨이트 모델 관련 핵심 뉴스와 활용 인사이트 13편을 최신순으로 모았습니다.

연구자 시몬 레르멘이 공개 가중치 모델의 거부 기능을 제거해 협박과 설득을 수행하는 AI 에이전트를 만든 과정을 해커톤 발표에서 공개했다. 노트북에서 돌아가는 80억 파라미터급 모델조차 상당한 수행 능력을 보였다는 점이 핵심이다.
핵심 내용 읽기 →
오픈웨이트 모델은 거부 학습 같은 사후 안전장치를 파인튜닝 몇 번으로 무력화할 수 있다. 연구진은 사전학습 데이터에서 위험 지식을 미리 걸러낸 6.9B 모델을 처음부터 학습시켜 이 문제에 정면으로 접근했다.
핵심 내용 읽기 →
2026년 7월 넷째 주에 Opus 5와 Kimi K3, GPT-5.6 Sol이 한꺼번에 등장한 상황을 정리한다. 허깅페이스 보안 사고와 온프레미스 비용, 태스크당 가격 경쟁, 그리고 노광 장비와 전력이라는 근본 병목까지 짚는다.
핵심 내용 읽기 →
AI 코딩 도구가 오픈소스 협업 문화와 공급망 신뢰를 무너뜨리는 현실, 그리고 오픈웨이트 모델이 추론 비용 경쟁으로 판을 다시 짤 것이라는 클라인 창업자의 진단을 컨퍼런스 발표 자막을 근거로 정리했습니다.
핵심 내용 읽기 →
미니맥스 RL 연구 총괄과 투게더 AI 커널 담당 임원이 오픈 웨이트 모델 M3의 학습과 서빙을 함께 설명했다. 멀티모달 사전학습, 희소 어텐션, 커널 벤치마크, 에이전트 워크로드가 바꾼 추론 스택이 주제다.
핵심 내용 읽기 →
Z.AI가 GLM 5.2의 가중치를 공개했다. 독립 벤치마크에서 이전 버전 대비 도약이 크고 상위권에 소수 상용 모델만 남았다. 긴 사고 사슬로 인한 토큰 사용량, 100만 토큰당 가격, 데이터 전송 선택권까지 짚었다.
핵심 내용 읽기 →
최신 AI 모델이 나와도 누구는 바로 쓰고 누구는 몇 주를 기다린다. 접근권 격차가 생산성 격차로 이어지는 흐름과, 오픈웨이트 모델 활용·벤더 분산 전략을 정리했다.
핵심 내용 읽기 →
문샷 AI의 키미 K3가 공개 모델 가운데 최대 규모로 등장했다. 토큰당 16개만 켜지는 전문가 혼합 구조와 코드 아레나 1위 기록, 그리고 환각률과 자체 측정 방식을 둘러싼 논란까지 함께 정리했다.
핵심 내용 읽기 →
가중치를 공개하는 오픈 모델이 비공개 프런티어와 실제로 얼마나 가까워졌는지, 중국 연구소들의 추격 동력은 무엇인지, 증류가 성능을 설명하는지에 대한 반박과 미국 생태계의 대응까지 분기 결산 대담의 논점을 정리했습니다.
핵심 내용 읽기 →
IBM 보안 전문가들이 오픈 가중치 모델 GLM-5.2의 보안 파장, CVSS를 대체하는 CISA의 새 취약점 우선순위 모델, 바이브 헌팅, 오픈소스 보안 프로젝트 Lightwell을 논의한 내용을 정리했습니다.
핵심 내용 읽기 →
음성 인식·언어 모델·음성 합성 세 모델을 순서대로 엮어 클라우드 없이 로컬 기기 한 대에서 돌아가는 음성 AI를 만든 사례. 통합 메모리와 온디바이스 추론이 여는 가능성을 소개한다.
핵심 내용 읽기 →
세바스찬 라슈카가 딥시크 V3, OLMo 2, Gemma 3, Qwen 3, Kimi 2, GPT-OSS, GLM 4.5 등 2025년 공개된 주요 LLM 아키텍처의 핵심 설계 차이를 도식으로 비교해 알기 쉽게 설명합니다.
핵심 내용 읽기 →
중국 랩이 가중치를 공개한 오픈웨이트 모델 MiniMax M3를 커서에 붙여, URL 단축기 제작·러스트 레이트레이서·대규모 코드베이스 리팩터링 세 과제로 Composer 2.5와 속도·코드 품질·가격을 비교한 실측 후기를 정리했다.
핵심 내용 읽기 →