VS Code 음성 받아쓰기 기본 탑재: 로컬 실행 모델로 채팅·에디터·터미널에 말하기
확장 설치 없이 VS Code 안에서 말로 입력하는 받아쓰기가 기본 탑재됐다. 음성 인식 모델은 내 컴퓨터에 내려받아 로컬로 돌고, 채팅과 인라인 채팅, 에디터 본문, 터미널, 에이전트 창까지 모두 지원한다.
핵심 내용 읽기 →AI TOPIC
음성인식 관련 핵심 뉴스와 활용 인사이트 15편을 최신순으로 모았습니다.

확장 설치 없이 VS Code 안에서 말로 입력하는 받아쓰기가 기본 탑재됐다. 음성 인식 모델은 내 컴퓨터에 내려받아 로컬로 돌고, 채팅과 인라인 채팅, 에디터 본문, 터미널, 에이전트 창까지 모두 지원한다.
핵심 내용 읽기 →
음성인식과 언어모델, 음성합성을 이어 붙이는 캐스케이드 방식 대신 통째로 학습하는 음성 LLM의 구조를 뜯어본다. 정보 손실·오류 전파·지연이라는 세 가지 약점과 스피치 인코더·보코더의 역할, 길이 압축 문제까지 짚었다.
핵심 내용 읽기 →
엔비디아가 공개한 Nemotron 3.5 ASR은 6억 파라미터 체크포인트 하나로 40개 언어의 실시간 스트리밍 음성인식을 처리한다. 캐시 인식 스트리밍과 단어 부스팅, 화자 분리를 직접 돌려본 개발자의 평가와 한계를 정리했다.
핵심 내용 읽기 →
오픈AI가 녹음 파일을 한 번에 처리하는 모델과 말하는 즉시 텍스트를 내보내는 실시간 모델을 함께 내놨다. 57개 언어와 전문용어 사전 지정을 지원한다.
핵심 내용 읽기 →
음성인식에 머신러닝을 도입한 리카이푸가 1980년대 CMU 시절부터 오늘의 대규모 언어모델까지를 돌아본다. 전문가 시스템과의 경쟁, 데이터와 컴퓨트의 힘, 그리고 후배 연구자를 위한 조언까지 정리했다.
핵심 내용 읽기 →
어셈블리AI가 유니버설 3.5 프로와 함께 싱크 API를 공개했다. 최대 120초 길이 오디오를 300밀리초 안팎에 전사하며, 대화 맥락을 함께 넘기면 생년월일과 카드 유효기간, 주소 서식까지 맞춰 돌려준다.
핵심 내용 읽기 →
짧은 음성을 즉시 텍스트로 바꿀 때는 상태 확인을 반복하는 폴링이 걸림돌이 됩니다. 여러 요청을 하나로 합치고 녹음이 진행되는 동안 연결을 미리 데워 지연 시간을 줄인 동기식 음성 인식 API의 구조를 살펴봅니다.
핵심 내용 읽기 →
실시간 스트리밍 음성인식(ASR)을 서버에 올릴 때 GPU 메모리·지연·비용이 어떻게 달라지는지, Kyutai Moshi 모델과 Rust 추론 서버 실험 사례를 바탕으로 KV 캐시 관리부터 LLM 서빙과의 차이까지 정리했다.
핵심 내용 읽기 →
어셈블리AI가 녹음 파일 전사용 Universal-3.5 Pro를 공개했습니다. 다국어 코드 스위칭과 문맥 프롬프트로 정확도를 높인 음성인식 모델의 특징을 정리했습니다.
핵심 내용 읽기 →
어셈블리AI의 새 음성인식 모델 유니버설 3.5 프로가 프롬프트와 대화 맥락으로 정확도를 높이는 방식을 데모로 소개한다. 도메인 프롬프트, 키워드 맥락 적용, 음성 에이전트용 대화 맥락 기능을 정리했다.
핵심 내용 읽기 →
AssemblyAI의 Na가 음성 코드 탐색 도구 Clickie에 최신 전사 모델 Universal-3.5를 적용한 데모를 선보인다. 화면의 핵심 용어를 실시간으로 프롬프트에 넣어 PCM S16LE 같은 난해한 코드 용어까지 정확히 알아듣는다.
핵심 내용 읽기 →
AssemblyAI의 최신 실시간 음성인식 모델 Universal-3.5 Pro가 프롬프트 기반 문맥 인식, 19개 언어 코드스위칭, 보이스 포커스로 어떻게 정확도를 끌어올리는지 데모로 살펴본다.
핵심 내용 읽기 →
AssemblyAI가 공개한 Universal-3.5 Pro 스트리밍의 핵심 기능 컨텍스트 캐리오버를 소개한다. 직전 발화를 기억해 짧은 답변도 맥락에 맞게 받아쓰는 원리와, 음성 에이전트에서의 의미를 정리했다.
핵심 내용 읽기 →
매일 쓰는 AI 음성·받아쓰기 도구 5가지를 정리했다. 키보드 없이 말로 타이핑하는 Whisper Flow, 봇 없이 회의록을 만드는 Jamie, 자막으로 영상 편집하는 Tella, 만능 오디오 도구 ElevenLabs, 아이디어를 음성으로 잡는 Voice Notes.
핵심 내용 읽기 →
AI가 음성 파형을 텍스트로 바꾸는 STT의 원리와, 코퍼스·그래머로 도메인에 맞춰 정확도를 높이는 방법을 IBM 설명으로 정리했다. 전화 기반 음성 AI에서 특히 중요하다.
핵심 내용 읽기 →