<aside> 📘 오늘 채터로 실시간 음성 대화를 걸어 보고, 내 문장을 같은 목소리로 여러 언어로 읽혀 보자.
</aside>
마이크로소프트가 10월 1일 음성 모델 3종을 내놨다.
실시간 받아쓰기 MAI-Transcribe-2-Streaming, 음성 생성 MAI-Voice-2.1 과 MAI-Voice-2.1-Flash 다.
말이 끝나기 전에 자막이 뜨고, 같은 목소리가 23개 언어로 읽는다. 이 책은 체험장에서 말 걸기부터 SSML(음성 합성용 대본 형식)로 목소리를 고르는 법까지 담았다.

공식 시연 — 손님 질문에 이어 AI 답변이 실시간 자막으로 뜨는 장면
<aside> ⚡ 말하는 중에 자막 — 받아쓰기 모델은 문장이 끝나기를 기다리지 않고 글자를 내보낸다.
</aside>
<aside> 🔁 앞 글자 고치기 — 뒤에 들린 말을 반영해 앞서 받아쓴 내용도 수정한다.
</aside>
<aside> 🌍 같은 목소리 23개 언어 — 마이 보이스 2.1은 언어가 바뀌어도 화자의 목소리를 유지한다. 지원 언어 목록에 한국어가 있다.
</aside>
<aside> 💨 대화용 플래시 — 공식 표 기준 플래시의 모델 추론 지연은 약 45ms, 기본 2.1은 약 550ms다.
</aside>
<aside> 📊 오류율 2.5% — 외부 평가 기관 Artificial Analysis의 9월 28일 실시간 받아쓰기 집계에서 최종 단어 오류율이 가장 낮게 표시됐다.
</aside>

공식 모델 표 — 두 음성 모델의 추론 지연·가격·지원 언어
누가 어디서 쓰나. 일반 사용자는 공식 체험장 채터에서, 개발자는 Microsoft Foundry와 Vercel 경로로 쓴다. 일부 경로는 공개 미리보기(public preview)다.
공식 문서는 미리보기라 서비스 수준 보장이 없고 실제 서비스용으로는 권하지 않는다고 적어 두었다.
가격(공식 표 기준). 마이 보이스 2.1은 100만 글자당 22달러, 플래시는 100만 글자당 15달러다.
목소리 복제. 5~60초 참고 음성으로 목소리를 맞추는 기능은 승인제(gated)다.

채터 첫 화면 — 왼쪽 Chatter 메뉴, 가운데 Start a conversation 버튼과 톱니바퀴