태그: #stt
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
#stt 태그가 붙은 글은 5편이고, 가장 최근 글은 2026-05-15에 올라왔습니다.
함께 자주 붙은 태그: #tts 5 #2026-03 2 #cartesia 2 #deep-dive 2 #deepgram 2
최근 90일 동안 많이 읽힌 글:
음성 AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 심층 가이드 ♪ 들을 수 있어요
2024년 10월 Whisper Large v3 Turbo가 8배 빨라지고, Cartesia가 Mamba 저자들 손으로 90ms TTS를 만들고, Sesame의 Brendan Iribe가 "voice presence"를 들고 나오면서 2026년 음성 AI는 TTS·STT·실시간 에이전트 세 축이 모두 폭발했다. ElevenLabs V3부터 NVIDIA Parakeet 1.1, VOICEVOX
2026-05-15 · 36 분 읽기 #voice-ai#tts#stt#asr#elevenlabsAI 음성 2026 — ElevenLabs · OpenAI Realtime · Cartesia · Vapi · Sesame · Deepgram, 보이스 에이전트 스택의 현재 ♪ 들을 수 있어요
생성형 미디어 4부작의 마지막 — 음악, 이미지, 비디오에 이어 음성이다. 2026년의 AI 음성 풍경을 정직하게 정리한다. ElevenLabs(보이스 클로닝과 Conversational AI), OpenAI Realtime(WebRTC 기반 음성-인-음성-아웃), Cartesia Sonic-2(최저 지연 TTS), Vapi(보이스 에이전트 플랫폼), Sesame(개성 있는 대화 모델), D
2026-05-14 · 54 분 읽기 #ai-voice#elevenlabs#openai-realtime#cartesia#vapiVoice AI 실전 완전 가이드: 실시간 STT/TTS, 음성 LLM, Turn-taking, 딥페이크 방어 (2025)
"화면 없는 AI"가 2025년의 가장 뜨거운 제품 범주가 된 이유. 실시간 음성 파이프라인(VAD/STT/LLM/TTS), 음성 LLM(GPT-4o realtime/Gemini Live/Moshi), Turn-taking과 인터럽션, 감정·억양 제어, 전화·브라우저·모바일 실전, 딥페이크 방어와 보안, 한국어 음성 제품의 특수성까지.
2026-04-15 · 17 분 읽기 #voice-ai#stt#tts#gpt-4o-realtime#moshi음성 챗봇 구축 가이드: STT/TTS 파이프라인과 실시간 음성 인터페이스 구현 ♪ 들을 수 있어요
음성 챗봇 구축의 모든 것. Whisper STT, TTS 엔진 비교, 실시간 음성 스트리밍 아키텍처, WebSocket 기반 양방향 통신, LLM 연동, 지연 시간 최적화와 프로덕션 운영 가이드까지 다룹니다.
2026-03-08 · 43 분 읽기 #chatbot#voice#stt#tts#speech-recognition오픈소스 실시간 대화형 음성 챗봇 구축 가이드: Barge-In(응답 중단) 지원 아키텍처와 구현
오픈소스만으로 실시간 음성 챗봇을 구현하는 종합 가이드. Silero VAD, faster-whisper, Ollama, Piper TTS를 조합한 파이프라인에 barge-in(사용자 발화 시 즉시 응답 중단) 기능을 구현하는 상태머신 설계, Python 예시 코드, 지연시간 최적화, 한국어 품질 개선 팁까지 다룹니다.
2026-03-08 · 34 분 읽기 #ai-platform#voice-chatbot#barge-in#realtime-audio#stt