태그: #speech-recognition
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
#speech-recognition 태그가 붙은 글은 5편이고, 가장 최근 글은 2026-08-12에 올라왔습니다.
함께 자주 붙은 태그: #2026-03 2 #ai-papers 2 #text-to-speech 2 #tts 2 #whisper 2
최근 90일 동안 많이 읽힌 글:
음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechSOTA 음성 인식·합성 분석 — Whisper에서 코덱 언어모델까지 ♪ 들을 수 있어요
음성 인식(ASR)과 음성 합성(TTS)의 최신 흐름을 정리합니다. HMM에서 CTC/어텐션, Whisper의 대규모 약지도 학습, 그리고 Tacotron에서 뉴럴 보코더와 코덱 언어모델까지 계보와 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codecWeb Audio API & 브라우저 오디오 2026 — AudioWorklet / Tone.js / Howler.js / Wavesurfer / Peaks.js / Meyda / Faust / Csound / Web Speech 심층 가이드
2026년 브라우저는 마침내 진짜 오디오 워크스테이션이 되었다. Web Audio API는 W3C 레벨 2 권고로 안정화됐고, AudioWorklet이 ScriptProcessor를 완전히 대체했으며, Tone.js·Howler.js·WaveSurfer.js·Peaks.js·Meyda 같은 라이브러리가 게임·음악·DAW·분석 영역을 각각 장악했다. Faust2WebAudio와 Csound o
2026-05-16 · 26 분 읽기 #web-audio#web-audio-api#audioworklet#audiocontext#offline-audio-context음성 챗봇 구축 가이드: STT/TTS 파이프라인과 실시간 음성 인터페이스 구현 ♪ 들을 수 있어요
음성 챗봇 구축의 모든 것. Whisper STT, TTS 엔진 비교, 실시간 음성 스트리밍 아키텍처, WebSocket 기반 양방향 통신, LLM 연동, 지연 시간 최적화와 프로덕션 운영 가이드까지 다룹니다.
2026-03-08 · 43 분 읽기 #chatbot#voice#stt#tts#speech-recognitiontorchaudio 완전 가이드 — 오디오 처리부터 음성인식, TTS, 음악 분석까지
torchaudio로 오디오 로드, 스펙트로그램 변환, Mel 필터뱅크, MFCC, 음성인식(Wav2Vec2/Whisper), TTS, 화자 분리, 노이즈 제거까지. 오디오 AI의 모든 것을 PyTorch로 다룹니다.
2026-03-02 · 11 분 읽기 #ai-platform#pytorch#torchaudio#audio#speech-recognition