タグ: #audio
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
MP3 を VBR で書き出すと台本クリックがずれる — CBR と VBR の違いを実測で
ポッドキャストの台本を押すと違う場所へ飛ぶ問題の原因は、音声ファイルの形式だった。VBR の Xing TOC がなぜ最大 0.9 秒ずれるのか、CBR がなぜ 0.04 秒に収まるのか、96 話を測って確かめた記録。
2026-09-10 · 10 分で読めます #audio#mp3#ffmpeg#web#debuggingSOTAマルチモーダルLLM分析 — 一つのモデルで見て聞いて話す ♪ 聞けます
テキストだけで学習されたLLMが、どのようにして画像・音声・動画まで理解し生成できるようになったのかを見ていきます。モダリティごとのエンコーダとプロジェクタ、統合トークン空間、any-to-anyの流れ、ネイティブマルチモーダルとアダプタ接合、そして学習戦略やベンチマーク・限界までを整理します。
2026-06-30 · 43 分で読めます #multimodal-llm#any-to-any#vision-language#audio#architecturetorchaudio完全ガイド — オーディオ処理から音声認識、TTS、音楽分析まで
torchaudioでオーディオ読み込み、スペクトログラム変換、Melフィルタバンク、MFCC、音声認識(Wav2Vec2/Whisper)、TTS、話者分離、ノイズ除去まで。オーディオAIのすべてをPyTorchで扱います。
2026-03-02 · 11 分で読めます #ai-platform#pytorch#torchaudio#audio#speech-recognition