标签: #audio
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
MP3 用 VBR 编码会让字幕点击错位 — 用实测看 CBR 与 VBR 的区别
点击播客字幕却跳到错误位置,原因是音频文件的格式。VBR 的 Xing TOC 为什么最多偏差 0.9 秒,CBR 为什么能控制在 0.04 秒以内,以及对 96 集实测后的记录。
2026-09-10 · 8 分钟阅读 #audio#mp3#ffmpeg#web#debuggingSOTA多模态LLM解析 — 用一个模型看、听、说 ♪ 可收听
一个只用文本训练出来的LLM,是如何走到能够理解并生成图像、音频乃至视频的?本文梳理了各模态的编码器与投影器、统一token空间、any-to-any流程、原生多模态与适配器拼接两种路线的对比,以及训练策略、基准测试与局限性。
2026-06-30 · 37 分钟阅读 #multimodal-llm#any-to-any#vision-language#audio#architecturetorchaudio 完全指南 — 从音频处理到语音识别、TTS、音乐分析
用 torchaudio 讲透音频加载、频谱图变换、Mel 滤波器组、MFCC、语音识别(Wav2Vec2/Whisper)、TTS、说话人分离、降噪。音频 AI 的方方面面,全部用 PyTorch 覆盖。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchaudio#audio#speech-recognition