语音 AI 智能体 — 会听、会查、会说的流水线
在一个 CPU Pod 里把听到说完整串起来,并测量延迟
고급 · 课时 30 · 实验 10
课程大纲
音频基础 — PCM·帧·重采样
VAD 与话轮转换 — 语音结束判定与插话
- 何时回答 — VAD·话轮结束判定·插话 reading
- 说完了吗 — 用 VAD 切分话轮并找出插话 lab
- 测验:VAD·话轮结束·插话 quiz
流式 ASR — 部分结果·最终结果·WER
LLM 响应流式输出与首 token 延迟
语音查询的 RAG — 改写·拒答阈值·引用校验
智能体工作流 — 工具·确认·重试·转人工
- 用声音驱动的工具 — 状态机·确认提问·重试·转交人工 reading
- 用状态机实现预约智能体 — 确认·重试·转人工 lab
- 测验:状态机·确认·重试·转人工 quiz
流式 TTS — 分句与首个声音延迟
- 说话 — 首个声音的时间与制作“可朗读文本” reading
- 让首个声音提前 — 分句·重叠合成·可朗读文本 lab
- 测验:RTF·首个声音·分句·可朗读文本 quiz
延迟预算 — 让流水线重叠运行
- 延迟预算 — 从说完话的那一刻到首个声音 reading
- 从说完话到首个声音 — 测量串行与重叠并对照预算 lab
- 测验:延迟预算·重叠·分布 quiz
评估与可观测性 — 质量·失败率·SLO·关卡
- 测什么才可信 — 区间记录·质量指标·失败率·关卡 reading
- 从一条追踪得出所有指标 — 质量·失败率·SLO·关卡 lab
- 测验:区间·质量·失败率·关卡 quiz
安全 — 通过语音进来的注入与个人信息
- 从耳朵进来的攻击与泄露的信息 — 注入·工具许可·个人信息 reading
- 拦截通过语音进来的注入并遮蔽个人信息 lab
- 测验:注入·许可表·个人信息 quiz