集成 ASR 语音识别、TTS 语音合成、NLP 对话与实时字幕,打造 IPTV 智能语音助手与 IVR 客服系统。
Powered by LLM · ASR · TTS一个完整的语音交互系统通常包含三个环节:听清、听懂、说话。下图展示端到端处理流程。
将麦克风采集到的语音流实时转成文字。中文识别准确率可达 96%+,支持普通话、方言、英语混合。
将 LLM 生成的回复文本合成为自然、有情感的语音,支持音色克隆与多情感音色。
基于 GLM、Qwen、DeepSeek 等大模型进行多轮对话,支持 Function Call 调用业务接口(查节目单、切台、点播)。
"嗨,小五" 等唤醒词 + 说话人识别,让 IPTV 机顶盒像智能音箱一样待命唤醒。
将直播流通过 ASR 转写,生成 WebVTT 字幕流,与 HLS 同步分发,适合新闻、新闻台、教育直播。
对接 SIP/Asterisk,把传统按键 IVR 升级为自然语言客服,按需转人工坐席。
用户说"换到央视一套"或"播放新闻",LLM 解析意图后调用 EPG 接口自动切台。
语音搜索"最近有什么动作片",机顶盒直接返回相关点播内容。
新闻直播同步生成字幕,辅助听障用户观看,提升无障碍体验。
用 LLM 生成新闻稿件,TTS 合成主播声音,数字人驱动虚拟主播 24 小时播报。
对话日志结构化,分析高频意图,反哺运营推荐策略。
电视购物、宽带报修的 IVR 智能化,自然语言自助 + 转人工。
使用浏览器原生 Web Speech API 实现一个最小可用的语音对话(免费、零依赖),后端可对接任意 LLM:
const SR = window.SpeechRecognition || window.webkitSpeechRecognition;
const recog = new SR();
recog.lang = 'zh-CN';
recog.continuous = false;
recog.onresult = async (e) => {
const text = e.results[0][0].transcript;
console.log('用户:', text);
// 把识别文本发给后端 LLM 接口
const r = await fetch('/api/chat', {
method: 'POST',
headers: {'Content-Type':'application/json'},
body: JSON.stringify({text})
});
const {reply} = await r.json();
// TTS 朗读回复
const u = new SpeechSynthesisUtterance(reply);
u.lang = 'zh-CN';
speechSynthesis.speak(u);
};
document.getElementById('mic').onclick = () => recog.start();
通过将 ASR 输出与视频流合成 WebVTT 字幕轨,给现有 HLS 直播追加字幕:
ffmpeg -i input.mp4 -vf "subtitles=subtitles.vtt" \
-c:v libx264 -preset veryfast -c:a aac \
-f hls -hls_time 6 -hls_list_size 10 \
out.m3u8