语音识别由 ZenzyPaw Runtime 安全提供。
合成走流式接口(pcm16 / 24kHz),首包即播,不再等整段音频。
对话走流式 output,边生成边分句合成语音。
浏览器要求先有一次用户操作才能播放声音(移动端同时会申请麦克风权限)