技术剖析

ESP32 怎么听懂你说话:语音唤醒与 AI 对话的五个环节,一篇讲透

一颗几十块钱的芯片怎么做到「随叫随答」?把一句「把灯调蓝」拆成五个环节:AFE 洗干净声音、WakeNet 认名字、命令词与云端听写、大模型想明白、TTS 边收边播——附打断的原理与离线 / 在线的分工。

ESP32 怎么听懂你说话:语音唤醒与 AI 对话的五个环节,一篇讲透 头图

自研 AI 那篇讲了路线与成本,这篇往里走一层:你说一句「把灯调成蓝色」,从声波进麦克风,到喇叭里说出「好的,已调蓝」,中间到底发生了什么?拆成五个环节——听清、唤醒、听懂、想明白、说出来。看完你会知道,一颗几十块钱的 ESP32-S3,凭什么能「随叫随答」,哪些本事在芯片上,哪些本事在云端。

先分清三件事:唤醒、命令词、自由对话

  • 语音唤醒:设备一直在听,但只等一个「名字」——听到「你好小智」「Hi,乐鑫」才正式开工;全程离线,不上网
  • 离线命令词:固定口令,「打开灯」「调到二十度」,断网也能执行——识别的是「有限的词」,不是「任意的话」
  • 自由对话:随便聊、随便问,这个能力在云端——端侧负责把声音送上去,大模型负责想明白
  • 一句话:唤醒与口令在芯片上,聊天在大模型里——这是语音产品科普里最常见的混淆,先掰开

第一环:听清——声音进门先「洗干净」

麦克风拾进来的不是干净人声:屋里的噪声、电视里的人声,还有设备自己喇叭正在放的声音。ESP32-S3 上的声学前端(AFE)先做三件事:回声消除——芯片知道自己放的是什么,把它从拾音信号里减掉,这是「能打断 AI」的前提;噪声抑制——压住背景噪声;语音活动检测——有人说话才启动后续流程,没人说话就省电待命。硬件上只需一颗 I2S 数字麦克风加芯片自身算力,不用外挂 DSP。

第二环:唤醒——一颗只认「名字」的小神经网络

唤醒词模型(WakeNet)常驻运行,逐帧判断「刚才这段音是不是那个词」,本质是一个很小的神经网络,功耗压到可以常年监听。乐鑫预训练了二十多个免费唤醒词,编译选项里直接挑;想用自己的品牌名当唤醒词,官方提供定制:语料采集加模型训练约 2-3 周,按量级收少量费用。设备给出反馈音的那一瞬间——用户感知到的「它知道我在叫它」,就是这一环。顺带一句:常年「开着耳朵」对插电产品无所谓,电池产品的唤醒策略要单独设计,功耗账参考低功耗那篇。

第三环:听懂——离线走口令,在线走听写

  • 离线路径:命令词模型按「拼音组合」匹配,最多约 200 条,增删口令不用重新训练模型——「打开客厅灯」这类固定指令走这条路,断网照常工作
  • 在线路径:自由说话,音频经 Opus 编码压缩,通过 WebSocket 流式上传,云端 ASR 边听边转文字
  • 为什么是 Opus:同等清晰度下码率只有未压缩的十几分之一——Wi-Fi 再挤,声音也能实时送上去

第四环:想明白——这已经是文字的天下

到这一环,你的话已经变成文字,后面就是大模型的专场:通义千问、DeepSeek、豆包这些国产 API 都能接,模型拿着文字与会话上下文生成回答文字。端侧不跑大模型——几十块钱的芯片跑不动,也不需要跑,它在链路里的角色始终是「耳朵和嘴」。产品的人设、知识库、跨对话的记忆,都在云端会话层设计——那才是差异化的所在,也是数据资产所在。

第五环:说出来——合成、回传、边收边播

回答文字交给云端 TTS 合成语音,同样以 Opus 帧流式下发;设备边收边解码播放,不等整段合成完。流式的意义全在延迟:从用户说完到 AI 开口,业内把 1-2 秒当作及格线——识别、生成、合成三段都流式化,每一环省几百毫秒,加起来就是「对答如流」与「它死机了?」的差别。

打断:对话感的分水岭

人和人说话会抢话,和 AI 也一样。AI 正在播报时你插一句「停」,设备要在自己的声音里听出你的声音——靠的正是第一环的回声消除:把自己放出来的声音减掉,剩下的才是你。如今单麦克风就能同时做唤醒与打断,这是 ESP32-S3 这代芯片最实用的进步,也是语音产品「像对话」还是「像对讲机」的分水岭。

一条链路,两个世界:离线管可靠,在线管聪明

  • 断网时:唤醒、反馈音、固定命令词、本地控制——设备的「底盘」还在
  • 联网时:自由对话、人设记忆、控制万物——开源社区已经用 MCP 协议让大模型直接下发设备指令
  • 整条链路有完整的开源参照(小智 AI 项目,一块几十块的 ESP32-S3 开发板就能跑通)——链路已不神秘,量产的功夫在配网、OTA、产测与长期运维,那是「能跑」与「能卖」的距离
链路是通用的,产品才是自己的:唤醒词用哪个词、命令词怎么设、人设怎么定,决定你的产品和别人家的不一样。想把语音对话装进你的设备,把产品形态发给我们:免费评估,1-3 天出全包报价,离线与在线的分工写进方案。
AI 硬件自研篇:ESP32 + 端侧唤醒 + 云端大模型,把 AI 装进自己的产品 头图延伸阅读:AI 硬件自研篇(ESP32 + 端侧唤醒 + 云端大模型的路线与成本账)延伸阅读:电池供电产品怎么做低功耗(唤醒监听的功耗账)AI 硬件的定价账:大模型调用费怎么摊进售价,三种模式一次算清 头图延伸阅读:AI 硬件的定价账(大模型调用费怎么摊进售价)
分享给朋友:

有产品想智能化?

告诉我们您的需求,我们将在 24 小时内提供初步方案

免费获取方案