专注语音芯片研发

广州唯创电子WTK6900语音识别芯片唤醒词自学习功能:用户自定义唤醒词的技术实现到底怎么做的?

2026-09-24 09:35:13

做过语音交互产品的工程师都知道一个尴尬的现实:语音识别芯片出厂时固化的唤醒词,到了终端用户手里往往“水土不服”。年轻人说“小智小智”很自然,老年人可能咬字不清;南方用户和北方用户对同一个词的发音差异明显;更有用户直接反馈“我不喜欢这个唤醒词,能不能换成我习惯的叫法”。传统的解决方案是厂商重新烧录固件,周期长、成本高,对于已经出货的产品几乎不可行。广州唯创电子WTK6900系列的唤醒词自学习功能,把“定义唤醒词的权利”交还给了终端用户——用户对着设备说三遍新唤醒词,芯片就能记住并从此响应。这套功能背后的技术实现路径是怎样的?用户实际怎么操作?工程落地时又有哪些需要注意的坑?本文从算法原理到操作流程,把唤醒词自学习的完整技术链路拆解清楚。

广州唯创电子WTK6900语音识别芯片唤醒词自学习功能.jpg

一、唤醒词自学习的硬件与算法底座

WTK6900系列的自学习功能并非简单的“录音回放”,而是一套完整的声学建模流程。理解它的技术实现,需要先看芯片提供了什么样的硬件和算法基础。

算力层面WTK6900FC搭载32位RISC架构CPU,主频220MHz,内置2MB Flash和640KB SRAM。关键的AI加速能力来自BNPU V3神经网络处理单元,它能够并行执行DNN、TDNN、RNN、CNN等多种网络架构的矢量运算,确保自学习过程中的声学特征提取和模板匹配在本地毫秒级完成。

音频采集层面,芯片集成高性能Audio Codec,信噪比SNR≥95dB,支持双通道PDM数字麦克风接口和单通道模拟麦克风接口。对于需要自学习功能的远场产品,推荐使用PDM数字麦克风,数字传输方式能有效避免模拟信号在长距离走线中的噪声耦合。

算法架构层面,自学习功能建立在深度神经网络(DNN-HMM)声学模型之上。芯片从语音信号中提取MFCC(梅尔频率倒谱系数)等声学特征参数,这些特征去除了音色、音量等与语义无关的信息,保留了与识别相关的核心特征。自学习的过程,本质上是在芯片本地为新唤醒词建立一套独立的声学特征模板,并存入Flash的专用存储区。

二、唤醒词学习全流程:从触发到生效的完整链路

用户端看到的“说三遍就学会了”,背后是一套严谨的多阶段处理流程。

阶段一:学习模式的触发

唤醒词学习不能“随口触发”,否则环境中的偶然语音可能导致误进入学习模式。WTK6900系列采用多级唤醒验证机制来确保触发的可靠性:系统对唤醒触发设置了三重条件:唤醒词与预设声纹模板的相似度须高于0.82,语音信号幅值须比环境噪声基线高出12dB以上,且指令间隔应保持在0.3至1.2秒之间。

触发方式提供了多种选择:在默认唤醒状态下清晰说出“学习唤醒词”指令,芯片播放2kHz提示音后进入教学模式;也可以通过GPIO物理按键触发,或者由MCU通过串口指令下发学习命令。对于已经配套App的产品,用户还可以通过App启动学习流程。

阶段二:三次语音采样与特征建模

进入学习模式后,用户需要在安静环境中用自然语调重复新唤醒词三次。这三遍采样并非简单的取平均,而是经过一套完整的信号处理链路:

时频分析提取每次发音的MFCC特征参数;动态时间规整(DTW) 算法消除三次发音之间的语速差异,将不同时长的语音在时间轴上对齐;高斯混合建模在此基础上建立该唤醒词的声学特征模板。这一过程中,芯片内置的自适应降噪算法同步工作,自动过滤环境底噪,语音活动检测(VAD)引擎精准识别每次发音的起止点,避免将环境噪声混入特征模板。

阶段三:模板存储与验证

三次采样完成后,芯片自动播放确认音,新建的声学特征模板被写入Flash的专用存储区,占用约8KB空间。此时新唤醒词立即生效,原厂唤醒词仍然保留作为备用——这一点在工程上很重要,如果用户对新唤醒词的识别效果不满意,或者家人不习惯新唤醒词,仍然可以使用原厂唤醒词来激活设备。

值得注意的是,芯片还支持声纹匹配验证:学习成功的新唤醒词模板,在后续识别时需要与用户声纹的相似度达到阈值才能触发,这在一定程度上防止了“别人喊同一个词也能唤醒”的误触发问题。

三、命令词自学习:批量学习与断点续学

唤醒词学习之外,WTK6900FC还支持19条命令词的自学习,让用户可以自定义控制指令。

命令词学习采用批量模式:说出“学习命令词”后进入连续学习状态,系统支持单次学习5至20个指令词(视存储空间而定)。每个词的学习流程与唤醒词类似,但增加了特征压缩环节,采用PCA算法降低数据维度,在保证识别精度的同时节省存储空间。

断点续学机制是命令词学习的一个实用设计:长按物理按键3秒可随时退出学习,已成功学习的命令词自动加密存储;下次进入学习模式时,系统智能跳过已存词条,避免重复学习。存储空间的管理采用分级架构——临时缓存区存储未确认的学习数据,验证通过的特征模板会被加密写入永久存储区,同时备份扇区中保留最近5次有效模板版本。当存储量达到80%时,系统自动触发LRU(最近最少使用)替换算法,淘汰最久未使用的模板。

四、技术实现的核心算法逻辑

自学习功能的底层算法可以概括为特征提取 + 模板匹配 + 双重决策”三步。

特征提取环节,芯片以16kHz采样率获取语音信号,经过预加重、分帧、加窗处理后,提取包含12维MFCC、能量参数和差分参数的39维特征向量。这个特征向量是对语音信号的高度抽象表示。

模板匹配环节采用改进型DTW算法。DTW的核心作用是解决“同一个词,不同人说出来时长不同、语速不同”的问题。其递推公式为:D(i,j) = d(i,j) + min{D(i-1,j), D(i,j-1), D(i-1,j-1)},其中d(i,j)表示测试模板第i帧与参考模板第j帧的欧氏距离。简单来说,DTW允许语音信号在时间轴上“弹性伸缩”,找到两个语音序列之间最优的匹配路径。

决策机制设置双重判别条件:最近邻得分需大于阈值θ1,同时次优得分与最近邻得分的差值需大于阈值θ2。满足两个条件才触发对应指令,否则进入拒识状态。这种双重门槛的设计有效降低了“听错指令”的概率。

五、工程实践中的关键参数与注意事项

学习环境的要求

自学习过程对环境噪声有明确要求:建议背景噪声<45dB(A)。如果学习时环境噪声过大,采集到的声学特征会混入噪声成分,导致后续识别率下降。在实际产品中,可以通过语音提示引导用户在安静环境下完成学习,或者在App端加入环境噪声检测,噪声超标时提示用户更换学习位置。

相似唤醒词的规避

工程上需要避免设置发音过于接近的唤醒词。例如“开门”和“开灯”在声学特征上高度相似,自学习建立的模板可能无法有效区分,导致误触发。在为用户设计自学习引导界面时,可以内置一套相似度检测逻辑,当用户尝试学习的唤醒词与已有词条过于接近时给出提示。

存储空间的预算

每条自学习模板约占8KB Flash空间。WTK6900FC支持19条命令词自学习,如果全部学满,约需150KB以上的存储空间。在芯片的2MB Flash中,这部分空间需要与固定词条、固件和提示音资源共享。如果产品规划了较大的固定词条库(如300条命令词),在规划自学习功能时需要提前核算Flash预算,避免因空间不足导致自学习功能受限。

工业与特殊场景的参数调优

在工业车间等高噪声环境中(信噪比≥15dB),自学习识别需要调整默认参数。可以参考的调优方向包括:延长最大语音时长至4秒,提升抗噪等级至L3,启用定向波束成形模式,适当提高VAD阈值以过滤背景噪声。对于儿童交互产品,则建议缩短最小语音时长至0.4秒,降低VAD阈值3dB,以适应儿童较快的语速和较低的发音能量。

六、自学习功能的典型应用场景

智能家居中的个性化交互。 用户可以将唤醒词从出厂默认的“智能管家”改为自己习惯的叫法,比如“小度小度”“嘿Siri”(注:仅作为用户自定义示例)。对于家中有老年人的场景,自学习功能让老人可以用自己最自然的发音方式唤醒设备,无需刻意模仿标准普通话,大幅降低了使用门槛。

酒店客控系统的多语言适配。 酒店场景中,同一间客房可能接待不同语言背景的宾客。WTK6900FC支持中英日韩多语种自学习,酒店可以通过App端批量配置不同语言版本的唤醒词和命令词,一套硬件方案覆盖多语言服务需求。

工业设备的手套操作场景。 操作工人佩戴手套时,触摸屏幕或按键不方便,语音唤醒成为更自然的交互方式。通过自学习功能,工人可以用简短的手势配合语音指令完成设备控制,无需摘下手套。

带口音用户的适应性提升。 非特定人语音识别模型虽然覆盖了大多数普通话发音,但地方口音较重的用户仍然可能遇到唤醒困难。自学习功能让这类用户用自己的口音录入唤醒词,识别率相比通用模型有显著提升。

结语

WTK6900系列的唤醒词自学习功能,本质上是把“声学模型定制”的能力从厂商端下沉到了用户端。用户说三遍新唤醒词,芯片在本地完成特征提取、DTW对齐、高斯混合建模和模板存储,整个过程不依赖网络、不依赖专业工具。对产品开发者而言,这意味着不再需要为每一个用户的个性化需求去维护固件版本;对终端用户而言,这意味着设备真正“听懂”了自己的声音。选型的核心判断很简单:如果产品需要终端用户自行定义唤醒词或控制指令,WTK6900FC是当前系列中唯一同时覆盖唤醒词和命令词自学习的型号;如果只需要更换唤醒词,WTK6900HC是更具成本优势的选择。

  • 联系方式

    308040936@qq.com

    138-0273-1296

  • 公司地址

    广州市花都区新华街天贵大厦A座704-708室

  • 138-0273-1296

  • 扫一扫加微信
    版权所有©2026 广州唯创电子有限公司
    网站地图     唯创电子:英文网

    扫码添加微信

    返回顶部小火箭