综合电子论坛首页 --> 学习资料 --> 综合文献 --> 语音识别专用芯片

语音识别专用芯片


SENSORY 是业界高质量语音识别技术的领导者。交互式语音产品线有为我们赢得众多大奖、低成本的RSC系列处理器,这是专门为消费类电子产品控制而设计的。
对于已有MCU(微处理器)或DSP的产品来说,采用SENSORY的声音处理器软件来实现语音识别是一个很好的解决方法。

产品介绍
应用于消费类电子产品上的交互式语音集成芯片(RSC-200/264T,RSC-300/364)是一种高性能、低成本的8位MCU,所有这类芯片内部集成有ADC、DAC、ROM(除了RSC-200/300)、RAM和麦克风的预放大电路,并拥有以下多种功能:与说话者无关/有关的语音识别、语音确认(PASSWORD)、语音和音乐合成,录音和回放、快速数字拨号(只有RSC-300/364)、持续监听。

产品线有两种通用目的的微处理器(RSC系列)
1.    RSC-200/264T—低成本的版本(只支持4.0版本技术)
2.    RSC-300/364(支持最新版本的6.0版本技术),它有更快的响应时间、先进和附加的技术(包括数字拨号,固定单词触发,同时产生数字记录和识别模板)
3.    RSC-264/364产品的特性
a)    有64k内置ROM的8位微处理器;
b)    集成有A/D和D/A转换器;
c)    DAC或PWM(Pulse Width Modulation);
d)    可实现DTMF 拨号;
e)    音源的AGC功能;
f)    16个通用I/O端口;
g)    片上有输出放大器;
h)    省电模式-最小的功耗(小于5UA)。


RSC-300/364产品特性
RSC-300/364是专门为消费类电子产品应用而设计的,拥有高度集成和高识别率的系统化芯片。RSC-300/364有额外的SDAM和硬件加速器去支持SENSORY的最
新技术(5.0以上)。这种特别设计的8位微处理器在拥有灵活的编程时支持一系列语音技术:与说话者无关/有关的识别、语音和音乐的合成、语音确认、语音提示、持续监听、快速数字拨号、录音和回放。RSC-300/364允许在片上存储最多6个与说话者有关的短句。RSC-300与RSC-364的区别就是少一个64K的ROM。
RSC-264T产品特性
SENSORY的RSC-200/264是专门为成本较为敏感的消费类电子和玩具业设计的。RSC-200/264也是一块8位的微处理器,支持4.0的语音技术:与说话者无关/有关的语音识别、声音合成、语音确认、持续监听、录音和回放。片上集成有麦克风预放大电路、ADC、DAC、ROM、RAM和PWM(脉宽可调)的喇叭输出,从而使您的系统成本大大降低。RSC-200与RSC-264的区别就是少一个64K的ROM。

VOICE DAILER特性(ASSP)
VOICE DAILER364是为了增加语音拨号而设计的,它可应用在非手持的车载电话、手持电话、PDA、答录机和其它个人电子设备。使用者只需说出名字便可拨出相关的电话;VOICE DAILER-364芯片可管理一整套电话目录,包括名字、电话号码和语音识别模板。

SENSORY技术

与说话者有关的语音识别 (Speaker Dependent, SD)
在识别时,每个识别词语需要使用者训练两次来创建语音模板,一个模板需要占用128个字节的存储量。由于练习的原因,一般把需识别的词汇量限制在60个以内,但超过100个也是完全可以的。通过正常设计,    SENSORY的SD技术能达到99%的准确率。
与说话者无关的语音识别 (Speaker Independent, SI)
——不需要训练
SI技术是为一种指定的语系而设计的(如英语、汉语、德语),它最多能识别14条命令(识别数量由ROM的容量决定)。通过正常设计,SENSORY的SI技术能达到97%的准确率
语音确认 (Speaker Verification, SV)
同SD技术有点相似,SV能辨别出现在的一句话与原来说的是否相同。使用者可以训练1~4级密码(密码级数越多越安全)来开启设备。误识率大概在1~6%。根据环境、使用者数量、要求的安全程度的不同可设定五级训练难度。
语音自适应技术 (Speaker Adaptive, SA)
对于单用户来说,SA通过一段时间对环境和说话者声音的适应,改进相关的语音模板,从而提高识别准确率。
持续监听 (Continuous Listening, CL)
持续监听技术不需按键便可对某个特别、非连续的命令(在这之前需要静音)产生响应,    SENSORY提供SI和SD两种持续监听技术。
WORD SPOTTING
——在一句话中响应某个指定词语。
WORD SPOTTING是持续监听的升级版本,它可以从正常的谈话中“捕捉”并响应某个关键词语,这种技术提供了更为自然、友好的人机界面。
快速数字拨号 (Fast Digit)
——输入电话号码和数字串
快速数字拨号采用了优化的识别算法来实现快速数字串输入,这种技术对语音拨号应用是非常理想的,辟如用在手持通信设备、个人拨号器,手机、非手持设备。
录音和回放 (Record & Playback)
——压缩的数字声音再现。
SENSORY的交互式语音处理器可以14Kbit/s的数据率来存储声音在外置的RAM上。它可用在答录机、变音器、手持录音设备上。根据回放的质量和数量要求,也可以改变片上的压缩率。录音过程中出现完全静音时,微处理器会自动去掉静音这一段来改善声音质量,节约存储空间。
语音合成 (Speech Synthesis)
——创建一个自然的使用界面。
语音效果合成是通过在片上的微处理器读取ROM上的数据实现的。SENSORY合成技术使用了时域技术来压缩语音,使数据率在10kbit/s以下,另外使用了加强的ADPCM算法来回放声音。语音合成技术降低了对手工指令的依赖,使人机界面更为友好。
音乐合成 (Music Synthesis)
SENSORY的音乐合成技术能产生四首模拟乐曲,用户也可用一种乐器的声音和音阶来自定义乐库。合成技术不同于数字录音,一首2~3分钟的歌曲只需5KB的片外存储容量,在电话机的应用中,这种功能还可以产生DTMF音,使RSC微处理器实现直接拨号功能。
产品控制
——完全的系统芯片解决方法。
RSC语音处理器可单独工作或作为协处理器来实现语音功能,通常,它是一个复杂系统的核心:它可提供可变长度的指令,传输率达到4MIPS 、两个计时器、外部存储器接口、DAC和PWM输出,麦克风预放大器、16个I/O端口等。

开发工具

演示模板264T和364 (Demo Unit)
通过演示模板,您能充分体会到SENSORY公司SR芯片的真正魅力。每个模板都能单独演示独一无二的技术,包括SI、SD、SV等,264T和364有着几乎相同的硬件,两者的主要区别是预编程的软件和相关库文件。
RSC-264T和RSC-364开发工具 (Development Kit)
有着相同硬件平台的RSC-264T和RSC-364开发工具,提供了灵活、简便的开发环境,它包括硬件、软件两部分。利用它可开发出用户想要的新颖语音产品。软件开发人员可以无限制的接触到独特的语音技术。 
Rapid Prototyping Module(适配器, RPM)
它用来连接264T/364演示模板和RSC-264T/364开发工具的,开发人员可以下载RSC软件到适配器,从而快速应用到自己的产品上。
Voice Dialer364开发工具
Voice Dialer364开发工具的硬件部分是演示模板364,利用这套工具可以开发出任何基于VD364芯片的语音拨号(综合电子论坛)

 *注:部份文章为网上收录供大家共同学习参考之用,并不代表本站意见。如存在版权问题请马上通知我们,我们将马上删除。