据行业预测,中国智能语音产业规模将达到101.4亿元。而智能语音产业的快速发展,将带动智能家居、智能汽车以及智能穿戴设备等相关领域市场规模增长上千亿元。

智能语音市场规模得以如此神速扩张,并且应用到多个领域,这必然离不开智能语音技术的不断突破。那么,我们当前的语音技术达到了什么地步?换句话说,能够实现什么样的人机互动效果呢?

以欧拉蜜团队为代表,我们一起来看看这些年国内智能语音行业的技术突破。

技术门槛高,首先得保证语音识别准确率

中国的语音识别研究起始于1958年,由中国科学院声学所利用电子管电路识别10个元音。虽然与国外语音识别研究起步时间同步,但由于当时条件的限制,随后一段时间内技术的进展较为缓慢。

最初,我国语音技术的研究一直以学术界为主,随后才有企业逐渐涉足这个领域。由于语音识别技术准入门槛高、人才稀缺,经过多年研究与探索,一些国内企业终于在这个行业冒头,形成了“一超多强”的局面。

欧拉蜜团队在智能语音方面的研究已达5年。初期,欧拉蜜以设计出一个中文理解能力超越Siri的智能语音助理为目标,开始投入人工智能相关研究领域,而长远的目标则是致力于提供全方位的人机交互解决方案。

这5年里,欧拉蜜攻破了不少技术难关。首先要解决的,就是语音识别的精准度。

语音人机交互面临着多重技术难题。例如,人声距离不能过远、发音要标准、环境要安静、不能持续对话、不能被打断……

(欧拉蜜开发套件拾音测试视频截图)

欧拉蜜团队重点解决了这些语音识别方面的问题。目前,欧拉蜜的人声识别准确度高达90%,并且可实现超远距离识别(最远可准确识别距离8米的人声)。

同时,欧拉蜜团队研发了具有强抗噪能力的语音识别技术与核心算法,包括语音活性检测(Voice AcTIvity DetecTIon | Speech AcTIvity DetecTIon),回声消除算法(AcousticEcho Cancellation),噪声处理算法(Noise Reduction & Cancellation),混响处理算法(Reverberation)等多项专利技术。

欧拉蜜还为企业用户提供深度定制服务,比如对儿童声音、嘈杂环境声音进行训练,可达到特殊要求下的语音识别高准确度。

难点在于自然语言语义理解和处理

“能穿多少穿多少”,这句话的意思,到底是要你“多穿”呢,还是要你“少穿”呢。同样的,中文语境下,类似的歧义句还不在少数。

例如,“中国队大败德国队”,不知是中国赢了德国,还是德国赢了中国;“小王跟我请了假”,不知是小王向我请了假,还是小王和我都请了假……那么,在这种歧义的语境下,我们需要更多的信息来明确原句的意思。

比较常见的NLP/NLU现有技术与方案有这么几种。一是基于关键词和简单规则,但这样误抓率高、歧义多,无法精准抓取参数;二是基于ASR语法的扩展,但这种方式描述能力有限,可扩展性较低;三是基于统计的句法分析算法,这种算法准确率与性能不够高,且不易处理上下文问题;最后呢,是处理语法扩展的编程,但这种程序复杂度很高。

那么,欧拉蜜是怎么解决这个问题的呢?

欧拉蜜团队自主研发的语法描述语言(Syntax Language),可用灵活的规则来描述说法。同时,依托可全文检索的结构化知识库,辅助确定语法参数的合法性,消除歧义。

欧拉蜜采用了结合规则和统计的有机算法、时间和数字识别技术、以编译器技术动态解析和匹配规则,能够实现多维度的上下文支持能力,准确理解用户的表达意图。

(上图为欧拉蜜语音助手截图)

例如,当用户连续输入“今天上海的天气”,“北京呢”,“买一张去那里的机票”。经过算法处理以及数据库检索,欧拉蜜能够结合上下文,准确将“北京呢”理解为“北京今天的天气如何”,并给出当天北京的天气状况。

同样的,欧拉蜜也能获取最后一句中的“那里”指代的是“北京”,并为用户反馈当地去北京的机票信息。

以视觉行为侦测技术为辅助的语音人机交互

如果人机交互可以更加“智能”,那么它应该拥有哪些能力呢?欧拉蜜团队进一步改进了语音机器人的唤醒功能,使人机交互更加流畅。

市面上主流的智能音响,目前使用的都是语音唤醒。由于智能音响没有屏幕,一切功能都是通过语音来操控,唤醒功能也不例外。往往会用一句唤醒话术(通常是产品的名称)来作为启动标志,当人们对着智能音响说出这句话时,智能音响就会进行答复并开始接收你传递给它的信息。

你可能会说,语音唤醒已经很方便了,难道还能有什么改进余地吗?

试想一下,日常生活中,当我们想要对另一人说话时常常会面向他,这时候,不需要叫对方的名字,对方也知道我们正在与他对话。如果机器也能做到这样,那么“语音唤醒”都可以省略掉了。

(欧拉蜜人脸与视线追踪视频截图)

欧拉蜜正是想赋予语音机器人这样“人性化”的功能。因此,欧拉蜜团队使用声源定位并结合视线检测(Eye Gaze Detection)技术,来帮助机器人确认用户的说话对象。这样一来,机器人们除了知道你在说话,还能够判断出你是否是在跟它说话,并自动唤醒。

国内智能语音识别产业的增长,可能源于三大技术突破相关推荐

  1. 腾讯云大学大咖分享 | 深入浅出话智能语音识别

    语音识别就是把语音变成文字的过程,相信大家在平时生活也已经用到过一些语音识别的场景,比如说语音输入法.地图产品的语音输入.近年来,随着互联网的发展,各种音频数据和文本数据得到不断积累和丰富,CPU.G ...

  2. 魔方大数据系列圆桌论坛(22)之 “数据智能助力产业升级“ 暨国内首个大数据微应用实验室落户上海超级计算中心签约仪式

    大数据技术已经深入应用到各个垂直产业,逐步成为助力产业转型升级的重要推动力.依托海量数据.秒级运算能力.如何围绕具体应用场景,开发更多行业落地应用,成为产业数字化升级的关键. 本着协同发展,共同促进大 ...

  3. 智能投影销量爆发式增长 国内智能投影市场的春天还会要多久?

    随着智能家居的概念盛行,智能投影也成为这领域的热门产品,销售量也是与日俱增,它已经让越来越多的用户把它当做了居家大屏观影的首选.随着市场需求的增加,这也让智能投影成为了资本追逐的焦点,BATJ也开始重 ...

  4. 2014年国内智能家居市场发展报告(完整版)

    腾讯家电讯 (李珅)在电影<钢铁侠>中,小罗伯特·唐尼的家充满了科技的味道,他可以双手在空中操作电脑,电脑呈现出来的全息影像能够直接显示在眼前,他的管家也是一部机器,他可以直接通过语音下达 ...

  5. 北京智能计算产业研究院落户顺义,中科睿芯联手计算所、顺义区打造“产业园2.0”...

    作为具有重大发展潜力的高技术产业方向,智能计算在我国方兴未艾. 12月6日,由中科院计算所孵化的智能计算领域创业公司"中科睿芯"牵头发起.联袂中科院计算所和中关村顺义园管委会共同打 ...

  6. 全球及中国智能电网产业十四五规划方向及投资决策建议报告2021年版

    全球及中国智能电网产业十四五规划方向及投资决策建议报告2021年版 HS--HS--HS--HS--HS--HS--HS--HS--HS--HS--HS--HS-- [修订日期]:2021年11月 [ ...

  7. 灵云智能语音识别平台 促进人工智能

    捷通华声为满足人工智能技术爆发性应用需求,推出了灵云全方位人工智能开放平台(hcicloud.com)的私有云版本-灵云全智能能力平台,携手系统集成商.解决方案提供商.软件开发商共同推动各项人工智能技 ...

  8. 国内智能音箱生态系统对比分析

    国内智能音箱生态系统对比分析 The article is released under license CC BY-NC-ND 4.0 IoT Boot Camp系列课程是由TorchIoTBoot ...

  9. 2022-2028年全球与中国智能纺织品产业市场前瞻与投资战略规划分析

    本文研究全球与中国市场智能纺织品的发展现状及未来发展趋势,分别从生产和消费的角度分析智能纺织品的主要生产地区.主要消费地区以及主要的生产商.重点分析全球与中国市场的主要厂商产品特点.产品规格.不同规格 ...

最新文章

  1. 文件服务器raid1设置,文件服务器raid1设置
  2. 移动硬盘提示此卷不包含可识别的文件系统数据如何恢复
  3. 直观、形象、动态,一文了解无处不在的标准差
  4. JAVA之关于This的用法
  5. 前端学习(3176):react-hello-react之脚手架配置2
  6. Android方法的概括,android中的Filter接口简介
  7. [Leetcode][第392题][JAVA][判断子序列][动态规划][双指针]
  8. java中的 =运算符_(二十七)、java中的运算符
  9. 今日逢君君不识下一句
  10. 最优化算法之粒子群算法(PSO)
  11. JavaScript使用drag事件
  12. 清华小学上册计算机教学案例,创新型教学案例.doc
  13. C++ UTF8 互转 Unicode
  14. 苹果三代耳机_【团品2】1.苹果原装数据线以及有线耳机 2.苹果蓝牙耳机
  15. js如何获取当天开始时间和结束时时间并传递(时间戳)给后端
  16. 鸡年关于鸡的一些歇后语
  17. 消除笔哪个p图软件有?快把这些软件收好
  18. 5、Horizon 桌面模板机安装配置
  19. 自由职业需要我们知道什么呢?
  20. 揭开影响RS485通讯因素的面纱

热门文章

  1. Unity NGUI中动态添加和删除sprite
  2. homework-06
  3. 51Nod-1080 两个数的平方和【暴力法】
  4. POJ3421 X-factor Chains【分解质因子+组合数学】
  5. CCF NOI1153 素数环
  6. eclipse 环境 JUnit 测试框架(junit.framework.* 与 org.junit.*)
  7. Java 并发 —— Java 标准库对并发的支持及 java.util.concurrent 包
  8. python opencv3 —— 改变颜色空间(color space)
  9. 机器学习/深度学习测试题(二)—— 单层线性神经网络求解异或问题
  10. Matlab Tricks(二十八)—— 笛卡尔积的实现