欢迎访问wabc.cc — 源码交易 · 软件定制 · 建站服务一站式平台
全部分类
首页 - 首页 - 解决方案 - 推荐文章 - 陈孝良:机器将听你所言,知你所想 | 未来简说

陈孝良:机器将听你所言,知你所想 | 未来简说

分类:推荐文章 · 发布:2025-12-20 · 浏览:1

  

  导语:2013 年上映的电影《她》,讲述了作家西奥多(华金·菲尼克斯饰)在结束了一段令他心碎的爱情长跑之后,爱上了人工智能操作系统里的女声——“萨曼莎”(斯嘉丽·约翰逊配音),她不仅有着一把略微沙哑的性感嗓音,并且风趣幽默、善解人意,让孤独的男主泥足深陷。虽然这只是电影情节,但是人类从未停止过对虚拟伴侣的追求。机器到底如何才能听懂人类的感情?让我们来听听声智科技创始人陈孝良是怎么说的。

  <语音交互是在传递信息的基础上承载情感的交流>

  当我来创客星球演讲的时候,内心仍然是感到有些抱歉的,因为我的演讲可能让大家感觉很累。首先,我的发音有鼻音和粘连,大家可能经常听不准我说的话;其次,我的演讲内容是声学和人工智能,这个主题虽然与我们的生活息息相关,但不如美食、购物、旅行等内容更有吸引力,所以大家听我的演讲就容易感觉晦涩。

  听不准和听不懂这两个因素叠加,就容易造成大脑疲劳。

  

  对于我们来说,语音交互实际上是在传递信息的基础上承载情感的交流。但是,往往因为语音问题而导致事与愿违,这种例子不胜枚举。当我们大脑疲劳超过一定时间就容易产生烦躁,当年我们上课总喜欢在课堂上打盹,因为很多老师上课有口音,我们听不清,可能本来也听不懂。既然人类之间的交互都是如此复杂,那么,机器又是怎样听到并理解人类世界的呢?

  

  我们先了解下机器和人类的听力差异。有两段人声完全一致的声音素材,第 1 段没有任何背景音,我们听着很清晰,但若让机器“听”,识别率并不好。而第 2 段加了“噪音”的声音,我们人耳听起来不太舒服,在以深度学习为核心的近场语音识别中,识别率超过 90%。事实上,大于90%的识别率就意味着机器能听得准人类的声音了。也就意味着,第二种我们听着不那么清晰的声音,才是机器所需要的。

  <当前技术还没能让机器听得准>

  机器若想理解人类世界,听得准和听得懂都是必要的。但事实上,当前技术至今还没能让机器听得准。我们可能在很多新闻上都能看到机器语音识别超过人类的报道,但实际上这对人类是不公平的。人类的交互是自然的复杂场景下远场交互,但新闻报道的,却是理想实验环境下的近场测试集识别率。而机器和人类之间的交互,必然也是复杂环境下的远场交互,真实场景的变化带来的技术挑战远远超过了实验室的环境。

  

  麦克风阵列技术,是当前解决远场语音交互的主要手段。其实就是利用多个麦克风来模拟人类耳朵,实现类似人耳的声源定向、噪声抑制、混响和回声抵消等功能,以便获得更好的语音识别率。这里有两组 4 段音频,第 1 段声音是日常场景下录制的人声,有空调噪声;第 2 段,是把第 1 段声音经过麦克风阵列处理后的效果,噪声已经得到抑制。第 3 段声音是复杂场景下录制的,包含了电视和人说话的声音;第 4 段声音是把第 3 段经过麦克风阵列处理后的效果,其中电视声音不能算作噪声,机器很难处理这类声音干扰,所以我们处理完后还有残留,但是已经不影响机器识别了。

  

  <人工智能分为两个阶段感知阶段和认知阶段>

  但是,麦克风阵列只能帮助机器解决听得准的问题,如何才能让机器听得懂?这是一件非常困难的事情,因为让机器听得懂人类的语言,不仅要解决人机信息传递的问题,还要解决人机情感传递的问题。一般来说,我们将人工智能划分为两大阶段,感知阶段和认知阶段,它们区别非常显著:感知阶段的机器说得自然、听得准确,而认知阶段的机器说得委婉、听得自然。简单举个例子,当一个女孩子对着机器或者魔镜说,我是不是很美丽?如果机器回答:姑娘,你的美丽度只有 50%,这就是感知阶段;如果机器回答:美女,你还缺只很棒的口红,这就是认知阶段。显然,让机器听得懂人类的语言应该是认知阶段才能解决的事情。如何解决这个问题,学术界也很迷茫,大数据和机器学习可能是一种有效的解决方法。

  

  <机器迟早能听得懂人类的情感>

  但可以预见的是,机器迟早能听懂人类的情感。我们要关注这个事情,因为这意味着未来求职方向的变化,有很多人会发现新的工作机会,自然也有很多人失去机会。我们已经推动人机语音交互前进了一大步,很快,机器甚至可以随意模仿我们人类的声音,类似美颜相机提升了虚拟世界的颜值,美声功能也可能改变虚拟世界的声音。这是一个很有意思的事情,当机器听懂了你的撒娇和愤怒,同样与你撒娇和愤怒,甚至不惜与你吵架的时候,我们人类又当如何应对呢?

  

  我们人类通过语音交互构建圈子、满足生存、获取尊重,听懂情感的机器很可能也有这种需求。那么,到底是机器适应人类,还是人类适应机器?未来的人工智能时代,社交将是一个宽泛的概念,不仅仅是人类和人类之间的交互,还有机器和人类之间的交互,可能还有机器和机器之间的交互,这是一个更加复杂的世界。未来,无限想象,我们的使命是努力做到让机器听你所言,知你所想!

  


  

  Q: 我们现在人人都能修饰图片,假如未来每个人把自己的声音也修饰了,这是不是一件很可怕的事?

  A:这是肯定的,事实上这个功能我们已经实现了。现在很多导航软件里面,用了郭德纲或者林志玲的声音。我们如果能拿到大家的语料,就可以模仿任何人的声音。在未来这是比较可怕的一件事,首先在安全方面是很大的一个隐患。比如电话诈骗,很可能是模仿你身边很亲近人的声音。技术永远是双刃剑,它给我们带来便利的同时,同样会给我们带来很多的隐患。就像我们工业时代的交通工具,比如汽车、飞机、火车,它们大大改善了我们的生活,但同样也给我们带来了很多的事故。未来的人工智能,包括声学的发展,对于社会来说,也可能会是一种潜在的威胁。

  假如未来你能像钢铁侠那样有一个属于自己的 Jarvis,你最希望它能替你干啥?

  A.第一件就是为我写诗,为我写诗为我静止,为我做不可能的事……

  B.想那些打死我都想不出来的创意文案

  C.把我的三流水准小短片改成好莱坞大片效果

  D. 帮我背单词,有问必答,让我过目不忘……


  <想知道未来五年的生活看看他们怎么说>

  

  

  

  特别感谢创业邦、猎云网、极客公园、品玩 、硅谷动力、风颂、中谷跨境服务中心 、将门、上海双创投资中心 、活动行《未来简说》的大力支持!

上一篇:企服早报:图麟科技获2.5亿A轮融资,Mindspace获2000万美元B轮融资
下一篇:2019河海大学法学院考研QQ群及复习资料

相关文章

源码分类

热门源码

最新资讯

联系我们