近日,以“智汇世界 声动未来”为主题的2021“中国声谷”语音产业发展高峰论坛在安徽创新馆举行。本次论坛由安徽省人民政府、科技部、中国科学院主办,安徽省经济和信息化厅承办,中国声谷运营单位安徽省信息产业投资控股有限公司和科大讯飞协办。安徽省政府副省长何树山出席论坛并致辞。
活动现场,举行了成果发布环节。中国声谷企业科大讯飞股份有限公司总裁吴晓如、讯飞听见市场总监张靖宇为“讯飞听见智慧屏”揭幕亮相。中国声谷企业华云数据董事长、总裁许广彬,合肥市卓怡恒通信息安全有限公司董事长兼总经理李强,安徽雄品智能总经理刘瑾共同为“智能办公一体机”揭幕亮相。
本次论坛,来自高校、科研院所和企业的代表围绕未来智能语音技术如何变革、产业如何发展等话题,进行深度研讨。
东南大学首席教授 曹进德
网络群智研究破题1+1>2
谈及智能语音,一个关键词就是“人工智能”(AI)技术。正是由于AI技术的迅猛发展,给语音技术和产业发展插上智能翅膀。欧洲科学院院士、东南大学首席教授曹进德提出关于“群智系统”相关概念。其在《群智系统与网络》主旨报告中提出:群智系统与网络的理论和技术是AI2.0时代的重要研究课题。
曹进德认为,网络广泛存在于自然界和人类社会中,比如鸟群、鱼群、航空网、战略网、制造网络、电力网络等。在自然界中,局部、无序的网络能够在短时间内形成全局、协调网络,进而解决某些个体无法解决的问题。“例如,本来松散无序的鸟群,受到惊吓后能够很快形成有规律的队形,共同防御外部危机。网络群智研究就是要解释1+1大于2的问题,即智能物体通过聚集在一起,解决单个个体无法解决的难题。”
曹进德介绍,网络群智协同与控制是人工智能领域的重要研究方向,国外主流学会、研究机构和权威学者围绕网络群智协同和优化进行大量研究。梳理已有研究发现,目前在该领域仍存在三个难点:一是网络协同难,主要表现在网络系统分析难、网络系统优化难、网络系统协同控制难;二是业务融合难,具体包括共性服务体系难建立、业务持续网络难构建、业务融合扩展难实现等;三是模型融合难,比如数据异构难表达、网络系统难耦合等具体问题。
曹进德表示,5G和人工智能技术的协同发展为解决以上难题提供了开放思路,有助于驱动实现分布式群智网络的智能协同与控制。例如,研究认为人脑是极为复杂的动态系统,其理性决策是智能寻优过程的结果,神经动力学优化研究旨在建立仿脑寻优的动模型,用以构建智能系统。将神经动力学优化算法应用在分布式计算机网络系统上,可以大大加快算法运算速度,实现对分布式群智网络的智能优化与控制。
当前,群智系统在智能电网、智能交通、无人机集群协同等方面应用广泛,有着良好的产业前景。“目前,人工智能算法耗时长、成本高,智能算法精度差,缺乏多任务和精确任务执行能力,稀疏网络信息挖掘难度较大等,导致现有网络群智协同与控制仍存在诸多挑战。下一步,在5G+AI框架下,如何解决大规模、复杂的群智网络优化等问题,仍有待深入研究。”曹进德说。
中国社科院语言所研究员、语言研究室主任 熊子瑜
推动智能语言技术更好地应用
中国社科院语言所研究员、语音研究室主任熊子瑜的演讲题目为《谈智能语音技术在个性化语言学习中的应用前景》。其认为,针对不同的学习对象,如何利用语音学的知识为学习者提供个性化的语音教学服务,仍是一个挑战。要通过收集各种真实场景下不同声音的材料数据,加以个性化的基础研究,转化成能够服务于学习者需要的手段,最终实现智能语言技术在更多学习场景中的应用。
该研究所研究方向是语音学,有十多个部门,如研究语音、方言、句法等。“语音学的一个重要的应用方向是语音教学,语音技术作为智能交互技术的核心,为语音教学的发展和语音评测提供智能化的手段。”他认为。
从基础研究的角度说,该所是做数据库的建设,把语言学、语音学的一些知识标注到数据里,然后在此基础上利用企业技术手段去做建模,或者是做一些应用方面工作。“所有在语音学上搞研究是离不开数据的,都要基于数据来开展,所以数据是我们的‘命’,没有数据我们啥事也干不了。”熊子瑜坦言。
熊子瑜表示,“我们希望在基于方言区的学习者的材料方面,做一套韵律的自动检测标注系统出来,检测出学习者在韵律上、语调上出现的偏误性问题。比方说,我们学英语,从小老师就教我们疑问句句末要升调,这些都可以通过语音手段实现教学。”
中国声谷企业科大讯飞股份有限公司总裁 吴晓如
数字经济让社会服务更加公平高效
中国声谷企业科大讯飞股份有限公司总裁吴晓如分享“智能语音技术助力数字社会”时认为:语音是万物互联下的重要入口,关键技术需要掌握在自己手里。随着人工智能赋能的领域越来越多,相关核心技术在教育、医疗、办公等细分行业得到良好发展应用,数字经济在国民经济中的占比也越来越大,让社会服务更加公平高效。
“最近很多人讲,从来没有一个时期像最近10年一样,各种新技术耦合对经济社会发展产生这么大的作用。同时也从来没有一种技术像信息化技术一样,对经济社会产生这么大的影响。”刚刚参加数字中国峰会回来的吴晓如说。据介绍,目前中国数字产业规模约占GDP的7%,预计5年后占比大约提高到10%。
人工智能到底在未来社会能起到什么样作用?吴晓如说,第一是智能化。“比如开车的时候,到一个停车场,以前需要一个收费员,现在不需要了,通过车牌自动识别,通过传感器等技术,就变成一个无人值守的停车场。智能化现在在我们的生活中不断渗透,未来它的效率会越来越高。”
第二是个性化。个性化下一步会涉及到消费升级,个性化服务将会使每个人都能够得到高品质、高性价比的服务。未来,人工智能能为数字化社会带来一些关键性的应用。
谈及人工智能赋能民生,吴晓如举一个医疗方面的例子。科大讯飞开发一个叫“智医助理”的产品,已在安徽基本上全面推广应用。它是怎么服务基层医生的?医生在看病时,旁边有一个智能机器人,当医生针对一个病情作出诊断时,机器人同步作出诊断。如果两个诊断结果不一致,医生面临两个选择,一是再去思考一下,可能机器人是对的,于是就把诊断结果调整过来;二是如果他觉得自己的判断结果正确,诊断样例就会送到上级医生,由上级医生给予指导。
“病例的规范性是国家卫健委一直大力希望推动的,就是怎么让医生把病历写得更加准确。病历是所有医疗大数据的基础,如果没有病历,很多医疗大数据都是无源之水。”吴晓如说,有了“智医助理”后,可以帮助医生更好地把病例写出来,而且告诉医生哪些地方写得不规范,病历规范率大幅提高。
中国科大电子工程与信息科学系教授 凌震华
新的音色满足多样化云应用
中国科学技术大学电子工程与信息科学系教授、博导凌震华,从技术层面分享了业内最先进的研究成果———《个性化语音生成与检测》,一方面介绍个性化语音生成,另一方面分享生成语音检测。
如今,大家对人工智能这个名词都不陌生,它是希望让机器具有像人一样的感知认知、决策执行等能力。从人工智能发展的三个阶段来看,涉及语音生成技术叫做感知智能,其目的是希望让机器具有像人一样能够自如说话的能力。
凌震华解释,所谓个性化语音生成,就是希望能够生成特定目标说话人的语音,当前主要有两条技术途径:第一条叫做语音合成,通常叫做文语转换,具有目标说话人的一些特点;第二条叫做语音转换,通俗来说就是变声的技术,在不修改其内容情况下,使声音听起来像一个目标说话人。
“希望这种个性化,可以帮助我们去做电影的配音,去做故事书的朗读等。另外,可以在模拟基础上创造更多的甚至是现实中没有的新的音色,来满足更加多样化的云应用的需要。”凌震华说。
其实,个性化语音生成,除了可以带来更多便利和多样化的技术体验之外,也会造成一些负面影响。比如,有可能被不法分子用来做电话诈骗,就是说即使你听到一个你熟悉的人的声音,有可能声音是假的。
“所以,在这样的背景下衍生一个新的任务,我们把它叫做假音检测技术。目的就是把合成语音和真实语音分开。”凌震华说。