数据与智能融合,新赛道的投资机会如何判断?


大数据领域经历了2013年开始的疯狂增长,2016年的断崖式下降,以及2018年以来的迭代复苏,单一的数据技术逐步与人工智能技术结合,应用场景从营销获客、金融风控等为主,转为与城市管理、工业制造等领域越来越深度的结合。大数据产业已进入2.0时代。新时代下,数据与智能融合,新赛道的投资机会如何判断?

中国计算机学会(CCF)大数据专家委员会,每年年底都会发布下一年的大数据发展十大趋势预测。回顾从2013年到2019年的第一大预测,可以发现有意思的发展轨迹:数据的资源化(2013)、大数据从“概念”走向“价值”(2014)、大数据分析成为数据价值化的热点(2015)、可视化推动大数据平民化(2016)、机器学习继续成智能分析核心技术(2017)、机器学习继续成大数据智能分析的核心技术(2018)、数据科学与人工智能的结合越来越紧密(2019)。

从大数据的概念兴起到寻找和挖掘大数据的价值,再到大数据的平民化以及大数据与人工智能的紧密结合,这是一个螺旋上升的过程。在这个过程中,整个大数据产业越来越认同:数据本身没有价值,经过清洗之后才能形成信息,信息只有经过整理才会形成知识,知识只有应用了才会形成智慧,智慧经过收集又变成数据,这是一个完整的循环。

数据经过迭代和循环之后,基于场景化的应用才能创造价值,这已经成为产业共识。进入2018年,我们正处于大数据产业第一轮上升周期的最后阶段——智能应用阶段。现在,各种各样的IT公司、AI公司、大数据公司甚至是SI系统集成商等都在进入所谓“数据智能”领域,造成竞争非常激烈,使得很多从业者在审视方向和战略路径的时候产生了焦虑。其他赛道的争相融合,也使得数据智能赛道中的选手排名有很大的不确定性,再加上这些选手在一级市场高估值的现象,使得投资人在做判断的时候比较纠结。

在2018年12月举办的钛资本“新一代企业级科技投资人投研社”在线研讨会第八期上,达晨财智业务合伙人窦勇分享了对数据智能产业的思考。窦勇在达晨财智负责大数据业务,同时也是中国首席数据官联盟专家组成员,其投资案例包括数联铭品、数据堂、昆仑数据、美林数据、蝎子网络、中奥科技、索为高科、锐思环保等。

走进数据2.0时代

大数据,通俗的讲就是一台机器干不完的事情,利用多台机器来完成。大数据能够快速发展的根本原因无非两个,一个是计算性能的提升,第二个存储成本的降低。

对标国外来看,整个20世纪90年代之前,因为信息化尚未完成,数据量比较少。进入21世纪,移动互联网的兴起使得数据量飙升。2005年,雅虎解决网页搜索问题的时候,提出来两个概念——高性能计算、分布式存储,对行业有着很深远的意义。资本市场更关注的是2009年Splank的上市,来自资本市场的刺激让整个市场为之动容。而2014年Plantir的估值达到200亿美金,更是让国内的整个投资界为之疯狂。

国内来看,从2013年到2017年12月9号,属于数据1.0时代,是进行认知、培训、泡沫、创新的过程。为什么以2017年12月9号为分界点呢?因为在这一天梅宏院士向中央递交了一个报告,从此整个行业进入了数据2.0时代,也就是数据场景化应用、深度融合的时代。

云计算、大数据、人工智能这三者之间你中有我、我中有你、互利共存,一起促进了整个数据智能产业的发展。云计算的出现带动了大数据的热潮,后来人工智能变得更热了,是不是大数据就变得不重要了?其实大数据已经融入到了整个人工智能产业中。

回顾数据1.0时代的投资逻辑

数据1.0时代是一个体现数据差异化的时代,这个时代从消费领域的大数据开始,经历了机器大数据以及后来的工业大数据。

机器大数据萌芽阶段是从2013年到2015年,从2015年进入成长阶段,新三板的介入助推了这个进程。在2016年之前,工业大数据没有得到太多的关注,整个产业现在也还处于发展的初期,这是因为工业领域的信息化尚未完成,有很多的不确定性因素,也存在大量机会。数据1.0时代,从产业角度来看,数据格式从结构化、半结构化、异构化等多样化的融合使得数据源变得更加丰富;而处理数据的手段,无论是基于Hadoop还是Spark的计算方式,都使得整个产业不断地迭代和演进。

数据1.0时代的创业者无非有三类:第一类是原来的传统IT和系统集成商,这一部分群体的出现主要是因为在2015年整个数据行业处于高速发展中,在一级市场给出高估值的情况下,大部分IT系统集成厂商摇身一变成了所谓的数据厂商,他们胜在更贴近用户,但可能对于行业的认知不足,不太关注研发投入;第二类是拥有稀缺数据资源的厂商,他们凭着独有的数据资源能够带来独有的视角和商业价值;第三类是具备技术的创业团队,他们大部分来自于传统的企业IT公司,包括微软、IBM、Oracle等大型厂商,对于技术的应用比较强。在过去五年当中,这三者各有一席之地,但是最终在进入数据2.0时代的时候逐渐融合,都在往场景落地上走,也就是所谓的数据融合。

数据1.0时代从资本的角度来看,2014年Palantir获得200亿美金的估值,加快了国内整个行业泡沫的形成。新三板2015年的推出导致整个行业的虚高。2016年6月1号,《网络安全法》的公布又矫枉过正。特别是对个人隐私数据的极端关注,导致大量行业从业者退出。

而因为泡沫的存在,造成了大量黑产数据的形成,产业里面形成了大量的灰色地带。整个行业陷入极其消沉期是在2017年,由于对整个行业的未来方向都看不清楚,很多人到处尝试,数据行业投入的壁垒也在逐渐加大。

2017年12月9日的“实施国家大数据战略”,为整个数据行业带来了一个新的方向。中国政府是数据最大的拥有者,也是数据最大的需求者,但本身没有技术能力使用数据。因此,如果没有政策的指引,地×××府也不敢投入。所以,2017年12月9日之后,整个行业迎来了快速发展。

对于数据应用来说,什么样的行业领域才能体现数据价值?一是这个行业具备一定的信息化程度;二是具备购买数据服务的能力;三是具有数据安全或安全数据,数据安全是指数据资产本身从流通到应用过程中的安全,安全数据是指数据来源的合法性,对这个问题必须慎之又慎。

对大数据企业进行估值也比较挑战,传统的估值模型往往在现实中不成立。数据企业具有一个显著的特点:除了轻资产外,其它的什么都没有。对于这类型资产怎么进行估值?投资机构在最开始做数据企业估值的时候肯定是“两眼一抹黑”,不过可以基于三个方面的目的进行判断:第一,投资机构确实想进入这个市场,所以在有标的物的估值方面可能会采取折中的办法;第二,投资以退出为目的,估值取决于需要多长时间能够收回本金;第三,数据企业的产品应用场景在哪里,用户的反馈是什么。

还有一些比较实用的小技巧:第一,数据企业到底能解决什么样的问题,是否具备可复制性,持续能力在哪里;第二,团队的构成是否互补,数据企业往往都是科学家型,在面对市场时有哪些短板,如果后期补齐了短板,成长的能力又在哪里;第三,创业早期可能对财务指标不会太在意,但是对于资金的使用去向要特别关注。

数据2.0时代:场景逻辑,巨头形成

数据2.0时代到底是什么样的呢?

从产业内部来看:第一,普适性的教育已经初步完成,分工明确、需求也十分确定,给整个数据产业带来了一个快速发展的强周期,具备了天时、地利和人和;第二,随着金融资本市场进一步的回落,对于数据企业的认知更加回归本质,资本市场给整个产业带来的泡沫逐渐消亡,原来单纯靠PPT演讲就能融资的情况已经基本不存在了。

从产业外部来看:第一,资本市场回归理性,泡沫空间变小。都知道2018年难熬,大家的口号都是“活下去”;第二,外部政策环境持续利好,无论是科创板的即将开板,还是国家把数据行业定位为新经济的重要支柱,都给数据产业的良性发展提供了一个良好的外部环境。

天时、地利、人和都具备了,可以预测,大数据企业在未来的一段时间将形成以下三个良性发展:

第一:场景落地的效应更加明确。到底是针对什么样的场景解决什么样的问题,这种场景是否具备可复制性,持续效应在哪里,如何随着时间的推移得到进一步的应用;

第二,数据龙头企业形成。资本寒冬后留下来的是良品,大数据企业会趋于一种寡头效应。凭借着资本市场以及行业里大量的沉淀,将形成对整个产业的新认知。现在二级市场上虽然很多自称大数据企业,其实真正的大数据企业可能寥寥无几,可以期待之后真正的数据巨头形成;

第三个是技术更新加快。现在无论是从硬件还是软件,整个产业层面对于数据行业的支撑在不断的加快演进与迭变。无论是从计算性能还是存储效率来看,计算效率的极大提升将驱动产业进一步良性的发展。

回归到本质来看,数据2.0时代的“场景落地”到底指的是什么样的场景?这个场景一定是在信息化基本完成的行业里,并且行业具有较强的支付能力。创业公司也不再是项目型,而是以产品的形式带动整个产业的发展。

工业互联网:数据2.0的典型场景

在场景落地方面,工业互联网是一个典型的细分赛道。2017年12月9号之后,最让整个产业界兴奋的事件,就是工业富联上市。工业互联网赛道在当前的寒冬期仍相当红火,主要推手有两个:一个是工信部信通院在推广工业互联网板块,另一个是国家层面的“中国制造2025”。这两个推手促成了工业互联网赛道的趋之若鹜。

但目前我国的工业尚处于3.0阶段,难以跟以高科技著称的美国工业互联网、以机械著称的德国工业互联网对标,所以国家提出了“中国制造2025”。虽然这只是纲领性的文件,但是对整个产业界、投资界以及工业互联网创业圈的振动却不小。

从“中国制造2025”的宏伟目标看,其中的产业机会达上万亿。但整个赛道从投资者的角度来看,创业者并不多。因为既懂IT又懂工业的人少之又少,整个工业互联网赛道看似有巨大的商业机会,但从基本面来看还处于一个比较落后的阶段。

投资人应该怎么看工业互联网?工业互联网可以分两部分:第一,透明工厂,就是在工厂内部围绕产品打通原料、生产流、信息流、资金流,实现设备智能化、流程信息化、过程网络化;第二,以前当产品离开工厂后就很难再与工厂发生联系,而从工业互联角度考虑就要以用户为中心,实现需求个性化、体验场景化、用户生态化。围绕这两部分,工业互联网的体系,从产品全周期管理开始到最终用户互联互通,形成了一个生态。生态当中流通的是数据,以数据的方式驱动整个产业的布局。

按三个层级划分,工业互联网领域可以布局的赛道具体有以下这些:

第一,边缘层。围绕工业互联网的数据汇聚基础,值得布局的赛道有工业传感器、5G、芯片产业。实际上,传感器领域还是被国外厂商垄断,5G核心芯片也是类似情况。但是,随着带宽的提高,采集数据的成本降低了。物联网领域,形成了M2P(Machine-to-Person机器与人连接)和M2M(Machine-to-Machine机器与机器连接),数据的流通得到了进一步的加强。当然芯片不是靠钱能堆出来,但是基于工业互联网的单片机相对比较容易,投入资金也能促成一些基于行业场景化、定制化的芯片,所以这个领域还是有一定的机会。

第二,平台层。可以关注几个方向:首先是行业内的应用平台,这是因为没有行业应用具体特征的数据平台会比较空泛,而解决工业领域各种细分需求的平台需要花费更多时间打造;其次,从技术逻辑角度来看,基于工业产品的时空数据库并没有较好的解决方案,相应可以布局专门针对工业领域数据特点的解决方案。

第三,应用层。因为这个行业相对比较早期,哪怕相对比较大型的企业如树根互联、网智天元、徐工信息等,可能在某一个细分领域凭借原来的行业经验积累了丰富的应用,或者凭借母公司带来相对垄断的资源,但也还都是项目制的方式运营,完全以标准化产品提供服务的还比较少。应用层的创业和投资机会,可以从两个方面考察:第一,信息化是否提前完成;第二,有资金和技改经费。按照这两个标准,能源、电力、高端装备制造业等都是比较好的选择。

整体来说,在工业互联网板块三个层级里,哪一个层级会先有选手跑出来呢?从用户的角度来看,可能是平台层。虽然没有边缘层这些企业解决数据采集、数据治理、数据清洗的问题,平台层无从谈起。但是边缘层往往吃力不讨好。大的企业客户往往急于看到效果,对于平台层的需求往往超出对于边缘层的需求。应用层是不是没有机会呢?也不是。但是在工业互联网领域,用户在意的是究竟能不能解决问题。从行业来看,一定是在能源、电力、高端装备制造业等板块,会较早的跑出一些选手。

大数据领域经历了2013年开始的疯狂增长,2016年的断崖式下降,以及2018年以来的迭代复苏,单一的数据技术逐步与人工智能技术结合,应用场景从营销获客、金融风控等为主,转为与城市管理、工业制造等领域越来越深度的结合。大数据产业正进入到2.0时代。新时代下大数据与人工智能的融合,已然成为各行各业技术驱动、产业升级的重要支撑。具备数据智能的能力、以场景应用为中心的项目,将成为大数据领域的投资主流。

推荐文章

自动标注、平滑过渡、音乐鉴权、AI创作,当AI技术应用于音乐行业为人类的精神文化与娱乐生活带来便利和更多选择时,也是一件让人激动不已的事情。随着深度学习算法的出现、大数据和5G技术的成熟,AI人工智能已逐渐融入我们的生产生活中,在教育、医疗、政务办公、城市管理等多个方面发挥作用。随着AI技术在音乐行业研究及应用的深入,音乐人工智能已经不新鲜,很多新的应用和产品已经惊艳亮相。基于对于音乐技术及产品的了解,简单梳理一下目前AI技术在音乐类产品的各类应用场景。一.动标注当平台曲库量达到定量级时,如果再依赖传统的为打标签模式就会花费量成本且受到主观影响较。频动标注相关技术就受到泛关注,动标注的作不仅仅只是能替代标注以达到节省成本,同时可以客观评价乐内容,因此还可以拓展到流媒体播放的乐推荐。例如:Spodify、KKBOX都有利深度学习做推荐,其中KKBOX采频件、歌词以及户相关标注和评论等数据作为输从曲、场景及情绪等多个维度来判断乐是否满推荐的条件。般的动标注功能也和KKBOX的推荐维度类似,从曲、应场景、器乐和情绪等维度来进标注。HFIIVE旗下曲多多(AGM)音乐标签对于动标注,笔者也在上听到过一些不太专业的吐槽,比如之前有看到说音频自动标注可能会出现将一首歌曲的情绪同时标注为“欢乐”和“悲伤”两种情绪。在解释这原因之前,可以简单普及下机器学习中分类器、单标签多分类任务和多标签多分类任务。简单来说,分类器就是利已知的输和输出数据来训练,然后该分类器就会对未知的输数据进分类或输出个值。对于个分类器模型,它预测的结果是2个或于2个以上的(结果只有1个代表结果确定就不需要分类模型了)。如果可能的结果数为2称之为分类任务于2就是多分类任务;对于情绪可能有:亢、欢快、安静、悲伤等多个结果,因此情绪分类是个多分类任务。如果认为情绪模型是个单标签多分类任务,那么绝对是不可能出现”欢乐“和”悲伤”同时出现的情况。如果同时出现“欢乐”和“悲伤”,则只能存在于多标签多分类任务。“欢乐”和“悲伤”同时出现就定是错误的吗?也不定!基于深度学习的乐处理式般是分段处理,也就是将乐划分为多个段然后对每个段进预测判断它可能的标签。如果歌曲情绪存在波动,比如一首歌曲的情绪从开始的“欢乐”转向了“悲伤”,那么这种情况也是完全可能出现,现实活中很多歌曲的确是存在多个情绪甚互斥的标签存在的情况。二、平滑过渡平滑过渡功能是近年新出现的“炫酷”功能。简单理解,就是当歌曲快要播放完毕时下歌曲可能缝接,这种歌曲间的平滑过渡,不会让听众觉得非常突兀。这种功能的实现,也有依赖于基于深度学习的技术。致原理是将歌曲的末尾段和可能平滑过渡的其他歌曲的头部段作为训练样本。训练出来的模型可以预测当前输段可以过渡的下个段,然后当播放器播放歌曲尾部段的时候利该模型得到可平滑过渡的下歌曲。三、音乐鉴权互联网上的音乐侵权一直存在,但音乐版权方要在互联网上维护自己的权益,往往比较困难。因为互联网具有海量的内容,而且内容形式具有复合性,比如音乐内容仅仅作为视频的背景音乐,靠人工去发现和识别,难度太大。在这方面,AI技术的运用,已经能够实现实时监控视频、直播或播节中是否有存 在歌曲的侵权情况。其中的原理是,将版权的曲库中歌曲提取出关键特征保存在集群数据库,然后提取待检测的频特征,并通过数据技术进快速检索数据库中是否存在相似数据。目前,拥有类似技术的公司,除了笔者所在公司外,ACRCloud也较具有代表性。四、AI创作当AI进入到音乐创作层面,在互联网行业也已有不少AI音乐创作工具,Amper Music、AIVA、Jukedeck、Ecrett Music、Melodrive、等ORB Composer等。公司层面,索尼、谷歌、百度以及人工智能非营利组织OpenAI等均在AI作曲领域有所尝试。2016年,索尼公司使用一种名为“流机器”(Flow Machines)的软件,创作了一首披头士(Beatles)风格的旋律,然后作曲家伯努瓦卡雷(Benoit Carre)将其制作成一首完整的流行歌曲《Daddy ‘s Car》(爸爸的车)。2018年,微软宣布第四代小冰加入到虚拟歌手市场竞争当中,并“演唱”了一首《隐形的翅膀》。AIVA科技开发的AI作曲家“Aiva”创作摇滚乐曲《On the Edge》并与歌手Taryn Southern合作创作流行乐曲《Love Sick》;在国内,笔者所在公司的相关产品在AI智能创作上,能够实现识曲(识别音乐作品中的音乐元素)、作词、作曲等功能,并已实现了商业化授权和应用。(HIFIVE小嗨 AI识曲/作曲/作词)在具体的AI智能音乐创作层面,AI作曲工具可辅助创意生成。如英国音乐制作人Alexa Da Kid利用IBM沃森认知计算平台中的机器学习音乐生成算法创作出单曲《Not Easy》、歌手Taryn Southern与AI作曲公司Amper Music开发的工具共同创作出《Break Free》与Aiva合作创作流行乐曲《Love Sick》。这些作品都曾一度成为热播曲目。随着越来越多AI音乐创作工具的诞生,充当音乐人的辅助,协助创作出更多优质的作品,AI作曲家的音乐创作能力也在逐渐得到认可。当AI遇上音乐,音乐被注入了越加鲜活的生命力,智能化大潮来袭,AI+音乐,未来值得期待!

热门文章

        对数据标注行业稍微有些了解的人都知道数据标注进入门槛低,适合很多人兼职也适合创业。        正是因为数据标注行业的门槛低这个特点最近两年从事数据标注的小公司小工作室如雨后春笋般的遍布全车大大小小的县城。        但是目前有个有趣的现象,那就是有很多进入数据标注行业做了一段时间的人慢慢的感觉数据标注行业就是个坑?为什么有些人会说数据标注就是个坑呢?        其实对与有上述问题认识的人我们认为,这些人多数都是有于对这个行业对自身条件的不了解,盲目的开始进入数据标注行业的。为什么我们会这样说呢?下面就给给大家来分析下到底有哪几方面的原因:        一、有相当一部分人是听了朋友或者网上消息说这行很火爆,好做,门槛低,也有一部分人了因此租办公室买电脑招人,然后就去群里面找分发项目的人就开张干起来了。可实际上这些人他们大多数都没有充分了解数据标注行业,更没有认真仔细得去调查分析,到底自己能不能做好一个项目,到底自己能不能有质有量按时交付的完成一个项目,到底自己有没有这个能力来管理项目。更多的人也没有去用长远的眼光去考虑数据标注项目。        二、数据标注项目虽然入门门槛低,但是相当一部分有于理解认知应变能力上都不能保证去做好数据标注项目,还有一部分人由于自己对标注项目重视程度不足接到项目之后呢?不仔细认真的去阅读理解项目规则,更没有很好的对规则质检标准去培训员工,而对员工的要求主要看重每天的产出效率,从而导致接到手的项目做的质量很差,频繁的返工,有提项目甚至因为质量太烂项目方不给结算或者是结算比例很少,最终的结果就是做好些个项目但基本都是赔钱。        三、虽然业内人都 说数据标注简单,但是标注项目他也是一个系统性的工程,一个项目能不能做好并不简单的看项目好做就能赔钱。实际上决定项目赚不赚钱考验的是一个团队的项目管理水平,质量管理能力,运营能力各方面因素的。一句话再好赚钱的项目也照样有人赚钱也有人赚钱,要赚钱不是那么简单的。        四、还有些工作室 、小公司因为对行业不够了解等他们做了一段时间后发现,自己团队经常会没有项目做,而自己团队接项目的业务能力又不具备,甚至有的时候为了员工有活干去接一些价格极低根本就不赚钱的标注项目,时间稍微一长这些工作室团队就会赔上很多钱最终关门倒闭。        五、下来要说的就是一部分人人兼职人员由于认识不到位,对项目的规则质量要求 文件不认真阅读消化理解导致做的项目质量差返工有的甚至最后不结算,最终退出这行。更有一些人由于经验不足被标注行业的项目骗子给忽悠到辛苦劳动到最后结算时找不到人。        标注行业本身由于进入门槛低,做的人很行业内盲目打价格战,导致很多转手二手三手的项目在质量工期的要求下根本就不赚钱甚至赔钱,所以在这里也提醒大家做任何事都要谨慎而行。