汽车大数据应用的6个前提
最近博鳌的论坛上,各路大神在神侃人工智能是否会消灭人类的伦理问题,最讨厌一帮文科二货在台上扯淡人类技术末日,因为无论这个伦理问题多么严重,最终解决问题还得靠理工男女的技术头脑。制造AI的恐慌是没有意义的,了解AI是什么比想象它的恐怖有趣得多。
在当前这帮文科二货们的蛊惑下,大数据和人工智能越来越热,汽车这个垂直应用领域更是热得一塌糊涂。从大数据技术的基本应用场景看,汽车和车险的销售广告显然是典型的应用场景,近年来,汽车金融的应用场景也渐渐丰富起来,至于自动驾驶,那已经是资本宠儿。我认为汽车大数据最可能率先发挥价值的一是汽车和车险广告,二是金融和车险的风险控制,三是自动驾驶,其他领域的应用即使有,也商业价值有限。
但目前来看,绝大多数自称汽车大数据的公司本质上都是卖数据的公司,我们耳熟能详的那些大数据公司,干的基本上就是倒卖官方还没有合法公开的个人数据,未经用户同意倒卖用户隐私数据的勾当。倒卖数据是当前到处吹牛的汽车大数据公司典型业务。真正运用算法和模型解决行业问题的公司都还在埋头苦干,都在积累应用案例,短期恐怕难以盈利。对投资人和创业者而言,我认为看清楚汽车大数据的应用方向非常重要。
要应用汽车大数据,首先得解决数据处理的问题。从汽车数据处理技术的角度看,大约有6个层次。我认为这是实现汽车大数据应用的6个前提。
一是数据接口化,这个层次的问题不解决,大数据技术根本就没有用武之地。搞不定接口,只是拿个移动硬盘拷死数据的,就别凑大数据的热闹了。比如汽车违章数据对于用户个人征信有价值,弄个爬虫去偷数据的就别琢磨大数据应用了,数据源都不稳定,相当于工厂的原材料都不稳定,你还怎么搞生产,怎么考虑产品质量呢?
二是结构化,数据采集的接口问题解决了,需要解决数据存储问题。传统的数据库采用SQL存储结构化数据,但如果要用大数据技术,图片、甚至视频等非结构化数据也需要存储,虽然有NoSQL产品解决这类数据寸纯问题,但最终应用仍然需要把非结构化数据结构化。
三是标准化,结构化存储的数据来源广泛,比如同样是车辆的保单数据,不同保险公司的保单数据标准不同,在应用前必须把不同保险公司的保单数据标准化。同样,汽车违章查询的数据、汽车贷款的数据,都需要按照统一的标准进行规范,这样可以用一把尺子度量不同来源的汽车数据。通常,绝大多数吹牛自己是大数据公司的,基本工作就是做到了这一步,也就是把来自各种途径的数据进行了标准化,能够用Excel表格输出数据,可以卖了!
四是因子化,完成了标准化,这时的数据库才能采用大数据技术进行有目的的挖掘。要开展数据挖掘,首先第一步得解决标准化数据的因子化。比如车主性别,有男,有女,有不确定。计算机因子化处理这个问题的时候就会把男定义为1,女定义为0,不确定性别定义为2。性别的因子化相对简单,再比如违章数据,究竟违章多少次,何种违章才应该被判定为高风险呢?要因子化处理,我们就得定义规则,比如非扣分的违章0-3次风险因子是1,4-6次风险因子是2,7次以上风险因子是3……诸如此类的数据因子化处理,才能进入数据建模。
五是模型化,很多吹牛搞汽车大数据的,动辄就吹牛要搞数据模型,其实绝大多数人连前面四个数据处理过程都干不了。极少数搞定前四个步骤的公司会雇佣数据建模师,围绕特定的问题,建立数据模型。这个过程一定程度上并不是科学,更多的像是艺术工作。因为不存在绝对的解,建模师的工作就是要用想象力,尽可能建立一个能够模拟现实世界运行的数据模型。先有一个假设,然后用现实世界的数据去测试这个假设,如果错了,反馈参数去修订这个模型,再用真实数据测试,直到结果能够很好的模拟真实世界……这个过程就是机器学习的数据训练。由于每个行业、每个行业的细分领域、每个细分领域的不同公司都在经营不同的生意,同样是车险保单,不同保险公司的用户偏好是不同的,同一个模型是不可能适应所有保险公司,每一家保险公司如果要应用大数据和人工智能技术,都必须个性化训练,一旦某一家率先建立自己的机器人,其在行业里的效率提升将大幅领先于没有人工智能机器人的公司——对汽车保险、金融、二手车、后市场等领域来说,谁先用人工智能武装自己,谁将与竞争对手真正拉开差距。
六是产品化,有了模型并不是万事大吉,模型必须应用于某个生产场景才能创造价值。比如在汽车广告领域,区分潜在用户销售线索优劣的模型就非常有用。目前每年车企投放大量广告获得几十倍上百倍实际销售量的销售线索,目前不加区分进行电话轰炸的方式效率非常低,成本也非常高。建立销售线索鱼成交结果的数据模型之后,必须为车企提供一个应用生产环境,帮助4S店销售人员准确把握每一个销售线索的价值,把有限的时间和资源,放在最可能成交的那些潜在用户身上。也就是说,必须把模型封装在一个Saas系统里,大数据技术才能真正落地应用。
我知道这篇文章对大多数人而言过于专业,但真要应用大数据、机器学习和人工智能解决汽车行业的问题,这篇只能算是扫盲。写出这些扫盲文章的目的无他,我只是想治愈那些AI恐惧症患者。美国人可能有必要担心这些问题,因为在发达国家,数据的接口化和标准化工作已经在几十年前完成,而我们中国远远没有恐惧AI的必要,各种数据连接口化的工作都无法完成,你想训练一个AI出来,谈何容易——各位吹大数据牛的公司,卖数据的生意前景不错,6月1日网络安全法出台前可以继续得瑟,之后就自求多福吧!
数据分析咨询请扫描二维码
CDA数据分析师在中国航信高科技产业园进行了面向测试度量的数据分析培训课程,培训人数近2 ...
2024-05-01CDA数据分析师走进深圳迈瑞生物医疗电子股份有限公司,在迈瑞总部展开了为期两天的培训,本次课程参训人员线上及线下近百人, ...
2024-05-01CDA数据分析师在合肥市对合肥阳光新能源科技有限公司开展了为期8天的企业内训。 合肥阳光新能源科技 ...
2024-05-01CDA数据分析师走进海尔大学,进行了《数据治理与数据中台建设的道与术》专题培训,培训现场爆满,近百人参加了此次培训。 ...
2024-05-01在中国银行苏州分行培训中心开始数据分析师培训,此次培训课程共10天内容,包括Excel、MySQL、概率论与数理统计、SPSS等内容, ...
2024-05-01从实际的业务需求出发,结合行业的典型应用特点,围绕实际的商业问题,探讨数据挖掘、机器学习模型在金融领域的应用,包括获客、信用评分、细分画像、交叉销售、反欺诈、违规识别、时序预测、运筹优化、流程挖掘九个方面,形成 ...
2024-05-01本次培训课程为线上+线下的模式,由于学员编程能力不一、部分学员没有编程基础,故提供统计学、python基 ...
2024-05-01华夏银行信用卡中心-机器学习培训 1、课程亮点 取材于业界一流企业和顶级咨询公司的行业实践;已经被证明是人人 ...
2024-05-01主 题:数据中台建设及数据分析应用主题分享 1. 数据中台市场洞察 2. 主流数据中台产品比较 3. 某企业数据中 ...
2024-05-01围绕“数据驱动”战略,全力打造我行 300 人数字化人才梯队,着力培养数字化管理人才、大数据专业团队 ...
2024-05-01在当今数据驱动的商业环境中,数据分析成为了企业决策的重要依据。通过对大量数据的收集、处理和分析,企业能够更好地理解市场 ...
2024-04-29在人工智能(AI)的世界里,提示词(Prompt)是一种强大的工具,它能够引导AI按照用户的需求产生特定的输出。本文将深入探讨AI ...
2024-04-29CDA立足未来职场,拓展前沿视野——对外经贸大学保险学院举办“三全育人大讲堂”分享行业最新动态。 ...
2024-04-294月2日,CDA数据分析师创始发起人兼协会理事长赵坚毅博士受邀在浙江万里学院举办了一场以“数字化能力在职场中的作用” ...
2024-04-29随机森林(Random Forests)现在机器学习中比较火的一个算法,是一种基于Bagging的集成学习方法,能够很好地处理分类和回归的问 ...
2022-12-23方差分析是数据分析中常用的一种统计分析方法,接下来让我们简单了解一下方差分析的基本思想和原理吧。 方差分析(Analysis ...
2022-12-23来源:关于数据分析与可视化 关于streamlit-aggrid 数据排序 表格样式的调整 数据 ...
2022-08-03作者:麦叔 定义 「把上面晦涩的概念汇成一句话就是:」 ❝ 回调函数就是一个被作为参 ...
2022-08-03现今,高学历人群日益增多,物以稀为贵的高学历光环淡去。无论本科生还是研究生,甚至博士生,求职竞争力都大不如前,就业压力越来越大。
2022-06-01某家企业10个人面试,有9个本科生……如何脱颖而出,除得体的举止和良好的沟通力外,证书成重要筹码,这也是很多人考证的关键所在。
2022-04-14