京公网安备 11010802034615号
经营许可证编号:京B2-20210330
汽车大数据应用的6个前提
最近博鳌的论坛上,各路大神在神侃人工智能是否会消灭人类的伦理问题,最讨厌一帮文科二货在台上扯淡人类技术末日,因为无论这个伦理问题多么严重,最终解决问题还得靠理工男女的技术头脑。制造AI的恐慌是没有意义的,了解AI是什么比想象它的恐怖有趣得多。
在当前这帮文科二货们的蛊惑下,大数据和人工智能越来越热,汽车这个垂直应用领域更是热得一塌糊涂。从大数据技术的基本应用场景看,汽车和车险的销售广告显然是典型的应用场景,近年来,汽车金融的应用场景也渐渐丰富起来,至于自动驾驶,那已经是资本宠儿。我认为汽车大数据最可能率先发挥价值的一是汽车和车险广告,二是金融和车险的风险控制,三是自动驾驶,其他领域的应用即使有,也商业价值有限。
但目前来看,绝大多数自称汽车大数据的公司本质上都是卖数据的公司,我们耳熟能详的那些大数据公司,干的基本上就是倒卖官方还没有合法公开的个人数据,未经用户同意倒卖用户隐私数据的勾当。倒卖数据是当前到处吹牛的汽车大数据公司典型业务。真正运用算法和模型解决行业问题的公司都还在埋头苦干,都在积累应用案例,短期恐怕难以盈利。对投资人和创业者而言,我认为看清楚汽车大数据的应用方向非常重要。
要应用汽车大数据,首先得解决数据处理的问题。从汽车数据处理技术的角度看,大约有6个层次。我认为这是实现汽车大数据应用的6个前提。
一是数据接口化,这个层次的问题不解决,大数据技术根本就没有用武之地。搞不定接口,只是拿个移动硬盘拷死数据的,就别凑大数据的热闹了。比如汽车违章数据对于用户个人征信有价值,弄个爬虫去偷数据的就别琢磨大数据应用了,数据源都不稳定,相当于工厂的原材料都不稳定,你还怎么搞生产,怎么考虑产品质量呢?
二是结构化,数据采集的接口问题解决了,需要解决数据存储问题。传统的数据库采用SQL存储结构化数据,但如果要用大数据技术,图片、甚至视频等非结构化数据也需要存储,虽然有NoSQL产品解决这类数据寸纯问题,但最终应用仍然需要把非结构化数据结构化。
三是标准化,结构化存储的数据来源广泛,比如同样是车辆的保单数据,不同保险公司的保单数据标准不同,在应用前必须把不同保险公司的保单数据标准化。同样,汽车违章查询的数据、汽车贷款的数据,都需要按照统一的标准进行规范,这样可以用一把尺子度量不同来源的汽车数据。通常,绝大多数吹牛自己是大数据公司的,基本工作就是做到了这一步,也就是把来自各种途径的数据进行了标准化,能够用Excel表格输出数据,可以卖了!
四是因子化,完成了标准化,这时的数据库才能采用大数据技术进行有目的的挖掘。要开展数据挖掘,首先第一步得解决标准化数据的因子化。比如车主性别,有男,有女,有不确定。计算机因子化处理这个问题的时候就会把男定义为1,女定义为0,不确定性别定义为2。性别的因子化相对简单,再比如违章数据,究竟违章多少次,何种违章才应该被判定为高风险呢?要因子化处理,我们就得定义规则,比如非扣分的违章0-3次风险因子是1,4-6次风险因子是2,7次以上风险因子是3……诸如此类的数据因子化处理,才能进入数据建模。
五是模型化,很多吹牛搞汽车大数据的,动辄就吹牛要搞数据模型,其实绝大多数人连前面四个数据处理过程都干不了。极少数搞定前四个步骤的公司会雇佣数据建模师,围绕特定的问题,建立数据模型。这个过程一定程度上并不是科学,更多的像是艺术工作。因为不存在绝对的解,建模师的工作就是要用想象力,尽可能建立一个能够模拟现实世界运行的数据模型。先有一个假设,然后用现实世界的数据去测试这个假设,如果错了,反馈参数去修订这个模型,再用真实数据测试,直到结果能够很好的模拟真实世界……这个过程就是机器学习的数据训练。由于每个行业、每个行业的细分领域、每个细分领域的不同公司都在经营不同的生意,同样是车险保单,不同保险公司的用户偏好是不同的,同一个模型是不可能适应所有保险公司,每一家保险公司如果要应用大数据和人工智能技术,都必须个性化训练,一旦某一家率先建立自己的机器人,其在行业里的效率提升将大幅领先于没有人工智能机器人的公司——对汽车保险、金融、二手车、后市场等领域来说,谁先用人工智能武装自己,谁将与竞争对手真正拉开差距。
六是产品化,有了模型并不是万事大吉,模型必须应用于某个生产场景才能创造价值。比如在汽车广告领域,区分潜在用户销售线索优劣的模型就非常有用。目前每年车企投放大量广告获得几十倍上百倍实际销售量的销售线索,目前不加区分进行电话轰炸的方式效率非常低,成本也非常高。建立销售线索鱼成交结果的数据模型之后,必须为车企提供一个应用生产环境,帮助4S店销售人员准确把握每一个销售线索的价值,把有限的时间和资源,放在最可能成交的那些潜在用户身上。也就是说,必须把模型封装在一个Saas系统里,大数据技术才能真正落地应用。
我知道这篇文章对大多数人而言过于专业,但真要应用大数据、机器学习和人工智能解决汽车行业的问题,这篇只能算是扫盲。写出这些扫盲文章的目的无他,我只是想治愈那些AI恐惧症患者。美国人可能有必要担心这些问题,因为在发达国家,数据的接口化和标准化工作已经在几十年前完成,而我们中国远远没有恐惧AI的必要,各种数据连接口化的工作都无法完成,你想训练一个AI出来,谈何容易——各位吹大数据牛的公司,卖数据的生意前景不错,6月1日网络安全法出台前可以继续得瑟,之后就自求多福吧!
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在互联网产品运营、用户增长的实战场景中,很多从业者都会陷入一个误区:盲目投入资源做推广、拉新,却忽视了“拉新后的用户激活 ...
2026-02-06在机器学习建模过程中,特征选择是决定模型性能的关键环节——面对动辄几十、上百个特征的数据(如用户画像的几十项维度、企业经 ...
2026-02-06在CDA(Certified Data Analyst)数据分析师的日常实操中,表格结构数据是贯穿全流程的核心载体,而对表格数据类型的精准识别、 ...
2026-02-06在日常办公数据分析中,我们经常会面对杂乱无章的批量数据——比如员工月度绩效、产品销售数据、客户消费金额、月度运营指标等。 ...
2026-02-05在分类模型(如风控反欺诈、医疗疾病诊断、客户流失预警)的实操落地中,ROC曲线是评估模型区分能力的核心工具,而阈值则是连接 ...
2026-02-05对CDA(Certified Data Analyst)数据分析师而言,数据分析的价值不仅在于挖掘数据背后的规律与洞察,更在于通过专业的报告呈现 ...
2026-02-05在数据分析实战中,我们经常会遇到“多指标冗余”的问题——比如分析企业经营状况时,需同时关注营收、利润、负债率、周转率等十 ...
2026-02-04在数据分析场景中,基准比是衡量指标表现、评估业务成效、对比个体/群体差异的核心工具,广泛应用于绩效评估、业务监控、竞品对 ...
2026-02-04业务数据分析是企业日常运营的核心支撑,其核心价值在于将零散的业务数据转化为可落地的业务洞察,破解运营痛点、优化业务流程、 ...
2026-02-04在信贷业务中,违约率是衡量信贷资产质量、把控信用风险、制定风控策略的核心指标,其统计分布特征直接决定了风险定价的合理性、 ...
2026-02-03在数字化业务迭代中,AB测试已成为验证产品优化、策略调整、运营活动效果的核心工具。但多数业务场景中,单纯的“AB组差异对比” ...
2026-02-03企业战略决策的科学性,决定了其长远发展的格局与竞争力。战略分析方法作为一套系统化、专业化的思维工具,为企业研判行业趋势、 ...
2026-02-03在统计调查与数据分析中,抽样方法分为简单随机抽样与复杂抽样两大类。简单随机抽样因样本均匀、计算简便,是基础的抽样方式,但 ...
2026-02-02在数据驱动企业发展的今天,“数据分析”已成为企业经营决策的核心支撑,但实践中,战略数据分析与业务数据分析两个概念常被混淆 ...
2026-02-02在数据驱动企业发展的今天,“数据分析”已成为企业经营决策的核心支撑,但实践中,战略数据分析与业务数据分析两个概念常被混淆 ...
2026-02-02B+树作为数据库索引的核心数据结构,其高效的查询、插入、删除性能,离不开节点间指针的合理设计。在日常学习和数据库开发中,很 ...
2026-01-30在数据库开发中,UUID(通用唯一识别码)是生成唯一主键、唯一标识的常用方式,其标准格式包含4个短横线(如550e8400-e29b-41d4- ...
2026-01-30商业数据分析的价值落地,离不开标准化、系统化的总体流程作为支撑;而CDA(Certified Data Analyst)数据分析师,作为经过系统 ...
2026-01-30在数据分析、质量控制、科研实验等场景中,数据波动性(离散程度)的精准衡量是判断数据可靠性、稳定性的核心环节。标准差(Stan ...
2026-01-29在数据分析、质量检测、科研实验等领域,判断数据间是否存在本质差异是核心需求,而t检验、F检验是实现这一目标的经典统计方法。 ...
2026-01-29