
大数据与IT基础架构
有研究表明:人类70%的活动都是有规律可循的。大数据,可以让我们看到这种规律并预知未来,例如通过整理近期的气象情况和卫星云图,我们能够判断未来几天的天气状况。去年,央视两次携手百度分别打造“据说春运”与“据说春节”特别节目——“据说春运”携手百度地图,用大数据展现春节前后人口大迁徙的轨迹与特征;“据说春节”运用百度大数据来述说回娘家、恐婚族等春节长假期间的热门话题。可见,通过解读数据可以发现有趣的现象、挖掘以往被忽视的规律,还可以对人类的行为进行预测。
事实上,数据分析的案例自古有之,在前几年也有很多数据挖掘技术和应用的出现。但这些数据挖掘技术对数据的使用,都是先抽样、萃取人们或系统认为有价值的数据,再分析、挖掘,而并不是使用全部数据。原因很简单——信息的收集、存储和信息分析的系统构建、维护成本过于巨大,所以人们总是习惯在信息收集的过程中,把有关联的少部分精确数据留下。
以人们的日常购买行为为例,传统超市会通过对“时间、产品销售量/销售额”这几个指标的分析,判断近期哪些货品是热销产品,在短期更受用户的欢迎,进而对热销货品提供充足的货源保障,把热销货品放在超市最容易接触的位置,提供某些促销优惠等等。
再看另一个来自美国的零售商塔吉特的案例,它使用大数据进行“怀孕趋势分析”。通过对大量消费记录的分析,塔吉特公司注意到,准妈妈很可能在怀孕第三个月的时候购买某种乳液,并陆续购买营养品(如钙、镁、锌等)。塔吉特公司找到了几十种关联物,通过这些关联关系,预判客户是否怀孕以及预产期的大概日期。在客户怀孕的不同阶段,该公司会向客户推销相应的产品或优惠券。
前两个案例,分别是典型的“小数据”分析和“大数据”分析。大数据不仅是数据量大,同时数据种类多;不是数据的抽样,而是数据的全集;不是与目标有因果关系的数据,而是所有有关联的数据。与传统的数据分析相比,大数据可以被用来开发新产品和新型服务,其价值越来越受到关注。
为什么在几年前,没有人收集和利用全部的数据,再进行大数据分析呢?除了成本上的考虑,还存在另一个问题:传统上,人们是基于单一“业务”去构建系统,而不是基于“数据”去构建系统。例如,某超市要建设一个CRM系统,IT部门会基于“客户管理”这个业务采购软硬件,所有建设都围绕“客户管理”,很少考虑开放、兼容等特性;如果想再上一套“行为分析”系统,则围绕“行为分析”这个业务去采购软、硬件。当需要把两个系统的数据进行统一分析时,由于两套系统不兼容,需要中间件来转接、编译,因此两套系统各自要进行二次开发以实现兼容,使得操作难度变高,造成有价值的“数据”被困在了“系统”这个孤岛里。因此在规划初期,就应充分考虑到数据的流动性、系统的兼容性,考虑到数据将会被各种系统多次使用的情况。
也许有人会说:这样的系统规划会非常复杂,构建成本太高,很难把系统的模型和方案想清楚。我们再来看看互联网公司。大型互联网公司这几年在构建IT系统时,都会采用标准架构:如X86服务器、标准化的网络协议、开源的数据库、分布式存储等等。因为只有这样,才能够通过统一的硬件和软件平台来承载各种各样的业务。比如微信、QQ、游戏、视频等业务都是承载在同一个平台上,所有数据的流动在基础设施这个维度里都是自由的。所以我们看到如腾讯、阿里巴巴等互联网公司上线新业务的速度非常快,而且能够根据用户各种网络行为,判断互联网用户感兴趣的“热点”,在某项业务上再叠加新服务。这就是大数据的典型应用。
在构建了标准的硬件、软件基础设施之后,业务可以被逐步规划,分阶段上线,但是所有的业务架构、程序接口,都应按照标准基础设施的统一要求进行设计开发。大数据本身是“业务”,需要建设者用更多的时间去摸索业务模型,在实践中完善新技术,把现有的封闭的系统逐步改良为开放的标准化架构。
从IT的发展趋势看,大数据时代是在云计算建设成熟之后到来的,大多数互联网公司的建设历程也遵循了这种规律。云计算将带来标准、统一的IT架构,消除割裂和信息孤岛,并且简化大规模IT部署和运维的复杂程度,而这些都是大数据分析系统建设的前提。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22在企业数据分析中,“数据孤岛” 是制约分析深度的核心瓶颈 —— 用户数据散落在注册系统、APP 日志、客服记录中,订单数据分散 ...
2025-10-22在神经网络设计中,“隐藏层个数” 是决定模型能力的关键参数 —— 太少会导致 “欠拟合”(模型无法捕捉复杂数据规律,如用单隐 ...
2025-10-21在特征工程流程中,“单变量筛选” 是承上启下的关键步骤 —— 它通过分析单个特征与目标变量的关联强度,剔除无意义、冗余的特 ...
2025-10-21在数据分析全流程中,“数据读取” 常被误解为 “简单的文件打开”—— 双击 Excel、执行基础 SQL 查询即可完成。但对 CDA(Cert ...
2025-10-21在实际业务数据分析中,我们遇到的大多数数据并非理想的正态分布 —— 电商平台的用户消费金额(少数用户单次消费上万元,多数集 ...
2025-10-20在数字化交互中,用户的每一次操作 —— 从电商平台的 “浏览商品→加入购物车→查看评价→放弃下单”,到内容 APP 的 “点击短 ...
2025-10-20在数据分析的全流程中,“数据采集” 是最基础也最关键的环节 —— 如同烹饪前需备好新鲜食材,若采集的数据不完整、不准确或不 ...
2025-10-20在数据成为新时代“石油”的今天,几乎每个职场人都在焦虑: “为什么别人能用数据驱动决策、升职加薪,而我面对Excel表格却无从 ...
2025-10-18数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16在机器学习建模中,“参数” 是决定模型效果的关键变量 —— 无论是线性回归的系数、随机森林的树深度,还是神经网络的权重,这 ...
2025-10-16在数字化浪潮中,“数据” 已从 “辅助决策的工具” 升级为 “驱动业务的核心资产”—— 电商平台靠用户行为数据优化推荐算法, ...
2025-10-16在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15