京公网安备 11010802034615号
经营许可证编号:京B2-20210330
打破数据挖掘5神话
数据挖掘是一种强大的分析工具,可以使企业管理人员从描述顾客历史行为开始进一步达到预测顾客未来行为。它可以找出能解释顾客行为的规律。这些数据可以用来增加收入、降低费用、找出商业机会,以增加新的竞争优势。
会有关于数据挖掘的神话产生的部分原因是人们对它没有一个清晰的概念。数据挖掘的本质是一套复杂的数学方法,用来在详细的数据中找出并解释以前未知的规律。数据挖掘解决的是不同类型的问题。它可以用来预测未来的事件,例如在进行市场推广后的下一个月份的销售额。

许多成功的公司已经意识到,围绕着数据挖掘而衍生的神话并非事实。有远见的企业不仅不会成为这些神话的受害者,而且他们会通过使用数据挖掘来解决复杂的企业问题并达到赢利,因此获取了巨大的竞争优势。由此打破了有关数据挖掘的5个神话。
神话一:数据挖掘提供立时可见的预测
数据挖掘既不是占卜用的水晶球,也不是一按按钮答案就会魔术般跑出来的技术。它是一个多步骤过程,包括明确企业问题、研究并整理数据、开发模型、应用获取的知识。一般情况下,各企业都用大部分时间来对数据进行预处理和整理,以保证数据无冗余、无瑕疵、连贯一致及合理组合,以提供可靠的商业情报。数据挖掘的一切都是围绕数据来进行的,成功的数据挖掘需要准确反映企业运营的数据。
各企业必须了解数据挖掘的优势所在,即处理本质上可预测或可描述的具体企业问题。这些问题包括:客户细分、预测顾客购买倾向、查找欺诈、渠道最优化。
神话二:数据挖掘还不适用于商业应用
数据挖掘是一个可行的技术,其商业效果得到了高度评价。关于不适用于商业应用神话的产生归因于那些需要解释他们为什么还没有使用数据挖掘的人,且围绕着两个相关的陈述。第一个是“超大型数据库不能被有效地进行挖掘”。第二个是“数据挖掘在数据仓库引擎中不能进行。”
让我们同时解决这两个陈述的问题。因为现在的数据库非常大,所以许多企业均担心数据挖掘项目所需的额外IT基础设备会增加巨大的成本,而且针对某一项目的数据处理要花过分长的时间。但是目前有些数据库使用平行技术,它可以在数据库内进行挖掘。通过在数据库内进行挖掘,各企业可以不移动数据,利用平行处理,将数据冗余降为最低,避免因建立及维护一套全新的、数据挖掘专用的冗余数据库所带来的成本费用。通过平行处理进行的数据库内挖掘即是可行的数据挖掘技术。
神话三:数据挖掘需要单独的、专用的数据库
数据挖掘供应商一般会宣称,你需要一个昂贵的、专用的数据库、数据集市或分析服务器用于挖掘数据,因为需要将数据拉入一个专属格式以进行高效数据处理。这些数据集市不仅购买及维护的费用昂贵,它们还要求每一个单独的数据挖掘项目都进行数据抽取,这是一个昂贵并费时的过程。
数据库技术的发展使得数据挖掘可以不在单独的数据集市中进行。实际上,有效的数据挖掘需要建立一个企业级数据仓库,其全部成本比采用单独的数据集市的成本要低得多
现在我们来分析一下其中的原因。当在整个企业范围内采用数据挖掘项目时,使用数据挖掘模型的用户持续增加,同时使用大型数据基础设备的需求也在增加。一个尖端的企业级数据仓库不仅高效地储存了所有企业数据,省去了大部分其他数据集市或数据库,它还为数据挖掘项目建立了一个理想的基础。此基础是一个单一的企业范围内的数据存储库,它提供了前后一致的最新的顾客情况。通过将数据挖掘延伸整合到数据仓库,企业还可以在另外两个方面降低成本。首先,无须为数据挖掘购买并进行维护额外的专用硬件设备;其次,因采用数据挖掘技术,企业可将把数据从数据仓库中导出和导入的需求降为最低,而这一过程,像我们介绍的那样,是需要花费大量的人力和资源的。
神话四:只有博士们才会做数据挖掘
一些人认为数据挖掘是非常复杂的,至少需要三个博士才能实施它:一位来自于统计或量化领域;一位在商业领域,他了解顾客;另一位来自于计算机科学。
而实际上,成功的项目里从没有见过一个博士的身影。
数据挖掘是在以下三个领域中通过所有专业员工的合作所达成:商业运营人员提出一套明确的企业问题来引导此项目,然后他们必须解释出现的规律;分析建模人员了解数据挖掘技术、统计学和工具,他必须建立一个可靠的模型;IT人员提供了对处理及对数据理解的洞察力,也提供了关键的技术支持。
神话五:数据挖掘仅为大型公司所用
一个公司,不论大小,只要它能准确地反映其业务或客户的数据,它就可以建立运用这些数据的模型,以提供洞察重要的商业挑战的能力。企业具有的顾客数据量从来不是一个问题。
例如,Midwest Card Services公司(MCS)为20万位顾客提供电话市场推广服务、ATM管理服务、签账卡和专门的金融服务。此公司使用了一个集中式数据库以更加了解其客户群,进行有效的客户细分,并了解他们的规律及偏好。这使得MCS可以改进它自己的保险机制,并为客户提供全面的业务报告。
我们的结论是:数据挖掘不再是运行缓慢、价格昂贵或过于复杂而无法有效运行。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11在CDA(Certified Data Analyst)数据分析师的工作体系中,数据库就像“数据仓库的核心骨架”——所有业务数据的存储、组织与提 ...
2025-12-11在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05在CDA(Certified Data Analyst)数据分析师的能力模型中,“指标计算”是基础技能,而“指标体系搭建”则是区分新手与资深分析 ...
2025-12-05在回归分析的结果解读中,R方(决定系数)是衡量模型拟合效果的核心指标——它代表因变量的变异中能被自变量解释的比例,取值通 ...
2025-12-04在城市规划、物流配送、文旅分析等场景中,经纬度热力图是解读空间数据的核心工具——它能将零散的GPS坐标(如外卖订单地址、景 ...
2025-12-04在CDA(Certified Data Analyst)数据分析师的指标体系中,“通用指标”与“场景指标”并非相互割裂的两个部分,而是支撑业务分 ...
2025-12-04每到“双十一”,电商平台的销售额会迎来爆发式增长;每逢冬季,北方的天然气消耗量会显著上升;每月的10号左右,工资发放会带动 ...
2025-12-03随着数字化转型的深入,企业面临的数据量呈指数级增长——电商的用户行为日志、物联网的传感器数据、社交平台的图文视频等,这些 ...
2025-12-03在CDA(Certified Data Analyst)数据分析师的工作体系中,“指标”是贯穿始终的核心载体——从“销售额环比增长15%”的业务结论 ...
2025-12-03在神经网络训练中,损失函数的数值变化常被视为模型训练效果的“核心仪表盘”——初学者盯着屏幕上不断下降的损失值满心欢喜,却 ...
2025-12-02在CDA(Certified Data Analyst)数据分析师的日常工作中,“用部分数据推断整体情况”是高频需求——从10万条订单样本中判断全 ...
2025-12-02在数据预处理的纲量统一环节,标准化是消除量纲影响的核心手段——它将不同量级的特征(如“用户年龄”“消费金额”)转化为同一 ...
2025-12-02在数据驱动决策成为企业核心竞争力的今天,A/B测试已从“可选优化工具”升级为“必选验证体系”。它通过控制变量法构建“平行实 ...
2025-12-01