京公网安备 11010802034615号
经营许可证编号:京B2-20210330
小公司如何应对大数据
“大数据”已经成为互联网上最热门的概念之一,我看到许多创业者都开始谈论大数据的商用价值,创业项目一定得和“大数据”挂钩,有些人更是把《大数据时代》一书奉为圣经,仿佛只要买一本祭在家里的某个角落,自己就有资格高谈论阔、指点江山了。但实际上,虽然书中洞见了数据分析的趋势和隐忧,可由于作者Viktor
Mayer Sch nberger是一个典型的学术派,并没有什么值得称耀的实践经验,导致此书缺乏落地感,大数据商业应用在没有可靠技术支撑的状况下也只能是一纸空谈。
不可否认的是,“大数据”确实拥有十分重要的价值,如今从传统行业到互联网行业的很多产品也需要依靠“大数据”来作为功能支撑和核心竞争力,借用阿里巴巴数据平台与产品部数据仓库架构师占超群(花名离哲)的概括,目前阶段,大数据解决的主要问题分为3类:
小公司如何应对大数据
1. 拓展传统的商业智能(BI)领域。以前针对大数据量的统计、关联分析、趋势预测由抽样变成全量分析、将数据回流到各种报表。
2. 业务流程改。对各种数据进行聚合分析,用来做业务流程改进和考核的依据。
3. 数据商品和商业应用。通过对已有数据或数据处理能力进行服务化或产品化包装,形成数据产品或数据服务。
其中,我们在互联网行业最常见的就是通过已有的数据来形成数据产品和数据服务,最典型的应用场景就是“个性化推荐”,但这并非是人人都可以染指的概念——我们知道,行业内依靠四个特征界定“大数据”:
第一,Volume,体量巨大,PB级别;
第二,Variety,数据类型繁多;
第三,Veracity,价值密度低;
第四,Velocity,处理速度快。简而言之,需要从不同维度抓取海量数据并将其快速转变为有序的可用信息。
实际上,在中国互联网,完全具备以上四点特征也只有腾讯、阿里巴巴、百度等较大型公司,对于一般公司而言,根本就不可能拥有PB级别的数据,也无法支撑高昂的数据存储成本,而且大数据方面的技术人才十分稀缺。最近就有不少创业团队告诉我他们产品的愿景,很多想法都十分新颖,但迫于数据处理能力,只好选择“慢慢来”或者将产品功能阉割。那么,这类公司该如何在“大数据”浪潮中崛起呢?
我首先想到的就是利用第三方的数据处理服务平台,这是一项在海外已经比较成熟的业务,从字面不难理解,这些公司为那些没有大数据和大数据处理能力的公司提供“数据”或“服务”。
服务可以分为两大类:基础服务和个性化服务。
基础服务即帮助公司解决数据存储、框架搭建和管理等大数据处理的基础能力,这类公司的代表有Hadoop(分布式软件框架)管理软件与服务提供商Cloudera、非关系型数据库MongoDB开发商 10gen等。
另一类则直接帮助企业直接打造个性化解决方案,我认为这类公司更适合大部分从整体上就缺乏数据能力的中国的小型互联网公司和希望互联网化的传统企业,譬如帮助电商提供个性化网上购物体验的RichRelevance、个性化和数字市场营销优化服务提供商Baynote、为广告商提供数据和分析的eXelate,以及数据拍卖平台BlueKai等。在国内,也有一些不错的平台开始涌现,例如个性化推荐引擎服务商百分点。利用这些第三方的服务和数据,可以让小公司的产品也兼具优秀的个性化能力,融入大数据时代。
但我认为,还有另一种应对大数据浪潮的做法——逆势而为。我并不认为大数据是解决个性化的唯一方案,同是它还带有相当强的局限性——基于数据意为着用数据建立模型,从某种意义上说,它也像是一个牢笼:设想一下,如果你所有的信息全部来自个性化推荐,那么你很可能错失那些你从未接触过的全新领域,而这些开放的、全新的信息不正是互联网最迷人之处么?
事实上,已经有些产品这么做了,唐茶计划的李如一就曾表示,不会受数据干扰去决定出售/推荐哪一本电子书,而是完全基于他们的个人对内容的判断,还有进来比较受关注的电台Fuzz,完全由人工DJ来推送音乐。反过来想,如果同一类型的产品都具有精准的大数据处理能力,那么它们为用户提供的内容也很可能是千篇一律的,而这些逆势而为的产品,反而更像是真正的“个性化”服务。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10