京公网安备 11010802034615号
经营许可证编号:京B2-20210330
这10家创业公司将大数据分析推向全新高度
有结构、无结构数据的崛起创造了一个蓬勃发展的市场,其价值预计将在 2018 年达到415亿美元左右。大数据市场的快速增长造就了大量的供应商的出现,他们都希望能从中获利。在众多竞争市场地位的供应商中,有许多旨在帮助组织收集和分析数据的创业公司。CBR(计算机商业评论) 从中选出了10个值得被关注的公司。
1. Confluent
Confluent 公司成立于 2014,已经获得超过 3000 万美元的投资,这些投资来自于 LinkedIn、Index Ventures、Benchmark Capital 和 The Data Collective 等投资者。
该公司由 Apache Kafka 的开发者们创立(Apache Kafka是一个实时通讯和大数据流引擎)。其最初创立于 LinkedIn 内部,而后归入 Apache 软件基金会旗下,最后分离出来作为一个独立的公司。Confluent 本质上是 Apache Kafka 软件的商业提供者和技术支持者。当还在 LinkedIn 的时候,Confluent 已经开始帮助 LinkedIn 全面检测公司里发生的一切,作为一个实时的 Kafka feed,为 Hadoop、Search、Newsfeed 等数据系统填入数据。
Confluent 专注于构建一个数据流平台,从而帮助企业获得实时的企业数据。Confluent 提供的编程语言包括 Java、C 语言和C++,通过其 REST 服务器,可以使用任何网络连接工具来生成信息、实现通讯。
2. H2O.ai
H2O.ai (曾用名 0xdata)公司成立于 2011,已经获得了 3360 万美元的投资,这些投资来自于 Nexus Venture Partners、Paxion Capital Partners 和 Transamerica Ventures 等投资者。
该公司由 Platfora 和 Cliff Click 的联合创始人 SriSatish Ambati 创立,他还是 Java 虚拟机的领头开发者。公司创立之初的想法是,让开发人员和数据学家更简单轻松地应用机器学习算法。
该公司提供一个开源的机器学习平台,其设计是为了在使用 Web UI 或者不同的编程环境(如 R、java、python、Scala 、JSON)的同时,也能使用 Hadoop 和 Spark。该平台支持的数据库和文件类型包括微软 Excel、R Studio、和Tableau。H2O可以帮助开发模型培养机器学习能力,从而可以对数据进行解析、获取和模拟。
最基础的是,该技术有助于快速创建和应用机器学习算法。
3. AtScale
Atscale 成立于 2013,至今已募集了900万美元的投资,这些投资来自于 AME Cloud Ventures、Storm Ventures 和 UMC Capital 等投资者。该公司的想法是使用熟悉的商业智能(BI)工具和界面(如 SQL、Tableau)和 Hadoop这样的技术解决问题,也就是,它们在商业用户、可视化工具和基础 Hadoop 平台间建立桥梁。
其目标是帮助企业对现有数据进行数据分析,而且不需要将数据移入专门的分析工具,因为移入专门的分析工具有时间和金钱成本。
Atscale 由 Hadoop 和 BI 的前员工创立,他们具备把 Hadoop 集群转变成规模化 OLAP 服务器的能力。另外,Atscale 支持 BI 工具,可以和 SQL 或 MDX 进行信息交流。
4. Interana
把提供事件数据的行为分析作为自己招牌的 Interana 公司帮助企业做数据主导的决策。该公司成立于 2013 年,由首席执行官 Ann Johnson 和首席技术官 Bobby Johnson 联合创办,目前完成了 2820 万美元的融资,其中在由 Index Ventures 领投的 B 轮融资中获得了 2000 万美元。
Interana 专注于提供互动分析,帮助企业了解他们客户的行为和产品使用情况。该公司使用一个专有的数据库,能让它快速处理数十亿的事件。例如像 Tinder 这样的公司用它来进行网络连接故障检修,测量社交媒体的有效性,以及监测用户的刷机方式。Tinder 在全公司广泛使用 Interana,从而改善自己的服务和操作。
5. Tamr
Tamr 结合了机器学习软件和数据科学。该公司由 Andy Palmer、Mike Stonebrake 等人共同创立,他们都是数据研发的老兵。
Tamr 使用一个可扩展的数据统一平台,通过机器学习和人工输入的方式,帮助客户使用被孤立在不同的数据库、电子表格、记录数据、和合作伙伴资源里的数据。
Tamr 一种获得 4240 万美元融资,其中在最近的 B 轮融资中得到 2520 万美元。主要投资者包括 Hewlett-Packard Ventures、Thomson Reuters 和 MassMutual Ventures。简单来说,Tamr 是一个数据清理的创业公司,旨在清理来自不同资源的数据,从而让数据更容易被使用。
6. Wavefront
Wavefront 成立于 2013 年,总部设在加利福尼亚的帕洛奥图,至今已获得 2050 万美元投资,这些投资来自于 Sequoia Capital、Sutter Hill Ventures 和 Webb Investment Network 等投资者。
该公司提供一个实时的分析平台,可以把一个 IT 公司所有系统中的数据抽离出来,通过识别和诊断以预防崩溃。Wavefront 使用了一种查询语言,从而可以对时间序列数据进行处理,它也允许用户通过下拉菜单、过滤器和自动生成表格来手工查询。该技术最初是在 Google 和 Twitter 内部开发,现在正在被 Box、First Data 和 Workday 等公司使用。
7. BlueTalon
BlueTalon 是另一家成立于 2013、总部在加利福尼亚的公司,只不过它位于 Redwood。该公司至今已筹集了 1140 万美元的投资,这些投资来自于 Data Collective、Signia、Venture Partners 和 Bloomberg Data 等投资者。
BlueTalon 为大数据提供数据中心安全保障,例如 Hadoop、SQL,它主要是对 Hadoop 分布式文件系统使用访问控制和动态掩蔽实现这一点的。
除了在 Hadoop 上有效,它也能在微软 Azure 和亚马逊网络服务上工作。据 BlueTalon 所言,它允许用户自定义数据配置设定,这意味着企业用户和开发人员可以只访问他们所需要的数据。该公司还提供审核服务,让用户知道什么人在什么时候,因为什么原因访问了什么数据。
8. Cazena
Cazena 虽然只是成立于 2014,但已经从诸如 North Bridge Venture Partners、Growth Equity、Andreessen Horowitz 和 Formation 8 等投资那里筹集了 2800 万美元。在 2015 七月重新回归之后,Cazena 带来了一项叫做 Big Data-as-a-Service 的大数据服务。据该公司表示,将大数据处理转移到云端的过程只需要轻轻点击三次。
该公司专注于通过 Data-As-A-Service 大数据服务实现在加密的云端进行大数据处理。它的产品分为 Data Lake、Data Mart 和 Sandbox 三个版本。
为了智能工作,该公司供应和优化了云端基础设施,其中也包含 Hadoop、Spark、MPP SQL、Search 这样的数据技术。
另外,Cazena 提供端到端的数据加密技术,企业掌控着静态和动态秘钥。
9. DataTorrent
DataTorrent 成立于 2012 年,是这 10 家公司中的老创业公司之一。到目前为止它已募集到 2380 万美元,其中包括由 Singtel Innov8 领投的1500 万美元的 B 轮融资 。
该公司专注于实时大数据分析技术,其技术基础是一个开源的数据流和处理引擎,该公司表示此引擎在 Hadoop 集群中,每秒可以处理数十亿的事件。
DataTorrent 支持摄入的数据来源有 Kafka、AWS S3n、HDFS、NFS、JMS等等。
DataTorrent RTS Core 是一个开源的企业级统一的数据流和批量处理引擎。它提供了一整套系统服务,可以帮助开发人员专注于 Business Logic。该公司还提供一个完整的 Hadoop 集成应用的管理控制台,为熄灯管理提供图形界面。
10. Databricks
Apache Spark 这项技术如今已经在数据分析界非常流行。而这家公司正是由 Apache Spark 的开发者们在加州大学伯克利分校的 AMPLab 实验室创立。Databricks 是 Spark 的商业服务和支持提供商。
这几位开发者想要借助 Spark 在整个社区和众多厂商(IBM)那里的影响成立 Databricks 。 Databricks 本身也为交互分析、可视化、管理数据,以及协作与集成提供工具。
在 2013 年成立后,它开始用 Spark 帮助客户进行基于云端的大数据处理。Databricks 已经在两轮融资里筹集到 4700 万美元,其中 2014 年 6 月 B 轮融资获得 3300 万美元。
该公司与 Spark 的发展紧密联系在一起,而在最近也公布了三个特征变化。其中一个是开始执行 Tungsten 项目的下一阶段从而加速 Spark,他们是通过解决 Java 的记忆处理限制、改善实时数据流系统、将其使用的多种数据结构 API 整合为一个 API 实现加速目的的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21一、活动介绍 2026暑期CDA备考冲刺季,为想利用假期拿证的你量身打造。考点胶囊内容搭配多重硬核福利,让你在旅行、实习、居家 ...
2026-07-21金融行业的运营风险贯穿业务全流程,涵盖交易欺诈、操作违规、流程漏洞、合规偏差、客户信用异常等多元场景,是银行、保险、证券 ...
2026-07-17财产保险作为金融行业的核心板块,涵盖车险、家财险、责任险、企财险等多元品类,是个人与企业抵御财产风险、经营风险的重要保障 ...
2026-07-17 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-07-17【核心关键词】模块、餐饮、客户、门店、企业、订单、供应链、多样化、产品、生产计划、数据分析、生产管理、物料管理、业务分 ...
2026-07-16在数字化分析时代,原始数据本身不具备业务价值,只有通过科学的统计学方法加工、拆解、验证与解读,才能挖掘数据背后的规律、差 ...
2026-07-16 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-07-16在描述性统计分析、数据预处理、异常值排查与多组数据分布对比工作中,箱线图(Box Plot)是应用最广泛的可视化与统计工具之一。 ...
2026-07-15在企业数据存储、业务统计与数据分析工作中,绝大多数业务数据都带有时间维度属性,例如订单创建时间、用户注册时间、支付完成时 ...
2026-07-15 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-07-15【核心关键词】产品、经营、客户、调研、销售额、宏观、会计行业、客户满意度、发展趋势、经营状况、数据分析、竞争对手、数据 ...
2026-07-14问卷调查是市场调研、用户研究、社会调研与产品分析的核心数据采集方式。问卷数据大多以分类数据为主,例如用户性别、年龄分层、 ...
2026-07-14 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-07-14在数据分析、业务效果验证、AB实验扩展、行业对比等场景中,我们经常需要对比三组及以上样本的均值差异,例如不同区域的客单价对 ...
2026-07-13在互联网产品运营、用户生命周期管理与商业化数据分析中,留存指标是判断产品价值、用户满意度与商业模式健康度的核心基准。常规 ...
2026-07-13