京公网安备 11010802034615号
经营许可证编号:京B2-20210330
编译 | Harris来源 | 机房360
如今,大数据越来越重要,因为企业需要处理来自多个来源的不断增长的存储数据。
采用大数据可以称之为一场完美风暴。廉价的存储和大量的结构化和非结构化数据的大量涌入,导致了诸多的大型数据工具得以开发,帮助企业“解锁”他们积累的数据,从客户记录到产品性能的结果等更多的数据。
像传统的商业智能(BI),这些新的大数据工具可以分析过去的趋势,并帮助企业识别重要模式,如特定的销售趋势。许多大数据工具现在提供了一个新一代预测和规范性的见解,以及深埋在企业数据中心的所有数据。
对于人们面临的挑战,调查机构Gartner公司分析师道格·兰尼表示,人们还是不要用扩展的基础设施来处理所有这些数据,而是从各种数据本身进行处理。
“对于真正的挑战,企业对自己和客户的交易数据进行处理、整合,并共同构建和理解输入,加上来自合作伙伴和供应商的数据,还有一些外源性数据,如社会媒体的开放数据和聚合数据等等,而这些只是触及了表面。”兰尼在一封电子邮件中说表示。
大数据是一个大问题:您的网络准备好了吗?
尽管Gartner的客户端通过一个2比1的比例说明各种数据是一个更大的问题,对他们来说数据增长的速度越来越快,而数据处理供应商将会继续提供资金更大、更快的解决方案。
ConstellationResearch公司分析师道格·亨森特表示,大数据解决方案肯定是不断发展变化的。
“在我的书中,2014年是发布SQLHadoop公告的一年,但今年企业和销售商开始认识到大数据的机会不只是扩大传统的BI和数据库。”亨森特说,“因此,ApacheSpark开源框架和其他的分析方案已在2015年超越了SQL。2015年,数百家供应商和大公司开始采用ApacheSpark开源框架,IIBM公司拥抱是倡导其他分析选项最明显的厂商,而其他致力于数据集成和大数据平台的很多企业加入这个行列。”
事实上,大数据浪潮似乎来临,每天都会供应商推出的各种解决方案,其中也包括一些相对全面的设计。尽管很难得到一个全面的名单,这四个工具应该出在用户的应用清单中。
(1)数据科学家的H2O.ai
H2O.ai是初创公司Oxdata在2014年底推出的一个独立开源机器学习平台,主要服务于数据科学家和开发者,为其应用提供快速机器学习引擎。Oxdata公司表示,可以在商用硬件上对任何来源(如Hadoop,SQL)的数据进行处理分析,甚至在上千个网络节点或亚马逊的AWS云运行。个人可以尝试并继续免费使用H2O.ai。Oxdata公司将收取企业用户的费用。
“很多公司使用Spark代替Hadoop短期记忆,这就像大数据的内存一样。”H2O公司市场营销和增长副总裁奥列格·罗格斯科说,“在读取你的短期记忆方面,h20.ai的功能超越了Spark,基本上提供了超快速的分析能力。”
罗格斯科说,H2O.ai是旨在提供预测分析的数据工具的一个新品种。他指出,SQL帮助推动了描述性数据分析的早期阶段或“告诉我发生了什么”,其次是“预测期”的产品,看看发生了什么事,尽量帮助客户预测接下来会发生什么-例如:库存用完或产品突破等。
“我们在未来几年将看到第三个阶段是指令性的阶段发挥作用,这个系统说,‘这是我的教训,我认为未来会发生什么,你应该最大限度地实现目标。’”罗格斯科说,他还指出,谷歌地图的主动建议替代路线的能力就是一个规范性解决方案的例子。
H20.ai将自己定位为各种行业数据科学家使用的一个预测工具和“盒子”。例如,网络巨头思科公司有6万款预测购买决策的模型,该公司使用H2O.ai对这些模型评分。思科公司首席数据科学家表示,“其结果是太棒了,我们看到H2O.ai比我们的同类产品的性能要好3到7倍。在单独建模评分方面,h2o.ai环境是upwards的10到15倍。”
(2)ThoughtSpot3–大数据应用
借助谷歌公司这样的搜索引擎,很容易在网上搜到用户需要的社交数据和网络数据,但企业数据一般难以查找,也更难以利用。为此,7位工程师共同成立了ThoughtSpot公司,目标是开发一个类似于谷歌的搜索引擎,用于查找商业数据。
该公司在谷歌公司成立初期就为其提供硬件设备,在企业启用防火墙后提供超快搜索功能。ThoughtSpot结合了新搜索引擎的应用,它的功能是通过一个快速内存数据库来搜寻海量信息。该公司还计划提供一个基于云的服务。
ThoughtSpot3起始售价为90000美元,是一种为企业快速寻找大数据的数据科学家依赖的工具。“我们已经看到企业使用该产品的数据科学家正在增加。”ThoughtSpot公司营销副总裁史葛霍尔顿说,“二十亿人都在搜索,但在工作中,我们仍然依赖于数据专家。”
霍尔顿在加利福尼亚公司总部PaloAlto进行了一个演示,显示系统使用熟悉的搜索栏界面是如何工作的.刚刚发布的ThoughtSpot3.0具有一些新功能,包括“DataRank”的工作方式,类似于谷歌的PageRank和typeahead。该软件使用机器学习算法建议的关键词为客户搜索,以加快这一进程。
Popcharts无疑是最酷的新功能。当你在搜索框中输入“由东海岸销售......”ThoughtSpot瞬间创建基于查询相关的图表,并利用机器学习给出10多个可以选择的图表。
另一个“即时”功能是AutoJoins,其目的是为一般都有数百个数据源的企业导航。AutoJoins使用ThoughtSpot的数据索引,通过索引模式和机器学习,以了解表格是否相关,并在一秒内呈现研究结果。
霍尔顿说,ThoughtSpot更侧重于对历史数据的传统BI分析(速度超快,使用十分方便),其预测性和规范性分析功能会在未来的软件中体现。
(3)Connotate软件
Connotate公司是一家为美联社、路透社、道琼斯等大型公司对全球上千个网站的非结构化数据进行实时分类和分析的企业。在Web数据抽取和监控上,Connotate软件是世界上最简单、最合算的解决方案,以有效地利用海量数据,从中挖掘出对企业增长有价值的信息,并可以进行高度可扩展性的数据监控和数据收集。
Gartner公司分析师道格·莱尼表示,Connotate和BrightPlanet在他所列的大数据工具名单上,因为它们有助于从企业自身的数据库和互联网上收割和构建丰富多彩的内容。
“随着数字化和经济增长,企业认识到只关注自己的数据不再是万无一失的创新良方,他们越来越多地转向外源数据(即公司外部的数据)。”莱尼说。
Connotate公司表示,其从网页抽取内容的专利技术远远超出了网页抓取或自定义脚本。取而代之的是对于网站工作如何使用机器学习采用一种直观的视觉理解,Connotate公司表示,使其内容提取“准确可靠,并且可扩展。”
据该公司介绍,Connotate平台”可以很容易处理成百上千的网站和百万兆字节。”并提供与业务相关的有针对性的信息。其提供的内容采集平均成本比传统方法少55%。
例举一个使用案例,Connotate帮助销售情报提供者从数千个医院网站提取联系人资料(姓名,职务,电话,电子邮件和隶属关系),并建立一个全国性的医生档案数据库。
Connotate公司表示,其大数据解决方案卖给了几家大型制药公司,并没有花费额外的硬件或IT资源。大数据提取的规模化,甚至可以提供50万名医生的数据。
(4)BrightPlanet工具
BrightPlanet公司也从网络中提取数据,该公司宣称其搜索具有所谓的“深网”见解的能力。其深网可以挖掘那些具有密码保护的网站和通常不会被传统的搜索引擎索引的其他网站的数据。
BrightPlanet公司表示,其收集的数据条目数以百万计,其中包括推特和新闻数据库和医学期刊的数据,并可以根据企业的具体需求和条件进行过滤。
该公司为使用该软件的数据采集工程师提供一个免费的数据即服务(DaaS)咨询,并介绍他们的服务是一个不错的选择。咨询的目的是帮助企业数据中心找到合适的收集数据,并得到正确的格式,这样客户可以得到一个好主意的过程和结果。
最终用户或客户可以选择哪些网站收获的内容。反过来,BrightPlanet公司又将其内容进行充实。例如,像在社交媒体网站评论这样的非结构化数据,通过一个自定义格式设计,使其在更便于使用的客户端提交。
end
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22在数字化运营场景中,用户每一次点击、浏览、交互都构成了行为轨迹,这些轨迹交织成海量的用户行为路径。但并非所有路径都具备业 ...
2026-01-22在数字化时代,企业数据资产的价值持续攀升,数据安全已从“合规底线”升级为“生存红线”。企业数据安全管理方法论以“战略引领 ...
2026-01-22在SQL数据分析与业务查询中,日期数据是高频处理对象——订单创建时间、用户注册日期、数据统计周期等场景,都需对日期进行格式 ...
2026-01-21在实际业务数据分析中,单一数据表往往无法满足需求——用户信息存储在用户表、消费记录在订单表、商品详情在商品表,想要挖掘“ ...
2026-01-21在数字化转型浪潮中,企业数据已从“辅助资源”升级为“核心资产”,而高效的数据管理则是释放数据价值的前提。企业数据管理方法 ...
2026-01-21在数字化商业环境中,数据已成为企业优化运营、抢占市场、规避风险的核心资产。但商业数据分析绝非“堆砌数据、生成报表”的简单 ...
2026-01-20定量报告的核心价值是传递数据洞察,但密密麻麻的表格、复杂的计算公式、晦涩的数值罗列,往往让读者望而却步,导致核心信息被淹 ...
2026-01-20在CDA(Certified Data Analyst)数据分析师的工作场景中,“精准分类与回归预测”是高频核心需求——比如预测用户是否流失、判 ...
2026-01-20在建筑工程造价工作中,清单汇总分类是核心环节之一,尤其是针对楼梯、楼梯间这类包含多个分项工程(如混凝土浇筑、钢筋制作、扶 ...
2026-01-19数据清洗是数据分析的“前置必修课”,其核心目标是剔除无效信息、修正错误数据,让原始数据具备准确性、一致性与可用性。在实际 ...
2026-01-19在CDA(Certified Data Analyst)数据分析师的日常工作中,常面临“无标签高维数据难以归类、群体规律模糊”的痛点——比如海量 ...
2026-01-19在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16