京公网安备 11010802034615号
经营许可证编号:京B2-20210330
健康云上如何进行大数据的挖掘与分析(三)
三、健康云上的大数据分析
由于医疗数据的一些特有的性质,给健康云上的大数据分析带来了特殊的挑战。
1、 医疗数据是持续、大量增长的大数据。根据估算,中国一个中等城市(一千万人口)50年所积累的医疗数据量就会达到10PB级。并且,随着时间的推移和业务系统的不断升级换代,医疗数据模式的一致性也无法保证。因此,每天都会有大量的数据持续不断的导入区域医疗数据中心,并且每当有数据模式的更改,相关的历史数据也需要做相应的调整。所以,区域医疗数据中心并不是简单的传统数据仓库概念。相比之下,它的模式更灵活、写入和更新的操作更多,而对数据存储的水平可扩展性的要求也更高。
2、 医疗数据是关系复杂的多维数据。由于医疗数据是多种数据源数据的汇总,数据之间的关系非常复杂。比如:一个简单的实验室检验检测值,必须同时记录这个值对应的编码系统和编码、单位、检测时间、检验项目、标本编码,以及相关联的患者主索引号、就诊机构、申请科室、申请医师标识号、报告医师标识号、审核医师标识号、正常值参考等等。一条检测记录就可以把患者、医生、医疗机构多个实体在不同层次上关联起来。而不同的医疗信息服务更需要从不同的视角来观察这些数据,如下图所示。比如:以患者为中心的服务需要把一个患者的全周期数据按照时间轴排列,并分析诊断、用药和患者生命体征、检验检测值之间的关联;以医生为中心的服务又需要把与一个医生相关的患者数据挑拣出来,并进行分类;以科室为中心的服务可能需要即从科室所属医生的角度,又要从在该科室就诊患者的角度进行分析;针对社区的服务可能需要统计整个社区居民某项指标(比如血压、血糖)的达标率。总之,医疗数据的多维度多粒度为各种信息服务的多角度多层次分析提供了可能,但同时也为大数据分析带来了挑战。因为我们不可能为每一种信息服务存储一份特定的优化模式的数据,况且我们也无法枚举出所有可能的信息服务需求。这就需要医疗数据的存储模型能够适应灵活多变的多维统计分析需求。
3、 医疗数据是具有语义的数据。大家可能听说过语义网(Semantic Web),它是为让数据能跨应用进行共享和重用所设计的框架体系。我们可以把语义网简单地理解为:一个让机器(machines)读懂的维基百科(Wikipedia),主要包括了各种条目的定义以及各个条目之间的关系。如果数据也采用这些条目和关系组织内容,那么机器就可以自动理解数据的语义,并推理出各种知识。所以建立语义网的关键就是如何制作一本百科全书(有个专有名词叫Ontology)。由于医学是一门非常严谨的科学,其在全球的标准化水平很高,对疾病名称、药物成分、临床特征、仪器设备等都有严格的定义以及关联描述。所以,语义网在医学领域得到了广泛应用。进而,医疗数据也越来越多的采用基于语义网的临床文档框架(CDA)格式的XML文档来保存。这些XML文档通过Ontology的解释,就变成了一个无比巨大的概念+事实+关系的网络。虽然机器能够读懂这个网络,并能够在上面进行逻辑推理,从而发现知识,但是其计算代价也是相当高的。当前的医疗系统通常会把复杂的临床文档解析成简单的属性值,并存入自定义的关系表中。这样做虽然会有大量的语义及关系的丢失,但却能够满足日常业务系统对数据处理性能的要求。但是对于未来的区域医疗信息系统来说,为了能够提供丰富全面的信息服务,我们必须尽可能的保留临床文档中的语义信息。这样,医疗数据分析的过程中就不可避免的需要对大量XML文档进行解析、对各种关系进行推理。这样的数据分析处理过程比我们之前提到的互联网数据处理要复杂得多。
通过上述的分析可见,简单地将现有的大数据分析技术套用在健康云服务上是行不通的。我们需要充分考虑健康云服务的特点和充分利用现有技术框架的灵活性,已达到最好的大数据分析性能。EMC中国研究院大数据实验室正在涉足于健康云领域的大数据分析技术。根据我们已掌握的技术,我们提出了如下的初步解决方案:
1. 基于Hadoop生态系统构建健康云数据中心,用以解决数据存储水平扩展的挑战。利用MapReduce并行处理批量事务的能力,从多个数据源(主要是医疗机构的各个业务系统)抽取数据、转换格式、并导入基于HBase的数据存储模型。
2. 在数据存储模型的设计上,我们将充分借鉴已有的数据仓库中多维数据模型的设计思想,比如:星型模式和数据立方体的概念。在考虑应用需求的基础上,利用HBase中行键、列键、列族设计的灵活性,将多维医疗数据有效地组织在一起。而在索引技术上,我们会结合RDBMS领域的成熟技术,用以进一步提高HBase的查询性能。对于数据模式的更新,HBase特有的多版本共存的特性正好成了解决问题的关键。
3. 为了保留医疗数据中大量的语义关系,我们将采用结构化数据+XML文档混合存储的方式。在数据导入的同时,提取XML文档中特定的元数据,(比如:患者主索引、就诊科室、主治医师等),并将XML文档根据不同粒度打散成大小不一的子文档。根据不同粒度的查询条件,系统将自动选择相应的子文档进行进一步信息的解析,从而避免为提取少量信息而不得不解析大量XML文档的问题。
4. 数据模型的接口将采用Hive提供的类SQL查询的方式。这样更有利于数据分析人员设计分析算法。同时,我们的系统中将嵌入多种数据挖掘算法供数据分析师使用。
综上所述,为解决健康云上的大数据分析问题,我们必须同时利用RDBMS和NoSQL的优势,并且采用结构化和非结构化数据混合存储的形式,相互弥补缺陷,已达到最灵活和最高效的设计。而这套基于健康云的大数据分析平台,也将有希望扩展到其他类似行业,比如:电信、能源、物联网和公共事业等。
总结
在我国,健康云的发展才是刚刚起步。我们相信,在不久的将来,我国的区域医疗解决方案市场将会有突飞猛进的发展,文中提到的医疗信息服务将会真正的走入我们的日常生活。为此,EMC中国研究院已经走在了技术发展的前列,旨在为健康云的实现提供先进的技术支持。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据仓库与数据分析体系中,维度表与事实表是构建结构化数据模型的核心组件,二者如同“骨架”与“血肉”,协同支撑起各类业务 ...
2026-01-16在游戏行业“存量竞争”的当下,玩家留存率直接决定游戏的生命周期与商业价值。一款游戏即便拥有出色的画面与玩法,若无法精准识 ...
2026-01-16为配合CDA考试中心的 2025 版 CDA Level III 认证新大纲落地,CDA 网校正式推出新大纲更新后的第一套官方模拟题。该模拟题严格遵 ...
2026-01-16在数据驱动决策的时代,数据分析已成为企业运营、产品优化、业务增长的核心工具。但实际工作中,很多数据分析项目看似流程完整, ...
2026-01-15在CDA(Certified Data Analyst)数据分析师的日常工作中,“高维数据处理”是高频痛点——比如用户画像包含“浏览次数、停留时 ...
2026-01-15在教育测量与评价领域,百分制考试成绩的分布规律是评估教学效果、优化命题设计的核心依据,而正态分布则是其中最具代表性的分布 ...
2026-01-15在用户从“接触产品”到“完成核心目标”的全链路中,流失是必然存在的——电商用户可能“浏览商品却未下单”,APP新用户可能“ ...
2026-01-14在产品增长的核心指标体系中,次日留存率是当之无愧的“入门级关键指标”——它直接反映用户对产品的首次体验反馈,是判断产品是 ...
2026-01-14在CDA(Certified Data Analyst)数据分析师的业务实操中,“分类预测”是高频核心需求——比如“预测用户是否会购买商品”“判 ...
2026-01-14在数字化时代,用户的每一次操作——无论是电商平台的“浏览-加购-下单”、APP的“登录-点击-留存”,还是金融产品的“注册-实名 ...
2026-01-13在数据驱动决策的时代,“数据质量决定分析价值”已成为行业共识。数据库、日志系统、第三方平台等渠道采集的原始数据,往往存在 ...
2026-01-13在CDA(Certified Data Analyst)数据分析师的核心能力体系中,“通过数据建立模型、实现预测与归因”是进阶关键——比如“预测 ...
2026-01-13在企业数字化转型过程中,业务模型与数据模型是两大核心支撑体系:业务模型承载“业务应该如何运转”的逻辑,数据模型解决“数据 ...
2026-01-12当前手游市场进入存量竞争时代,“拉新难、留存更难”成为行业普遍痛点。对于手游产品而言,用户留存率不仅直接决定产品的生命周 ...
2026-01-12在CDA(Certified Data Analyst)数据分析师的日常工作中,“挖掘变量间的关联关系”是高频核心需求——比如判断“用户停留时长 ...
2026-01-12在存量竞争时代,用户流失率直接影响企业的营收与市场竞争力。无论是电商、互联网服务还是金融行业,提前精准预测潜在流失用户, ...
2026-01-09在量化投资领域,多因子选股是主流的选股策略之一——其核心逻辑是通过挖掘影响股票未来收益的各类因子(如估值、成长、盈利、流 ...
2026-01-09在CDA(Certified Data Analyst)数据分析师的工作场景中,分类型变量的关联分析是高频需求——例如“用户性别与商品偏好是否相 ...
2026-01-09数据库中的历史数据,是企业运营过程中沉淀的核心资产——包含用户行为轨迹、业务交易记录、产品迭代日志、市场活动效果等多维度 ...
2026-01-08在电商行业竞争日趋激烈的当下,数据已成为驱动业务增长的核心引擎。电商公司的数据分析师,不仅是数据的“解读官”,更是业务的 ...
2026-01-08