京公网安备 11010802034615号
经营许可证编号:京B2-20210330
4 医疗健康大数据平台
为了利用大数据技术处理医疗健康问题,需要针对数据特点以及处理方式设计专门的系统。下面主要介绍目前医疗健康大数据平台如何设计以应对挑战。
4.1 个人数据收集系统
iEpi[1]是一个便于流行病医疗科研人员快速搭建起收集用户接触信息、位置信息平台的系统,本文主要对其进行介绍分析。
4.1.1 背景
智能手机的普及为获取个人医疗数据提供了一个绝佳的机会,利用这些信息服务个人医疗、公共卫生成了关注的焦点。多个应用给予用户控制自己健康状况的自由,为医疗服务提供商提供病人的详细状态信息。这些应用主要提供非聚集的信息。而聚集化的信息可以更容易地提供准确、一致性的信息。
人口的接触信息提供了了解流行病传播模式的机会。人口活动信息加上位置信息,可帮助城市规划者了解建筑环境对健康的影响;加上环境质量监控器,可以帮助了解环境污染对健康的影响。
4.1.2 目标
设计一个个人数据收集系统,周期性收集用户数据,包括位置、加速度、温度、心跳等信息;
考虑到需要提供接触信息,位置信息应尽可能精准;
用户可以设定所要收集的数据以及数据收集的频率和持续时间;
考虑到医疗研究人员可能没有编程经验,配置方式应该简单。
4.1.3 设计
iEpi系统包含2个部分(如图1所示):数据收集部分(HealthLogger)和辅助处理部分。其中,HealthLogger由5个模块组成。
任务管理器:HealthLogger的任务包括上传数据、传输数据、读取传感器。任务分连续性和周期性两种方式调度,其中,周期性任务需要设置周期和持续时间。任务管理器也调度其他服务。
数据流和过滤器:数据流提供了访问Android传感器API和其他数据的标准接口,过滤器帮助用户剔除不需要的数据。
数据日志和数据缓存:数据日志存放收集的数据,数据缓存为数据日志提供临时存放功能。
数据传输器:数据传输器是一个通用的文件上传器,被HealthLogger的其他组件用来上传数据到服务器。
iEpian:是HealthLogger提供的一种简易脚本,用来为没有编程经验的医疗研究员提供控制数据采集方式的功能。
因此,用户可以在没有编程经验的情况下完成数据采集器的设计。HealthLogger还提供了蓝牙接口以帮助用户采集其他设备提供的数据,比如体重信息和饮食信息。当用户数据被收集后,会以文件形式存放在Apache服务器,iEpi周期性地检查新文件,对数据解密并解析,然后按用户和数据采集周期存放到数据库中。由于在室内时GPS提供的位置信息不准确,为了提高位置信息的准确性,iEpi定位器采用SaskEPS算法利用接入点位置及信号强度提高室内位置计算精确度。
4.2 面向病人的医疗健康网络社区
DiabeticLink[27,33]为糖尿病患者及相关利益人员提供了一个多功能的健康网络社区,下面将分析其设计思路。
4.2.1 背景
目前,在美国,糖尿病影响了8%的人口,建立为糖尿病人服务的医疗健康网络社区有助于帮助他们。该网络社区主要提供以下4个方面的服务:
糖尿病门户及在线健康社区,主要包括为病人提供论坛、博客等交流医疗经验及感情的服务,还包括匿名交流的服务;
糖尿病追踪及可视化,包括记录病人的医疗数据与健康数据并生成可视化报告;
糖尿病风险报告,使用病人数据预测患病风险,促进病人自我管理;
提供建议,为病人提供改善其状态的建议,并鼓励病人达成长期目标。
4.2.2 目标
设计一个面向病人的医疗健康网络门户,为患者、患者家属、护士、医师、制药公司提供服务。其中,病人可以利用医疗健康网络社区交流治疗经验和疾病信息,学习医疗知识,以更好地了解自己的病情、控制病情发展;病人家属可以利用医疗健康网络社区了解病人疾病、讨论治疗经验、阅读教育书籍,以提供更好的照顾;护士需要快速建立起疾病相关知识,以引导病人积极应对治疗。医疗健康网络社区还提供了以下功能:医师在面对不熟悉的疾病时,需要快速获取相关工具和资源的通道;部分医疗健康网络社区提供匿名的电子健康记录,医学研究员可以从中挖掘信息;制药公司可以从医疗健康网络社区挖掘药物不良反应信息。
4.2.3设计
为了满足多方面的需求,除了提供简单的医疗健康社区功能外,该系统还包含以下4个部分。
个性化病人智能工具:使用数据挖掘方法挖掘病人电子病例和病人博客以发现生活方式、治疗和疗效的关系,并为病人提供预防性建议。
疾病管理工具:记录患者糖尿病参数(血糖、血压、糖化血红蛋白等)、营养、运动量、用药量,并形成可视化报表,以帮助用户管理自己的状况。
社交功能:提供用户分享经验和感情,提出回答问题,寻找情感支撑等功能。
教育功能:提供可信的医疗文章、研究报告、健康食谱等内容,并为用户提供知识搜索引擎。
4.3 个人体征数据收集与处理系统
参考文献[34]为用户提供了一个便于开发个人体征分析应用的基于Hadoop的框架。
4.3.1 背景
医疗健康行业的重心正逐步从医疗转向预防[35],而可穿戴医疗设备的兴起为医疗健康行业的转变提供了独一无二的机会。利用可穿戴医疗设备从用户身上收集生命体征数据,比如心电图、体温、心跳,帮助提早检测用户患病危险、主动预防、管理健康。
生命体征数据包括像体温、血压这样的间隔数据,也包括像呼吸、心电图这样的连续测量才有意义的数据。前者可以用传统数据库存放,后者一般采用文件存放。
4.3.2 目标
设计一个个人健康分析系统,以便用户在此之上快速搭架生命体征分析应用。系统应该提供的服务包括:体征数据接收、数据存储管理、数据分析接口、个性化服务(发送用户服务数据到用户的智能设备)。考虑到两种不同体征数据形态,系统应该提供统一的处理方式。
4.3.3 设计
系统分为5个部分,如图2所示。
生命体征传输:为了提供可拓展性,系统采用符合W3C的SOAP标准传输数据。
中间服务层:为了对用户提供统一的数据形式,系统添加中间服务层来预处理数据,将数据转换为符合HL7规范的数据,中间服务层还提供接收体征数据、传送数据到处理平台、接收处理平台结果并发送给用户以及信号处理的功能(例如将加速度数据转换为记步数据)。
数据存储服务:系统接收中间服务层的数据,存放至分布式数据库HDFS中。
分析服务:系统采用Hadoop作为主要的数据分析平台。
4.4 小结
在设计医疗健康大数据处理平台时,必须把数据放在优先考虑的位置。下面总结了前文提到的医疗健康大数据平台设计思路,提出了定义数据源、确定数据处理方式、分析数据流向、设计系统的一般步骤。
(1)定义数据源
医疗健康大数据的数据来源包括结构化、半结构化、无结构化的医疗单位数据、个人健康数据和公共健康数据。例如医疗单位的电子病例数据、放射信息管理系统数据,传感器收集的体温、脉搏等个人数据,公共健康数据(包括政府发布的流感信息、社交媒体信息)等。为了实现良好的数据流,必须首先将平台所要收集的信息分类,分析每种数据的特点,包括:是否是结构化、无结构化或半结构化数据;是否需要预处理;包含何种有用信息。
(2)确定数据处理方式
大数据的处理方式包括前文提到机器学习、分类、聚类、回归等。根据上一步分析得到的数据特点和数据价值选择相应的处理方式。比如参考文献[34]中,为了得到用户的运动数据,需要用户的记步数据,而记步数据可以通过将源数据中的用户加速度信息经过信号处理获得。
(3)分析数据流向
根据数据源、数据处理方法和数据结构确定数据流方向。iEpi[1]中的各类传感器数据经过在手机端汇总后到达服务器,以临时文件方式存储,经过分析后存放在数据库中,最后提供给用户挖掘其中的关系、模式。
(4)设计系统
根据数据流的特点和数据处理方式选择现有的大数据处理平台作为子系统,然后设计中间系统以连接多个子系统。
5 医疗健康大数据技术
5.1 可视化技术
医疗可视化技术一直存在,比如X光、CT、核磁共振、远程医疗等。医疗可视化的功能在于为病人、医生以及利益相关者提供更深的理解,以帮助其做出更好的决策。
随着医疗信息化的到来以及移动设备、社交网络的流行,医疗健康数据呈爆发式增长,医生、制药公司、公共卫生机构无法在面对海量数据时有直观的了解,需要利用可视化技术将数据以直观的方式呈现给相关人员。
5.1.1 分析
医疗健康大数据来源主要包含3个方面[6]:个人健康数据、医疗数据、人口健康数据。在个人健康数据方面,数据来源主要是传感器信息和在线信息。使用可视化技术处理个人健康数据、个人疾病数据可以帮助用户更容易地实现健康管理、疾病管理。处理个人饮食、运动数据可以帮助用户直观了解身体状况,有助于用户保持身体健康。在医疗数据方面,数据来源主要是医学研究数据、电子病例数据。医生无法跟上从这些数据中发现新的医学知识的速度并将其用到病人的治疗上,医疗可视化将为医生提供直观了解新知识的机会。人口健康数据以及疾病监控数据可以通过可视化技术帮助用户了解人口健康状况、疾病爆发状况。
5.1.2 挑战
由于需要处理大量数据以提供可视化的分析报告,可视化服务需要较长时延才能提供。当作为临床决策支持系统时,医师希望在短时间内获得服务,这对可视化服务提供者提出了实时性服务的挑战。
5.2 个性化医疗
考虑到患者间存在很大的差异,不存在针对一种病症的适应所有情况的治疗方案[36],实际上,研究人员一直在寻找针对病人的治疗经历、基因信息、遗传信息、环境信息、生活方式等信息给予个性化治疗的方案[37]。鉴于人类基因工程的原因,人类可以从基因角度给予患者个性化治疗。
5.2.1 分析
个性化治疗一般使用以下工具:家族健康历史,利用家族健康历史整合遗传信息可以有效帮助预测疾病,进行主动的预防性措施;基因信息,指利用基因信息及其衍生物信息,包括RNA、蛋白质、代谢产物信息进行疾病预测和个性化治疗,然而,基因检测费用高昂[38],基因多态性的特质可能导致评估错误及预测错误,导致了通过基因检测提供个性化治疗难以获得较高的性价比;临床决策支持系统,其提供了一个利用所有信息为患者提供个性化治疗方案的机会。
5.2.2 挑战
个性化医疗的挑战主要在于部分用于疾病预测、疗效预测的数据源难以获得。首先,平价的个人基因分析技术应该被提上日程;其次,用户不愿意提交个人医疗数据的部分原因是担心隐私泄露[39],这就对医疗数据提供商的安全和隐私保护提出了要求。
6 结束语
本文首先介绍了大数据概念、特点与处理平台,之后分析了医疗健康行业的数据来源与特点,然后讨论了利用大数据技术应对医疗健康行业挑战的例子,最后介绍了医疗健康大数据系统与关键技术。目前医疗健康大数据还处于初期发展阶段,但是它已经展现了改变医疗服务的潜力。医疗健康服务提供商利用大数据分析技术可以从临床数据、研究数据、个人健康数据、公共健康数据中挖掘潜在的关系,为临床决策、公共卫生、个人健康提供帮助。将来,医疗健康大数据将会快速地发展。目前,医疗健康大数据还面临着诸多挑战,隐私问题关系到用户的数据不会被用作恶意用途,数据安全和标准化需要成立专门的机构来管理。然而,随着技术的发展,医疗技术和大数据技术的结合将更好地为人类健康提供服务。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在实验检测、质量控制、科研验证等场景中,“方法验证”是确保检测/分析结果可靠、可复用的核心环节——无论是新开发的检测方法 ...
2026-03-04在数据分析、科研实验、办公统计等场景中,我们常常需要对比两组数据的整体差异——比如两种营销策略的销售额差异、两种实验方案 ...
2026-03-04在数字化转型进入深水区的今天,企业对数据的依赖程度日益加深,而数据治理体系则是企业实现数据规范化、高质量化、价值化的核心 ...
2026-03-04在深度学习,尤其是卷积神经网络(CNN)的实操中,转置卷积(Transposed Convolution)是一个高频应用的操作——它核心用于实现 ...
2026-03-03在日常办公、数据分析、金融理财、科研统计等场景中,我们经常需要计算“平均值”来概括一组数据的整体水平——比如计算月度平均 ...
2026-03-03在数字化转型的浪潮中,数据已成为企业最核心的战略资产,而数据治理则是激活这份资产价值的前提——没有规范、高质量的数据治理 ...
2026-03-03在Excel办公中,数据透视表是汇总、分析繁杂数据的核心工具,我们常常通过它快速得到销售额汇总、人员统计、业绩分析等关键结果 ...
2026-03-02在日常办公和数据分析中,我们常常需要探究两个或多个数据之间的关联关系——比如销售额与广告投入是否正相关、员工出勤率与绩效 ...
2026-03-02在数字化运营中,时间序列数据是CDA(Certified Data Analyst)数据分析师最常接触的数据类型之一——每日的营收、每小时的用户 ...
2026-03-02在日常办公中,数据透视表是Excel、WPS等表格工具中最常用的数据分析利器——它能快速汇总繁杂数据、挖掘数据关联、生成直观报表 ...
2026-02-28有限元法(Finite Element Method, FEM)作为工程数值模拟的核心工具,已广泛应用于机械制造、航空航天、土木工程、生物医学等多 ...
2026-02-28在数字化时代,“以用户为中心”已成为企业运营的核心逻辑,而用户画像则是企业读懂用户、精准服务用户的关键载体。CDA(Certifi ...
2026-02-28在Python面向对象编程(OOP)中,类方法是构建模块化、可复用代码的核心载体,也是实现封装、继承、多态特性的关键工具。无论是 ...
2026-02-27在MySQL数据库优化中,索引是提升查询效率的核心手段—— 面对千万级、亿级数据量,合理创建索引能将查询时间从秒级压缩到毫秒级 ...
2026-02-27在数字化时代,企业积累的海量数据如同散落的珍珠,若缺乏有效的梳理与分类,终将难以发挥实际价值。CDA(Certified Data Analys ...
2026-02-27在问卷调研中,我们常遇到这样的场景:针对同一批调查对象,在不同时间点(如干预前、干预后、随访期)发放相同或相似的问卷,收 ...
2026-02-26在销售管理的实操场景中,“销售机会”是核心抓手—— 从潜在客户接触到最终成交,每一个环节都藏着业绩增长的关键,也暗藏着客 ...
2026-02-26在CDA数据分析师的日常工作中,数据提取、整理、加工是所有分析工作的起点,而“创建表”与“创建视图”,则是数据库操作中最基 ...
2026-02-26在机器学习分析、数据决策的全流程中,“数据质量决定分析价值”早已成为行业共识—— 正如我们此前在运用机器学习进行分析时强 ...
2026-02-25在数字化时代,数据已成为企业决策、行业升级的核心资产,但海量杂乱的原始数据本身不具备价值—— 只有通过科学的分析方法,挖 ...
2026-02-25