
如何利用人工智能和大数据,为癌症等疑难病症找到更好治疗方法,目前已取得进展,但他们在收集患者信息上遇到难题。
文章主要内容如下:
IBM、波士顿制药公司 Berg Pharma、纪念斯隆-凯特琳癌症中心(Memorial Sloan Kettering)、加州大学伯克利分校(UC Berkeley)及其它机构的研究人员,正在探索如何利用人工智能和大数据,找到更好的疾病治疗方法。
但是,在医疗领域充分利用这些计算工具面临的最大挑战是,这方面的海量数据被束之高阁——或者说从一开始就没有数字化。
早期的医学研究成果或病人的病历,往往锁在医药公司的档案或医生办公室的文件柜中。
病人的隐私问题、公司间的利益冲突以及纯粹缺乏电子病历,阻碍着医疗领域的信息共享,让每一次治疗都像一个孤立的事件。如果医疗领域的信息共享能取得进展,人们很有可能发现更具普遍意义的治疗方案。
加州大学旧金山分校的讲师迈克尔·凯泽(Michael Keiser)指出,当你能够对10万个病人的临床试验数据、基因组数据和电子病历进行分析时,与以往只能接触少数病人的信息相比,你将能发现以往所不能发现的治疗方案。
鉴于这样的前景,一些组织开始着手将医疗数据整合在一起。
去年年底,美国临床肿瘤学会(American Society of Clinical Oncology,ASCO)宣布了旗下“CancerLinQ”项目的初步进展情况。“CancerLinQ”是一个“快速学习系统”,允许研究人员进入、访问和分析匿名癌症患者的病历。
今年4月,一个有众多主要制药公司参与的非营利性组织——“癌症生命科学协会CEO圆桌会(the CEO Roundtable on Cancer)”,宣布推出PDS计划(Project Data Sphere)。该计划将打造一个第三阶段癌症临床试验数据共享和分析平台,初始数据集已由阿斯利康、拜耳、新基医药(Celgene)、纪念斯隆-凯特琳癌症中心、辉瑞、赛诺菲等共同提供。
这些数据已去除患者的个人信息,并进行了统一编号,供生命科学公司、医院、医疗机构以及独立研究者可以免费使用。他们可以访问平台内置的分析工具,或者将数据插入到自己的软件中。
癌症CEO圆桌会议首席执行官马丁·墨菲(Martin Murphy)表示,PDS计划可能有助于发现鲜为人知的癌症候选药物,这些药物可能对某些癌变有一定的疗效。而在某一特定研究中,这些药物可能会因为没有达到研究的主要目标而被抛弃。
其它推进医疗领域信息共享的努力还包括:由从多医疗机构、研究型大学、生命科学公司等组建的全球基因组学与健康联盟(Global Alliance for Genomics and Health)、欧洲生物信息研究所(EMBL-EBI)维护的分子生物数据库,以及美国国立卫生研究院(National Institute of Health, NIH)成立的“生物标记共同体(Biomarker Consortium)”等。
与此同时,用大数据服务肿瘤医疗行业的初创公司Flatiron Health上月完成了1.3亿美元 B 轮融资,由谷歌旗下风投机构谷歌风投(Google Ventures)领投。Flatiron Health 打造了一个“肿瘤学云平台(OncologyCloud)”,能提取和整合病人电子病历(EMR)中的临床数据以及医疗费用数据。
该系统使在医生办公室和医院以不可持续和非结构化格式留存的数据变得有意义,从而能够对大规模癌症患者群体的治疗情况进行分析。理想情况下,它可以发现哪种治疗方法对哪些类型的癌症患者有效。
Flatiron Health 联合创始人奈特·特纳(Nat Turner)表示:“Flatiron Health专注于所谓‘真实世界’患者的临床资料。在美国,只有4%的癌症患者会参与前瞻性临床试验,因此我们正在努力提取和整合剩下96%患者的数据。”
他说:“要真正了解什么对癌症有效,其他患者正在接受什么样的治疗,以及癌症领域的研究取得了什么样的成果,相关机构应该开放“去识别(de-identified)”的医疗数据和匿名的典型病例,这是Flatiron Health愿景的一部分。”
隐私风险
可以肯定的是,推进医疗信息的开放应该非常谨慎。医疗信息是高度敏感的,所以任何隐私风险需求应慎重考虑。
医疗信息能开放到什么程度,取决于全社会所做出的让步。许多人坚定地持有这样的观点:挽救生命最重要。但受旧习惯和过时规章制度的影响,社会的转变速度还不够快,这一点加州大学伯克利分校的计算机科学教授大卫·帕特森(David Patterson)深有感触。帕特森致力于用于癌症研究的机器学习工具。
他说:“对于计算机领域的研究人员,我们习惯于互联网时间和摩尔定律。但现在我们无法让官方达成一致,让我们能够大量快餐收集数据并进行整合,这是非常令人沮丧的。”
他指出:“患者的隐私很重要,但争取癌症治疗领域取得进展同样很重要。将大量治疗信息汇集在一起的好处是,我们可以在攻克这种可怕疾病方面取得进展。”
这些接受采访的专家,还没有谁能例举出目前为止大数据等计算技术对癌症治疗带来了什么突破。毕竟,这些技术都是新的,而且医疗数据集刚刚整合在一起,临床试验又需要数年时间。
但几乎所有人都同意,在癌症治疗方面,研究人员正处于重大突破的边缘。
墨菲称,如果把攻克癌症比喻为一座高山,目前已接近顶峰的边缘,这一高度是前所未有的。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29