京公网安备 11010802034615号
经营许可证编号:京B2-20210330
该对大数据立规矩了吗?
随着移动互联网的普及,社交生活网络化的泛滥,我们每个人在享受信息技术带来的便利时,每分每秒也在留下自己的数字足迹(digital footprint),包括现在或过去任何一个时点所在的位置、移动轨迹等等,平台、应用等商品和服务提供者有能力搜集并分析利用,以了解我们的活动范围、生活习惯、各种偏好,并最终描绘出我们每个人的“数字画像”(digital profiling)。正如法官Alsup所担心的,互联网公司把基于大数据的精准定位和营销,“创造性”地用到庭审诉讼双方的辩论中,很可能会左右陪审团的判断,控制庭审的结果。
事实上,描绘出个人的数字画像进而“投其所好”,还是大数据一种“相对保守”的利用方式。毕竟在微信朋友圈中,是看到豪车还是饮料的广告,顶多成为我们吹牛或自嘲的谈资。但随着基于大数据的自动化决策科技 (automated decision-making) 在个人对健康、教育、工作、信用、商品和服务的取得上,扮演着逐渐重要的角色,甚至是“生杀予夺”的权重时,我们就应该对大数据、自动化决策过程的影响高度重视起来。
例如,当大数据和算法判断求职者为男性时,为其推送高薪主管职位消息的概率远大于同等条件的女性求职者;利用大数据计算参与恐怖主义活动的概率,并采取各种不同程度限制出行或监控的措施;在缺乏直接信用记录和数据的情况下,基于其他信息(如电话账单、教育背景、社交网络等)预估信用评分,最终导致特定群体的人无法申请小额贷款;信用卡发卡银行降低某人信用额度的原因并非基于该持卡人的消费与还款记录,而是基于该持卡人被归为“同一类型”之消费者所共同拥有的记录与特征等等。
2016年1月6日,美国联邦交易委员会公布报告《大数据:吸纳或排他的工具?》(Big Data: A Tool for Inclusion or Exclusion? Understanding the Issues)中还举了这样一个例子:
2012年,当桑迪飓风肆虐美国时,短短时间,推特上产生了超过2000万条相关的消息,其中包含了大量关于飓风和受灾人群的信息。为了做到救灾资源的有效配置,美国当局决定对推特上的消息进行实时分析,以此判断哪些地区、哪些人群最需要帮助。可是事后分析回顾发现,因为电力供应受到严重影响,导致重灾区人群无法发出大量的网络消息,所以恰恰是受灾最重地区的推特消息最少。对推特消息的分析形成了不准确的数据视图,无法正确指向受灾最重的地区以及最需要帮助的人群。
被大数据歧视了怎么办?
为避免大数据可能带来的歧视或偏差,美国政府从2014年开始发布了多份报告,希望引起社会各界对此问题的重视。2014年5月1日,美国白宫发表报告《大数据:抓住机会、保存价值》(Big Data: Seizing Opportunities, Preserving Values)。报告建议:“联邦政府主要的公民权利和消费者保护机构,包括司法部、联邦贸易委员会、消费者金融保护局和公平就业机会委员会,应当主动研究有可能对特定阶级带来歧视性影响的大数据分析的做法和结果,并制定计划调查和解决违反法律的此类事件。”
上文提到的美国联邦交易委员会的报告建议,在进行分析之前,首先要确保数据具有代表性;企业必须谨防数据模型中隐藏的偏差,厘清统计关联性和因果性之间的区别;企业需要详尽审视相关模型所依赖的因子,把握好预测分析与公平性之间的平衡关系;在流程建设上,允许消费者能访问自身数据并就错误或遗漏提出异议。
2016年5月4日,美国白宫发布报告《大数据:关于算法系统、机会、公民权利的报告》(Big Data: A Report on Algorithmic Systems, Opportunity, and Civil Rights)。报告提出通过算法和系统的设计来实现平等权利(a principle of “equal opportunity by design”),并建议研究机构和行业一起,开展算法审计和对大数据系统的外部测试以保证人们被公平对待。
欧洲在这方面走在了其他国家的前面。将于2018年5月25日正式生效的欧盟《一般数据保护条例》,在第22条明确规定了对于仅仅以自动化方式(包括数字画像)做出的、对个人能够产生法律效果的或其他类似的显著影响的决定,个人有权免受这样决定的制约。
在我国,大数据和自动化算法高歌猛进,与此同时,我们是不是也应该放慢下脚步,仔细想想如何将其可能的负面影响降到最低?
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16在机器学习无监督学习领域,Kmeans聚类因其原理简洁、计算高效、可扩展性强的优势,成为数据聚类任务中的主流算法,广泛应用于用 ...
2026-04-16在机器学习建模实践中,特征工程是决定模型性能的核心环节之一。面对高维数据集,冗余特征、无关特征不仅会增加模型训练成本、延 ...
2026-04-16在数字化时代,用户是产品的核心资产,用户运营的本质的是通过科学的指标监测、分析与优化,实现“拉新、促活、留存、转化、复购 ...
2026-04-15