
正确看待大数据的另一面
最近有微博网友爆料称,某旅行网站预订酒店服务有“杀熟欺生”的嫌疑:当遇到举棋不定的新用户或消费较保守的老用户时,会抛出一个相对有诱惑力的价位,诱导网友注册和消费,先成功获客再说;而对已经稳定的“回头客”,系统会开出一个相对较高的价格。媒体调查显示,这种根据用户的消费习惯提供“针对性”价格服务的现象,涉及打车、购票、订房、订餐等各种常见的网络平台消费。
这就是大数据的另一面。在互联网世界的话语体系里,大数据通常被形容为无所不能,所谓“比你更了解你自己”,用精确的算法给用户画像,继而提供“投食”般的服务。主流看法认为,大数据创造了一种新业态、新模式,给人们提供了前所未有的便捷,甚至在网上政务建设方面也大有作为,然而这并不意味着它就是无可指责的。大数据固然波澜壮阔,但也隐藏着许多风险,“杀熟欺生”是一种,“隐私泄露”也一直受到关注。某媒体曾报道称,700元就能买到同事行踪,包括乘机住宿上网吧等11项记录,甚至可查看电商网站、移动支付等所有痕迹;几天前,美国一个网站被爆泄露了5000万的用户数据,始作俑者是一个第三方小插件。这些活生生的例子表明,大数据不是法外之地,必须有足够明确的规范,才能保证其行稳致远。
大数据和个体隐私之间存在明确界限,但这一点正在被有意无意地忽略。日前,百度CEO李彦宏公开表示,“多数情况下,中国人愿意用隐私交换便捷性,他们没那么敏感”,结果引起轩然大波。究其根本,人们发现持这类观点的互联网企业不在少数。以数据收集为例,一个手电筒软件都恨不得读取你的地理位置和通讯录,一个图片软件也要登记你的电话号码,否则就不能用。在数据利用方面,人们更是被“绕过”了,某些网站收集用户信息,隔三差五就通过短信、电话等方式进行“精准营销”,在一个购物软件里搜过的东西,打开某视频软件,竟然也能看到相关广告。去年,有媒体对50家互联网企业发起隐私调查,结果只有30家制定独立隐私政策,18家存在于用户协议中,2家没有。
大数据的收集和利用没有规范,表面上有企业不够自律的原因,但也与它们缺乏规范化的动力有关。目前,无论是《网络安全法》,还是“两高”对个人信息的司法解释,虽然明确惩治侵犯公民个人信息犯罪活动,但更多还是集中于买卖环节的“灰色产业链”上,对大数据一笔带过。相对而言,大数据许多细节还有待界定,比如从采集到应用的各个环节,包括数据质量、数据隐私以及数据采集界限等方面。举个例子,在欧盟制定的专门保护个人数据权利的法律中,提出了“被遗忘权”的概念,体现在某种事实层面上,就是软件可以选择注销,然后企业删除数据,将你“遗忘”。但在我们这里,“遗忘”是件奢侈的事情,很少软件提供注销功能。这件小事并无技术难度,然而足见隐私意识的匮乏,法律惩戒力的不足。
随着越来越多企业加入竞争,大数据已经被看作一种核心资产和商业模式,被程度不一地进行挖掘。这既是创新力的表现,也意味着复杂的挑战,除了寄望于企业形成良好的自律意识,更需要进行有效的引导和管理。今年全国两会,多名代表委员提出的“个人信息安全法”是一个很好的办法,市场主体对于个人信息的使用究竟该遵循哪些强制规定,信息泄露后相关追责机制如何完善,最终还是有赖于建立起完善的个人信息安全监管机制。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在 “神经网络与卡尔曼滤波融合” 的理论基础上,Python 凭借其丰富的科学计算库(NumPy、FilterPy)、深度学习框架(PyTorch、T ...
2025-10-23在工业控制、自动驾驶、机器人导航、气象预测等领域,“状态估计” 是核心任务 —— 即从含噪声的观测数据中,精准推断系统的真 ...
2025-10-23在数据分析全流程中,“数据清洗” 恰似烹饪前的食材处理:若食材(数据)腐烂变质、混杂异物(脏数据),即便拥有精湛的烹饪技 ...
2025-10-23在人工智能领域,“大模型” 已成为近年来的热点标签:从参数超 1750 亿的 GPT-3,到万亿级参数的 PaLM,再到多模态大模型 GPT-4 ...
2025-10-22在 MySQL 数据库的日常运维与开发中,“更新数据是否会影响读数据” 是一个高频疑问。这个问题的答案并非简单的 “是” 或 “否 ...
2025-10-22在企业数据分析中,“数据孤岛” 是制约分析深度的核心瓶颈 —— 用户数据散落在注册系统、APP 日志、客服记录中,订单数据分散 ...
2025-10-22在神经网络设计中,“隐藏层个数” 是决定模型能力的关键参数 —— 太少会导致 “欠拟合”(模型无法捕捉复杂数据规律,如用单隐 ...
2025-10-21在特征工程流程中,“单变量筛选” 是承上启下的关键步骤 —— 它通过分析单个特征与目标变量的关联强度,剔除无意义、冗余的特 ...
2025-10-21在数据分析全流程中,“数据读取” 常被误解为 “简单的文件打开”—— 双击 Excel、执行基础 SQL 查询即可完成。但对 CDA(Cert ...
2025-10-21在实际业务数据分析中,我们遇到的大多数数据并非理想的正态分布 —— 电商平台的用户消费金额(少数用户单次消费上万元,多数集 ...
2025-10-20在数字化交互中,用户的每一次操作 —— 从电商平台的 “浏览商品→加入购物车→查看评价→放弃下单”,到内容 APP 的 “点击短 ...
2025-10-20在数据分析的全流程中,“数据采集” 是最基础也最关键的环节 —— 如同烹饪前需备好新鲜食材,若采集的数据不完整、不准确或不 ...
2025-10-20在数据成为新时代“石油”的今天,几乎每个职场人都在焦虑: “为什么别人能用数据驱动决策、升职加薪,而我面对Excel表格却无从 ...
2025-10-18数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16在机器学习建模中,“参数” 是决定模型效果的关键变量 —— 无论是线性回归的系数、随机森林的树深度,还是神经网络的权重,这 ...
2025-10-16在数字化浪潮中,“数据” 已从 “辅助决策的工具” 升级为 “驱动业务的核心资产”—— 电商平台靠用户行为数据优化推荐算法, ...
2025-10-16在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15