大数据产业未来的瓶颈在哪里 通过对大数据产业链的分析,我们可以清楚地看到,在大数据产业链的各个生产环节中,各大公司都已开占位,随着高性能计算机、海量数据的存储和管理的流程的不断优化,技术能够解决 ...
2018-02-26深度学习防止过拟合的方法 过拟合即在训练误差很小,而泛化误差很大,因为模型可能过于的复杂,使其”记住”了训练样本,然而其泛化误差却很高,在传统的机器学习方法中有很大防止过拟合的方法,同样这些方法很多也 ...
2018-02-26R语言-统计学 描述性统计 描述定量数据的数值方法:中心趋势度量 变异的度量 相对位置的度量。 1.中心趋势度量 : 算数平均 中位数 众数 1.1在R中计算平均数的函数 mean( ) 常规的mean() 函数用法 ...
2018-02-26大数据时代,业务创新不能忽视IT支持 还记得前不久人民大学官网上刊登的美女毕业生照片吗?它一改往日人大严肃的风格,在毕业季换上这样一张清新的图片,让人大形象瞬间变得高端霸气。然而,由于访问量激增,最 ...
2018-02-26使用python实现生成用户信息 今天练习的时候要展示一个从用户信息列表,就想把他做成信息和修改在一起的一个网页,方便用户修改内容 考虑到要把信息和值分开放,那么肯定是字典了,因为需要保证位置不变,使用有 ...
2018-02-26大数据环境下的创业需要政府的支持 万众创业的热潮还在继续,大数据的热潮也还在继续,大数据想要全面的应用需要打破原有的机制和体制,让每一个想要创业的人都可以有自己创业的空间,在创业的过程中可以拥有更 ...
2018-02-26【北京朝批茂利升商贸有限公司】招聘数据分析师 秉持诚信、创新、协作、共赢的核心价值,北京朝批茂利升商贸有限公司自2003年成立以来,通过每一位茂利升人不断的努力,成长为目前电子商务平台上领先的品牌代理运营 ...
2018-02-25【上海魔域投资管理有限公司】招聘数据分析师 魔方公寓管理有限公司系一家具有丰富连锁公寓经营经验的外资公司,在中国公共租赁行业中具有绝对领先地位,是连锁白领公寓长期租赁的***。公司主营业务包括公寓连锁经营 ...
2018-02-25【育宁教育科技(上海)有限公司】招聘数据分析师 成长保是什么?成长保----在线儿童思维训练第一品牌。用有趣的交互体验,高质量的内容和服务,提供个性化教育,培养孩子独立思考的能力。成长保的每一个课时和内容, ...
2018-02-25机器学习中防止过拟合方法 过拟合 在进行数据挖掘或者机器学习模型建立的时候,因为在统计学习中,假设数据满足独立同分布,即当前已产生的数据可以对未来的数据进行推测与模拟,因此都是使用历史数据建立模 ...
2018-02-25一些常见的特征选择方法 现实中产生的特征维度可能很多,特征质量参差不齐,不仅会增加训练过程的时间,也可能会降低模型质量。因此,提取出最具代表性的一部分特征来参与训练就很重要了。 通常有特征 ...
2018-02-25数据挖掘模型中的IV和WOE详解 1.IV的用途 IV的全称是InformationValue,中文意思是信息价值,或者信息量。 我们在用逻辑回归、决策树等模型方法构建分类模型时,经常需要对自变量进行筛选。比如我们有200 ...
2018-02-25Python matplotlib画图的中文显示问题 python中的matplotlib仅支持Unicode编码,默认是不显示中文的,如果让其默认显示中文,有下面2种方法: 第一种方法: 1、在python的安装目录中找到配置文件: %Pyt ...
2018-02-25常用的4种大数据分析方法 本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。 当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的 ...
2018-02-25几种常见排序算法的分析 泡排序是最简单的排序算法,在所有算法中平均效率是最低的,但便于理解,适用于记录个数n较小的排序中;选择排序适用于记录个数n较小而记录本身信息量较大的排序中;插入排序适用于记 ...
2018-02-25创建大数据项目的五大步骤 企业需要积极的提升他们的数据管理能力。这并非意味着他们应该制定繁琐的流程和监督机制。明智的企业会配合他们的数据活动的生命周期制定灵活的流程和功能:根据业务需求启动更轻更严 ...
2018-02-25大数据时代中国的“破障” 要想在大数据时代的激烈竞争中赢得主动,中国需要在公开信息资源、优化产业环境、发展核心技术等方面作出更多努力。 “预计明年全球网民平均每月下载的数据流量将达到10G,如果你 ...
2018-02-25关于描述性统计分析 在数据分析的时候,一般首先要对数据进行描述性统计分析(Descriptive Analysis),以发现其内在的规律,再选择进一步分析的方法。描述性统计分析要对调查总体所有变量的有关数据做统计性 ...
2018-02-25“大数据”之于“电子政务” 大数据是继云计算、物联网之后IT产业又一次颠覆性的技术变革,对国家治理方式、决策、组织和业务流程、提供公共服务的方式等都将产生巨大的影响。随着互联网、云计算、物联网等信息 ...
2018-02-25过完年以后,敢问一句年近30岁的你月薪多少? 近几天的知乎热榜有一个问题引起了二胖的注意:三十岁,研究生毕业的你,现在收入多少? 这不禁让二胖一边摸着钱包,一边想要统计下不同学历的人群在而立之年的 ...
2018-02-24在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11在机器学习建模流程中,“特征重要性分析” 是连接 “数据” 与 “业务” 的关键桥梁 —— 它不仅能帮我们筛选冗余特征、提升模 ...
2025-10-11在企业的数据体系中,未经分类的数据如同 “杂乱无章的仓库”—— 用户行为日志、订单记录、商品信息混杂存储,CDA(Certified D ...
2025-10-11在 SQL Server 数据库操作中,“数据类型转换” 是高频需求 —— 无论是将字符串格式的日期转为datetime用于筛选,还是将数值转 ...
2025-10-10在科研攻关、工业优化、产品开发中,正交试验(Orthogonal Experiment)因 “用少量试验覆盖多因素多水平组合” 的高效性,成为 ...
2025-10-10在企业数据量从 “GB 级” 迈向 “PB 级” 的过程中,“数据混乱” 的痛点逐渐从 “隐性问题” 变为 “显性瓶颈”:各部门数据口 ...
2025-10-10在深度学习中,“模型如何从错误中学习” 是最关键的问题 —— 而损失函数与反向传播正是回答这一问题的核心技术:损失函数负责 ...
2025-10-09本文将从 “检验本质” 切入,拆解两种方法的核心适用条件、场景边界与实战选择逻辑,结合医学、工业、教育领域的案例,让你明确 ...
2025-10-09在 CDA 数据分析师的日常工作中,常会遇到这样的困惑:某电商平台 11 月 GMV 同比增长 20%,但究竟是 “长期趋势自然增长”,还 ...
2025-10-09Pandas 选取特定值所在行:6 类核心方法与实战指南 在使用 pandas 处理结构化数据时,“选取特定值所在的行” 是最高频的操作之 ...
2025-09-30球面卷积神经网络(SCNN) 为解决这一痛点,球面卷积神经网络(Spherical Convolutional Neural Network, SCNN) 应运而生。它通 ...
2025-09-30在企业日常运营中,“未来会怎样” 是决策者最关心的问题 —— 电商平台想知道 “下月销量能否达标”,金融机构想预判 “下周股 ...
2025-09-30Excel 能做聚类分析吗?基础方法、进阶技巧与场景边界 在数据分析领域,聚类分析是 “无监督学习” 的核心技术 —— 无需预设分 ...
2025-09-29XGBoost 决策树:原理、优化与工业级实战指南 在机器学习领域,决策树因 “可解释性强、处理非线性关系能力突出” 成为基础模型 ...
2025-09-29