
[从产品角度学EXCEL 02]-EXCEL里的树形结构
前言请看:
0 为什么要关注Excel的本质
1 excel是怎样运作的
本文仅由尾巴本人发布于特定网站。不接受任何无授权转载,如需转载,请先联系我,非常感谢。
2 Excel里的树形结构
这段时间,上海街边的树上陆陆续续长出了嫩芽,放眼望去有各种层次的绿色,格外好看。我们今天的话题,恰好也与树有关。只不过,树都是往天空伸展枝叶的,而我们这里讨论的‘树’,却是由根部出发,逐行逐行往下延展、伸展。
还记得上一个章节里,我们对一个excel文件解压缩后,发现了若干个xml文件吗?
xml本质上是一种使用树形结构存储信息的文档。它由一个根节点root开始,逐层逐层长枝节,并给每一层都打了个标签,让xml解析器可以快速定位信息的内容。而每一层以及每一个底部的节点,都是这些信息的一个分类属性。我们了解了它们的属性和层级,也就了解这颗结构树长成什么样子。
正因为xml的结构与层级是如此重要,在进一步讲单元格之前,我们很有必要先剖析看看excel xml树的结构,从大体上再来理解一下excel储存文件的方式。
需要注意的是,这一章节大概是整个系列里涉及最多编程的章节了。如果各位对编程不是特别感兴趣,可以先跳过这一节,去看后面的内容。不过按照我个人的经验来说,不管你是用excel做一些简单的数据处理,还是想要在数据分析行业里走得稳妥一些,了解了解编程,只会有好处而没有坏处。尤其是编程的一些思想,如妥善地设计接口,分隔各个功能块等,即使你用excel处理数据,这些也对你十分有好处。
言归正传吧。我们回过头来再看看excel解压缩以后的xml文件。
让我们随意打开一个xml文件,一串串密密麻麻的字符就这样跳了出来。
对于不熟悉xml架构的人来说,我们只会看到眼花缭乱的括号,等号,引号。但是如果你对xml有点理解,你就会知道,这一系列的标点符号框起了一个个xml的数据结构。
对于xml来说,每一个层级都是由<标签 属性=ABC>内容信息</标签>构成的。有的内容信息里又会再次嵌套一层标签层级,重重相叠,从根部开始向下延展出了无数枝叶,构成了一棵看似错综复杂,却是层次分明的xml树。人们只要定位到某一个枝叶,就可以迅速把这个枝叶下的特定信息取出来。而要搞懂这棵xml树长什么样子,首先就要搞懂说这棵树是有哪些层级,各个层级叫什么,有什么内容。
但是各位再回顾看看上面的截图,一长串一长串的代码,你当然可以一个个去判断说,啊,根标签从worksheet开始,下面有selection层级,有f层级等等,但是这样子做,不仅低效,而且会有遗漏。
请各位在学习excel时,随时记住一个原则,那就是可以不要手工去做的事情,就不要手工去做。宁愿自己脑子废点脑力构思最优方法,也不要直接就开始机械的作业。
那么,在这里,面临这个要人工一个个看标签的艰巨任务时,我们该如何是好呢?
在这里跟大家再普及一个概念的是,xml嘛,除了微软在用于office系列文档储存格式以外,它还广泛应用于各种网页设计领域。而在网页获取信息这一块,我们天然有很多工具可以通过读取html或者xml源代码,解析它们的结构,进行数据提取工作(高级点叫法即网络爬虫)
所以对于这里的excel xml源文件,我们自然可以应用各种爬虫工具,把xml的框架给找出来。
我 用的比较熟的应该是R语言的rvest包爬虫了,查了一下它的文档,有一个叫xml_structure的,可以直接把xml文件的标签层次给读出来,而 xml_nodes/xml_attr等,又可以把里面特定的标签内容给分层读出来。那么写一段代码,帮我把excel的xml源文件里的层级与内容弄出 来,那就省了我很大的心力啦^^
因为R语言代码并不是我们的重点,所以我把源代码放在文章末尾的扩展阅读里了,有需要的可以去看看,也可以用其他语言写写。有的时候只要学会一点点的编程,就能大大的改善各位的工作效率。要用好工具而不是被工具玩,是我希望在这系列excel教程里告诉大家的一个点。
那么言归正传。请各位看看下面这个用R语言跑出来的csv文件截图。
左列是我们的标签名,右列是我们标签里面包含的文本。通过这个文件,我们就可以很容易知道各个标签里存放了什么文本信息。我们会发现row下面是一串串的c/v/f。而c与v的信息几乎完全一样。
另外,在r里,我们可以通过xml_structure输出xml文件的结构。这两个结合起来,我为各位绘制了一张sheet1.xml的树形结构图:
各位可以看到,在worksheet文件夹里的sheet1.xml,是在sheetdata里按照row为标签层级,存放了若干行的数据。而行又以 c(cell)为导向,存放了单元格的v (value)和f(函数)。有多少行,在sheet1.xml里就有多少row,一个row有若干个有效单元格,就会有若干个c。
从这个角度看excel,会不会对excel的产品设计层次有了进一步的理解呢?
另外,上面的截图没有出示的一点是,在worksheet这个文件夹里,数字是直接存在各个sheetxxx.xml里的,而字符类文本,却是单独存放在外面的SharedString.xml里。
嘿嘿,数字和文本的存放格式不一样,各位想到了什么?有没有虎躯一震,想到了excel里因为数字和文本的不同,带来的各种不便?
在前面啰嗦完为什么要写这个系列,以及excel是怎么工作以后,我们终于把拼图最重要的一块——解读xml补上了。
R语言解析XML源代码:
setwd("~/excel/")
library(rvest)
#代码用于《从产品角度学EXCEL》系列文章,XML解析
# read xml in zip files
get_xmllist<-function(access){
list<-list.files(access,full.names=TRUE,pattern = "xml$",recursive = TRUE)
list_name<-gsub(as.character(access),"",list)
list_name<-gsub("\\/|\\.|\\[|\\]","-",list_name)
list_name<-gsub("\\-\\-","-",list_name)
list<-data.frame(list,list_name,stringsAsFactors = FALSE)
list
}
# read xml structure
get_structure<-function(xmlfile){
data<-xml(xmlfile,encoding="UTF-8")
data<-data %>% html_nodes("*")
output<-cbind(node_names=data %>% html_tag(),
node_text=data %>% html_text())
output<-data.frame(output)
output
}
write_result<-function(dataframe,name){
write.csv(dataframe,paste0("./Output/",name,".csv"),row.names=FALSE)
}
#use these three function
xml_list<-get_xmllist("./sample u.xlsx/")
for (i in 1:nrow(xml_list)){
data<-get_structure(xml_list$list[i])
write_result(data,xml_list$list_name[i])
}
#write the structure
xml_structure(html(xml_list$list[8]))
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29CDA 数据分析与量化策略分析流程:协同落地数据驱动价值 在数据驱动决策的实践中,“流程” 是确保价值落地的核心骨架 ——CDA ...
2025-08-29CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-28CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-08-28