
Python实现简单过滤文本段的方法
这篇文章主要介绍了Python实现简单过滤文本段的方法,涉及Python针对文本的读取及字符串遍历、判断、打印等相关操作技巧,需要的朋友可以参考下
一、问题:
如下文本:
## Alignment 0: score=397.0 e_value=8.2e-18 N=9 scaffold1&scaffold106 minus
0- 0: 10026549 10007782 2e-75
0- 1: 10026550 10007781 8e-150
0- 2: 10026552 10007780 1e-116
0- 3: 10026555 10007778 0
0- 4: 10026570 10007768 0
0- 5: 10026579 10007758 4e-15
0- 6: 10026581 10007738 2e-44
0- 7: 10026587 10007734 9e-145
0- 8: 10026591 10007732 2e-147
## Alignment 1: score=2304.0 e_value=1e-164 N=47 scaffold1&scaffold107 minus
1- 0: 10026836 10007942 2e-84
1- 1: 10026839 10007940 0
1- 2: 10026840 10007938 0
1- 3: 10026842 10007937 9e-82
1- 4: 10026843 10007935 7e-79
1- 5: 10026847 10007933 3e-119
1- 6: 10026850 10007932 2e-87
1- 7: 10026854 10007928 5e-22
1- 8: 10026855 10007927 3e-101
1- 9: 10026856 10007925 1e-106
1- 10: 10026857 10007924 0
1- 11: 10026858 10007922 9e-123
1- 12: 10026859 10007921 1e-80
1- 13: 10026860 10007920 8e-104
1- 14: 10026862 10007918 4e-25
1- 15: 10026863 10007917 0
1- 16: 10026864 10007912 4e-40
1- 17: 10026865 10007911 0
1- 18: 10026866 10007910 7e-122
1- 19: 10026867 10007908 2e-25
1- 20: 10026868 10007907 0
1- 21: 10026869 10007905 0
1- 22: 10026870 10007904 3e-150
1- 23: 10026871 10007903 5e-77
1- 24: 10026874 10007901 0
1- 25: 10026875 10007897 0
1- 26: 10026876 10007896 0
1- 27: 10026877 10007894 0
1- 28: 10026880 10007893 3e-52
1- 29: 10026881 10007892 0
1- 30: 10026882 10007891 0
1- 31: 10026883 10007890 0
1- 32: 10026886 10007889 1e-50
1- 33: 10026887 10007888 6e-157
1- 34: 10026888 10007887 0
1- 35: 10026889 10007884 0
1- 36: 10026890 10007883 2e-18
1- 37: 10026891 10007882 9e-64
1- 38: 10026892 10007881 0
1- 39: 10026895 10007880 0
1- 40: 10026898 10007875 0
1- 41: 10026900 10007874 0
1- 42: 10026901 10007873 0
1- 43: 10026902 10007871 2e-123
1- 44: 10026903 10007870 0
1- 45: 10026905 10007869 0
1- 46: 10026909 10007868 1e-81
## Alignment 2: score=811.0 e_value=3.3e-43 N=17 scaffold1&scaffold111 minus
2- 0: 10026595 10007449 6e-40
2- 1: 10026599 10007448 4e-90
2- 2: 10026600 10007447 0
2- 3: 10026601 10007444 9e-55
2- 4: 10026603 10007438 4e-78
2- 5: 10026604 10007434 9e-122
2- 6: 10026606 10007432 2e-162
2- 7: 10026607 10007427 0
2- 8: 10026608 10007426 0
2- 9: 10026612 10007417 0
2- 10: 10026613 10007415 8e-128
2- 11: 10026614 10007414 3e-64
2- 12: 10026615 10007409 0
2- 13: 10026616 10007406 0
2- 14: 10026617 10007403 1e-171
2- 15: 10026618 10007402 0
2- 16: 10026619 10007397 7e-18
........
要求:如果Alignment后面少于20行,把整个的去掉
二、实现方法:
python代码:
#!/usr/bin/python
sum = 0
sumdata = []
FD = open("/root/data.txt","r")
line = FD.readline()
while line:
if line.find("Alignment") == 3:
if sum >= 20:
for i in sumdata:
print i,
sum=0
sumdata=[line]
else:
sum = sum + 1
sumdata.append(line)
line=FD.readline()
if len(line) == 0:
if sum >= 20:
for i in sumdata:
print i,
附:
perl代码
#!/usr/bin/perl
open(FD,"/root/data.txt");
while (){
if ($_ =~ /Alignment/){
if($sum >= 20){
print @sumdata;}
$sum=0;
@sumdata=($_);}
else{
$sum++;
push(@sumdata,$_);}
}
print @sumdata if $sum >=20;
close(FD);
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01CDA 数据分析师:企业数字化转型的核心引擎 —— 从能力落地到价值跃迁 当数字化转型从 “选择题” 变为企业生存的 “必答题”, ...
2025-09-01数据清洗工具全景指南:从入门到进阶的实操路径 在数据驱动决策的链条中,“数据清洗” 是决定后续分析与建模有效性的 “第一道 ...
2025-08-29机器学习中的参数优化:以预测结果为核心的闭环调优路径 在机器学习模型落地中,“参数” 是连接 “数据” 与 “预测结果” 的关 ...
2025-08-29CDA 数据分析与量化策略分析流程:协同落地数据驱动价值 在数据驱动决策的实践中,“流程” 是确保价值落地的核心骨架 ——CDA ...
2025-08-29CDA含金量分析 在数字经济与人工智能深度融合的时代,数据驱动决策已成为企业核心竞争力的关键要素。CDA(Certified Data Analys ...
2025-08-28CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-08-28PCU:游戏运营的 “实时晴雨表”—— 从数据监控到运营决策的落地指南 在游戏行业,DAU(日活跃用户)、MAU(月活跃用户)是衡量 ...
2025-08-28Excel 聚类分析:零代码实现数据分群,赋能中小团队业务决策 在数字化转型中,“数据分群” 是企业理解用户、优化运营的核心手段 ...
2025-08-28CDA 数据分析师:数字化时代数据思维的践行者与价值推动者 当数字经济成为全球经济增长的核心引擎,数据已从 “辅助性信息” 跃 ...
2025-08-28ALTER TABLE ADD 多个 INDEX:数据库批量索引优化的高效实践 在数据库运维与性能优化中,索引是提升查询效率的核心手段。当业务 ...
2025-08-27Power BI 去重函数:数据清洗与精准分析的核心工具 在企业数据分析流程中,数据质量直接决定分析结果的可靠性。Power BI 作为主 ...
2025-08-27CDA 数据分析师:数据探索与统计分析的实践与价值 在数字化浪潮席卷各行业的当下,数据已成为企业核心资产,而 CDA(Certif ...
2025-08-27t 检验与 Wilcoxon 检验:数据差异比较的两大统计利器 在数据分析中,“比较差异” 是核心需求之一 —— 如新药疗效是否优于旧药 ...
2025-08-26季节性分解外推法:解锁时间序列预测的规律密码 在商业决策、资源调度、政策制定等领域,准确的预测是规避风险、提升效率的关键 ...
2025-08-26