京公网安备 11010802034615号
经营许可证编号:京B2-20210330
python是一款功能强大的数据分析工具,我们在平时的工作和生活中经常会用到。但是你知道如何使用python来提取视频中的素材吗?小编今天跟大家分享的就是如何使用python简单快速地提取电影中的片段,学会之后,能够省去我们剪辑的麻烦哦。
以下内容来源: Python的乐趣
作者: 一粒米饭
在上一篇中实现了基于人脸识别提取人物片段的功能,但是在实践过程中发现,如果是一部电影,那么提取到的片段太多了。为了找女神的电影片段,还要在辣么多剪辑中苦苦手工筛选,这个不是一个优秀的程序员应该做的。
经过一番实践和探索,发现了一个强大的库,叫做face_recognition。
本菜鸟也尝试过用opencv识别出图像,通过图像指纹计算出相似度,抑或通过图片向量的余弦相似度计算,奈何实现复杂,效果也不如face_recognition,只好弃暗投明。
face_recognition使用 dlib 顶尖的深度学习人脸识别技术构建,在户外脸部检测数据库基准(Labeled Faces in the Wild benchmark)上的准确率高达 99.38%。
项目地址:https://github.com/ageitgey/face_recognition#face-recognition
官方介绍了face_recognition以下基本功能:
1.1 找出图片中的人脸
1.2 找到并且控制图像中的脸部特征
1.3 识别图片中的人脸
在本文中使用的就是它的第三个功能识别图片中的人脸。
face需要依赖于dlib,dlib的安装参考How to install dlib v19.9 or newer from github on macOS and Ubuntu
face_recognition的使用需要基于Python3.3以上或Python2.7,操作系统为MacOS或Linux(Windows不提供官方支持)。安装命令如下:
$ pip install face_recognition
安装完成后可以在命令行使用face_recognition或在Python中调用。以在Python中“识别女神李一桐”为例,其过程如下:
Python代码如下:
import face_recognition
# 初始化
picture_of_liyitong = face_recognition.load_image_file("yilitong.jpg")
liyitong_encoding = face_recognition.face_encodings(picture_of_liyitong)[0]
# 加载对比图片
unknown_picture = face_recognition.load_image_file("unknown.jpg")
unknown_face_encoding = face_recognition.face_encodings(unknown_picture)[0]
# 用`compare_faces`方法继续对比得到结果,
# 值得注意的是第一个参数是一个列表,可以传多个图片参数进行对比
results = face_recognition.compare_faces([liyitong_encoding], unknown_face_encoding)
if results[0] == True:
print("图片中包含女神")
else:
print("未找到女神!")
提取女神视频的过程与之前《从视频中自动提取人物的视频片段》的思路类似。
1.1. 获取图片,用moivepy读取视频,用iter_frames方法从中获取图片帧;
1.2. 标记时间点,利用opencv识别图片中的人物并标记人物出现的起始时间点和结束时间点,并将这些时间点放到到一个列表中。
1.3. 视频截取,用moivepy将上一步中标记的时间片段从视频中截取出来,最后筛选出需要的视频片段即可。
只是将上面第二步中“用opencv识别图片中的人物”改为“用face_recognition进行对比”。代码实现如下:
from moviepy.editor import VideoFileClip
from moviepy.video.io.ffmpeg_tools import ffmpeg_extract_subclip
import face_recognition
def contain_godness(img, godness_encoding):
face_locations = face_recognition.face_locations(img)
is_godness = False
for (top_right_y, top_right_x, left_bottom_y,left_bottom_x) in face_locations:
unknown_image = img[top_right_y-50:left_bottom_y+50, left_bottom_x-50:top_right_x+50]
unknown_encoding = face_recognition.face_encodings(unknown_image)
if unknown_encoding:
results = face_recognition.compare_faces([godness_encoding], unknown_encoding[0])
print(results)
is_godness = results[0]
return is_godness
def find_durations(clip, godness_encoding):
"""
从视频中搜索女神片段
"""
duration_list = [] # 存储片段时间列表
start_time = 0 # 记录片段开始时间, 以毫秒为单位
end_time = 0 # 记录片段结束时间, 以毫秒为单位
last_index = 0
for i, img in enumerate(clip.iter_frames(fps=20)):
print(i)
flag = contain_godness(img, godness_encoding)
if flag and start_time == 0:
start_time = i / 20
last_index = i
if start_time > 0 and not flag:
end_time = i / 20
duration_list.append([start_time, end_time])
# 重置开始时间和结束时间
start_time = end_time = 0
# 打印片段时间列表并返回
print(duration_list)
return duration_list
if __name__ == "__main__":
filename = "demo.mp4"
clip = VideoFileClip(filename)
godness_image = face_recognition.load_image_file("godness.png")
godness_encoding = face_recognition.face_encodings(godness_image)[0]
durations = find_durations(clip, godness_encoding)
for d in durations:
start_t, end_t = d
ffmpeg_extract_subclip(filename, start_t, end_t)
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动决策的体系中,数据分析按照分析目的可分为描述性分析、诊断性分析、预测性分析与指导性分析四大类型。其中,诊断性分 ...
2026-09-01网络请求是Python爬虫开发、接口测试、数据拉取的核心基础功能,Python生态中主要依靠 urllib 和 requests 两大库实现HTTP请求操 ...
2026-09-01 很多数据分析师面对业务问题时,常常感到“知道要分析,却不知道用什么方法”。其实,数据分析并非无章可循——从三大基础范 ...
2026-09-01在数据库设计与业务数据维护中,自增ID是数据表最常用的主键字段,用于唯一标识每一条业务数据,正常状态下ID应保持连续递增。但 ...
2026-08-31在数理统计、数据分析、经济测算与日常量化评估中,平均值是刻画数据集中趋势、反映整体水平的基础核心指标。在实际应用中,最常 ...
2026-08-31在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-08-31在大数据时代背景下,海量行业数据亟需通过专业化工具挖掘潜在价值,辅助企业业务决策、优化运营模式、规避经营风险。Python凭借 ...
2026-08-28SQL是数据分析领域最基础、最核心的工具,承担着取数、清洗、统计、分层、归因的全流程工作。不同于单纯的语法练习,实战化SQL数 ...
2026-08-28 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-28随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-08-26在数理统计与数据分析领域,多因素方差分析与线性回归模型是研究变量关系、因素影响、数据差异规律的两大核心工具。二者均属于经 ...
2026-08-25数据分析的核心价值不在于数据计算与图表制作,而在于清晰、精准、有逻辑地输出结论、支撑业务决策。日常数据分析报告普遍存在结 ...
2026-08-25 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-08-25平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24