python pdfplumber用于pdf表格提取
2024-09-17 16:43:35
import pdfplumber with pdfplumber.open('test.pdf') as pdf:
#page_count = len(pdf.pages())
p0 = pdf.pages[0]
# 获取文本,直接得到字符串,包括了换行符【与PDF上的换行位置一致,而不是实际的“段落”】
#print(p0.extract_text())
# 获取本页全部表格,也可以使用extract_table()获得单个表格
for table in p0.extract_tables():
#得到的table是嵌套list类型,转化成DataFrame更加方便查看和分析
for line in table:
print(line) #安装ImageMagick,地址在下面
#http://docs.wand-py.org/en/latest/guide/install.html#install-imagemagick-on-windows
16 #https://blog.csdn.net/blmoistawinde/article/details/82051915
最新文章
- was not declared in this scope
- 【转】ACM训练计划
- javascript类型注意事项
- C#判断网站运行状态是否正常
- 模拟键盘输入首先要用到一个API函数:keybd_event
- css基本属性
- log翻硬币
- 每天一个JavaScript实例-推断图片是否载入完毕
- 【高德地图API】那些年我们一起开发的APP—即LBS应用模式分享
- sw代码问题
- 阅读MDN文档之CSS选择器介绍(一)
- hive入门(一)、什么是hive
- 使用axios以及http-proxy-middleware代理处理跨域的问题
- MySQL my.cnf 配置文件注释
- PAT1008:Elevator
- HDU 1212 Big Number(C++ 大数取模)(java 大数类运用)
- 使用libcurl 发送post请求
- for in,Object.keys和Object.getOwnPropertyNames的区别
- render, render_to_response, redirect,
- BASIC-10_蓝桥杯_十进制转十六进制