This commit is contained in:
512song committed 2021-11-08 22:13:52 +08:00
1 parent b208898522
commit a707437a2b
2 files changed
+217 -87

No files matched your search

+77 -8
View File
@@ -29,8 +29,8 @@
"import openpyxl\n",
"import math\n",
"\n",
"fi_xls = os.getcwd() + '/file/中国石油化工股份有限公司安庆炼化分公司员工在职人员名单.xlsx'\n",
"fi_path = os.getcwd() + '/file/210924'\n",
"fi_xls = os.getcwd() + '/北海炼化名单表(202110).xlsx'\n",
"fi_path = os.getcwd() + '/file/211028'\n",
"old = []\n",
"dict1 = {}\n",
"\n",
@@ -38,14 +38,14 @@
"sheet = wb.active\n",
"depart = []\n",
"for n in range(2,sheet.max_row+1): \n",
" m_name = sheet.cell(n,1).value.strip()\n",
" m_name = str(sheet.cell(n,1).value)\n",
" m_depart = sheet.cell(n,5).value\n",
" if m_depart not in depart:\n",
" depart.append(sheet.cell(n,5).value)\n",
" dict1[int(m_name.split('.')[0])] = [sheet.cell(n,2).value.strip(),sheet.cell(n,5).value.strip()]\n",
" \n",
"# 创建部门办公室 \n",
"m_path = os.getcwd()+'/file/210924/new'\n",
"m_path = os.getcwd()+'/file/211028/new'\n",
"for pn in depart:\n",
" if not os.path.exists(m_path + '/' + pn):\n",
" os.mkdir(m_path + '/' + pn)\n",
@@ -402,7 +402,9 @@
"cell_type": "code",
"execution_count": null,
"id": "0b0d621c-f2be-4dcb-a1f0-4b16196d25ee",
"metadata": {},
"metadata": {
"tags": []
},
"outputs": [],
"source": [
"from newpdfminer.pdfparser import PDFParser, PDFDocument\n",
@@ -411,7 +413,7 @@
"from newpdfminer.layout import LAParams, LTTextBox\n",
"from newpdfminer.pdfinterp import PDFTextExtractionNotAllowed\n",
"\n",
"path = \"5.pdf\"\n",
"path = \"file/211027/114.pdf\"\n",
"\n",
"# 用文件对象来创建一个pdf文档分析器\n",
"praser = PDFParser(open(path, 'rb'))\n",
@@ -504,9 +506,11 @@
},
{
"cell_type": "code",
"execution_count": 38,
"execution_count": null,
"id": "5ff3d5dd-b8dd-4707-8e29-26ba6cf97070",
"metadata": {},
"metadata": {
"tags": []
},
"outputs": [],
"source": [
"import fitz\n",
@@ -534,6 +538,71 @@
"\n",
"pdf2image1(file_path, dir_path)"
]
},
{
"cell_type": "markdown",
"id": "7e86692e-43fe-4aaa-a72f-2fe25fc3597e",
"metadata": {},
"source": [
"### Pdf文件拆分"
]
},
{
"cell_type": "code",
"execution_count": null,
"id": "c4931fc0-7f0b-4f78-8c8f-151dce930a6b",
"metadata": {
"tags": []
},
"outputs": [],
"source": [
"import os, sys\n",
"from PyPDF2 import PdfFileWriter, PdfFileReader, PdfFileMerger\n",
"\n",
"file = \"file/211027/114.pdf\"\n",
"pdf_reader = PdfFileReader(file)\n",
"n = pdf_reader.numPages\n",
"print(n)\n",
"pdfWriter = PdfFileWriter()\n",
"pageObj = pdf_reader.getPage(n-2)\n",
"pageObj.scaleBy(1)\n",
"pdfWriter.addPage(pageObj)\n",
"with open('split_114.pdf', 'wb') as pdfOutputFile:\n",
" pdfWriter.write(pdfOutputFile)\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"id": "2382429a-7b73-42bc-bef6-67a0b69a449d",
"metadata": {
"tags": []
},
"outputs": [],
"source": [
"import fitz\n",
"import os\n",
"\n",
"file = \"file/211027/114.pdf\"\n",
"doc = fitz.open(file)\n",
"n = doc.page_count\n",
"print(n)\n",
"doc2 = fitz.open()\n",
"page = doc[n - 2]\n",
"#doc2.insert_pdf(doc, to_page = n-2) # first 10 pages\n",
"doc2.insert_pdf(doc, from_page = n-2,to_page = n-2)\n",
"#print(type(page))\n",
"#doc2.insert_pdf(page) # last 10 pages\n",
"doc2.save(\"first-and-last-10.pdf\")\n"
]
},
{
"cell_type": "code",
"execution_count": null,
"id": "ed609077-c179-4041-8ad2-200f02c4ea83",
"metadata": {},
"outputs": [],
"source": []
}
],
"metadata": {