利用python快速读取pdf文件（python 读取pdf）

off999 2024-09-21 20:58 54 浏览 0 评论

import PyPDF2
import re
import threading

# 读取pdf文件
def read_pdf(file_path):
    try:
        with open(file_path, 'rb') as file:
            pdf = PyPDF2.PdfFileReader(file)
            return pdf
    except Exception as e:
        print("读取pdf文件出错：", e)
        return None

# 判断关键字是否在pdf中
def is_keyword_in_pdf(pdf, keyword):
    for i in range(pdf.numPages):
        page = pdf.getPage(i)
        text = page.extractText()
        if re.search(keyword, text):
            return True, i+1
    return False, -1

# 处理pdf中的乱码
def decode_text(text):
    try:
        decoded_text = text.encode('latin-1').decode('utf-8')
        return decoded_text
    except Exception as e:
        print("解码出错：", e)
        return text

# 处理pdf中的表格、图等
def process_pdf_content(content):
    # 处理表格
    table_pattern = r"\+-+\+"
    content = re.sub(table_pattern, "", content)

    # 处理图
    image_pattern = r"\[Image:[^\]]+\]"
    content = re.sub(image_pattern, "", content)

    return content

# 读取pdf内容
def read_pdf_content(pdf, page_num):
    try:
        page = pdf.getPage(page_num)
        text = page.extractText()
        decoded_text = decode_text(text)
        return decoded_text
    except Exception as e:
        print("读取pdf内容出错：", e)
        return None

# 多线程处理pdf
def process_pdf(file_path, keyword):
    pdf = read_pdf(file_path)
    if pdf is None:
        return

    is_keyword, page_num = is_keyword_in_pdf(pdf, keyword)
    if is_keyword:
        content = read_pdf_content(pdf, page_num)
        if content is not None:
            content = process_pdf_content(content)
            content_list = content.split('\n')
            if keyword in content_list:
                keyword_index = content_list.index(keyword)
                if keyword_index < len(content_list) - 1:
                    next_value = content_list[keyword_index + 1]
                    print("关键字'{}'在第{}页，后一位的值为：{}".format(keyword, page_num, next_value))
    else:
        print("关键字'{}'不在pdf中".format(keyword))

# 创建多线程
def create_threads(file_path_list, keyword):
    threads = []
    for file_path in file_path_list:
        thread = threading.Thread(target=process_pdf, args=(file_path, keyword))
        threads.append(thread)
    
    return threads

# 平均分配数据执行多线程
def execute_threads(threads):
    thread_count = len(threads)
    for i in range(thread_count):
        threads[i].start()
    for i in range(thread_count):
        threads[i].join()

# 主函数
def main():
    file_path_list = ['file1.pdf', 'file2.pdf', 'file3.pdf']  # pdf文件路径列表
    keyword = '关键字'  # 关键字

    threads = create_threads(file_path_list, keyword)
    execute_threads(threads)

if __name__ == '__main__':
    main()

注意事项：