百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

Python读取PDF文档并翻译(python 读pdf文件)

off999 2024-09-21 20:58 38 浏览 0 评论

自制文档翻译小工具,告别xxx词典的收费翻译!

翻译服务选择免费的百度翻译api

https://api.fanyi.baidu.com/
标准版服务完全免费,不限使用字符量
完成身份认证,还可免费升级至高级版、尊享版,每月享受200万免费字符量及增值服务
# -*- coding: utf-8 -*-
 
import random
import hashlib
import sys
import importlib
importlib.reload(sys)
import time
from pdfminer.pdfparser import PDFParser,PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import *
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed
 
 
#**********翻译部分********************
def fanyi(query):
    import http.client
    import hashlib
    import urllib
    import random
    import json
    appid = ''  # !!!!补充
    secretKey = ''  # !!!!补充
    httpClient = None
    myurl = '/api/trans/vip/translate'
    q = query
    fromLang = 'auto'
    toLang = 'zh'
    salt = random.randint(32768, 65536)
 
    sign = appid + q + str(salt) + secretKey
    m1 = hashlib.md5()
    m1.update(sign.encode())
    sign = m1.hexdigest()
    myurl = myurl + '?appid=' + appid + '&q=' + urllib.parse.quote(
        q) + '&from=' + fromLang + '&to=' + toLang + '&salt=' + str(salt) + '&sign=' + sign
    # print(urllib.parse.quote(q))
    try:
        httpClient = http.client.HTTPConnection('api.fanyi.baidu.com')
        httpClient.request('GET', myurl)
        # response是HTTPResponse对象
        response = httpClient.getresponse()
        html = response.read()  # bytes
        # print("html:  ",type(html),html)
        html_str = html.decode()  # bytes to str
        # print("html_str:  ",type(html_str),html_str)
        html_dict = json.loads(html_str)  # str to dict
        # print("html_dist:  ",type(html_dict),html_str)
        # result_ori = html_dict["trans_result"][0]["src"]
        # result_tar = html_dict["trans_result"][0]["dst"]
        # print(html_dict["trans_result"])
        result_tar = ''
        for i in html_dict["trans_result"]:
            result_tar += i["dst"]
        # print(result_ori, " --> ", result_tar)
        print("翻译文本: " + result_tar)
        print("*" * 100)
        return result_tar
    except Exception as e:
        print(e)
        return ''
    finally:
        if httpClient:
            httpClient.close()
 
 
'''
解析pdf文件,获取文件中包含的各种对象
'''
 
# 解析pdf文件函数
def parse(pdf_path):
    textName = pdf_path.split('\\')[-1].split('.')[0] + '.txt'
    fp = open(pdf_path, 'rb')  # 以二进制读模式打开
    # 用文件对象来创建一个pdf文档分析器
    parser = PDFParser(fp)
    # 创建一个PDF文档
    doc = PDFDocument()
    # 连接分析器 与文档对象
    parser.set_document(doc)
    doc.set_parser(parser)
 
    # 提供初始化密码
    # 如果没有密码 就创建一个空的字符串
    doc.initialize()
 
    # 检测文档是否提供txt转换,不提供就忽略
    if not doc.is_extractable:
        raise PDFTextExtractionNotAllowed
    else:
        # 创建PDf 资源管理器 来管理共享资源
        rsrcmgr = PDFResourceManager()
        # 创建一个PDF设备对象
        laparams = LAParams()
        device = PDFPageAggregator(rsrcmgr, laparams=laparams)
        # 创建一个PDF解释器对象
        interpreter = PDFPageInterpreter(rsrcmgr, device)
 
        # 用来计数页面,图片,曲线,figure,水平文本框等对象的数量
        num_page, num_image, num_curve, num_figure, num_TextBoxHorizontal = 0, 0, 0, 0, 0
 
        # 循环遍历列表,每次处理一个page的内容
        for page in doc.get_pages(): # doc.get_pages() 获取page列表
            num_page += 1  # 页面增一
            print("\r\n>> 当前页:", num_page)
            interpreter.process_page(page)
            # 接受该页面的LTPage对象
            layout = device.get_result()
            for x in layout:
                if isinstance(x,LTImage):  # 图片对象
                    num_image += 1
                if isinstance(x,LTCurve):  # 曲线对象
                    num_curve += 1
                if isinstance(x,LTFigure):  # figure对象
                    num_figure += 1
                if isinstance(x, LTTextBoxHorizontal):  # 获取文本内容
                    num_TextBoxHorizontal += 1  # 水平文本框对象增一
                    results = x.get_text()
                    print(results.replace('\n', ''))
                    # 保存文本内容
                    with open(textName, 'a+', encoding='utf8') as f:
                        results = x.get_text()
                        f.write(results.replace('\n', '') + '\n')
        print('对象数量:\n','页面数:%s\n'%num_page,'图片数:%s\n'%num_image,'曲线数:%s\n'%num_curve,'水平文本框:%s\n'
              %num_TextBoxHorizontal)
 
import os
if __name__ == '__main__':
    pdf_path = r'A Survey on Network Methodologies for.pdf'
    rootPath = '\\'.join(pdf_path.split('\\')[:-1]) if "\\" in pdf_path else ''
    textName = pdf_path.split('\\')[-1].split('.')[0] + '.txt'
    print(">> 当前文件:", os.path.join(rootPath, textName))
    if os.path.exists(os.path.join(rootPath, textName)):
        print(">> 删除:", textName)
        os.remove(os.path.join(rootPath, textName))
    if os.path.exists(os.path.join(rootPath, "translate.txt")):
        print(">> 删除:", "translate.txt")
        os.remove(os.path.join(rootPath, "translate.txt"))
 
    parse(pdf_path)
 
    with open(textName, 'r', encoding='utf8') as f:
        content = f.read()
        results = content.split('.')
        for i in results:
            res = fanyi(i)
            with open("translate.txt", 'a+', encoding='utf8') as fp:
                fp.write(res + '\n')
            time.sleep(1)

运行中:

pdf转txt:

翻译:


pdf转文字问题、分句问题,翻译结果可能不准,仅供参考。

相关推荐

笔记本无音频输出设备(笔记本无音频输出设备)

1、没有声卡驱动,解决方法就是找到笔记本的官网,下载电脑声卡的驱动安装即可。2、没有外界的音频播放设备,解决方法就是买一个外界的音频播放设备插到电脑主机的音频接口上即可。笔记本电脑显示未安装任何音频输...

iso文件能用手机打开吗(iso文件能用手机打开吗安全吗)

一般的压缩软件就可以打开的,比如,好压软件,这个打开只是解压形式的,如果你说的是运行iso文件,这个没有,况且安卓系统也不支持iso运行ISO文件一般用于光盘镜像文件的存储,如果想要在手机上运行ISO...

win7系统卡顿怎么优化(win7很慢很卡怎么优化)

1、首先打开安全卫士,进入安全卫士首页,单击软件窗口右下角的“更多”图标,打开扩展应用程序。2、单击选择“我的工具”。3、在我的工具菜单里面找到“人工服务”单击打开人工服务。4、在人工服务对话框有很多...

如何查看c盘微信聊天记录(如何查看c盘微信聊天记录内存大小)

微信群中的消息只要没删除基本都能保存,想要找微信群中几个多月前的消息可以直接根据日期来查找聊天记录。操作如下:1、打开想要查找记录的微信群,点击右上角人形图标;2、点击查找聊天内容;3、选择按日...

office2016家庭版激活密钥(office家庭版激活码2019)

走淘宝吧,因为零售版的密钥只能用一次。大概几块钱就能激活2016。如果你不在乎钱的话可以向我一样,订阅一个office365.实在不行可以和几个人一起买一个家庭版的365.出现这个情况,找微软申诉是没...

移动硬盘驱动器下载安装(移动硬盘驱动器下载安装教程)

1、右键单击您的桌面,选择“新建文件夹”,并命名该文件夹(例如“usb驱动程序”);2、然后到本站下载驱动程序;3、将其解压缩至在您的桌面上刚刚创建的usb驱动程序文件夹;4、单击开始菜单,然后选择设...

电脑硬盘格式化工具(电脑 格式化硬盘)

硬盘格式化工具很多,PQMACGIG8.0(中文就叫硬盘分区魔法师)是比较好的一个,这个是在WINDOWS下比叫好用,(个人感觉)FDISK也是比较好的一个,这个一般用在DOS下分区格式化WIN...

photoshop是一款什么软件(ps指的是什么软件)

这个说法是错误的,ps软件“即:photoshop”是由美国著名的“adobe阿多比”公司出品的专业的图像处理软件,它不是由微软公司出品的软件。众所周知的是,微软公司以设计视窗操作系统名满全球,它出...

ipad越狱的好处与坏处(ipad越狱好不好)

  好处一:  1、重命名、重组应用程序  如果你看着Sparrow(iOS最优秀邮件客户端)这个名字不爽,越狱之后就可以改成“Email”,如果你觉得“豆瓣电台”这个名字不给力,那就改成“中央人民广...

win7光盘重装系统步骤图解(win7光盘如何重装系统)

1.确认您的电脑支持从光盘启动。如果支持,可以直接将Windows7安装光盘插入电脑的光驱中。 2.打开电脑,按下F2、F10、F12或Delete等键进入BIOS设置界面。 ...

电脑已联网却无法上网(电脑已经联网了但是不能上网)

电脑连上网后,仍可能存在无法上网的情况,这可能是由多种原因造成的。以下是一些可能的原因和解决方法:1.浏览器问题:有时候,浏览器可能会出现故障,导致无法正常访问网络。您可以尝试清除浏览器的缓存和co...

u盘价格一览表(u盘单价)

不同品牌价格不同,不同内存价格也不同,例如8g、16g、32g、64g等多种容量大小的,根据容量的不同,报价在29元到120元之间不等。闪存盘虽然小,但相对来说却有很大的存储容量。U盘大多能够存储比一...

windows查看ip命令(windows如何查看ip地址)

查看电脑IP:    1)使用Windows+R键打开“运行”窗口,然后输入CMD进入命令提示窗口2)进入命令窗口之后,输入:ipconfig/all回车即可...

内存条的作用(内存条的作用和参数配置)

内存条是存储电脑运行所需的数据和程序,帮助CPU快速读取和运行,提高计算机的运行速度和处理能力。内存条也被称为随机存取存储器(RAM),是电脑中非常必要的一个组件。常见的内存条类型有DDR、DDR2、...

autocad2012安装失败(autocad2012无法安装)

如果您遇到CAD2012安装不了的问题,可能有几个原因导致这种情况。以下是一些常见的解决方法:1.确保系统要求:首先,请确保您的计算机符合CAD2012的系统要求。检查您的操作系统版本、内存、处理器...

取消回复欢迎 发表评论: