python爬取网页内容转换为PDF文件

yipeiwu_com5年前Python爬虫

本文实例为大家分享了python爬取网页内容转换为PDF的具体代码,供大家参考,具体内容如下

将廖雪峰的学习教程转换成PDF文件,代码只适合该网站,如果需要其他网站的教程,可靠需要进行稍微的修改。

# coding=utf-8 
import os 
import re 
import time 
import pdfkit 
import requests 
from bs4 import BeautifulSoup 
from PyPDF2 import PdfFileMerger
import sys
reload(sys)
sys.setdefaultencoding('utf8')

html_template = """ 
<!DOCTYPE html> 
<html lang="en"> 
<head> 
  <meta charset="UTF-8"> 
</head> 
<body> 
{content} 
</body> 
</html> 

""" 

#----------------------------------------------------------------------
def parse_url_to_html(url, name): 
  """ 
  解析URL,返回HTML内容 
  :param url:解析的url 
  :param name: 保存的html文件名 
  :return: html 
  """ 
  try: 
    response = requests.get(url) 
    soup = BeautifulSoup(response.content, 'html.parser') 
    # 正文 
    body = soup.find_all(class_="x-wiki-content")[0] 
    # 标题 
    title = soup.find('h4').get_text() 

    # 标题加入到正文的最前面,居中显示 
    center_tag = soup.new_tag("center") 
    title_tag = soup.new_tag('h1') 
    title_tag.string = title 
    center_tag.insert(1, title_tag) 
    body.insert(1, center_tag) 
    html = str(body) 
    # body中的img标签的src相对路径的改成绝对路径 
    pattern = "(<img .*?src=\")(.*?)(\")" 

    def func(m): 
      if not m.group(3).startswith("http"): 
        rtn = m.group(1) + "http://www.liaoxuefeng.com" + m.group(2) + m.group(3) 
        return rtn 
      else: 
        return m.group(1)+m.group(2)+m.group(3) 
    html = re.compile(pattern).sub(func, html) 
    html = html_template.format(content=html) 
    html = html.encode("utf-8") 
    with open(name, 'wb') as f: 
      f.write(html) 
    return name 

  except Exception as e:
    print "解析错误!"

#----------------------------------------------------------------------
def get_url_list(): 
  """ 
  获取所有URL目录列表 
  :return: 
  """ 
  response = requests.get("http://www.liaoxuefeng.com/wiki/0014316089557264a6b348958f449949df42a6d3a2e542c000") 
  soup = BeautifulSoup(response.content, "html.parser") 
  menu_tag = soup.find_all(class_="uk-nav uk-nav-side")[1] 
  urls = [] 
  for li in menu_tag.find_all("li"): 
    url = "http://www.liaoxuefeng.com" + li.a.get('href') 
    urls.append(url) 
  return urls 

#----------------------------------------------------------------------
def save_pdf(htmls, file_name): 
  """ 
  把所有html文件保存到pdf文件 
  :param htmls: html文件列表 
  :param file_name: pdf文件名 
  :return: 
  """ 
  options = { 
    'page-size': 'Letter', 
    'margin-top': '0.75in', 
    'margin-right': '0.75in', 
    'margin-bottom': '0.75in', 
    'margin-left': '0.75in', 
    'encoding': "UTF-8", 
    'custom-header': [ 
      ('Accept-Encoding', 'gzip') 
    ], 
    'cookie': [ 
      ('cookie-name1', 'cookie-value1'), 
      ('cookie-name2', 'cookie-value2'), 
    ], 
    'outline-depth': 10, 
  } 
  pdfkit.from_file(htmls, file_name, options=options) 

#----------------------------------------------------------------------
def main(): 
  start = time.time() 
  file_name = u"liaoxuefeng_Python3_tutorial" 
  urls = get_url_list() 
  for index, url in enumerate(urls):
    parse_url_to_html(url, str(index) + ".html") 
  htmls =[] 
  pdfs =[] 
  for i in range(0,124): 
    htmls.append(str(i)+'.html') 
    pdfs.append(file_name+str(i)+'.pdf') 

    save_pdf(str(i)+'.html', file_name+str(i)+'.pdf') 

    print u"转换完成第"+str(i)+'个html' 

  merger = PdfFileMerger() 
  for pdf in pdfs:
    merger.append(open(pdf,'rb'))
    print u"合并完成第"+str(i)+'个pdf'+pdf 

  output = open(u"廖雪峰Python_all.pdf", "wb") 
  merger.write(output) 

  print u"输出PDF成功!" 

  for html in htmls: 
    os.remove(html) 
    print u"删除临时文件"+html 

  for pdf in pdfs: 
    os.remove(pdf) 
    print u"删除临时文件"+pdf 

  total_time = time.time() - start 
  print(u"总共耗时:%f 秒" % total_time)

#----------------------------------------------------------------------
def changeDir(dir_name):
  """
  目录切换
  """
  if not os.path.exists(dir_name):
    os.mkdir(dir_name)

  os.chdir(dir_name)
#----------------------------------------------------------------------
if __name__ == '__main__':
  #存放文件的路径
  dir_name = '/home/Python/Html'  
  changeDir(dir_name)
  main() 

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持【听图阁-专注于Python设计】。

相关文章

python爬虫 正则表达式使用技巧及爬取个人博客的实例讲解

python爬虫 正则表达式使用技巧及爬取个人博客的实例讲解

这篇博客是自己《数据挖掘与分析》课程讲到正则表达式爬虫的相关内容,主要简单介绍Python正则表达式爬虫,同时讲述常见的正则表达式分析方法,最后通过实例爬取作者的个人博客网站。希望这篇基...

Python正则抓取网易新闻的方法示例

Python正则抓取网易新闻的方法示例

本文实例讲述了Python正则抓取网易新闻的方法。分享给大家供大家参考,具体如下: 自己写了些关于抓取网易新闻的爬虫,发现其网页源代码与网页的评论根本就对不上,所以,采用了抓包工具得到了...

零基础写python爬虫之爬虫编写全记录

零基础写python爬虫之爬虫编写全记录

先来说一下我们学校的网站: http://jwxt.sdu.edu.cn:7777/zhxt_bks/zhxt_bks.html 查询成绩需要登录,然后显示各学科成绩,但是只显示成绩而没...

python打造爬虫代理池过程解析

最近在使用爬虫爬取数据时,经常会返回403代码,大致意思是该IP访问过于频繁,被限制访问。限制IP访问网站最常用的反爬手段了,其实破解也很容易,就是在爬取网站是使用代理即可,这个IP被限...

利用Python爬取微博数据生成词云图片实例代码

利用Python爬取微博数据生成词云图片实例代码

前言 在很早之前写过一篇怎么利用微博数据制作词云图片出来,之前的写得不完整,而且只能使用自己的数据,现在重新整理了一下,任何的微博数据都可以制作出来,一年一度的虐汪节,是继续蹲在角落默默...