使用BeautifulSoup爬虫程序获取百度搜索结果的标题和url示例

yipeiwu_com5年前 (2020-03-06)Python爬虫

熟悉Java的jsoup包的话，对于Python的BeautifulSoup库应该很容易上手。

复制代码代码如下:

#coding: utf-8
import sys
import urllib
import urllib2
from BeautifulSoup import BeautifulSoup

question_word = "吃货程序员"
url = "http://www.baidu.com/s?wd=" + urllib.quote(question_word.decode(sys.stdin.encoding).encode('gbk'))
htmlpage = urllib2.urlopen(url).read()
soup = BeautifulSoup(htmlpage)
print len(soup.findAll("table", {"class": "result"}))
for result_table in soup.findAll("table", {"class": "result"}):
    a_click = result_table.find("a")
    print "-----标题----\n" + a_click.renderContents()#标题
    print "----链接----\n" + str(a_click.get("href"))#链接
    print "----描述----\n" + result_table.find("div", {"class": "c-abstract"}).renderContents()#描述
    print

返回列表

上一篇：Python字符转换

下一篇：PHP生成静态页面详解

相关文章

python爬虫实现教程转换成 PDF 电子书

python爬虫实现教程转换成 PDF 电子书

写爬虫似乎没有比用 Python 更合适了，Python 社区提供的爬虫工具多得让你眼花缭乱，各种拿来就可以直接用的 library 分分钟就可以写出一个爬虫出来，今天就琢磨着写一个爬虫...

Python HTML解析模块HTMLParser用法分析【爬虫工具】

本文实例讲述了Python HTML解析模块HTMLParser用法。分享给大家供大家参考，具体如下：简介先简略介绍一下。实际上，HTMLParser是python用来解析HTML的...

Python数据抓取爬虫代理防封IP方法

Python数据抓取爬虫代理防封IP方法

爬虫：一段自动抓取互联网信息的程序，从互联网上抓取对于我们有价值的信息，一般来说，Python爬虫程序很多时候都要使用（飞猪IP）代理的IP地址来爬取程序，但是默认的urlopen是无法...

Python爬虫之正则表达式基本用法实例分析

Python爬虫之正则表达式基本用法实例分析

本文实例讲述了Python爬虫之正则表达式基本用法。分享给大家供大家参考，具体如下：一、简介正则表达式，又称正规表示式、正规表示法、正规表达式、规则表达式、常规表示法（英语：Regu...

浅谈Python爬取网页的编码处理

浅谈Python爬取网页的编码处理

背景中秋的时候，一个朋友给我发了一封邮件，说他在爬链家的时候，发现网页返回的代码都是乱码，让我帮他参谋参谋(中秋加班，真是敬业= =！)，其实这个问题我很早就遇到过，之前在爬小说的时候...