很多时候,我们要查看的内容必须要先登录才能找到,比如知乎的回答,QQ空间的好友列表、微博上关注的人和粉丝等。要使用爬虫直接登录抓取这些信息时,有一个不太好解决的难题,就是这些网站设置的登录规则以及登录时的验证码识别。不过,我们可以想办法绕过去,思路是这样的:先使用浏览器登录,从浏览器获取登录后的“凭证”,然后将这个“凭证”放到爬虫里,模拟用户的行为继续抓取。…
标签归档:爬虫
Python网络爬虫6 – 网页编码
在抓取网页时遇到了一段报错信息:
|
1 2 3 4 5 6 |
Traceback (most recent call last): File "D:/pythonDevelop/spider/pic_grab.py", line 14, in <module> print(get("http://pp.163 |
Python网络爬虫5 – 图片抓取
这一节看下如何抓取网页中的图片。目标网址是:http://pp.163.com/longer-yowoo/pp/10069141.html。这里有一组我非常喜欢的图片。
要抓取网页首先就要找出图片的网址。这里仍然是使用BeautifulSoup,具体如何使用在前一节《使用BeautifulSoup解析网页》时说过,现在就不说了。看下代码好了:
|
1 2 3 |
Python网络爬虫4 – 多线程抓取
之前的内容已经大致实现了如何获取网页、分析网页、获取目标内容。接下来的目标是如何让网页抓取进行得更效率些。在进行抓取的时候,时间的消耗主要是在请求等待的时间上,所以一个最容易想到的优化方式就是使用多线程。
多线程
多线程的实现还是比较简单的,下面是一个简单的线程实现方案:
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 |
#!python # encoding |
Python网络爬虫2 – 请求中遇到的几个问题
这次尝试下怎样搜索电影并解析出磁力链接信息。
搜索的网址是:https://www.torrentkitty.tv/search/。
开始了!
使用FireFox打开上面的网址,输入要搜索的电影。在点击搜索按钮前记得打开FireBug,并激活“网络”页签。
查看了请求的详情有些哭笑不得:点击搜索按钮后网页跳转到了这样的地址:https://www.torrentki…
Python网络爬虫1 – 简单的Http请求
最近这段时间会有需要写一个网络爬虫。会在这里将实现网络爬虫的经验记录下来。
爬虫什么的,只是一个名字罢了。简单地说,也都是从http请求开始的。
Python实现http请求主要依赖的是urllib.request模块。例如发送http get请求:
|
1 2 3 4 5 |
from urllib import request url = 'http://www.zh |