Mrli
别装作很努力,
因为结局不会陪你演戏。
Contacts:
QQ博客园

Python爬虫知识点——爬虫的基本原理

2019/09/15 爬虫 Python 计算机网络知识
Word count: 255 | Reading time: 1min

爬虫的基本原理

爬虫就是获取网页提取保存信息自动化程序

获取网页:

获取网页就是获取网页的源码,只要把源码获取下来,就可以从中提取想要的消息

爬虫的流程:想网站的服务器发送一个请求,返回的响应体就是网页的源代码。

>1,构造请求发送给服务器=>2.接受响应并解析

提取信息:

通过分析网页结构,提取网页信息。通常使用的解析库有:BeautifulSoup、lxml、pyquery,也可以使用正则,但是构造正则表达式比较复杂且易错

保存数据:

将提取的数据保存到某处以便后续利用。保存形式有:TXT、Json、数据库:MySQL、MongoDB、或远程服务器SFTP…

自动化程序

替人完成完成爬取工作的自动化程序,可以在抓取过程中进行异常处理……保证爬取的高效运行

Author: Mrli

Link: https://nymrli.top/2018/10/24/Python爬虫知识点——爬虫的基本原理/

Copyright: All articles in this blog are licensed under CC BY-NC-SA 3.0 unless stating additionally.

< PreviousPost
Python爬虫知识点——响应
NextPost >
Python爬虫知识点——URL与URI
CATALOG
  1. 1. 爬虫的基本原理
    1. 1.1. 获取网页:
    2. 1.2. 提取信息:
    3. 1.3. 保存数据:
    4. 1.4. 自动化程序