赞
踩
目录
运用正则表达式,找到相对应的数据,然后对数据进行清洗,最后保存数据,保存为excel文件和保存到数据库中。(这里用的是sqlite数据库)
import re # 正则表达式,进行文字匹配
from urllib.request import Request
from urllib.request import urlopen # 制定URL,获取网页数据
from urllib.error import URLError as error
import json
import xlwt
import sqlite3
爬取到的信息是很多,需要用正则表达式进行匹配,一个工作岗位有:8个属性,我只爬取职位名称、公司名称、公司链接、工资、工作地点、是否是实习、员工待遇。
def main():
baseurl = "https://search.51job.com/list/000000,000000,0000,00,9,99,python,2,{}.html?lang=c&po
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。