赞
踩
不知道大家在工作无聊时,有没有一种冲动:总想掏出手机,看看微博热搜在讨论什么有趣的话题,但又不方便直接打开微博浏
览,今天就和大家分享一个有趣的小爬虫,定时采集微博热搜榜&热评,下面让我们来看看具体的实现方法。
热榜首页:https://s.weibo.com/top/summary?cate=realtimehot
热榜首页的榜单中共五十条数据,在这个页面,我们需要获取排行、热度、标题,以及详情页的链接。
我们打开页面后要先 登录,之后使用 F12 打开开发者工具,Ctrl + R 刷新页面后找到第一条数据包。这里需要记录一下自己的
Cookie 与 User-Agent。
对于标签的定位,直接使用 Google 工具获取标签的 xpath 表达式即可。
对于详情页,我们需要获取评论时间、用户名称、转发次数、评论次数、点赞次数、评论内容这部分信息。
方法与热搜页采集方式基本相同,下面看看如何用代码实现!
首先导入所需要的模块。
python插件/素材/源码加Q群:903971231####
import requests
from time import sleep
import pandas as pd
import numpy as np
from lxml import etree
import re
•headers:请求头
•all_df:DataFrame,保存采集的数据
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.54 Safari/537.36',
'Cookie': '''你的Cookie'''
}
all_df = pd.DataFrame(columns=['排行', '热度', '标题', '评论时间', '用户名称', '转发次数', '评论次数', '点赞次数'
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。