当前位置:   article > 正文

上班用Python采集热搜榜,堪称摸鱼神器_热词爬虫

热词爬虫

前言

不知道大家在工作无聊时,有没有一种冲动:总想掏出手机,看看微博热搜在讨论什么有趣的话题,但又不方便直接打开微博浏

览,今天就和大家分享一个有趣的小爬虫,定时采集微博热搜榜&热评,下面让我们来看看具体的实现方法。

页面分析

热搜页

热榜首页:https://s.weibo.com/top/summary?cate=realtimehot
  • 1

热榜首页的榜单中共五十条数据,在这个页面,我们需要获取排行、热度、标题,以及详情页的链接。

在这里插入图片描述

我们打开页面后要先 登录,之后使用 F12 打开开发者工具,Ctrl + R 刷新页面后找到第一条数据包。这里需要记录一下自己的

Cookie 与 User-Agent。
在这里插入图片描述

对于标签的定位,直接使用 Google 工具获取标签的 xpath 表达式即可。
在这里插入图片描述

详情页

对于详情页,我们需要获取评论时间、用户名称、转发次数、评论次数、点赞次数、评论内容这部分信息。
在这里插入图片描述

方法与热搜页采集方式基本相同,下面看看如何用代码实现!

采集代码

首先导入所需要的模块。

python插件/素材/源码加Q群:903971231####
import requests
from time import sleep
import pandas as pd
import numpy as np
from lxml import etree
import re
  • 1
  • 2
  • 3
  • 4
  • 5
  • 6
  • 7

定义全局变量

•headers:请求头

•all_df:DataFrame,保存采集的数据

headers = {
   
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/94.0.4606.54 Safari/537.36',
    'Cookie': '''你的Cookie'''
}
all_df = pd.DataFrame(columns=['排行', '热度', '标题', '评论时间', '用户名称', '转发次数', '评论次数', '点赞次数'
  • 1
  • 2
  • 3
  • 4
  • 5
声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/繁依Fanyi0/article/detail/102205
推荐阅读
相关标签
  

闽ICP备14008679号