当前位置:   article > 正文

大众点评评论抓取_大众点评评论爬取

大众点评评论爬取

一、背景

大众点评评论部分还是值得我们关注的,因为我们上点评网看的也就是评论,通过评论抓取分析,也有利于我们对店铺有更加清晰的定位

二、 抓取分析

首先通过店铺列表页可以得到各家店铺的URL列表,或者店铺的ID,因为店铺详情页就是通过店铺ID做的相应拼接。如:http://www.dianping.com/shop/2972056/review_all/p; 第一个关键字就是店铺ID,第二个关键字为评论详情页,第三个P则为翻页。注意review_all是关键字。

详情页我们抓取了用户名称,用户url链接,以及用户对店铺做的一些相应评价。

三、 数据抓取

该网站好多数据都通过Ajax请求传送,但这部分评论信息没找到,因此通过普通方式抓取,同时它的user-agent很特别,不能带cookie信息,也不能带Referer信息,否则不会给你返回值,但是做大量翻页抓取的时候要不断迭代改变Regerer,这样才不至于被反爬。

代码:

  1. #!/usr/bin/env python
  2. # encoding: utf-8
  3. """
  4. @version: v1.0
  5. @author: W_H_J
  6. @license: Apache Licence
  7. @contact: 415900617@qq.com
  8. @site:
  9. @software: PyCharm
  10. @file: dazhongdianpin.py
  11. @time: 2018/8/1 10:32
  12. @describe: 抓取大众点评评论信息
  13. """
  14. import csv
  15. import requests
  16. from pyquery import PyQuery as pq
  17. headers = {
  18. 'Host': 'www.dianping.com',
  19. 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 Safari/535.19',
  20. 'Accept-Encoding': 'gzip',
  21. }
  22. def spiderDazhong(ID):
  23. try:
  24. html = requests.get("http://www.dianping.com/shop/%s/review_all"%(ID), headers=headers)
  25. doc = pq(html.text)
  26. if doc:
  27. # 存入csv文件
  28. out = open('./data/Stu_csv.csv', 'a', newline='',encoding="utf-8")
  29. # 设定写入模式
  30. csv_write = csv.writer(out, dialect='excel')
  31. shopName = doc("div.review-list-header > h1 > a").text()
  32. shopurl = "http://www.dianping.com"+doc("div.review-list-header > h1 > a").attr("href")
  33. csv_write.writerow(["店铺名称","店铺网址"])
  34. csv_write.writerow([shopName,shopurl])
  35. csv_write.writerow(["用户名", "用户ID链接", "评定星级", "评论描述", "评论详情", "评论时间", "评论商铺", "评论图片"])
  36. # 解析评论
  37. pinglunLi = doc("div.reviews-items > ul > li").items()
  38. for data in pinglunLi:
  39. userName = data("div.main-review > div.dper-info > a").text()
  40. userID = "http://www.dianping.com"+data("div.main-review > div.dper-info > a").attr("href")
  41. startShop = str(data("div.review-rank > span").attr("class")).split(" ")[1].replace("sml-str","")
  42. describeShop = data("div.review-rank > span.score").text()
  43. pinglunShop = data("div > div.review-words").text().replace("收起评论","").replace(" ","").replace("\n","")
  44. timeShop = data("div.main-review > div.misc-info.clearfix > span.time").text()
  45. Shop = data("div.main-review > div.misc-info.clearfix > span.shop").text()
  46. imgShop = data("div > div.review-pictures > ul > li> a").items()
  47. imgList = []
  48. for img in imgShop:
  49. imgList.append("http://www.dianping.com"+img.attr("href"))
  50. # 写入具体内容
  51. csv_write.writerow([userName,userID,startShop,describeShop,pinglunShop,timeShop,Shop,imgList])
  52. print("successful insert csv!")
  53. except Exception as e:
  54. print("error",str(e))
  55. if __name__ == '__main__':
  56. # 代表各大商铺ID,可通过商铺列表页回去
  57. listShop = ["2972056", "91018291","69952338"]
  58. for shop in listShop:
  59. spiderDazhong(shop)

四、 完整代码

完整代码可见github:https://github.com/Liangchengdeye/DaZhongdianping.git

五、加密字体解析抓取

新博文:

大众点评评论抓取-加密评论信息完整抓取: https://blog.csdn.net/sinat_32651363/article/details/85123876

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/不正经/article/detail/368346
推荐阅读
相关标签
  

闽ICP备14008679号