700字范文 > Python爬虫入门教程 54-100 博客园等博客网站自动评论器

Python爬虫入门教程 54-100 博客园等博客网站自动评论器

时间：2020-05-09 20:04:32

爬虫背景

爬虫最核心的问题就是解决重复操作，当一件事情可以重复的进行的时候，就可以用爬虫来解决这个问题，今天要实现的一个基本需求是完成“博客园“ 博客的自动评论，其实原理是非常简单的，提炼一下需求

基本需求

登录博客园<不实现，登录单独编写博客>调用评论接口返回请求结果

确定流程之后，基本就是找突破口的环节了

实际的去评论一下，然后不管你用什么抓包工具都可以，只要抓取到你想要的数据，即可

评论API如下

Request URL: /mvc/PostComment/Add.aspxRequest Method: POST

POST URL 有了，下面就是参数的问题

我随便找了一个请求的参数

{"blogApp":"wuxiaobin","postId":10510784,"body":"继续研究","parentCommentId":0}

分析参数

blogApp 是博主的用户昵称

postid 是博文的ID

body 评论主体

parentCommentid 看参数命名知道应该是指的回复的那条ID

分析到这里，你就可以开始模拟请求了，一般情况下是不成功的，因为我们没有登录，不过，代码先写起来

观察请求头参数

请求头基本包含一些用户信息，必备部分如下，剩下的就是cookies部分了

origin: referer: /user-agent: Mozilla/5.0 (Windows NT 10.0; WOW64) x-requested-with: XMLHttpRequest

编写代码

import requestsimport jsonclass CnBlogs(object):def __init__(self):self._url = "/mvc/PostComment/Add.aspx"def run(self):params = {"blogApp":"wuxiaobin", # 博主ID"postId":10510784, # 评论博文的ID"body":"继续研究b", # 评论内容"parentCommentId":0}headers = {"origin": "","referer": "/","user-agent": "浏览器UA","x-requested-with": "XMLHttpRequest","cookie":".CNBlogsCookie=重要参数;"}res = requests.post("/mvc/PostComment/Add.aspx",data=params,headers=headers)print(json.loads(res.text))if __name__ == '__main__':cnblogs = CnBlogs()cnblogs.run()