小水滴真的是太可爱了吧

2020-09-22 21:35 已编辑门头沟学院产品经理

关注

【爬虫学习笔记day29】3.7. 尝试对验证码进行机器识别处理+尝试对知乎网验证码进行处理+尝试处理中文字符

文章目录

3.7. 尝试对验证码进行机器识别处理
- 尝试对知乎网验证码进行处理：
- 尝试处理中文字符

3.7. 尝试对验证码进行机器识别处理

尝试对知乎网验证码进行处理：

许多流行的内容管理系统即使加了验证码模块，其众所周知的注册页面也经常会遭到网络机器人的垃圾注册。

那么，这些网络机器人究，竟是怎么做的呢?既然我们已经，可以成功地识别出保存在电脑上的验证码了，那么如何才能实现一个全能的网络机器人呢?

大多数网站生成的验证码图片都具有以下属性。

它们是服务器端的程序动态生成的图片。验证码图片的 src 属性可能和普通图片不太一样，比如 <img src="WebForm.aspx?id=8AP85CQKE9TJ">，但是可以和其他图片一样进行下载和处理。
图片的答案存储在服务器端的数据库里。
很多验证码都有时间限制，如果你太长时间没解决就会失效。
常用的处理方法就是，首先把验证码图片下载到硬盘里，清理干净，然后用 Tesseract 处理图片，最后返回符合网站要求的识别结果。

#!/usr/bin/env python
# -*- coding:utf-8 -*-

import requests
import time
import pytesseract
from PIL import Image
from bs4 import BeautifulSoup

def captcha(data):
    with open('captcha.jpg','wb') as fp:
        fp.write(data)
    time.sleep(1)
    image = Image.open("captcha.jpg")
    text = pytesseract.image_to_string(image)
    print "机器识别后的验证码为：" + text
    command = raw_input("请输入Y表示同意使用，按其他键自行重新输入：")
    if (command == "Y" or command == "y"):
        return text
    else:
        return raw_input('输入验证码：')

def zhihuLogin(username,password):

    # 构建一个保存Cookie值的session对象
    sessiona = requests.Session()
    headers = {
   'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:47.0) Gecko/20100101 Firefox/47.0'}

    # 先获取页面信息，找到需要POST的数据（并且已记录当前页面的Cookie）
    html = sessiona.get('https://www.zhihu.com/#signin', headers=headers).content

    # 找到 name 属性值为 _xsrf 的input标签，取出value里的值
    _xsrf = BeautifulSoup(html ,'lxml').find('input', attrs={
   'name':'_xsrf'}).get('value')

    # 取出验证码，r后面的值是Unix时间戳,time.time()
    captcha_url = 'https://www.zhihu.com/captcha.gif?r=%d&type=login' % (time.time() * 1000)
    response = sessiona.get(captcha_url, headers = headers)


    data = {
   
        "_xsrf":_xsrf,
        "email":username,
        "password":password,
        "remember_me":True,
        "captcha": captcha(response.content)
    }

    response = sessiona.post('https://www.zhihu.com/login/email', data = data, headers=headers)
    print response.text

    response = sessiona.get('https://www.zhihu.com/people/maozhaojun/activities', headers=headers)
    print response.text


if __name__ == "__main__":
    zhihuLogin('xxxx@qq.com','ALAxxxxIME')

尝试处理中文字符

如果手头上有中文的训练数据，也可以尝试对中文进行识别。

命令：tesseract --list-langs可以查看当前支持的语言，chi_sim表示支持简体中文。

那么在使用时候，可以指定某个语言来进行识别，如：

tesseract -l chi_sim paixu.png paixu

表现在程序里，则可以这么写：

#!/usr/bin/env python
# -*- coding:utf-8 -*-

from PIL import Image
import subprocess

def cleanFile(filePath)
    image = Image.open(filePath)

    # 调用系统的tesseract命令, 对图片进行OCR中文识别
    subprocess.call(["tesseract", "-l", "chi_sim", filePath, "paixu"])

    # 打开文件读取结果
    with open("paixu.txt", 'r') as f:
        print(f.read())

if __name__ == "__main__":
    cleanFile("paixu.png")

结果如下：

全部评论

推荐最新楼层

11-21 16:10

云南艺术学院交互设计师

被人说不够大大方方

前几天公司有个展厅活动，会议和参观都是由我负责拍照，因为在会议上拍照，领导们都在发言，我就是很安静的拍照，我自己觉得很正常。会后公司副总和我说，XX呀，你拍照要大大方方的拍，回家在想我到底哪儿不大大方呀？包括上次公司团建活动回来，领导把我和老板助理比较，我是业务助理，他说你看看老板的助理，人家多大大方方的。。。。

点赞评论收藏

分享

11-24 11:23

重庆邮电大学 C++

怎么选择offer

点赞评论收藏

分享

10-11 17:45

门头沟学院 Java

请你不要扣扣

😅😅😅😅😅😅

走吗：别怕我以前也是这么认为虽然一面就挂但是颇有收获！

点赞评论收藏

分享

10-09 09:39

门头沟学院 C++

第一个正式offer

HHHHaos：这也太虚了，工资就一半是真的

点赞评论收藏

分享

今天 14:40

辽宁工业大学汽车电子工程师

比亚迪工作真实体验

加班文化在比亚迪是挺普遍的，不同部门不同岗位情况不一样。G级有加班工资，F级看情况，有的可以特批加班工资或者换调休。晋升方面，如果起点太低，机会不大，除非你有个好领导，个人能力强，还得有点机遇。比亚迪推崇智能化、信息化、自动化，老员工竞争力会越来越小，新来的本科生研究生专业知识强，学习能力也好，可能两三年就能达到老员工六七年的高度。内部换部门和事业部挺难的，没人能告诉你到底好不好，只有自己融入进去才知道。总的来说，比亚迪平台大，有好有坏，有机遇有前景，但能不能抓住得看运气。很多人想进来，也有很多人想出去，每个人的体验都不一样

比亚迪成长空间 165人发布

点赞评论收藏

分享

点赞收藏评论

全站热榜

正在热议

# 25届秋招总结 #

321224次浏览 2980人参与

# 上班苦还是上学苦呢？ #

69198次浏览 601人参与

# 百度开奖 #

179259次浏览 1119人参与

# 地方国企笔面经互助 #

4377次浏览 12人参与

# 如果有时光机，你最想去到哪个年纪？ #

20347次浏览 345人参与

# 选完offer后，你后悔学本专业吗 #

21388次浏览 155人参与

# 阿里云管培生offer #

36116次浏览 420人参与

# 如何一边实习一边秋招 #

995606次浏览 12660人参与

# 我的实习求职记录 #

6066597次浏览 83517人参与

# 招聘要求与实际实习内容不符怎么办 #

10658次浏览 276人参与

214461次浏览 2534人参与

# 学历or实习经历，哪个更重要 #

53383次浏览 417人参与

# 实习工作，你找得还顺利吗？ #

247499次浏览 2901人参与

# 海康威视求职进展汇总 #

400263次浏览 3407人参与

# 正在实习的你，几点下班 #

52951次浏览 395人参与

# 如果再来一次，你还会学硬件吗 #

95048次浏览 1168人参与

# 软件开发薪资爆料 #

2190694次浏览 21861人参与

# 软开人，秋招你打算投哪些公司呢 #

44030次浏览 544人参与

# 科大讯飞求职进展汇总 #

237972次浏览 2505人参与

# 国央企薪资爆料 #

11047次浏览 79人参与

# 租房前辈的忠告 #

109290次浏览 5235人参与

# 机械制造秋招总结 #

30576次浏览 354人参与

牛客网
牛客企业服务