小水滴真的是太可爱了吧

2020-09-22 21:35 已编辑门头沟学院产品经理

关注

【爬虫学习笔记day29】3.7. 尝试对验证码进行机器识别处理+尝试对知乎网验证码进行处理+尝试处理中文字符

文章目录

3.7. 尝试对验证码进行机器识别处理
- 尝试对知乎网验证码进行处理：
- 尝试处理中文字符

3.7. 尝试对验证码进行机器识别处理

尝试对知乎网验证码进行处理：

许多流行的内容管理系统即使加了验证码模块，其众所周知的注册页面也经常会遭到网络机器人的垃圾注册。

那么，这些网络机器人究，竟是怎么做的呢?既然我们已经，可以成功地识别出保存在电脑上的验证码了，那么如何才能实现一个全能的网络机器人呢?

大多数网站生成的验证码图片都具有以下属性。

它们是服务器端的程序动态生成的图片。验证码图片的 src 属性可能和普通图片不太一样，比如 <img src="WebForm.aspx?id=8AP85CQKE9TJ">，但是可以和其他图片一样进行下载和处理。
图片的答案存储在服务器端的数据库里。
很多验证码都有时间限制，如果你太长时间没解决就会失效。
常用的处理方法就是，首先把验证码图片下载到硬盘里，清理干净，然后用 Tesseract 处理图片，最后返回符合网站要求的识别结果。

#!/usr/bin/env python
# -*- coding:utf-8 -*-

import requests
import time
import pytesseract
from PIL import Image
from bs4 import BeautifulSoup

def captcha(data):
    with open('captcha.jpg','wb') as fp:
        fp.write(data)
    time.sleep(1)
    image = Image.open("captcha.jpg")
    text = pytesseract.image_to_string(image)
    print "机器识别后的验证码为：" + text
    command = raw_input("请输入Y表示同意使用，按其他键自行重新输入：")
    if (command == "Y" or command == "y"):
        return text
    else:
        return raw_input('输入验证码：')

def zhihuLogin(username,password):

    # 构建一个保存Cookie值的session对象
    sessiona = requests.Session()
    headers = {
   'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:47.0) Gecko/20100101 Firefox/47.0'}

    # 先获取页面信息，找到需要POST的数据（并且已记录当前页面的Cookie）
    html = sessiona.get('https://www.zhihu.com/#signin', headers=headers).content

    # 找到 name 属性值为 _xsrf 的input标签，取出value里的值
    _xsrf = BeautifulSoup(html ,'lxml').find('input', attrs={
   'name':'_xsrf'}).get('value')

    # 取出验证码，r后面的值是Unix时间戳,time.time()
    captcha_url = 'https://www.zhihu.com/captcha.gif?r=%d&type=login' % (time.time() * 1000)
    response = sessiona.get(captcha_url, headers = headers)


    data = {
   
        "_xsrf":_xsrf,
        "email":username,
        "password":password,
        "remember_me":True,
        "captcha": captcha(response.content)
    }

    response = sessiona.post('https://www.zhihu.com/login/email', data = data, headers=headers)
    print response.text

    response = sessiona.get('https://www.zhihu.com/people/maozhaojun/activities', headers=headers)
    print response.text


if __name__ == "__main__":
    zhihuLogin('xxxx@qq.com','ALAxxxxIME')

尝试处理中文字符

如果手头上有中文的训练数据，也可以尝试对中文进行识别。

命令：tesseract --list-langs可以查看当前支持的语言，chi_sim表示支持简体中文。

那么在使用时候，可以指定某个语言来进行识别，如：

tesseract -l chi_sim paixu.png paixu

表现在程序里，则可以这么写：

#!/usr/bin/env python
# -*- coding:utf-8 -*-

from PIL import Image
import subprocess

def cleanFile(filePath)
    image = Image.open(filePath)

    # 调用系统的tesseract命令, 对图片进行OCR中文识别
    subprocess.call(["tesseract", "-l", "chi_sim", filePath, "paixu"])

    # 打开文件读取结果
    with open("paixu.txt", 'r') as f:
        print(f.read())

if __name__ == "__main__":
    cleanFile("paixu.png")

结果如下：

全部评论

推荐最新楼层

11-27 18:28

中南大学 Java

补录第一🗡，先斩teg

牛魔的秋招到现在第一次面腾讯，终于想起我了是吧全程1h，摆烂1个多月面试状态下滑严重强者发型面试官开局狠狠拷打实习经历就一实习难点展开讨论，最后发出灵魂拷打：“你这实习难点也不难啊，那我们问点基础的吧”。我最爱的八股环节（内容都包含在我整理的八股笔记专栏里https://www.nowcoder.com/discuss/660899447991201792?sourceSSR=users）1.什么是tcp的time_wait状态？time_wait状态有什么用？time_wait状态过多怎么解决？2.tcp的三次握手过程3.redis常用数据类型?zset底层原理？redis怎么看...

回不去家的废废在玉玉：云架平累的喔

查看5道真题和解析牛客创作赏金赛软件开发笔面经

点赞评论收藏

分享

11-24 11:40

北京城市学院项目经理

在拼多多工作的体验

首先，厕所简直是稀缺资源，建议直接去商场的厕所，省得在公司里排队。 工时也是个硬指标，基本上是11点到晚上8点，周日加班的话，薪水是单倍的，但请假多了，领导可就会找你谈话。工作强度大是常态，但这也算是变相实现8小时工作制吧。至于裁员，快满三年合同的员工，可能会被优先不续签，赔偿也就那样。 竞业协议也是个麻烦事，股票的竞业计算方式很麻烦，未行权的股票就只能放弃

拼多多集团-PDD工作强度 283人发布

点赞评论收藏

分享

11-26 18:15

门头沟学院后端

26 届求实习

佬们问一下为啥投官网简历都过不了😭

M_bao：换个排版吧哥们，看着费劲

点赞评论收藏

分享

10-18 18:48

美团_到家_前端(准入职员工)

美团真开了？还是fake news

比去年还低？

斑驳不同：还为啥暴躁假的不骂你骂谁啊

点赞评论收藏

分享

昨天 12:05

深圳大学 Java

秋招面试有感

和国内头部大厂多家对比下来，平安产险的面试体验挺好的。浅浅小吹一下 面试官很和谒、给人很亲切的感觉，整个面试过程也没有上压力，就纯聊天很放松。 面试流程推进得也很快，我是当天一站式面试，效率简直不要太高！ 面试结果反馈得很快，现在已在offer评估中，不得不说打电话的hr小姐姐声音好甜

点赞评论收藏

分享

评论

点赞

收藏

全站热榜

正在热议

# 拼多多求职进展汇总 #

233302次浏览 2030人参与

# 在职场上，你最讨厌什么样的同事 #

5712次浏览 81人参与

# 阿里云管培生offer #

58962次浏览 1748人参与

# 25届秋招总结 #

396515次浏览 3976人参与

# 哪些公司校招卡第一学历 #

32830次浏览 105人参与

# 地方国企笔面经互助 #

6536次浏览 16人参与

# 北方华创开奖 #

66002次浏览 549人参与

# ai智能作图 #

21348次浏览 262人参与

# 硬件兄弟们甩出你的华为奖状 #

77944次浏览 625人参与

# 实习，投递多份简历没人回复怎么办 #

2435813次浏览 34703人参与

# 工作中，你有没有遇到非常爱骂人的领导？ #

4724次浏览 47人参与

# 实习与准备秋招该如何平衡 #

722790次浏览 8551人参与

# 我的实习求职记录 #

6121384次浏览 83953人参与

# 如果再来一次，你还会选择这个工作吗？ #

110425次浏览 1109人参与

# 25届机械人为了秋招做了哪些准备？ #

24989次浏览 355人参与

# 签了三方后想毁约怎么办 #

18563次浏览 111人参与

# 如果你有一天可以担任公司的CEO，你会做哪三件事？ #

9953次浏览 213人参与

# 机械求职避坑tips #

22153次浏览 240人参与

# 游戏求职进展汇总 #

52760次浏览 344人参与

# 夸夸我的求职搭子 #

132018次浏览 1360人参与

# 腾讯求职进展汇总 #

207562次浏览 1694人参与

# 实习想申请秋招offer，能不能argue薪资 #

35782次浏览 308人参与

牛客网
牛客企业服务