一、多线程

Python标准库提供2个模块,thread是低级模块,threading是高级模块

1.threading模块创建多线程

方式1:把1个函数传入并创建Thread实例,然后调用start方法开始执行

importrandomimporttime,threading#新线程执行的代码

defthread_run(urls):print 'Current %s is running...' %threading.current_thread().namefor url inurls:print '%s ---->>> %s' %(threading.current_thread().name,url)

time.sleep(random.random())print '%s ended' %threading.current_thread().nameprint '%s is running...' %threading.current_thread().name

t1= threading.Thread(target=thread_run,name='Thread_1',args=(['url_1','url_2','url_3'],))

t2= threading.Thread(target=thread_run,name='Thread_2',args=(['url_4','url_5','url_6'],))

t1.start()

t2.start()

t1.join()

t2.join()print '%s ended' %threading.current_thread().name

执行结果:

MainThreadisrunning...

Current Thread_1isrunning...

Thread_1---->>>url_1

Current Thread_2isrunning...

Thread_2---->>>url_4

Thread_1---->>>url_2

Thread_2---->>>url_5

Thread_2---->>>url_6

Thread_1---->>>url_3

Thread_1 ended

Thread_2 ended

MainThread ended

方式2:从threading.Thread继承并创建线程类,然后重写__init__方法和run方法

importrandomimporttime,threadingclassmyThread(threading.Thread):def __init__(self,name,urls):

threading.Thread.__init__(self,name=name)

self.urls=urlsdefrun(self):print 'Current %s is running...' %threading.current_thread().namefor url inurls:print '%s ---->>> %s' %(threading.current_thread().name,url)

time.sleep(random.random())print '%s ended' %threading.current_thread().nameprint '%s is running...' %threading.current_thread().name

t1= threading.Thread(target=thread_run,name='Thread_1',args=(['url_1','url_2','url_3'],))

t2= threading.Thread(target=thread_run,name='Thread_2',args=(['url_4','url_5','url_6'],))

t1.start()

t2.start()

t1.join()

t2.join()print '%s ended' %threading.current_thread().name

执行结果:

MainThreadisrunning...

Current Thread_1isrunning...

Thread_1---->>>url_1

Current Thread_2isrunning...

Thread_2---->>>url_4

Thread_2---->>>url_5

Thread_1---->>>url_2

Thread_1---->>>url_3

Thread_2---->>>url_6

Thread_2 ended

Thread_1 ended

MainThread ended

二、线程同步:

作用:若多个线程共同对某个数据修改,则会出现不可预料的结果,为保证数据的正确性,需对多个线程进行同步。

实现方法:使用Thread对象的Lock和RLock

1.Lock对象【acquire、release方法】

若1个线程连续2次进行acquire操作,那么忧郁第1次acquire后未release,第2次acquire将挂起线程,会导致Lock对象一直不会release,导致线程死锁

2.RLock对象【acquire、release方法】

允许1个线程多次对其进行acquire操作(原因:内部通过1个counter变量维护线程acquire的次数),且每1次acquire操作必须有1个release操作与之对应,在所有的release操作完成后,别的线程才能申请该RLock对象

importthreading

mylock=threading.RLock()

num=0classmyThread(threading.Thread):def __init__(self,name):

threading.Thread.__init__(self,name=name)defrun(self):globalnumwhileTrue:

mylock.acquire()print '%s locked,Number:%d'%(threading.current_thread().name,num)if num>=4:

mylock.release()print '%s released,Number:%d'%(threading.current_thread().name,num)breaknum+ = 1

print '%s released,Number:%d'%(threading.current_thread().name,num)

mylock.release()if __name__=='__main__':

thread1= myThread('Thread_1')

thread2= myThread('Thread_2')

thread1.start()

thread2.start()

执行结果:

Thread_1 locked,Number:0

Thread_1 released,Number:1Thread_1 locked,Number:1Thread_1 released,Number:2Thread_2 locked,Number:2Thread_2 released,Number:3Thread_1 locked,Number:3Thread_1 released,Number:4Thread_2 locked,Number:4Thread_2 released,Number:4Thread_1 locked,Number:4Thread_1 released,Number:4

三、协程

协程,又称微线程。协程是一种用户态的轻量级线程。

协程拥有自己的寄存器上下文和栈。协程调度切换时,将寄存器上下文和栈保存到其他地方,在切回来的时候,恢复先前保存的寄存器上下文和栈。因此:

协程能保留上一次调用时的状态(即所有局部状态的一个特定组合),每次过程重入时,就相当于进入上一次调用的状态,换种说法:进入上一次离开时所处逻辑流的位置。

协程定义:

必须在只有一个单线程里实现并发

修改共享数据不需加锁

用户程序里自己保存多个控制流的上下文栈

一个协程遇到IO操作自动切换到其它协程

协程的优点:

无需线程上下文切换的开销

无需原子操作锁定及同步的开销

方便切换控制流,简化编程模型

高并发+高扩展性+低成本:一个CPU支持上万的协程都不是问题。所以很适合用于高并发处理。

"原子操作(atomic operation)是不需要synchronized",所谓原子操作是指不会被线程调度机制打断的操作;这种操作一旦开始,就一直运行到结束,中间不会有任何 context switch (切换到另一个线程)。原子操作可以是一个步骤,也可以是多个操作步骤,但是其顺序是不可以被打乱,或者切割掉只执行部分。视作整体是原子性的核心。

协程的缺点:

无法利用多核资源:协程的本质是个单线程,它不能同时将 单个CPU 的多个核用上,协程需要和进程配合才能运行在多CPU上.当然我们日常所编写的绝大部分应用都没有这个必要,除非是cpu密集型应用。

进行阻塞(Blocking)操作(如IO时)会阻塞掉整个程序

Python协程实现方法(yield):

importtimeimportqueuedefconsumer(name):print("--->starting eating baozi...")whileTrue:

new_baozi= yield

print("[%s] is eating baozi %s" %(name,new_baozi))#time.sleep(1)

defproducer():

r= con.__next__()

r= con2.__next__()

n=0while n < 5:

n+=1con.send(n)

con2.send(n)print("\033[32;1m[producer]\033[0m is making baozi %s" %n )if __name__ == '__main__':

con= consumer("c1")

con2= consumer("c2")

p= producer()

Python协程实现方法(greenlet):

greenlet是一个用C实现的协程模块,相比与python自带的yield,它可以使你在任意函数之间随意切换,而不需把这个函数先声明为generator。

#-*- coding:utf-8 -*-

from greenlet importgreenletdeftest1():print(12)

gr2.switch()print(34)

gr2.switch()deftest2():print(56)

gr1.switch()print(78)

gr1=greenlet(test1)

gr2=greenlet(test2)

gr1.switch()

问题:比generator简单,但好像还没有解决一个问题,就是遇到IO操作,自动切换

Python协程实现方法(Gevent)

Gevent 是一个第三方库,可以轻松通过gevent实现并发同步或异步编程,在gevent中用到的主要模式是Greenlet, 它是以C扩展模块形式接入Python的轻量级协程。 Greenlet全部运行在主程序操作系统进程的内部,但它们被协作式地调度。

importgeventdeffunc1():print('\033[31;1m李闯在跟海涛搞...\033[0m')

gevent.sleep(2)print('\033[31;1m李闯又回去跟继续跟海涛搞...\033[0m')deffunc2():print('\033[32;1m李闯切换到了跟海龙搞...\033[0m')

gevent.sleep(1)print('\033[32;1m李闯搞完了海涛,回来继续跟海龙搞...\033[0m')

gevent.joinall([

gevent.spawn(func1),

gevent.spawn(func2),#gevent.spawn(func3),

])

执行结果:

李闯在跟海涛搞...

李闯切换到了跟海龙搞...

李闯搞完了海涛,回来继续跟海龙搞...

李闯又回去跟继续跟海涛搞...

同步与异步的区别

importgeventdeftask(pid):"""Some non-deterministic task"""gevent.sleep(0.5)print('Task %s done' %pid)defsynchronous():for i in range(1,10):

task(i)defasynchronous():

threads= [gevent.spawn(task, i) for i in range(10)]

gevent.joinall(threads)print('Synchronous:')

synchronous()print('Asynchronous:')

asynchronous()

该程序的重要部分是将task函数封装到Greenlet内部线程的gevent.spawn。 初始化的greenlet列表存放在数组threads中,此数组被传给gevent.joinall 函数,

后者阻塞当前流程,并执行所有给定的greenlet。执行流程只会在 所有greenlet执行完后才会继续向下走。

遇到IO阻塞时会自动切换任务

from gevent importmonkey; monkey.patch_all()importgeventfrom urllib.request importurlopendeff(url):print('GET: %s' %url)

resp=urlopen(url)

data=resp.read()print('%d bytes received from %s.' %(len(data), url))

gevent.joinall([

gevent.spawn(f,'https://www.python.org/'),

gevent.spawn(f,'https://www.yahoo.com/'),

gevent.spawn(f,'https://github.com/'),

])

通过gevent实现单线程下的多socket并发

#Server Side

importsysimportsocketimporttimeimportgeventfrom gevent importsocket,monkey

monkey.patch_all()defserver(port):

s=socket.socket()

s.bind(('0.0.0.0', port))

s.listen(500)whileTrue:

cli, addr=s.accept()

gevent.spawn(handle_request, cli)defhandle_request(conn):try:whileTrue:

data= conn.recv(1024)print("recv:", data)

conn.send(data)if notdata:

conn.shutdown(socket.SHUT_WR)exceptException as ex:print(ex)finally:

conn.close()if __name__ == '__main__':

server(8001)#Client Side

importsocket

HOST= 'localhost' #The remote host

PORT = 8001 #The same port as used by the server

s =socket.socket(socket.AF_INET, socket.SOCK_STREAM)

s.connect((HOST, PORT))whileTrue:

msg= bytes(input(">>:"),encoding="utf8")

s.sendall(msg)

data= s.recv(1024)#print(data)

print('Received', repr(data))

s.close()

哈哈哈

python爬虫怎么写多线程_Python爬虫【第3篇】【多线程】相关推荐

  1. python爬虫网络数据包_Python爬虫之多线程图虫网数据爬取(十六)

    Python爬虫之多线程图虫网数据爬取(十六) 发布时间:2019-05-14 10:11, 浏览次数:289 , 标签: Python 原创不易,转载前请注明博主的链接地址:Blessy_Zhu h ...

  2. python运势预测程序_Python 爬虫系列之一——每日星座运势

    开个新坑--Python 爬虫系列,最近脑子里有很多非常有趣的想法,但实现起来都需要一些简单的爬虫知识,如果放在趣学 Python 系列,会显得文章太长,干脆拿出来开个新坑.这个系列本质上是为趣学 P ...

  3. python爬虫什么书好_python爬虫什么书

    有客服接口.######wp的微信不支持oauth2.0######其实你可以在支付成功的通知中,再调用相关接口给指定的微信发送消息###### 1.这个接口必须是异步的,微信本身有支付成功通知,另外 ...

  4. python爬虫爬取歌曲_python爬虫实战:爬取全站小说排行榜

    喜欢看小说的骚年们都知道,总是有一些小说让人耳目一新,不管是仙侠还是玄幻,前面更了几十章就成功圈了一大波粉丝,成功攀上飙升榜,热门榜等各种榜,扔几个栗子出来: 新笔趣阁是广大书友最值得收藏的网络小说阅 ...

  5. python基础知识500题_python爬虫基础知识点整理

    更多编程教程请到:菜鸟教程 https://www.piaodoo.com/ 友情链接: 高州阳光论坛https://www.hnthzk.com/ 人人影视http://www.sfkyty.com ...

  6. python爬虫基础项目教程_Python爬虫开发与项目实战_Python教程

    资源名称:Python爬虫开发与项目实战 内容简介: 随着大数据时代到来,网络信息量也变得更多更大,基于传统搜索引擎的局限性,网络爬虫应运而生,本书从基本的爬虫原理开始讲解,通过介绍Pthyon编程语 ...

  7. python爬虫怎么翻页_python爬虫_入门_翻页

    写出来的爬虫,肯定不能只在一个页面爬,只要要爬几个页面,甚至一个网站,这时候就需要用到翻页了 其实翻页很简单,还是这个页面http://bbs.fengniao.com/forum/10384633. ...

  8. python通过ip池爬_python 爬虫 代理ip池(适合初学者)

    初次学习python爬虫的朋友在频繁访问被爬取页面网站时都会被拦截,也就是限制ip.这里教教大家建立代理ip池. #!/usr/bin/env python3# -*- coding: utf-8 - ...

  9. python歌词统计单词词频_Python爬虫网易云歌词及词频统计

    采用词云对邓紫棋的热门前50歌曲进行可视化展示. 本次可视化步骤需要掌握的内容有:了解爬虫的原理 掌握xpath的用法 掌握词云工具wordcloud的使用 了解分词根据jieba的使用 首先,需要找 ...

  10. python爬虫要安装什么_python爬虫之分布式爬虫和部署

    分布式爬虫:爬虫共用同一个爬虫程序,即把同一个爬虫程序同时部署到多台电脑上运行,这样可以提高爬虫速度. 在默认情况下,scrapy爬虫是单机爬虫,只能在一台电脑上运行,因为爬虫调度器当中的队列queu ...

最新文章

  1. php ajax mysql 分页查询_基于PHP_MySql_Ajax的分页技术方案
  2. JavaScript实现跳跃游戏的动态编程自下而上的方法的算法(附完整源码)
  3. 【转】Ubuntu 16.04 Nvidia驱动安装(run方式)
  4. 小心使用IOCP完成端口
  5. python文件的基本操作_「Python」 - 文件基本操作
  6. linux4安装gcc,当ubuntu已有gcc4时安装gcc3
  7. pptx库ppt演示 python_Python自动化操作PPT看这一篇就够了
  8. Asp.net夜话之一:asp.net介绍
  9. jmeter校验结果_Springboot + redis + 注解 + 拦截器来实现接口幂等性校验
  10. 实对称矩阵的特征值求法_“绝境之下”,如何求解矩阵的特征值?
  11. IPD开发流程TR1-TR6各个阶段简介
  12. acdsee ultimate 2020 特别版 v13.0附安装教程
  13. html合并边框线,css中border-collapse属性设置表格边框线的方法
  14. 设置网站301跳转,直接输入主域名跳转至www域名
  15. UML-封神之路的开始
  16. 血型(输血-受血)匹配数电设计
  17. Win10系统程序以管理员身份开机自启动配置
  18. 技术,管理,和境界问题
  19. 100题前端面试[题目+答案] -- 自用
  20. 下机数据处理:拼接、过滤和去嵌合

热门文章

  1. UWP ListView 绑定 单击 选中项 颜色
  2. hibernate缓存详解
  3. 最直白的跨域访问原理
  4. 什么是处理机的态?为什么要区分处理机的态?
  5. 通过js引用外部脚本(嘿嘿,方便直接在浏览器上调试抓取代码)
  6. WGS84坐标和UTM坐标的转换
  7. Properties类 解析xml文件问题
  8. 服务器pcie性能最大,首款PCIe 4.0服务器处理器为数据中心加速
  9. 在linux下进行嵌入式系统设计,一种应用于测控系统的基于Linux的嵌入式系统的设计...
  10. csv文件怎么转成excel_Python操作Excel文件(1):花式大师pyexcel