1.主要模块
DBUtils : 允许在多线程应用和数据库之间连接的模块套件
Threading : 提供多线程功能

2.创建连接池
PooledDB 基本参数:

mincached : 最少的空闲连接数,如果空闲连接数小于这个数,Pool自动创建新连接;
maxcached : 最大的空闲连接数,如果空闲连接数大于这个数,Pool则关闭空闲连接;
maxconnections : 最大的连接数;
blocking : 当连接数达到最大的连接数时,在请求连接的时候,如果这个值是True,请求连接的程序会一直等待,直到当前连接数小于最大连接数,如果这个值是False,会报错;
CODE :

def mysql_connection():maxconnections = 15  # 最大连接数pool = PooledDB(pymysql,maxconnections,host='localhost',user='root',port=3306,passwd='123456',db='test_DB',use_unicode=True)return pool
# use
>> pool = mysql_connection()
>> con = pool.connection()

3.数据预处理

文件格式:txt
共准备了四份虚拟数据以便测试,分别有10万, 50万, 100万, 500万行数据

MySQL表结构如下图:

数据处理思路 :

每一行一条记录,每个字段间用制表符 “\t” 间隔开,字段带有双引号;
读取出来的数据类型是 Bytes ;
最终得到嵌套列表的格式,用于多线程循环每个任务每次处理10万行数据;
格式 : [ [(A,B,C,D), (A,B,C,D),(A,B,C,D),…], [(A,B,C,D), (A,B,C,D),(A,B,C,D),…], [], … ]
CODE :

import re
import timest = time.time()
with open("10w.txt", "rb") as f:data = []for line in f:line = re.sub("\s", "", str(line, encoding="utf-8"))line = tuple(line[1:-1].split("\"\""))data.append(line)n = 100000  # 按每10万行数据为最小单位拆分成嵌套列表result = [data[i:i + n] for i in range(0, len(data), n)]
print("10万行数据,耗时:{}".format(round(time.time() - st, 3)))# out
>> 10万行数据,耗时:0.374
>> 50万行数据,耗时:1.848
>> 100万行数据,耗时:3.725
>> 500万行数据,耗时:18.493

4.线程任务

每调用一次插入函数就从连接池中取出一个链接操作,完成后关闭链接;
executemany 批量操作,减少 commit 次数,提升效率;

CODE :

def mysql_insert(*args):con = pool.connection()cur = con.cursor()sql = "INSERT INTO test(sku,fnsku,asin,shopid) VALUES(%s, %s, %s, %s)"try:cur.executemany(sql, *args)con.commit()except Exception as e:con.rollback()  # 事务回滚print('SQL执行有误,原因:', e)finally:cur.close()con.close()

5.启动多线程
代码思路 :

设定最大队列数,该值必须要小于连接池的最大连接数,否则创建线程任务所需要的连接无法满足,会报错 : pymysql.err.OperationalError: (1040, ‘Too many connections’)
循环预处理好的列表数据,添加队列任务
如果达到队列最大值 或者 当前任务是最后一个,就开始多线程队执行队列里的任务,直到队列为空;
CODE :

def task():q = Queue(maxsize=10)  # 设定最大队列数和线程数# data : 预处理好的数据(嵌套列表)while data:content = data.pop()t = threading.Thread(target=mysql_insert, args=(content,))q.put(t)if (q.full() == True) or (len(data)) == 0:thread_list = []while q.empty() == False:t = q.get()thread_list.append(t)t.start()for t in thread_list:t.join()

6.完整示例

import pymysql
import threading
import re
import time
from queue import Queue
from DBUtils.PooledDB import PooledDBclass ThreadInsert(object):"多线程并发MySQL插入数据"def __init__(self):start_time = time.time()self.pool = self.mysql_connection()self.data = self.getData()self.mysql_delete()self.task()print("========= 数据插入,共耗时:{}'s =========".format(round(time.time() - start_time, 3)))def mysql_connection(self):maxconnections = 15  # 最大连接数pool = PooledDB(pymysql,maxconnections,host='localhost',user='root',port=3306,passwd='123456',db='test_DB',use_unicode=True)return pooldef getData(self):st = time.time()with open("10w.txt", "rb") as f:data = []for line in f:line = re.sub("\s", "", str(line, encoding="utf-8"))line = tuple(line[1:-1].split("\"\""))data.append(line)n = 100000    # 按每10万行数据为最小单位拆分成嵌套列表result = [data[i:i + n] for i in range(0, len(data), n)]print("共获取{}组数据,每组{}个元素.==>> 耗时:{}'s".format(len(result), n, round(time.time() - st, 3)))return resultdef mysql_delete(self):st = time.time()con = self.pool.connection()cur = con.cursor()sql = "TRUNCATE TABLE test"cur.execute(sql)con.commit()cur.close()con.close()print("清空原数据.==>> 耗时:{}'s".format(round(time.time() - st, 3)))def mysql_insert(self, *args):con = self.pool.connection()cur = con.cursor()sql = "INSERT INTO test(sku, fnsku, asin, shopid) VALUES(%s, %s, %s, %s)"try:cur.executemany(sql, *args)con.commit()except Exception as e:con.rollback()  # 事务回滚print('SQL执行有误,原因:', e)finally:cur.close()con.close()def task(self):q = Queue(maxsize=10)  # 设定最大队列数和线程数st = time.time()while self.data:content = self.data.pop()t = threading.Thread(target=self.mysql_insert, args=(content,))q.put(t)if (q.full() == True) or (len(self.data)) == 0:thread_list = []while q.empty() == False:t = q.get()thread_list.append(t)t.start()for t in thread_list:t.join()print("数据插入完成.==>> 耗时:{}'s".format(round(time.time() - st, 3)))if __name__ == '__main__':ThreadInsert()

插入数据对比

共获取1组数据,每组100000个元素.== >> 耗时:0.374’s
清空原数据.== >> 耗时:0.031’s
数据插入完成.== >> 耗时:2.499’s
=============== 10w数据插入,共耗时:3.092’s ===============
共获取5组数据,每组100000个元素.== >> 耗时:1.745’s
清空原数据.== >> 耗时:0.0’s
数据插入完成.== >> 耗时:16.129’s
=============== 50w数据插入,共耗时:17.969’s ===============
共获取10组数据,每组100000个元素.== >> 耗时:3.858’s
清空原数据.== >> 耗时:0.028’s
数据插入完成.== >> 耗时:41.269’s
=============== 100w数据插入,共耗时:45.257’s ===============
共获取50组数据,每组100000个元素.== >> 耗时:19.478’s
清空原数据.== >> 耗时:0.016’s
数据插入完成.== >> 耗时:317.346’s
=============== 500w数据插入,共耗时:337.053’s ===============

7.思考/总结
思考 :
多线程+队列的方式基本能满足日常的工作需要,但是细想还是有不足;
例子中每次执行10个线程任务,在这10个任务执行完后才能重新添加队列任务,这样会造成队列空闲.如剩余1个任务未完成,当中空闲数 9,当中的资源时间都浪费了;
是否能一直保持队列饱满的状态,每完成一个任务就重新填充一个.
总结 :
野生猿一枚,代码很粗糙,如果错误请评论指正.

转载于:https://www.cnblogs.com/insane-Mr-Li/p/11634417.html

Python3 多线程(连接池)操作MySQL插入数据相关推荐

  1. python操作mysql插入数据

    python操作mysql插入数据 首先安装pymysql这个库 pycharm连接数据库 操作mysql语句 连接数据库 插入数据 由于有时候,数据存在excel表格中,需要借助python去读取数 ...

  2. 一种利用ADO连接池操作MySQL的解决方案(VC++)

    VC++连接MySQL数据库 常用的方式有三种:ADO.mysql++,mysql API ; 本文只讲述ADO的连接方式. 为什么要使用连接池? 对于简单的数据库应用,完全可以先创建一个常连接(此连 ...

  3. C MySql封装类 高性能连接池_在vc中通过连接池操作mysql(api方式),附c++访问mysql的封装类...

    在有大量节点访问的数据库设计中,经常要使用到连接池来管理所有的连接. 一般方法是:建立两个连接句柄队列,空闲的等待使用的队列和正在使用的队列. 当要查询时先从空闲队列中获取一个句柄,插入到正在使用的队 ...

  4. Android之网络编程利用PHP操作MySql插入数据(四)

    因为最近在更新我的项目,就想着把自己在项目中用到的一些的简单的与网络交互的方法总结一下,所以最近Android网络编程方面的博文会比较多一些,我尽量以最简单的方法给大家分享,让大家明白易懂.如果有什么 ...

  5. nodejs之MySQL插入数据

    const mysql=require('mysql'); //创建链接池 var pool=mysql.createPool({ host:'127.0.0.1', port:3306, user: ...

  6. python mysql批量insert数据、返回id_Python3 操作 MySQL 插入一条数据并返回主键 id的实例...

    Python 中貌似并没有直接返回插入数据 id 的操作(反正我是没找到),但是我们可以变通一下,找到最新插入的数据 #!/usr/bin/env python3 # -*- coding: UTF- ...

  7. c# 向mysql插入数据_C#连接mysql数据库 及向表中插入数据的方法

    mysql 语句操作: 创建数据库:create database hotelATMDb; use hotelATMDb; C#连接mysql 1.引用 dll MySql.Data.dll 下载地址 ...

  8. c mysql 插入大量数据_C++操作MySQL大量数据插入效率低下的解决方法

    通常来说C++操作MySQL的时候,往Mysql中插入10000条简单数据,速度非常缓慢,居然要5分钟左右, 而打开事务的话,一秒不到就搞定了! 具体实现代码如下: #include #include ...

  9. Python连接mysql,插入数据时不报错,但是没有插入进去

    Python连接mysql,插入数据时不报错,但是没有插入进去在connect方法中,设置 autocommit =True conn=pymysql.connect(host=host_db,use ...

最新文章

  1. HTTP精简教程一:Web网络基础
  2. CentOS 7.1云服务器 配置FTP服务器vsftpd
  3. 一次服务器CPU占用率高的定位分析
  4. 方差为平方的均值减去均值的平方
  5. ASP.NET Core分布式项目实战(详解oauth2授权码流程)--学习笔记
  6. android电梯程序设计,课内资源 - 基于Android实现的电梯调度模拟
  7. html兼容webki,评IE10对HTML5的完美支持
  8. 集成电路的设计 —— 半导体
  9. MySQL 8个character_set变量的基本作用
  10. 大数据之路之数据上云解决方案(全量)
  11. 智驾小车|如何给树莓派系统接入摄像头模块
  12. MAC安装中文输入法Rime
  13. matlab 半导体激光模拟工具箱,MATLAB中的激光器仿真
  14. Python游戏嗷大喵快跑设计
  15. java中如何表达sin_在Java中使用“sincos”
  16. worldpress 的 GPG 加密插件
  17. Log4j2中RollingFile的文件滚动更新机制
  18. 中国人为什么喜欢创业?
  19. 集合(set) 深浅拷贝
  20. C#练习题答案: 寻找恩人【难度:1级】--景越C#经典编程题库,1000道C#基础练习题等你来挑战

热门文章

  1. 怎么用matlab显示噪声,怎么用MATLAB产生噪声调频信号
  2. iview关闭抽屉弹层时清空Select弹框高亮样式
  3. 查看某个属性在所有浏览器的兼容性
  4. element-ui按需引入
  5. 视频编码国家标准AVS与H.264的比较(节选)
  6. 蓝牙模块耳机做蓝牙透传_WiFi、蓝牙在工业领域的数据透传应用_SKYLAB 无线模块...
  7. Helm 3 完整教程(二十二):如何设置 Chart 安装完成后提示 NOTE 信息
  8. Ubuntu的默认root密码是多少,修改root密码
  9. mysql装完是什么样儿的_Win7系统安装MySQL之后找不到指定文件与服务如何解决?...
  10. 【codevs1295】N皇后问题