Python 进程与线程学习笔记
发布时间:2026/9/2 16:50:17来源:尧图网络
1. 引言在 Python 开发中进程Process与线程Thread是并发编程的两大核心概念。理解它们的区别与适用场景是写出高效、稳定程序的关键。本文将从基础概念出发结合代码示例系统梳理 Python 中进程与线程的知识要点。2. 基础概念2.1 什么是进程进程是操作系统进行资源分配和调度的基本单位是程序的一次执行过程。每个进程拥有独立的地址空间、内存、数据栈等资源进程之间相互隔离。多进程是指在系统中同时运行多个程序。2.2 什么是线程线程是进程内部的一个执行单元是 CPU 调度和分派的基本单位。同一进程内的多个线程共享该进程的地址空间和资源线程之间的通信与切换开销比进程小。2.3 进程与线程的关系一个进程可以包含多个线程进程是资源分配的最小单位线程是 CPU 调度的最小单位进程之间相互独立线程之间共享进程资源。3. 进程与线程的区别对比维度进程线程资源开销大独立地址空间小共享进程资源通信方式需借助 IPC管道、队列等直接读写共享变量稳定性一个进程崩溃不影响其他进程一个线程崩溃可能导致整个进程退出切换开销较大较小适用场景CPU 密集型任务I/O 密集型任务4. Python 中的线程同一时间只能有一个线程在执行线程之间可以共享数据4.1 threading 模块Python 通过threading模块提供线程支持。创建线程有两种常用方式直接实例化Thread类或继承Thread并重写run方法。importthreadingimporttimedefworker(name):print(f线程{name}开始执行)time.sleep(2)print(f线程{name}执行完毕)# 方式一直接传入目标函数t1threading.Thread(targetworker,args(A,))t1.start()t1.join()# 方式二继承 Thread 类classMyThread(threading.Thread):def__init__(self,name):super().__init__()self.namenamedefrun(self):print(f线程{self.name}开始执行)time.sleep(1)print(f线程{self.name}执行完毕)t2MyThread(B)t2.start()t2.join()4.2 线程池当需要频繁创建和销毁大量线程时可以使用线程池来复用线程减少系统开销。Python 中常用concurrent.futures.ThreadPoolExecutor实现线程池。fromconcurrent.futuresimportThreadPoolExecutorimporttimedeftask(n):print(f任务{n}开始)time.sleep(1)returnn*n# 方式一submit 提交单个任务withThreadPoolExecutor(max_workers3)asexecutor:futureexecutor.submit(task,5)print(f结果:{future.result()})# 方式二map 批量提交任务withThreadPoolExecutor(max_workers3)asexecutor:resultslist(executor.map(task,range(5)))print(f批量结果:{results})max_workers线程池中工作线程的最大数量submit(fn, *args)提交单个任务返回Future对象通过.result()获取结果map(fn, *iterables)批量提交任务按传入顺序返回结果列表使用with语句会在退出时自动调用shutdown(waitTrue)等待所有任务完成。线程池适合 I/O 密集型任务如网络请求、文件读写能有效避免频繁创建线程的开销同时配合Future可以方便地获取任务返回值。4.3 线程同步多个线程共享数据时需要使用锁Lock来避免竞态条件。importthreading counter0lockthreading.Lock()defincrement():globalcounterfor_inrange(100000):withlock:#等价于下面的语句counter1# lock.acquire()# counter 1# lock.release()threads[threading.Thread(targetincrement)for_inrange(10)]fortinthreads:t.start()fortinthreads:t.join()print(f最终计数:{counter})4.4 GIL 的影响非重点Python 的全局解释器锁GIL使得同一时刻只有一个线程能执行 Python 字节码。因此对于 CPU 密集型任务多线程并不能带来性能提升反而可能因线程切换而变慢但对于 I/O 密集型任务如网络请求、文件读写多线程能显著提升效率。5. Python 中的进程5.1 multiprocessing 模块multiprocessing模块用于创建多进程其 API 与threading高度相似但每个进程拥有独立的 GIL 和内存空间适合 CPU 密集型任务。1每当创建一个子进程就会创建一个python解释器如果不加if __name__ __main__执行到创建子进程地方就又会创建一个python解释器不断循环。加上以后因为子进程的__main__不是__main__所以不会一直循环创建‑start‑join2Process的创建multiprocessing.Process(groupNone,targetNone,nameNone,args(),kwargs{},*,daemonNone)group应当始终为None它的存在仅是为了与threading.Thread兼容。target由run()方法来发起调用的可调用对象默认为None。name进程名称默认为None则自动分配。args针对目标调用的参数元组如果传递一个参数记得加逗号。kwargs针对目标调用的关键字参数字典。daemon是否为守护进程True或False。默认为None则继承父进程。3Process的属性和方法与其他常用方法name获取进程名称。pid获取进程号。daemon判断或设置进程是否为守护进程。exitcode获取子进程的退出状态码。start()启动进程调用传入target的对象。start()只能被调用一次。run()默认调用传入target的对象如果子类化了Process可以重写此方法来自定义行为。join([timeout])阻塞主进程直到子进程结束或超时。timeout参数可选意为阻塞多少秒。terminate()强制终止子进程。kill()杀死进程与terminate()类似但更彻底。is_alive()检查进程是否仍在运行。os.getpid()获取当前进程编号。os.getppid()获取当前进程的父进程编号。frommultiprocessingimportProcessimportosdefworker(name):print(f子进程{name}PID:{os.getpid()})if__name____main__:processes[]foriinrange(4):pProcess(targetworker,args(fP{i},))processes.append(p)p.start()# ⚡启动子进程子进程开始跑主进程不会停下# 这里循环 joinforpinprocesses:p.join()#等子进程全部结束再打印主进程print(f主进程 PID:{os.getpid()})5.2 进程池当任务数量较多时可以使用Pool来管理一组工作进程避免频繁创建和销毁进程的开销。1进程池的创建multiprocessing.Pool([processes[,initializer[,initargs[,maxtasksperchild[,context]]]]])processes 要 使 用 的 工 作 进 程 数 量 。 如 果processes为None则 使 用os.cpu_count()所返回的数值。initializer如 果 不 为None 则 每 个 工 作 进 程 将 会 在 启 动 时 调 用initializer(*initargs)。maxtasksperchild一个工作进程在它退出或被一个新的工作进程代替之前能完成的任务数量为了释放未使用的资源。默认的maxtasksperchild是None意味着工作进程寿与池齐。context可被用于指定启动的工作进程的上下文。通常一个进程池是使用函数multiprocessing.Pool()或者一个上下文对象的Pool()方法创建的。注意进程池对象的方法只有创建它的进程能够调用。使用时一般只指定processes参数。2进程池的常用方法apply(func[, args[, kwds]])使用args参数以及kwds命名参数同步调用func,在返回结果前阻塞。另外func只会在一个进程池中的一个工作进程中执行。apply_async(func[, args[, kwds[, callback[, error_callback]]]])使用args参数以及kwds命名参数异步调用func并立即返回一个AsyncResult对象不会阻塞。可以通过callback获取结果和通过error_callback处理异常。close()阻止后续任务提交到进程池当所有任务执行完成后工作进程会退出。terminate()不必等待未完成的任务立即停止工作进程。当进程池对象被垃圾回收时会立即调用terminate()。join()阻塞主进程等待工作进程结束。调用join()前必须先调用close()或者terminate()。map(func,参数)阻塞主进程等待子进程干完活并自动收集结果成列表注意从3.8版本后进程池的进程默认是守护进程所以需join()确保主进程等待。frommultiprocessingimportPooldefsquare(x):returnx*xif__name____main__:withPool(4)aspool:#with结束后调用terminate()杀死子进程。所以代码块中必须搭配同步阻塞 APImap/apply如果使用异步进程就必须在with中添加pool.wait()等待所有子进程执行完毕resultspool.map(square,range(10))#map阻塞主进程等待子进程干完活并自动收集结果成列表赋值给resultsprint(results)3使用模板创建 → 提交任务干活 → close → join4map与apply_async区分✅要收集返回结果优先pool.map()代码简短。✅不要返回结果用循环apply_async()提交依靠with/closejoin等待全部任务结束。✅apply_async想要结果就调用.get()不想要就不调用。再记一遍时序map在 map 这一行就阻塞等任务完成apply_async提交不阻塞阻塞发生在 with 结束的 join 位置。见下面的例子# map版本阻塞发生在map这一行withPool(4)aspool:respool.map(func,range(10))# 这里就等任务完成print(这里任务已经全部做完)# apply_async无返回版本阻塞发生在离开with的时候withPool(4)aspool:foriinrange(10):pool.apply_async(func,args(i,))print(这里任务还不一定跑完只是提交完了)# 离开with块join才阻塞等待任务全部完成print(这里任务才全部做完)5.3 进程间通信进程之间不能直接共享全局变量需要使用Queue或Pipe进行通信。multiprocessing.Queue存 在 兼 容 性 问 题适用于multiprocessing 创建的进程 如 果 要 使 用 进 程 池 可 以 使 用Mananger().Queue()frommultiprocessingimportProcess,Queuedefproducer(q):foriinrange(5):q.put(i)q.put(None)# 结束信号defconsumer(q):whileTrue:itemq.get()ifitemisNone:breakprint(f消费:{item})if__name____main__:#方式1qQueue()p1Process(targetproducer,args(q,))p2Process(targetconsumer,args(q,))p1.start()p2.start()p1.join()p2.join()# 方式2qManager().Queue()poolPool(2)pool.apply_async(producer,(q,))pool.apply_async(consumer,(q,))pool.close()pool.join()6. 如何选择进程还是线程CPU 密集型任务如大量计算、图像处理优先使用多进程利用多核 CPU 并行计算I/O 密集型任务如网络爬虫、文件读写、数据库操作优先使用多线程线程切换开销小且不受 GIL 影响任务间需要频繁共享大量数据多线程更合适共享内存访问方便任务间相互独立、需要高稳定性多进程更合适进程隔离避免相互影响。7. 常见问题与注意事项多进程代码在 Windows 上必须放在if __name__ __main__:保护块中否则会递归创建子进程使用join()等待子进程/线程结束避免主程序提前退出多线程共享数据时务必加锁防止数据竞争避免创建过多线程或进程防止资源耗尽进程间通信优先使用Queue它内部已实现线程安全。8. 总结进程与线程是 Python 并发编程的两大基石。进程资源开销大但相互隔离适合 CPU 密集型任务线程共享资源、切换快适合 I/O 密集型任务。理解 GIL 的机制结合实际场景合理选择才能写出高效可靠的并发程序。希望这份笔记能帮助你快速掌握 Python 进程与线程的核心知识。
网站建设高端定制企业官网