pytorch模型保存与加载中的一些问题实战记录

前言

最近使用pytorch训练模型，保存模型后再次加载使用出现了一些问题。记录一下解决方案！

一、torch中模型保存和加载的方式

1、模型参数和模型结构保存和加载

torch.save(model,path)
torch.load(path)

2、只保存模型的参数和加载——这种方式比较安全，但是比较稍微麻烦一点点

torch.save(model.state_dict(),path)
model_state_dic = torch.load(path)
model.load_state_dic(model_state_dic)

二、torch中模型保存和加载出现的问题

1、单卡模型下保存模型结构和参数后加载出现的问题

模型保存的时候会把模型结构定义文件路径记录下来，加载的时候就会根据路径解析它然后装载参数；当把模型定义文件路径修改以后，使用torch.load(path)就会报错。

pytorch模型保存与加载中的一些问题实战记录

把model文件夹修改为models后，再加载就会报错。

import torch
from model.TextRNN import TextRNN
 
load_model = torch.load('experiment_model_save/textRNN.bin')
print('load_model',load_model)

这种保存完整模型结构和参数的方式，一定不要改动模型定义文件路径。

2、多卡机器单卡训练模型保存后在单卡机器上加载会报错

在多卡机器上有多张显卡0号开始，现在模型在n>=1上的显卡训练保存后，拷贝在单卡机器上加载

import torch
from model.TextRNN import TextRNN
 
load_model = torch.load('experiment_model_save/textRNN_cuda_1.bin')
print('load_model',load_model)

pytorch模型保存与加载中的一些问题实战记录

会出现cuda device不匹配的问题——你保存的模代码段小部件型是使用的cuda1，那么采用torch.load()打开的时候，会默认的去寻找cuda1，然后把模型加载到该设备上。这个时候可以直接使用map_location来解决，把模型加载到CPU上即可。

load_model = torch.load('experiment_model_save/textRNN_cuda_1.bin',map_location=torch.device('cpu'))

3、多卡训练模型保存模型结构和参数后加载出现的问题

当用多GPU同时训练模型之后，不管是采用模型结构和参数一起保存还是单独保存模型参数，然后在单卡下加载都会出现问题

a、模型结构和参数一起保然后在加载

pytorch模型保存与加载中的一些问题实战记录

torch.distributed.init_process_group(backend='nccl')

模型训练的时候采用上述多进程的方式，所以你在加载的时候也要声明，不然就会报错。

b、单独保存模型参数

model = Transformer(num_encoder_layers=6,num_decoder_layers=6)
state_dict = torch.load('train_model/clip/experiment.pt')
model.load_state_dict(state_dict)

同样会出现问题，不过这里出现的问题是参数字典的key和模型定义的key不一样

pytorch模型保存与加载中的一些问题实战记录

原因是多GPU训练下，使用分布式训练的时候会给模型进行一个包装，代码如下：

model = torch.load('train_model/clip/Vtransformers_bert_6_layers_encoder_clip.bin')
print(model)
model.cuda(args.local_rank)
。。。。。。
model = nn.parallel.DistributedDataParallel(model,device_ids=[args.local_rank],find_unused_parameters=True)
print('model',model)

包装前的模型结构：

pytorch模型保存与加载中的一些问题实战记录

包装后的模型

pytorch模型保存与加载中的一些问题实战记录

在外层多了DistributedDataParallel以及module，所以才会导致在单卡环境下加载模型权重的时候出现权重的keys不一致。

三、正确的保存模型和加载的方法

    if gpu_count > 1:
        torch.save(model.module.state_dict(),save_path)
    else:
        torch.save(model.state_dict(),save_path)
    model = Transformer(num_encoder_layers=6,num_decoder_layers=6)
    state_dict = torch.load(save_path)
    model.load_state_dict(state_dict)

这样就是比较好的范式，加载不会出错。

总结

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

pytorch模型保存与加载中的一些问题实战记录

目录

前言

一、torch中模型保存和加载的方式

1、模型参数和模型结构保存和加载

2、只保存模型的参数和加载——这种方式比较安全，但是比较稍微麻烦一点点

二、torch中模型保存和加载出现的问题

1、单卡模型下保存模型结构和参数后加载出现的问题

2、多卡机器单卡训练模型保存后在单卡机器上加载会报错

3、多卡训练模型保存模型结构和参数后加载出现的问题

三、正确的保存模型和加载的方法

总结

评论(0)

提示：请文明发言取消回复

作者信息

本站推荐

OpenCV全攻略C++计算机视觉项目实践含源码

何伟元素流瑜伽系统基础师资培训67GB

移动端APP渗透测试（价值199元）网络攻防

Python高级编程实战及应用[前后端开发]

清栀老师AI风景短视频剪辑自学课入门到进阶

阿炳老师·2026Coze平台搭建智能体课程

热门资源

苹果cms海螺影视模板/大橙子模板/仿B站模板/v7模板/带手机移动端+详细安装使用说明

【已测】修复版H5骰子微信竞猜游戏骰宝免公众号版修复登录ID相同完美全套源码对接免签支付

网页游戏卧龙吟一键服务端加远程工具带架设教程

邪风曲单机版 2D回合制网络游戏源码一键安装即玩服务端公益服+GM工具

完整可用版本去水印小程序源码带教程源码

仙侠H5【苍穹剑诀】一键即玩端+授权后台+外网教程

pytorch模型保存与加载中的一些问题实战记录

目录

前言

一、torch中模型保存和加载的方式

1、模型参数和模型结构保存和加载

2、只保存模型的参数和加载——这种方式比较安全，但是比较稍微麻烦一点点

二、torch中模型保存和加载出现的问题

1、单卡模型下保存模型结构和参数后加载出现的问题

2、多卡机器单卡训练模型保存后在单卡机器上加载会报错

3、多卡训练模型保存模型结构和参数后加载出现的问题

三、正确的保存模型和加载的方法

总结

评论(0)

提示：请文明发言 取消回复

相关文章

作者信息

本站推荐

热门资源

提示：请文明发言取消回复