没有合适的资源?快使用搜索试试~ 我知道了~
【Pytorch】简析DataLoader中的collate_fn参数
1.该资源内容由用户上传,如若侵权请联系客服进行举报
2.虚拟产品一经售出概不退款(资源遇到问题,请及时私信上传者)
2.虚拟产品一经售出概不退款(资源遇到问题,请及时私信上传者)
版权申诉
8 下载量 52 浏览量
2021-01-06
19:19:20
上传
评论
收藏 41KB PDF 举报
温馨提示
试读
1页
如在博文数据批量化处理类Dataset和DataLoader中所介绍的一样,DataLoader可通过collate_fn参数,对Dataset生成的mini-batch的可迭代数据进行进一步处理,而本文就简要介绍下该参数,并给出一个简单的例子。 1. collate_fn的设置、输入和输出 collate_fn应当是一个可调用对象,常见的可以是外部定义的函数或者lambda函数。其接受DataLoader不设置collate_fn参数时每个mini-batch输出的样本序列,所以可以理解为一个后处理的函数。 在不设置collate_fn参数时,DataLoader的mini-batch样本序
资源推荐
资源详情
资源评论
【【Pytorch】简析】简析DataLoader中的中的collate_fn参数参数
如在博文数据批量化处理类Dataset和DataLoader中所介绍的一样,DataLoader可通过collate_fn参数,对Dataset生成的mini-
batch的可迭代数据进行进一步处理,而本文就简要介绍下该参数,并给出一个简单的例子。
1. collate_fn的设置、输入和输出的设置、输入和输出
collate_fn应当是一个可调用对象,常见的可以是外部定义的函数或者lambda函数。其接受DataLoader不设置collate_fn参数时每个
mini-batch输出的样本序列,所以可以理解为一个后处理的函数后处理的函数。
在不设置collate_fn参数时,DataLoader的mini-batch样本序列样式取决于对应dataset参数的设置。而dataset只要是覆写
了__init__、__getitem__和__len__方法的Dataset子类即可,所以其输出形式可以很多样化。
而collate_fn对于上述的输出进行进一步的加工,可通过定义采样、切片、组合和数学操作等一系列操作,生成最终的训练数
据。
其输出值一般建议为可直接为深度学习模型直接使用的张量对象,而大小规模为min-batch。
由上可知,整个处理过程可以理解为:
2. 简单示例简单示例
在博文示例的基础上,对其进行简单拓展,通过 collate_fn参数实现对两组输入的拼接。
import torch
from torch.utils.data import Dataset, DataLoader
A = torch.randn(128, 3) # 待拼接的张量A
B = torch.randn(128, 2) # 待拼接的张量B
C = torch.randn(128, 1) # labels张量
# 1. 利用Dataset封装数据集
class MyDataset(Dataset):
def __init__(self, x1, x2, y):
assert x1.size(0)==x2.size(0)==y.size(0)
self.x1, self.x2, self.y = x1, x2, y
def __getitem__(self, idx):
return (self.x1[idx], self.x2[idx], self.y[idx])
def __len__(self):
return self.x1.size(0)
dataset = MyDataset(A, B, C)
# 2. 定义后处理的collate_fn函数
# 需要特别注意的是:输入的mini-batch输入,返回的为张量,因此要注意对格式进行转换和统一
def unify_fn(batch_data):
x_ = [x1.tolist()+x2.tolist() for x1, x2, y in batch_data] y_ = [y.tolist() for x1, x2, y in batch_data] return torch.tensor(x_),
torch.tensor(y_)
# 3. 利用DataLoader完成数据集的批量化
MyDataLoader = DataLoader(dataset=dataset, shuffle=True, batch_size=4, collate_fn=unify_fn)
for data_iter in MyDataLoader:
x, y = data_iter
# 进行训练
作者:guofei_fly
资源评论
weixin_38672800
- 粉丝: 4
- 资源: 917
上传资源 快速赚钱
- 我的内容管理 展开
- 我的资源 快来上传第一个资源
- 我的收益 登录查看自己的收益
- 我的积分 登录查看自己的积分
- 我的C币 登录后查看C币余额
- 我的收藏
- 我的下载
- 下载帮助
最新资源
- YOLOV4-TINY权重文件
- 以下是一个使用贪心算法解决多机调度问题的基本步骤0.txt
- 基于大数据的房产估价是近年来随着技术的发展而兴起的一种新型估价方法.txt
- 企业供应链管理系统v3.rar
- 富芮坤FR8016HA蓝牙开发板使用手册+硬件PCB图+封装库+DEMO演示软件源代码.zip
- 基于YOLOv7的芯片表面缺陷检测系统
- 京东物流 数字化供应链综合研究报告2018.rar
- 基于YOLOv7的植物虫害识别&防治系统
- 2000.1-2023.8中国经济政策不确定性指数月度数据.xlsx
- Screenshot_2024-04-21-20-42-15-443_com.tencent.mm.jpg
资源上传下载、课程学习等过程中有任何疑问或建议,欢迎提出宝贵意见哦~我们会及时处理!
点击此处反馈
安全验证
文档复制为VIP权益,开通VIP直接复制
信息提交成功