# 项目说明:
百度2021年语言与智能技术竞赛机器阅读理解Pytorch版baseline
比赛链接:https://aistudio.baidu.com/aistudio/competition/detail/66?isFromLuge=true
> 官方的baseline版本是基于paddlepaddle框架的,我把它改写成了Pytorch框架,其中大部分代码沿用的是官方提供的代码,只是有一些框架部分进行了修改,另外增加了早停策略/对抗训练等优化措施,习惯用Pytorch版本的可以基于此进行优化.
# 环境
- python=3.6
- torch=1.7
- transformers=4.5.0
# 训练示例
训练
```
python run.py
--max_len=256
--model_name_or_path=下载的预训练模型路径
--per_gpu_train_batch_size=7
--per_gpu_eval_batch_size=40
--learning_rate=1e-5
--linear_learning_rate=1e-4
--num_train_epochs=100
--output_dir="./output"
--weight_decay=0.01
--early_stop=2
```
预测
```
python predict.py
--max_len=400
--model_name_or_path=下载的预训练模型路径
--per_gpu_eval_batch_size=120
--output_dir="./output"
--fine_tunning_model=微调后的模型路径
```
# 实验结果
用的baseline模型是base版MacBERT(具体请看https://github.com/ymcui/MacBERT)
![image-20210410231128986](https://raw.githubusercontent.com/zhoujx4/PicGo/main/img/image-20210410231128986.png)
# 后续优化策略
- 数据清洗,据官方工作人员讲解到,训练集的准确率只能确保92%以上
- 更多的数据
- 更细粒度的数据增强
- 模型结构的优化
百度2021年语言与智能技术竞赛机器阅读理解torch版baseline.zip
版权申诉
179 浏览量
2023-12-01
16:22:24
上传
评论
收藏 17.3MB ZIP 举报
学术菜鸟小晨
- 粉丝: 1w+
- 资源: 4941
最新资源
- 下载安装这个软件.apk
- 【数据集详细解释及案例分析】数据集详细解释及案例分析
- 基于SHT71温湿度传感器、STM32F103C8T6、LCD1602温湿度采集显示系统proteus仿真设计
- 基于TH02温湿度传感器、STM32F103C8T6、LCD1602、FREERTOS的温湿度采集系统proteus仿真设计
- 【TCP-IP协议详细解释及案例分析】TCP-IP协议详细解释及案例分析
- 一文搞懂 LSTM(长短期记忆网络).rar
- 【autosar简介及基本案例解析】autosar简介及基本案例解析
- java模拟斗地主洗牌发牌
- springboot+vue登录系统 vue部分
- 常用常见 SQL语句语法
资源上传下载、课程学习等过程中有任何疑问或建议,欢迎提出宝贵意见哦~我们会及时处理!
点击此处反馈