Bert 模型微调¶
中文评论分析模型的本地训练与测试
- 使用 Tokenizer 实现字符编码,vocab 字典操作
- 模型微调的基本概念
- 下游任务设计(模型增量微调)
- 自定义模型训练与效果评估
AI 模型如何处理字符数据¶
所有深度学习模型本质上都是矩阵。
控制台输出:
vocab_size=21128:模型识别字符数(模型识别的字符数是有限的)

Token 编码:
控制台输出:
Token 解码:
控制台输出:
数据获取¶
HuggingFace 数据集:https://huggingface.co/datasets

- 选择的数据集:
lansinuote/ChnSentiCorp - 数据集地址:https://huggingface.co/datasets/lansinuote/ChnSentiCorp

模型训练¶

在线加载数据集:
PS:从
hugging face上下载的文件默认存储在当前登录用户的家目录下的.cahce目录下的huggingface目录中。可以使用
cache_dir参数指定数据缓存路径。

从本地磁盘加载数据:
从磁盘加载 CSV 格式数据:
将 HuggingFace 上的加密数据集进行数据类型转换:

输出数据集信息:
制作数据集:
定义下游任务模型结构: