博客
关于我
NLP 基于kashgari和BERT实现中文命名实体识别(NER)
阅读量:796 次
发布时间:2023-02-16

本文共 875 字,大约阅读时间需要 2 分钟。

准备工作

首先,确保您的 Python 环境符合要求,建议使用 Python 3.6 或更高版本。接下来,需要安装 Kashgari 库来处理 BERT 模型。

安装 Kashgari

通过以下命令安装适用于您的 TensorFlow 或 Keras 版本的 Kashgari:

  • 如果使用 TensorFlow 2.x(>=2.0.0):

    pip install kashgari>=2.0.0
  • 如果使用 TensorFlow 1.14+(<2.0.0):

    pip install kashgari>=1.0.0,<2.0.0
  • 如果使用 Keras(<1.0.0):

    pip install kashgari<1.0.0

选择 BERT 模型

在本地或云端环境中,选择适合您的 BERT 模型。这里推荐使用工大发布的 BERT-wwm-ext 模型。

数据集准备

使用人民日报标注的中文数据集进行训练。以下是数据加载示例:

from kashgari.corpus import ChineseDailyNerCorpus# 加载训练数据train_x, train_y = ChineseDailyNerCorpus.load_data('train')valid_x, valid_y = ChineseDailyNerCorpus.load_data('validate')test_x, test_y = ChineseDailyNerCorpus.load_data('test')# 查看数据集大小print(f"训练数据数量:{len(train_x)}")print(f"验证数据数量:{len(valid_x)}")print(f"测试数据数量:{len(test_x)}")

输出结果:

训练数据数量:20864验证数据数量:2318测试数据数量:4636

创建 BERT嵌入

通过以下代码创建 BERT嵌入:

import kashgarifrom kashgari.embeddings import BERT

模型准备就绪。

转载地址:http://bcjfk.baihongyu.com/

你可能感兴趣的文章
Nginx代理静态资源(gis瓦片图片)实现非固定ip的url适配网络环境映射ip下的资源请求解决方案
查看>>
Nginx代理静态资源(gis瓦片图片)实现非固定ip的url适配网络环境映射ip下的资源请求解决方案
查看>>
nginx反向代理
查看>>
nginx反向代理、文件批量改名及统计ip访问量等精髓总结
查看>>
Nginx反向代理与正向代理配置
查看>>
Nginx反向代理及负载均衡实现过程部署
查看>>
Nginx反向代理是什么意思?如何配置Nginx反向代理?
查看>>
nginx反向代理解决跨域问题,使本地调试更方便
查看>>
Nginx反向代理配置
查看>>
Nginx启动SSL功能,并进行功能优化,你看这个就足够了
查看>>
nginx启动脚本
查看>>
Nginx在Windows上和Linux上(Docker启动)分别配置基本身份认证示例
查看>>
Nginx在Windows下载安装启动与配置前后端请求代理
查看>>
Nginx多域名,多证书,多服务配置,实用版
查看>>
Nginx学习总结(14)——Nginx配置参数详细说明与整理
查看>>
Nginx安装与常见命令
查看>>
Nginx安装及配置详解
查看>>
Nginx实战经验分享:从小白到专家的成长历程!
查看>>
Nginx实现反向代理负载均衡
查看>>
nginx实现负载均衡
查看>>