面向中文科学数据集的句子级语义匹配模型
文献类型: 中文期刊
作者: 刘建平;初新涛;王健;顾勋勋;王萌;王影菲
作者机构:
关键词: 文本匹配;语义匹配;预训练模型;科学数据集;自然语言处理
期刊名称:郑州大学学报(工学版)
ISSN: 1671-6833
年卷期: 2024 年
页码:
收录情况: 北大核心(2023版) ; ; 科技核心(2024版)
摘要: 针对现有以词为粒度的语义匹配模型难以理解句子级科学数据集元数据的问题,提出了一个面向中文科学数据集的句子级语义匹配(CSDSM)模型。该模型使用CSL数据集对SimCSE和CoSENT进行训练生成CoSENT预训练模型。基于CoSENT模型,引入多头自注意力机制进行特征提取,通过余弦相似度与KNN分类结果加权求和得到最终输出。以国家地球系统科学数据中心开放的语义元数据信息作为自建科学数据集进行实验,实验结果表明:与中文BERT模型相比,所提模型在公共数据集AFQMC、LCQMC、Chinese-STS-B和PAWS-X上,Spearman指标ρ分别提升了0.044 8、0.029 0、0.177 7和0.050 9;在自建科学数据集上的F1和Acc分别提升了0.078 8和0.063 4,所提模型能够有效地解决科学数据集句子级语义匹配问题。
分类号:
- 相关文献
[1]基于深度学习的自然语言处理技术的发展及其在农业领域的应用. 崔运鹏,王健,刘娟. 2019
[2]基于词向量的检索扩展方法与农业领域实证. 吴蕾,梁晓贺,乌吉斯古楞,王瑞. 2019
[3]面向农业图书资源语义挖掘的主题模型应用设计研究. 龚浩,崔运鹏,钱平. 2018
[4]基于BERT的常见作物病害问答系统问句分类. 杨国峰,杨勇. 2020
[5]地理标志农产品品牌管理政策注意力分析模型构建及应用. 霍梦佳,刘娟,黄杰. 2023
[6]基于词性标注规则的马铃薯文献信息抽取方法. 王腾阳,赵小丹,胡林. 2023
[7]基于大语言模型的智能问答系统研究综述. 任海玉,刘建平,王健,顾勋勋,陈曦,张越,赵昌顼. 2024
[8]国家公园建设的公众反响测度——基于B站《我们的国家公园》纪录片评论的主题和情感分析. 吴俣,李海英,李扬,林巧,李飞. 2025
作者其他论文 更多>>
-
ADON-R:基于语义相似与规则推理的农业本体网络构建方法
作者:陈晓静;李威;李瑞航;林佳;姚琼;吴雯迪;樊景超;闫燊;王健;张建华;周国民
关键词:本体推理;预训练语言模型;向量检索;规则推理;分级证据;农业本体网络
-
马杜霉素铵对多房棘球蚴及旋毛虫的体外杀伤作用研究
作者:宋润润;李婷婷;次旦欧珠;王萌;付宝权;余溯明;次旺白珍;闫鸿斌;李立;张念章
关键词:马杜霉素铵;多房棘球蚴;旋毛虫
-
Regional environmental risk thresholds for cadmium in Chinese agricultural soils: Integrating zonal soil types and pedogenic properties
作者:俞磊;;王萌;;秦璐瑶;;孙晓艺;;王静;;刘佳晓;;周如烟;;李京泽;;陈世宝
关键词:Cadmium; Species sensitivity distribution; HC5; Chinese distinct ecoregions; Soil types and pedogenic properties
-
水稻DMP1、DMP2、DMP3基因突变体的创制及其单倍体诱导能力鉴定
作者:胡风越;王健;王春;王克剑;刘朝雷
关键词:水稻;单倍体诱导;DMP;OsMTL
-
华北集约化生产区耕地健康评价研究-以河北某县域为例
作者:周如烟;王静;王萌;俞磊;孙晓艺;刘佳晓;李京泽;陈世宝
关键词:土壤健康评价;华北集约化区;最小数据集;聚类分析;主成分分析;综合指数法
-
利用CBE系统编辑Wx基因调控稻米直链淀粉含量
作者:陈玉叶;焦晓真;王健;王克剑;陈峰;朱克明;刘朝雷
关键词:Wx;直链淀粉含量;单碱基编辑;CBE
-
黄河三角洲盐碱地5种传统农田杂草饲用价值评估
作者:柏雨;鲁雪莉;王萌;孙海栓;王文良;孟晨;李义强;徐宗昌
关键词:盐碱地;农田杂草;饲用价值;营养指标;重金属风险
