数字农科院2.0

大语言模型驱动的科学数据自动分类研究

文献类型: 中文期刊

作者: 黄永文;马玮璐;鲜国建;李娇;罗婷婷;孙坦

作者机构:

关键词: 大语言模型;科学数据分类;提示模板;少样本学习;监督式微调

期刊名称:情报理论与实践

ISSN: 1000-7490

年卷期: 2025 年

页码:

收录情况: 北大核心(2023版) ; ; CSSCI(2023-2024版) ; ; 科技核心(2024版)

摘要: [目的/意义]将科学数据分类到特定的学科领域,可以增强信息检索效果以及提高资源的可发现性,不过以人为主体对科学数据进行分类已难以应对海量数据处理的需求,因此有必要探索科学数据自动分类的有效方法。[方法/过程]提出大语言模型驱动的科学数据自动分类的研究思路。首先,利用数据期刊“Data in Brief”构建高质量标注数据集;然后,设计提示模板和遴选少样本数据,使开源模型Qwen2.5-7B快速适配分类任务,并利用标注数据进一步对大语言模型进行监督式微调;最后,进行少样本学习实验以及利用微调后的大语言模型分别针对元数据和全文进行分类实验。[结果/结论]将提示模板、少样本学习以及监督式微调相互结合,可以有效提高大语言模型的自动分类性能。同时,用于模型微调的标注数据的数量和学科分布,决定了大语言模型在不同学科分类的效果。

分类号:

  • 相关文献

[1]GPT技术驱动的农业发展范式研究与展望. 李灯华,李干琼,许世卫,陈威. 2024

[2]农业垂直领域大语言模型构建流程和技术展望. 张宇芹,朱景全,董薇,李富忠,郭雷风. 2024

[3]基于GraphRAG的中国马铃薯新品种知识图谱构建. 韦一金,任有强,赵慧,樊景超,方沩,闫燊. 2024

[4]基于大语言模型的智能问答系统研究综述. 任海玉,刘建平,王健,顾勋勋,陈曦,张越,赵昌顼. 2024

[5]国家公园建设的公众反响测度——基于B站《我们的国家公园》纪录片评论的主题和情感分析. 吴俣,李海英,李扬,林巧,李飞. 2025

[6]基于LLM和GraphRAG的科技文献图谱式摘要生成研究. 马玮璐,孙坦,赵瑞雪,鲜国建. 2025

[7]基于大语言模型的《中国小麦品种志》信息提取. 韦一金,陈彦清,王秀东,樊景超. 2025

作者其他论文 更多>>