一种基于LDA主题模型的政策文本聚类方法研究

被引:39
作者
张涛 [1 ]
马海群 [2 ]
机构
[1] 不详
[2] 黑龙江大学信息与网络中心
[3] 不详
[4] 黑龙江大学信息资源管理研究中心
[5] 不详
关键词
政策文本; LDA; 主题模型; 文本聚类;
D O I
暂无
中图分类号
TP391.1 [文字信息处理];
学科分类号
摘要
【目的】利用LDA主题模型有效提升政策文本聚类精准度。【方法】通过对政策文本模拟数据的预处理、导入政策词表、LDA模型生成基础数据、利用加权算法进行文本计算等步骤对政策文本聚类。【结果】实验数据表明:k=4时,加权后的政策文本聚类结果 G值最大,与初始人工分类数量吻合,Purity值和F值较高,因此验证该方法是合理有效的。【局限】实验中每步操作结果的精度都会对政策文本聚类的准确性产生影响。【结论】通过运用该方法的整体性设计,可对未来新政策的制定及对已有政策的反向评价检验和双向互动生成机制的形成提供借鉴。
引用
收藏
页码:59 / 65
页数:7
相关论文
共 20 条