收藏本站
收藏 | 投稿 | 手机打开
二维码
手机客户端打开本文

高维特征空间中文本聚类研究

姜宁  宫秀军  史忠植  
【摘要】:依据信息论的思想,从文档信息量变化的角度对文本聚类的过程进行了分析,指出了信息量在聚类过程中呈现的规律性,进而提出一种基于信息量模型的聚类分析算法。通过对高维特征空间中影响聚类准确率因素的分析,发现特征之间复杂的语义联系和过高的维度是影响文本聚类准确率的重要因素。从削弱特征之间的语义联系入手,提出了一种特征聚类算法,其算法复杂度与处理的文档数量无关,提高了高维空间下聚类的速度和效果。两种算法的结合使得对大量高维文本数据直接聚类变得可行,实际的测试中获得了满意的效果。

知网文化
【相似文献】
中国期刊全文数据库 前10条
1 姜宁,史忠植;文本聚类中的贝叶斯后验模型选择方法[J];计算机研究与发展;2002年05期
2 姜宁,宫秀军,史忠植;高维特征空间中文本聚类研究[J];计算机工程与应用;2002年10期
3 卜东波,白硕,李国杰;文本聚类中权重计算的对偶性策略[J];软件学报;2002年11期
4 徐建锁,王正欧,王莉;一种基于自组织神经网络的中文文本聚类新方法[J];情报学报;2003年06期
5 胡波;聚类方法在警报数据分类与约简中的应用[J];泰山学院学报;2003年03期
6 张毓敏,谢康林;基于SOM算法实现的文本聚类[J];计算机工程;2004年01期
7 王国勇,徐建锁;TCBLSA:一种中文文本聚类新方法[J];计算机工程;2004年05期
8 黄钢石,陆建江,张亚非;基于NMF的文本聚类方法[J];计算机工程;2004年11期
9 林建敏,谢康林;基于PAT-array和模糊聚类的文本聚类方法[J];计算机工程;2004年12期
10 刘立平,易华容,何文斌;一种基于向量空间模型的文本聚类方法[J];株洲师范高等专科学校学报;2004年05期
中国重要会议论文全文数据库 前9条
1 张宝艳;王庆辉;;中文文本聚类的研究与实现[A];第一届学生计算语言学研讨会论文集[C];2002年
2 张刚;周昭涛;王斌;;基于主题的分布式信息检索研究[A];NCIRCS2004第一届全国信息检索与内容安全学术会议论文集[C];2004年
3 邱立坤;程葳;龙志祎;孙娇华;;面向BBS的话题挖掘初探[A];全国第八届计算语言学联合学术会议(JSCL-2005)论文集[C];2005年
4 黎琳;;Web内容挖掘在数字图书馆中的应用[A];中国工程物理研究院第七届电子技术青年学术交流会论文集[C];2005年
5 彭怡;;从数据挖掘文章聚类分析看其发展趋势[A];现代工业工程与管理研讨会会议论文集[C];2006年
6 朱强生;田英;周延泉;何华灿;;基于非负因子分析的模糊文本挖掘[A];2006通信理论与技术新进展——第十一届全国青年通信学术会议论文集[C];2006年
7 罗娜;左万利;袁福宇;张靖波;张慧杰;;使用本体语义提高文本聚类(英文)[A];全国语域web与本体能研讨会论文集[C];2006年
8 颜端武;李晓鹏;王磊;成晓;;文本聚类中基于本体的相似性测度(英文)[A];全国语域web与本体能研讨会论文集[C];2006年
9 丁堃;许侃;;基于文本聚类方法的我国科技管理研究领域的计量研究[A];第三届科技政策与管理学术研讨会暨第二届科教发展战略论坛论文汇编[C];2007年
中国博士学位论文全文数据库 前4条
1 戈鹏;敏捷化CAPP系统原理、关键技术与应用实践[D];四川大学;2003年
2 何清;机器学习与文本挖掘若干算法研究[D];中国科学院研究生院(计算技术研究所);2002年
3 熊云波;文本信息处理的若干关键技术研究[D];复旦大学;2006年
4 刘向威;NLP技术在中文信息检索中的应用研究[D];天津大学;2005年
中国硕士学位论文全文数据库 前10条
1 易靖;基于信息粒度原理的文本分类方法的研究[D];北京工业大学;2001年
2 张俊艳;基于SVM有聚类指导的Web中文文本分类器的研究及其实现[D];福州大学;2004年
3 谷波;基于粗集模型的聚类方法及其在文献过滤系统中的应用[D];山西大学;2004年
4 袁磊;基于概率模型的文本聚类[D];吉林大学;2005年
5 杨文忠;基于近似网页聚类算法的Web文本数据挖掘技术的研究与应用[D];湖南大学;2005年
6 张猛;文本聚类中参数自动设置技术的研究与实现[D];东北大学;2005年
7 朱红灿;基于SOM的两阶段中文文本聚类算法的研究[D];湘潭大学;2005年
8 芦立华;基于后缀树的中文文本聚类算法研究[D];上海海事大学;2005年
9 齐丽云;通信行业客户服务系统中知识发现的应用研究[D];大连理工大学;2006年
10 庄世芳;一种改进的基于概念的中文WEB文本聚类算法的研究[D];福州大学;2006年
中国重要报纸全文数据库 前2条
1 王培森;从Web挖到竞争情报[N];中国计算机报;2003年
2 中国科学院计算技术研究所 王 斌;内容为王[N];计算机世界;2004年
中国知网广告投放
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62982499
  • 010-62783978