收藏本站
《井冈山大学学报(自然科学版)》 2012年02期
收藏 | 投稿 | 手机打开
二维码
手机客户端打开本文

基于Web结构的网站新闻采集系统的设计与实现

陈建国  
【摘要】:在深入研究网络信息采集技术的基础上,提出一个基于Web结构的新闻采集模型。该模型加载采集入口地址后,通过信息采集和过滤算法确定新闻列表页,结合正则表达式技术自动识别新闻内容页的链接地址,访问目标新闻内容页,使用采集算法自动提取新闻信息数据。同时,它可以过滤在此页面中嵌入的广告等信息。实践结果表明,该模型工作良好,可以自动化、高效率地采集新闻信息。
【作者单位】湖南大学软件学院;厦门理工学院;
【分类号】:TP393.09

【参考文献】
中国期刊全文数据库 前7条
1 胡凌云;胡桂兰;徐勇;李龙澍;;基于Web的新闻文本分类技术的研究[J];安徽大学学报(自然科学版);2010年06期
2 胡静芳;沈亚斌;;基于Web的新闻采集系统[J];电脑知识与技术;2009年19期
3 吴定明;赵东岩;;一种互联网新闻网页的采集分析方法[J];计算机工程与应用;2007年36期
4 王煜;张浩斌;;面向主题的网页采集系统的设计与研究[J];计算机与数字工程;2008年04期
5 张春元;康耀红;伍小芹;;Web新闻自动采集发布系统的设计与实现[J];计算机技术与发展;2009年09期
6 洪辉 ,刘子敬 ,李石君 ,欧伟杰;智能WEB信息提取系统的研究和设计[J];微计算机信息;2005年23期
7 赵建涛;徐玉凤;;基于RSS的新闻采集系统的研究[J];西安航空技术高等专科学校学报;2010年03期
中国博士学位论文全文数据库 前2条
1 彭涛;面向专业搜索引擎的主题爬行技术研究[D];吉林大学;2007年
2 宗校军;中文网页定题采集及分类研究[D];华中科技大学;2006年
中国硕士学位论文全文数据库 前1条
1 王涛;基于HTML标记的主题爬行器的设计与实现[D];电子科技大学;2009年
【共引文献】
中国期刊全文数据库 前10条
1 李伟;黄颖;;基于HtmlParser的网页信息提取[J];兵工自动化;2007年07期
2 郎凤举;;HTMLParser提取网页超链接研究[J];电脑编程技巧与维护;2010年02期
3 徐力;;网站新闻自动采集系统设计[J];电脑知识与技术;2009年33期
4 陈白云;;汇聚媒体资源 创新新闻搜索与热点分析服务平台[J];电脑知识与技术;2010年21期
5 黄轩;;辛亥革命史主题爬虫的设计与实现[J];电脑知识与技术;2011年13期
6 吴国祥;;网络挖掘研究综述[J];电脑知识与技术;2011年32期
7 曾昭江;;网站数据采集原理及防范策略[J];福建电脑;2011年04期
8 宋凯伦;邱广华;李珊;;基于Web的定向信息采集系统的设计与实现[J];福建电脑;2011年11期
9 王春晖;吴麒;朱锴;;基于特征选择优化的主题描述算法[J];计算机光盘软件与应用;2012年01期
10 杨光熠;;热点新闻的采集与发布[J];黑龙江科技信息;2010年14期
中国重要会议论文全文数据库 前2条
1 吴晨生;刘彦君;张鲁冀;董晓晴;;科普搜索的研究与实现[A];数字博物馆研究与实践(2009)[C];2010年
2 陈竹敏;马军;韩晓晖;雷景生;;面向主题爬取的多粒度URLs优先级计算方法[A];第四届全国信息检索与内容安全学术会议论文集(上)[C];2008年
中国博士学位论文全文数据库 前7条
1 安璐;基于自组织映射的期刊主题研究[D];武汉大学;2009年
2 李群;主题搜索引擎聚类算法的研究[D];北京林业大学;2011年
3 彭涛;面向专业搜索引擎的主题爬行技术研究[D];吉林大学;2007年
4 陈竹敏;面向垂直搜索引擎的主题爬行技术研究[D];山东大学;2008年
5 罗娜;基于本体的主题爬行技术研究[D];吉林大学;2009年
6 刘东飞;智能双语搜索方法及搜索引擎的研究[D];武汉理工大学;2009年
7 管子玉;基于图学习的Web信息检索技术研究[D];浙江大学;2010年
中国硕士学位论文全文数据库 前10条
1 李振;网络舆情预测关键技术研究[D];郑州大学;2010年
2 檀康;基于深度网页爬虫搜索引擎原型的研究和实现[D];东华大学;2010年
3 卢革超;基于本体的主题搜索引擎技术研究[D];吉林大学;2011年
4 卢承山;基于领域的主题信息采集技术研究[D];武汉理工大学;2011年
5 邱伟林;面向领域的垂直搜索引擎的研究与实现[D];大连海事大学;2011年
6 戴依若;基于内容的中文流行病新闻主题分类[D];北京邮电大学;2011年
7 刘欢;职位匹配系统的设计与实现[D];华东师范大学;2011年
8 郭艳芬;林业主题搜索引擎的设计与实现[D];北京林业大学;2011年
9 吴宗坤;基于Fuse的资源搜索文件系统设计与实现[D];华南理工大学;2011年
10 许绍萌;广域网环境下多数据源联合检索子系统的设计与实现[D];北京邮电大学;2011年
【二级参考文献】
中国期刊全文数据库 前10条
1 张利彪,周春光,刘小华,马铭;粒子群算法在求解优化问题中的应用[J];吉林大学学报(信息科学版);2005年04期
2 马建斌;李滢;滕桂法;王芳;赵洋;;KNN和SVM算法在中文文本自动分类技术上的比较研究[J];河北农业大学学报;2008年03期
3 欧歌,赵恒永;一种专题Web信息采集系统的设计方案[J];电脑与信息技术;2004年06期
4 丁璇,侯汉清,章成志;中文网页标引源主题表达能力的调查统计[J];大学图书馆学报;2002年06期
5 叶允明,于水,马范援,宋晖,张岭;分布式Web Crawler的研究:结构、算法和策略[J];电子学报;2002年S1期
6 吴军,王作英;汉语信息熵和语言模型的复杂度[J];电子学报;1996年10期
7 杨维,李歧强;粒子群优化算法综述[J];中国工程科学;2004年05期
8 刘晨曦;吴扬扬;;一种基于块分析的网页去噪音方法[J];广西师范大学学报(自然科学版);2007年02期
9 李静,陈兆乾,陈世福,徐殿祥;多Agent Teamwork研究综述[J];计算机研究与发展;2003年03期
10 王琦,唐世渭,杨冬青,王腾蛟;基于DOM的网页主题信息自动提取[J];计算机研究与发展;2004年10期
中国硕士学位论文全文数据库 前4条
1 张海燕;基于分词的中文文本自动分类研究与实现[D];湖南大学;2002年
2 唐志;主题Web信息采集与分析技术研究[D];重庆大学;2006年
3 李盛韬;基于主题的Web信息采集技术研究[D];中国科学院研究生院(计算技术研究所);2002年
4 王晓伟;垂直搜索引擎若干关键技术的研究[D];浙江大学;2007年
【相似文献】
中国期刊全文数据库 前10条
1 黄毅;数据挖掘技术在物流决策系统中的应用[J];广州航海高等专科学校学报;2003年02期
2 周自力;王仁武;;Web数据自动采集及其应用研究[J];电子商务;2006年04期
3 孙健;仲梁维;倪静;;基于Web的图档管理系统研究[J];精密制造与自动化;2008年03期
4 吕志花;;网络信息挖掘及其在搜索引擎方面的应用[J];微计算机信息;2008年06期
5 曹晓声;乔杰华;;网络数据的挖掘[J];辽宁工程技术大学学报;2006年S1期
6 曼丽春,朱宏;WEB数据挖掘研究与探讨[J];西南民族大学学报(自然科学版);2005年02期
7 王兆红;;企业商业智能系统的架构及实施研究[J];中国管理信息化(综合版);2007年06期
8 赵旵;;Asp.net平台下教育动态信息的定时采集[J];浙江现代教育技术;2007年05期
9 陈安;陈宁;;物联网核心技术RFID的数据挖掘及应用[J];科技促进发展;2010年11期
10 刘文清,包骏杰,陈晓红;基于Web的数据挖掘技术与应用研究[J];重庆三峡学院学报;2004年03期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 裴维玲;呼叫中心与数据挖掘,谁先上?[N];网络世界;2001年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 洪江龙;基于数据挖掘的本科专业评估管理信息系统应用研究[D];上海交通大学;2010年
2 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
3 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
4 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
5 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
6 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
7 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
8 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
9 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
10 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026