期刊文献+
共找到100篇文章
< 1 2 5 >
每页显示 20 50 100
基于DOM的网页主题信息自动提取 认领 引用 被引量:82
1
作者 王琦 唐世渭 +1 位作者 杨冬青 王腾蛟 《计算机研究与发展》 EI 北大核心 2004年第10期1786-1792,共7页
Web页面所表达的主要信息通常隐藏在大量无关的结构和文字中 ,使用户不能迅速获取主题信息 ,限制了Web的可用性 ,信息提取有助于解决这一问题 基于DOM规范 ,针对HTML的半结构化特征和缺乏语义描述的不足 ,提出含有语义信息的STU DOM树模... Web页面所表达的主要信息通常隐藏在大量无关的结构和文字中 ,使用户不能迅速获取主题信息 ,限制了Web的可用性 ,信息提取有助于解决这一问题 基于DOM规范 ,针对HTML的半结构化特征和缺乏语义描述的不足 ,提出含有语义信息的STU DOM树模型 将HTML文档转换为STU DOM树 ,并对其进行基于结构的过滤和基于语义的剪枝 ,能够准确地提取出主题信息 方法不依赖于信息源 ,而且不改变源网页的结构和内容 ,是一种自动、可靠和通用的方法 具有可观的应用价值 。 展开更多
关键词 DOM 信息提取 分块 STU STU树 STU-DOM 相关度
暂未订购 下载PDF
D-EEM:一种基于DOM树的Deep Web实体抽取机制 认领 引用 被引量:17
2
作者 寇月 李冬 +2 位作者 申德荣 于戈 聂铁铮 《计算机研究与发展》 EI 北大核心 2010年第5期858-865,共8页
随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DO... 随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DOM-tree based entity extraction mechanism for Deepweb,D-EEM),能够有效解决Deep Web环境中的实体抽取问题.D-EEM采用基于DOM树的自动实体抽取策略,利用DOM树中的文本内容和层次结构来确定数据区域和实体区域,提高了实体抽取的准确性;另外,提出了一种基于上下文距离和共现次数的语义标注方法,有效地将来自不同数据源的抽取结果进行合成.通过实验验证了D-EEM中所采用的关键技术的可行性和有效性,同其他实体抽取策略相比,D-EEM在抽取效率及抽取准确性等方面具有一定的优势. 展开更多
关键词 实体抽取 DOM DeepWeb 数据区域定位 实体区域定位
暂未订购 下载PDF
逆序解析DOM树及网页正文信息提取 认领 引用 被引量:15
3
作者 张瑞雪 宋明秋 公衍磊 《计算机科学》 CSCD 北大核心 2011年第4期213-215,225,共3页
一般地,从HTML网页中提取正文信息,应先将HTML网页解析成DOM树,然后遍历DOM树,依据目标信息在DOM树中的分布规律,将信息从DOM树中提取。这种传统方法将解析DOM树和从DOM树中提取信息看成两个独立的过程,制约了提取信息的速度。事实上,... 一般地,从HTML网页中提取正文信息,应先将HTML网页解析成DOM树,然后遍历DOM树,依据目标信息在DOM树中的分布规律,将信息从DOM树中提取。这种传统方法将解析DOM树和从DOM树中提取信息看成两个独立的过程,制约了提取信息的速度。事实上,在准确提取目标信息的过程中,独立解析整个DOM树是没有必要的。在此,提出了逆序解析DOM树算法,并结合DOM树相似理论和传统的顺序解析算法,从部分目标信息开始分别向后顺序和向前逆序解析DOM树,同时定位并获取其他目标信息。利用该方法提取网页正文信息,一方面只需解析部分DOM树,从而减少了解析树结构花费的时间,另一方面不需要遍历整个DOM树查找目标信息,从而节省了查找时间,大大提高了信息提取速度。最后,通过实验证实了该方法的优越性。 展开更多
关键词 DOM 网页正文提取 结构相似性 逆序解析
暂未订购 下载PDF
基于DOM修剪的藏文Web信息提取 认领 引用 被引量:7
4
作者 珠杰 欧珠 格桑多吉 《计算机工程》 CAS 北大核心 2008年第24期58-60,共3页
随着互联网的普及和藏文信息技术的不断发展,出现了大量的藏文网站。该文根据藏文"音节点"的特征识别藏文网页并进行抓取。在建立DOM树的基础上,分析网页的链接、非链接文本与主题信息块之间的相关度。通过语义修剪算法提取... 随着互联网的普及和藏文信息技术的不断发展,出现了大量的藏文网站。该文根据藏文"音节点"的特征识别藏文网页并进行抓取。在建立DOM树的基础上,分析网页的链接、非链接文本与主题信息块之间的相关度。通过语义修剪算法提取藏文主题信息。经测试证实,该算法在藏文网页识别和藏文主题信息提取中具有较好的适应性。 展开更多
关键词 音节点 DOM 藏文 Web信息提取
暂未订购 下载PDF
一种基于DOM树的XML数据频繁模式挖掘算法 认领 引用 被引量:4
5
作者 吉根林 韦素云 鲍培明 《南京航空航天大学学报(自然科学版)》 EI CAS 北大核心 2006年第2期206-211,共6页
由于XM L数据具有半结构化特性,使得面向XM L数据的数据挖掘不同于面向关系数据库的数据挖掘,它具有更复杂的层次结构。研究基于DOM树的XM L数据频繁模式挖掘算法,提出面向XM L数据的频繁模式增量式挖掘算法F reqtT ree。该算法首先将X... 由于XM L数据具有半结构化特性,使得面向XM L数据的数据挖掘不同于面向关系数据库的数据挖掘,它具有更复杂的层次结构。研究基于DOM树的XM L数据频繁模式挖掘算法,提出面向XM L数据的频繁模式增量式挖掘算法F reqtT ree。该算法首先将XM L数据转化成DOM树,然后从DOM树挖掘所有频繁模式。F reqtT ree算法采用最右扩展技术,只在树的最右分支上增加新结点生成新树。同时充分利用已生成的频繁模式信息,使得产生的候选模式数量较少。F reqtT ree算法利用频繁k-1模式的支持数计算候选k模式的支持数,该算法只对DOM树遍历一次,具有较高的效率。采用多组数据对此算法的性能进行检验,并与其他算法作对比实验,实验结果表明该算法高效可行。 展开更多
关键词 XML DOM 频繁模式 增量式挖掘 数据挖掘
暂未订购 下载PDF
一种基于网页DOM树的信息采集系统 认领 引用 被引量:3
6
作者 刘文杰 田伟 +1 位作者 马廷淮 崔萌萌 《武汉理工大学学报》 CAS 北大核心 2010年第16期119-122,共4页
在分析Web页面文档对象基础上,提出了一种通过网页DOM树路径进行采集区域定制的算法,进而实现网页信息的定时或实时自动抽取。基于该算法过程,以中国船舶市场研究中心需求为例,采用SSH(Spring、Struts和Hibernat)技术框架设计并实现了... 在分析Web页面文档对象基础上,提出了一种通过网页DOM树路径进行采集区域定制的算法,进而实现网页信息的定时或实时自动抽取。基于该算法过程,以中国船舶市场研究中心需求为例,采用SSH(Spring、Struts和Hibernat)技术框架设计并实现了一个信息采集系统,其执行过程分为网站信息源定制、网页信息抽取和信息管理3个过程;采集后的信息将存放在关系数据库和文件系统中,以便支持查询和其他扩展应用。系统经运行测试可对大多数船舶行业网站进行信息抽取,且抽取效果良好。 展开更多
关键词 信息抽取 DOM 信息采集 信息管理
暂未订购 下载PDF
基于DOM树与领域本体的Web抽取方法 认领 引用 被引量:6
7
作者 郭建兵 崔志明 +1 位作者 陈明 赵朋朋 《计算机工程》 CAS CSCD 2012年第5期56-58,共3页
为解决异构DeepWeb结果页面中数据区域及数据记录的自动抽取问题,提出一种基于DOM树与领域本体的Web抽取方法。利用数据内容特征以及领域本体库标记DOM树的节点,按照结果页面展示规律定位数据区域,根据改进的简单树匹配算法,定位数据区... 为解决异构DeepWeb结果页面中数据区域及数据记录的自动抽取问题,提出一种基于DOM树与领域本体的Web抽取方法。利用数据内容特征以及领域本体库标记DOM树的节点,按照结果页面展示规律定位数据区域,根据改进的简单树匹配算法,定位数据区域及数据记录。实验结果表明,该方法定位数据区域及数据记录的F-measure值比传统的抽取方法高2.93%~6.67%。 展开更多
关键词 自动抽取 DOM 领域本体 数据区域定位 简单树匹配
暂未订购 下载PDF
基于DOM树与模板的自适应网络信息抽取方法 认领 引用 被引量:4
8
作者 柏志安 廖健 曾剑平 《计算机应用与软件》 北大核心 2022年第8期15-20,81,共6页
针对论坛型网站的特性,包括标签的重复出现和文本内容的特定模式等,提出一种基于DOM树与模板的自适应信息抽取算法。以拥有共同父节点的邻近结构的相似子树为基础,提出生成候选集以及候选集过滤细分的抽取规则生成方法。该算法能很好地... 针对论坛型网站的特性,包括标签的重复出现和文本内容的特定模式等,提出一种基于DOM树与模板的自适应信息抽取算法。以拥有共同父节点的邻近结构的相似子树为基础,提出生成候选集以及候选集过滤细分的抽取规则生成方法。该算法能很好地适应论坛网页结构的变化,当网页结构改变后自动生成新的抽取规则。实验结果表明,在多个不同论坛型网站页面及相应改版页面上,该方法能够有效生成抽取规则以实现Web论坛信息抽取,并获得比现有信息抽取方法更好的性能。 展开更多
关键词 信息抽取 自适应 DOM 模板
暂未订购 下载PDF
基于DOM树及行文本统计去噪的网页文本抽取技术 认领 引用 被引量:4
9
作者 李霞 蒋盛益 《山东大学学报(理学版)》 CAS CSCD 北大核心 2012年第3期38-42,共5页
首先对网页源码文本统一编码转为UTF格式,然后把HTML网页文档转换为XML文档并解析为一棵DOM树。依据XML语言特点及噪声特征规则先对DOM树的噪声节点进行过滤删除,然后依据中文标点符号统计方法提取网页正文内容,并在此基础上利用行文本... 首先对网页源码文本统一编码转为UTF格式,然后把HTML网页文档转换为XML文档并解析为一棵DOM树。依据XML语言特点及噪声特征规则先对DOM树的噪声节点进行过滤删除,然后依据中文标点符号统计方法提取网页正文内容,并在此基础上利用行文本统计方法去除提取出的正文中存在的噪声信息,最后得到网页正文文本。对来自结构完全不同的主流与非主流的中英文新闻网站上的2 000篇网页进行实验,结果表明本文提出的方法具有较高的抽取准确率,并具有很好的通用性和实现简单的特点,适用于针对互联网中不同网站新闻文本信息的自动采集。 展开更多
关键词 网页文本抽取 DOM 行文本统计 标点符号统计
暂未订购 下载PDF
基于DOM树的视频元数据抽取系统 认领 引用 被引量:1
10
作者 唐朝伟 李俊 +1 位作者 苗光胜 杜欣慧 《计算机工程》 CAS CSCD 2012年第8期268-270,共3页
目前多数抽取方法主要针对主题信息块的提取,未深入到各单独信息块。为此,设计一种基于DOM树的视频元数据抽取系统。通过改进Heritrix的链接过滤功能和URL队列管理策略,结合网页DOM树节点类型,从各单独信息块中抽取网页元数据。实验结... 目前多数抽取方法主要针对主题信息块的提取,未深入到各单独信息块。为此,设计一种基于DOM树的视频元数据抽取系统。通过改进Heritrix的链接过滤功能和URL队列管理策略,结合网页DOM树节点类型,从各单独信息块中抽取网页元数据。实验结果表明,该系统的网页平均查准率为95.7%,平均抽取准确率为98.4%,高于同类系统。 展开更多
关键词 网络爬虫 信息采集 URL调度 增量更新 DOM
暂未订购 下载PDF
基于DOM树序列值比对的SQL注入漏洞检测 认领 引用 被引量:3
11
作者 罗明宇 凌捷 《计算机工程与设计》 北大核心 2015年第2期350-354,共5页
为更好地防止SQL注入的危害,优化漏洞检测方法,提出一种基于DOM树序列值比对的SQL注入检测算法。对待检测的页面进行SQL注入,选取注入前后页面的DOM树中体现结构的关键参数;通过计算得到序列值,用比对序列值的方法比对页面是否相同,将... 为更好地防止SQL注入的危害,优化漏洞检测方法,提出一种基于DOM树序列值比对的SQL注入检测算法。对待检测的页面进行SQL注入,选取注入前后页面的DOM树中体现结构的关键参数;通过计算得到序列值,用比对序列值的方法比对页面是否相同,将节点比对转化成数值比对,简化网页比对。实验分析结果表明,该算法有效地提高了漏洞检测的准确率与效率。 展开更多
关键词 SQL注入 漏洞检测 DOM 序列值 网页对比
暂未订购 下载PDF
XML编程中的DOM与SAX技术 认领 引用 被引量:25
12
作者 赵俊岚 《计算机工程》 EI CAS 北大核心 2004年第24期70-72,共3页
在XML的基础上,介绍了DOM与SAX技术的产生以及实现方式。通过引入应用示例对DOM与SAX的工作方式以及解析过程进行了分析,进而对两种技术进行了比较,并指出了DOM与SAX技术所适宜的情况与环境。
关键词 可扩展标记语言 文档对象模型 SAX 节点 树型结构 事件驱动
暂未订购 下载PDF
A Method of Eliminating Noises in Web Pages by Style Tree Model and Its Applications 认领 引用 被引量:2
13
作者 ZHAOCheng-li YIDong-yun 《Wuhan University Journal of Natural Sciences》 EI CAS 2004年第5期611-616,共6页
A Web page typically contains many information blocks. Apart from the main content blocks, it usually has such blocks as navigation panels, copyright and privacy notices, and advertisements. We call these blocks the n... A Web page typically contains many information blocks. Apart from the main content blocks, it usually has such blocks as navigation panels, copyright and privacy notices, and advertisements. We call these blocks the noisy blocks. The noises in Web pages can seriously harm Web data mining. To the question of climinating these noises, we intro duce a new tree structure, called Style Tree, and study an algorithm how to construct a site style tree. The Style Tree Model is employed to detect and climinate noises in any Web pages of the site. An information based measure to determine which element node is noisy is also constructed. In addition, the applications of this method are discussed in detail. Experimental results show that our noises climination technique is able to improve the mining results significantly. Key words noises climination - DOM tree - style tree - Web mining CLC number TP 339 Foundation item: Supported by the National Natural Science Foundation of China (60003013)Biography: ZHAN Cheng-li (1979-), male, Master candidate, research direction: Intelligent Information System. 展开更多
关键词 noises climination DOM tree style tree Web mining
暂未订购 下载PDF
基于本体和DOM树的Web信息抽取技术研究 认领 引用 被引量:2
14
作者 吴恒亮 《情报科学》 CSSCI 北大核心 2010年第7期1055-1059,共5页
Web信息抽取是一个很大、很复杂的课题,涉及人工智能、机器学习等多个领域,本文研究的主要内容是如何将网页中的非结构化信息转化成结构化信息。首先介绍了本体的基本知识,然后重点讨论了基于本体和网页DOM树的网页信息抽取技术的实现... Web信息抽取是一个很大、很复杂的课题,涉及人工智能、机器学习等多个领域,本文研究的主要内容是如何将网页中的非结构化信息转化成结构化信息。首先介绍了本体的基本知识,然后重点讨论了基于本体和网页DOM树的网页信息抽取技术的实现过程。 展开更多
关键词 本体 DOM Web信息 抽取技术
暂未订购 下载PDF
基于单DOM树特征预分类的自适应Web信息抽取方法 认领 引用 被引量:4
15
作者 彭艳兵 谢馨庭 《电子设计工程》 2017年第19期56-59,63,共4页
在传统的舆情中多为基于模板采集模式,基于减少人工维护的目的,文中提出一种基于单DOM树特征预分类的自适应Web信息抽取方法,分为链接预分类与信息抽取两个部分。链接预分类采用SVM分类算法,提取信息超链接在页面中的特征进行分类学习,... 在传统的舆情中多为基于模板采集模式,基于减少人工维护的目的,文中提出一种基于单DOM树特征预分类的自适应Web信息抽取方法,分为链接预分类与信息抽取两个部分。链接预分类采用SVM分类算法,提取信息超链接在页面中的特征进行分类学习,再对分类结果进行同源的Web信息提取。实验表明,此方法预分类结果准确率可达94.48%,召回率为94.77%。 展开更多
关键词 DOM 标签路径 信息抽取 SVM
暂未订购 下载PDF
一种DOM树标签路径和行块密度结合的Web信息抽取方法 认领 引用 被引量:5
16
作者 马晓慧 李泓莹 《智能计算机与应用》 2017年第4期13-16,20,共4页
本文提出了一种标签路径和行块分布函数相结合的信息抽取方法来实现Web页面的信息抽取。该方法将Web页面解析成DOM树,使用视觉特征和标签过滤的规则将树进行剪枝,引入标签路径特征的方法粗略划分出网页的正文内容和噪音内容,最终使用行... 本文提出了一种标签路径和行块分布函数相结合的信息抽取方法来实现Web页面的信息抽取。该方法将Web页面解析成DOM树,使用视觉特征和标签过滤的规则将树进行剪枝,引入标签路径特征的方法粗略划分出网页的正文内容和噪音内容,最终使用行块分布函数的方法进行抽取,获得正文文本。实验结果表明,这种抽取方法有效地防止了正文内容误删及噪音内容漏删的现象,使得提取的正文信息更加准确,准确度达到91%,召回率达到95%,F值达到93%。本算法对于包含过多短文本的网页抽取的准确度还有待提高。 展开更多
关键词 DOM 视觉特征 标签路径特征 行块分布函数
暂未订购 下载PDF
基于DOM树和混合文本密度的网页信息提取方法研究 认领 引用 被引量:1
17
作者 魏建兵 《信息与电脑》 2023年第10期52-54,共3页
在网页信息提取领域,文档对象模型(Document Object Model,DOM)树和混合文本密度是两个重要的概念。文章提出一种基于DOM树和混合文本密度的网页信息提取方法。首先,利用DOM树结构分析网页的标签层次结构,确定每个标签的重要性;其次,根... 在网页信息提取领域,文档对象模型(Document Object Model,DOM)树和混合文本密度是两个重要的概念。文章提出一种基于DOM树和混合文本密度的网页信息提取方法。首先,利用DOM树结构分析网页的标签层次结构,确定每个标签的重要性;其次,根据混合文本密度计算每个标签中包含有用信息的概率并且提取重要信息;最后,进行实验分析。实验结果表明,该方法能够有效提取网页中的有用信息。 展开更多
关键词 DOM 混合文本密度 信息提取
暂未订购 下载PDF
基于Web网页的DOM树链接预分类、信息抽取方法研究 认领 引用 被引量:1
18
作者 罗莎 《长江信息通信》 2023年第11期133-135,共3页
为满足Web网页的数据记录、自动抽取需求,提出依托DOM树特征的网页信息链接预分类、领域本体的Web信息抽取方法,根据HTML、XML网页文档结构设置DOM对象节点树,标记网页页码导航节点、前导符节点、数据特征节点,用DOM根节点到目标节点的... 为满足Web网页的数据记录、自动抽取需求,提出依托DOM树特征的网页信息链接预分类、领域本体的Web信息抽取方法,根据HTML、XML网页文档结构设置DOM对象节点树,标记网页页码导航节点、前导符节点、数据特征节点,用DOM根节点到目标节点的标签序列计算树路径,根据各网页链接的XPATH树路径进行分组,DOM树特征预分类模块完成站点信息链接预分类,采用SVM分类器、支持向量机SVM算法,将网页的数据记录样本作出数据信息抽取、属性特征提取计算,从而抽取出满足用户需求的数据文本、数据记录信息。 展开更多
关键词 Web网页 DOM树特征 信息链接预分类 信息抽取方法
暂未订购 下载PDF
无线网页转换系统中的分页技术研究与实现 认领 引用
19
作者 周淦淼 《信息与电脑》 2026年第7期162-164,共3页
针对无线设备适配缺陷,文章提出无线网页分页技术。系统抓取超文本标记语言(Hypertext Markup Language,HTML)网页并将其解析为文件对象模型(Document Object Model,DOM)树,区分新闻与普通页面后转换为可扩展超文本标记语言(Extensible ... 针对无线设备适配缺陷,文章提出无线网页分页技术。系统抓取超文本标记语言(Hypertext Markup Language,HTML)网页并将其解析为文件对象模型(Document Object Model,DOM)树,区分新闻与普通页面后转换为可扩展超文本标记语言(Extensible Hypertext Markup Language,XHTML)元素。这一过程采用差异化分页算法:新闻页面提取标题与正文、裁剪无关元素,按行数标准分裂文本并打分页标签;普通页面转换元素后,结合行数与DOM树层级分页,并通过链接计数器判定重要信息块优先推送。该技术能有效控制页面内存占用,保障元素关联性,优先呈现重要内容,为PC资源向无线设备转化提供了支持。 展开更多
关键词 HTML XHTML 分页技术 DOM
暂未订购 下载PDF
基于DOM树和视觉特征的网页信息自动抽取 认领 引用 被引量:6
20
作者 黄武冠 朱明 尹文科 《计算机工程》 CAS CSCD 2013年第10期309-312,共4页
针对生活信息服务网站的列表式商户信息,提出一种基于文档对象模型(DOM)树和视觉特征的网页信息自动抽取方法。利用商户信息列表页面中数据区域的DOM树结构和视觉特征,搜索得到候选目标数据区域,再利用视觉特征识别真正目标数据区域,从... 针对生活信息服务网站的列表式商户信息,提出一种基于文档对象模型(DOM)树和视觉特征的网页信息自动抽取方法。利用商户信息列表页面中数据区域的DOM树结构和视觉特征,搜索得到候选目标数据区域,再利用视觉特征识别真正目标数据区域,从而抽取其中的数据记录。对10个生活信息服务网站进行测试,结果表明,有8个网站的召回率和准确率达到100%,取得了较好的结果。 展开更多
关键词 文档对象模型树 视觉特征 自动抽取 数据记录 数据区域 挖掘算法
暂未订购 下载PDF
上一页 1 2 5 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈