期刊文献+
共找到100篇文章
< 1 2 5 >
每页显示 20 50 100
无线网页转换系统中的分页技术研究与实现 认领 引用
1
作者 周淦淼 《信息与电脑》 2026年第7期162-164,共3页
针对无线设备适配缺陷,文章提出无线网页分页技术。系统抓取超文本标记语言(Hypertext Markup Language,HTML)网页并将其解析为文件对象模型(Document Object Model,DOM)树,区分新闻与普通页面后转换为可扩展超文本标记语言(Extensible ... 针对无线设备适配缺陷,文章提出无线网页分页技术。系统抓取超文本标记语言(Hypertext Markup Language,HTML)网页并将其解析为文件对象模型(Document Object Model,DOM)树,区分新闻与普通页面后转换为可扩展超文本标记语言(Extensible Hypertext Markup Language,XHTML)元素。这一过程采用差异化分页算法:新闻页面提取标题与正文、裁剪无关元素,按行数标准分裂文本并打分页标签;普通页面转换元素后,结合行数与DOM树层级分页,并通过链接计数器判定重要信息块优先推送。该技术能有效控制页面内存占用,保障元素关联性,优先呈现重要内容,为PC资源向无线设备转化提供了支持。 展开更多
关键词 HTML XHTML 分页技术 DOM树
暂未订购 下载PDF
基于决策树和随机森林算法模型预测醛固酮瘤患者术后血压恢复情况 认领 引用 被引量:1
2
作者 关兆娟 薛舒婷 +2 位作者 谷婷钰 张岩波 王彦 《山西医科大学学报》 CAS 2025年第2期127-133,共7页
目的 构建决策树和随机森林算法模型,预测醛固酮瘤患者术后血压恢复情况,评估其预测效果,并识别影响术后血压恢复的关键因素。方法 收集211例醛固酮瘤患者的基本信息,按照7∶3的比例将数据集划分为训练集和测试集。在训练集上分别使用... 目的 构建决策树和随机森林算法模型,预测醛固酮瘤患者术后血压恢复情况,评估其预测效果,并识别影响术后血压恢复的关键因素。方法 收集211例醛固酮瘤患者的基本信息,按照7∶3的比例将数据集划分为训练集和测试集。在训练集上分别使用决策树和随机森林算法模型构建醛固酮瘤患者术后血压恢复情况的预测模型,并在测试集上进行验证。通过比较两种模型的预测性能,评估其在术后血压恢复预测中的效果。结果 在211例醛固酮瘤患者中,术后血压恢复正常的患者79例,术后血压有所改善但未治愈的患者132例,术后血压治愈率为37.4%。两组患者在年龄、体质量指数、高血压病程及肾小球滤过率等方面差异有统计学意义(P<0.05)。决策树模型的预测准确率为0.75,特异度为0.82,灵敏度为0.64,AUC为0.79,F1分数为0.67;随机森林模型的预测准确率为0.81,特异度为0.87,灵敏度为0.72,AUC为0.87,F1分数为0.75,故随机森林模型的预测性能优于决策树模型。结论 随机森林模型能够更准确地预测醛固酮瘤患者术后血压的恢复情况,有效识别出年龄、体质量指数、高血压病程和肾小球滤过率等影响因素。该模型可为醛固酮瘤患者术后血压的临床治疗和个性化管理提供科学依据。 展开更多
关键词 醛固酮瘤 肾上腺切除术 血压 预测模型 决策树模型 随机森林算法模型 影响因素
暂未订购 下载PDF
基于GF-2遥感影像的甘东南农村建筑物结构分类方法 认领 引用 被引量:7
3
作者 孙钦瑶 钟秀梅 +4 位作者 马金莲 王妍 许晓威 吴松翰 王谦 《遥感技术与应用》 CSCD 北大核心 2025年第1期192-201,共10页
农村建筑物作为地震灾害中最重要的承灾对象,对其类型、分布等信息的快速获取在抗震减灾等方面具有重要意义。基于GF-2高分辨率遥感数据,利用ESP(Estimation of Scale Parameter)算法和SeaTH(Seperability and Thresholds)算法分别确定... 农村建筑物作为地震灾害中最重要的承灾对象,对其类型、分布等信息的快速获取在抗震减灾等方面具有重要意义。基于GF-2高分辨率遥感数据,利用ESP(Estimation of Scale Parameter)算法和SeaTH(Seperability and Thresholds)算法分别确定影像最佳分割尺度及构建最优特征学习空间,选用决策树分类法和随机森林机器学习分类法,分别对2021年5月初甘肃省襄南镇的农村建筑物结构进行提取分类,并使用无人机航测和现场调查统计数据进行分类结果的准确度检验和修正。结果表明:①两种方法都能较好地识别空间分布均匀、面积大、颜色鲜明的砖混建筑物,但对于分布杂乱且相对集中、颜色灰暗、面积小的土木(砖木)建筑物难以有效识别出其边界轮廓并准确分类。②两种方法对研究区建筑物分类的精度分别是82.42%、86.82%,且基于随机森林的方法在提取建筑物信息时出现的错分漏分现象较少,因此,随机森林方法进行农村建筑物分类更适用。 展开更多
关键词 遥感影像 建筑物结构分类 Seath算法 决策树 随机森林
暂未订购 下载PDF
基于DOM的网页主题信息自动提取 认领 引用 被引量:82
4
作者 王琦 唐世渭 +1 位作者 杨冬青 王腾蛟 《计算机研究与发展》 EI 北大核心 2004年第10期1786-1792,共7页
Web页面所表达的主要信息通常隐藏在大量无关的结构和文字中 ,使用户不能迅速获取主题信息 ,限制了Web的可用性 ,信息提取有助于解决这一问题 基于DOM规范 ,针对HTML的半结构化特征和缺乏语义描述的不足 ,提出含有语义信息的STU DOM树模... Web页面所表达的主要信息通常隐藏在大量无关的结构和文字中 ,使用户不能迅速获取主题信息 ,限制了Web的可用性 ,信息提取有助于解决这一问题 基于DOM规范 ,针对HTML的半结构化特征和缺乏语义描述的不足 ,提出含有语义信息的STU DOM树模型 将HTML文档转换为STU DOM树 ,并对其进行基于结构的过滤和基于语义的剪枝 ,能够准确地提取出主题信息 方法不依赖于信息源 ,而且不改变源网页的结构和内容 ,是一种自动、可靠和通用的方法 具有可观的应用价值 。 展开更多
关键词 DOM 信息提取 分块 STU STU树 STU-DOM树 相关度
暂未订购 下载PDF
D-EEM:一种基于DOM树的Deep Web实体抽取机制 认领 引用 被引量:17
5
作者 寇月 李冬 +2 位作者 申德荣 于戈 聂铁铮 《计算机研究与发展》 EI 北大核心 2010年第5期858-865,共8页
随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DO... 随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DOM-tree based entity extraction mechanism for Deepweb,D-EEM),能够有效解决Deep Web环境中的实体抽取问题.D-EEM采用基于DOM树的自动实体抽取策略,利用DOM树中的文本内容和层次结构来确定数据区域和实体区域,提高了实体抽取的准确性;另外,提出了一种基于上下文距离和共现次数的语义标注方法,有效地将来自不同数据源的抽取结果进行合成.通过实验验证了D-EEM中所采用的关键技术的可行性和有效性,同其他实体抽取策略相比,D-EEM在抽取效率及抽取准确性等方面具有一定的优势. 展开更多
关键词 实体抽取 DOM树 DeepWeb 数据区域定位 实体区域定位
暂未订购 下载PDF
逆序解析DOM树及网页正文信息提取 认领 引用 被引量:15
6
作者 张瑞雪 宋明秋 公衍磊 《计算机科学》 CSCD 北大核心 2011年第4期213-215,225,共3页
一般地,从HTML网页中提取正文信息,应先将HTML网页解析成DOM树,然后遍历DOM树,依据目标信息在DOM树中的分布规律,将信息从DOM树中提取。这种传统方法将解析DOM树和从DOM树中提取信息看成两个独立的过程,制约了提取信息的速度。事实上,... 一般地,从HTML网页中提取正文信息,应先将HTML网页解析成DOM树,然后遍历DOM树,依据目标信息在DOM树中的分布规律,将信息从DOM树中提取。这种传统方法将解析DOM树和从DOM树中提取信息看成两个独立的过程,制约了提取信息的速度。事实上,在准确提取目标信息的过程中,独立解析整个DOM树是没有必要的。在此,提出了逆序解析DOM树算法,并结合DOM树相似理论和传统的顺序解析算法,从部分目标信息开始分别向后顺序和向前逆序解析DOM树,同时定位并获取其他目标信息。利用该方法提取网页正文信息,一方面只需解析部分DOM树,从而减少了解析树结构花费的时间,另一方面不需要遍历整个DOM树查找目标信息,从而节省了查找时间,大大提高了信息提取速度。最后,通过实验证实了该方法的优越性。 展开更多
关键词 DOM树 网页正文提取 结构相似性 逆序解析
暂未订购 下载PDF
一种基于节点密度分割和标签传播的Web页面挖掘方法 认领 引用 被引量:13
7
作者 张乃洲 曹薇 李石君 《计算机学报》 EI CAS CSCD 北大核心 2015年第2期349-364,共16页
获取Web页面中的重要内容如文本和链接,在许多Web挖掘研究领域有着重要的应用价值.目前针对该问题主要采用Web页面分割和区块识别的方法.但现有的方法将Web页面中重要文本和链接的识别视为两个相互独立的问题,这种做法忽略了Web页面中... 获取Web页面中的重要内容如文本和链接,在许多Web挖掘研究领域有着重要的应用价值.目前针对该问题主要采用Web页面分割和区块识别的方法.但现有的方法将Web页面中重要文本和链接的识别视为两个相互独立的问题,这种做法忽略了Web页面中文本和链接的内在语义关系,同时降低了页面处理的效率.文中提出了一种Web页面重要内容挖掘的统一框架,该框架主要由3个部分组成:第一,先将Web页面转换为DOM树表示,然后采用节点密度熵为度量将DOM树分割为不同的页面块;第二,采用基于K最近邻标签传播的半监督方法自动扩展页面块训练集;第三,在扩展的页面块训练集上对SVM分类器进行训练,并用来对页面块进行分类.采用该框架可以将Web页面块区分为多种类型,并且该框架独立于Web页面的类型和布局.我们在真实的Web环境下进行了广泛的实验,实验结果表明了该方法的有效性. 展开更多
关键词 页面分割 节点密度 标签传播 DOM树 块分类 社会计算 社交网络
暂未订购 下载PDF
基于改进的隐马尔科夫模型的网页新闻关键信息抽取 认领 引用 被引量:9
8
作者 刘志强 都云程 施水才 《数据分析与知识发现》 EI CSSCI CSCD 北大核心 2019年第3期120-128,共9页
【目的】通过隐马尔科夫模型解决新闻网页中标题、日期、来源、正文等关键信息抽取问题,并根据应用场景对算法做出改进以提高抽取效果。【方法】将网页文档转为DOM树并进行预处理,映射待抽取信息项为状态,映射待抽取观测项为词汇,研究... 【目的】通过隐马尔科夫模型解决新闻网页中标题、日期、来源、正文等关键信息抽取问题,并根据应用场景对算法做出改进以提高抽取效果。【方法】将网页文档转为DOM树并进行预处理,映射待抽取信息项为状态,映射待抽取观测项为词汇,研究隐马尔科夫模型在网页新闻关键信息抽取中的应用并对算法提出改进。【结果】使用隐马尔科夫模型的改进算法,在已构建抽取模型的网站中,平均准确率可达97%。【局限】抽取模型在分类能力上稍有不足,无法对细微差别信息进行准确抽取。【结论】该方法具有识别准确率高、建模能力强、训练数据小、训练速度快的优点。 展开更多
关键词 信息抽取 隐马尔科夫模型 机器学习 DOM树
基于重复模式的自动Web信息抽取 认领 引用 被引量:8
9
作者 胡仁龙 袁春风 +1 位作者 武港山 濮小佳 《计算机工程》 CAS 北大核心 2008年第22期73-76,共4页
互联网上存在很多在线购物网站,抽取这类网站页面里的商品信息可以为电子商务、Web查询提供增值服务。该文针对这类网站提出一种自动的Web信息抽取方法,通过检测网页中的重复模式以及分析主题内容的特征获取网页的主题内容,该方法在抽... 互联网上存在很多在线购物网站,抽取这类网站页面里的商品信息可以为电子商务、Web查询提供增值服务。该文针对这类网站提出一种自动的Web信息抽取方法,通过检测网页中的重复模式以及分析主题内容的特征获取网页的主题内容,该方法在抽取过程中不需要人工干预。对10个在线购物网站进行了测试,实验结果表明提出的方法是有效的。 展开更多
关键词 Web信息抽取 DOM树 重复模式
暂未订购 下载PDF
基于DOM修剪的藏文Web信息提取 认领 引用 被引量:7
10
作者 珠杰 欧珠 格桑多吉 《计算机工程》 CAS 北大核心 2008年第24期58-60,共3页
随着互联网的普及和藏文信息技术的不断发展,出现了大量的藏文网站。该文根据藏文"音节点"的特征识别藏文网页并进行抓取。在建立DOM树的基础上,分析网页的链接、非链接文本与主题信息块之间的相关度。通过语义修剪算法提取... 随着互联网的普及和藏文信息技术的不断发展,出现了大量的藏文网站。该文根据藏文"音节点"的特征识别藏文网页并进行抓取。在建立DOM树的基础上,分析网页的链接、非链接文本与主题信息块之间的相关度。通过语义修剪算法提取藏文主题信息。经测试证实,该算法在藏文网页识别和藏文主题信息提取中具有较好的适应性。 展开更多
关键词 音节点 DOM树 藏文 Web信息提取
暂未订购 下载PDF
基于HTML树和模板的文献信息提取方法研究 认领 引用 被引量:7
11
作者 李文立 王乐超 宋春雷 《计算机应用研究》 北大核心 2010年第12期4615-4617,共3页
教师科研文献信息的自动搜集是科研成果有效管理的重要手段,将网页信息的提取方法用于网络数据库中文献信息的自动搜集有广大的应用前景。提出基于DOM树和模板的文献信息提取方法,利用HTML标记间的嵌套关系将Web网页表示成一棵DOM树,将... 教师科研文献信息的自动搜集是科研成果有效管理的重要手段,将网页信息的提取方法用于网络数据库中文献信息的自动搜集有广大的应用前景。提出基于DOM树和模板的文献信息提取方法,利用HTML标记间的嵌套关系将Web网页表示成一棵DOM树,将DOM树结构用于网页相似度的度量和自动分类,相似度高的网页应用同一模板进行信息提取。实验结果表明该方法在提取网络数据库中文献信息的准确率在94%以上。 展开更多
关键词 网页信息提取 文档对象模型树 模板 文献信息搜集
暂未订购 下载PDF
XML数据聚簇技术研究 认领 引用 被引量:3
12
作者 乔百友 王国仁 +1 位作者 韩东红 赵相国 《东北大学学报(自然科学版)》 EI CAS 北大核心 2005年第6期538-541,共4页
在分析DOM标准中数据访问的特点后,提出了两种XML数据聚簇存储方法:基于父子关系的XML数据聚簇存储方法和基于兄弟关系的XML数据聚簇存储方法·针对两种典型树遍历操作,分析了两种XML聚簇存储方法发生I/O的概率,给出了两种DOM树遍... 在分析DOM标准中数据访问的特点后,提出了两种XML数据聚簇存储方法:基于父子关系的XML数据聚簇存储方法和基于兄弟关系的XML数据聚簇存储方法·针对两种典型树遍历操作,分析了两种XML聚簇存储方法发生I/O的概率,给出了两种DOM树遍历路径表达式查询算法,即深度优先查询算法和宽度优先查询算法·基于XMark和XMach测试基准进行了性能评价· 展开更多
关键词 XML DOM树 聚簇存储 路径表达式 遍历查询 性能评价
暂未订购 下载PDF
一种基于DOM树的XML数据频繁模式挖掘算法 认领 引用 被引量:4
13
作者 吉根林 韦素云 鲍培明 《南京航空航天大学学报(自然科学版)》 EI CAS 北大核心 2006年第2期206-211,共6页
由于XM L数据具有半结构化特性,使得面向XM L数据的数据挖掘不同于面向关系数据库的数据挖掘,它具有更复杂的层次结构。研究基于DOM树的XM L数据频繁模式挖掘算法,提出面向XM L数据的频繁模式增量式挖掘算法F reqtT ree。该算法首先将X... 由于XM L数据具有半结构化特性,使得面向XM L数据的数据挖掘不同于面向关系数据库的数据挖掘,它具有更复杂的层次结构。研究基于DOM树的XM L数据频繁模式挖掘算法,提出面向XM L数据的频繁模式增量式挖掘算法F reqtT ree。该算法首先将XM L数据转化成DOM树,然后从DOM树挖掘所有频繁模式。F reqtT ree算法采用最右扩展技术,只在树的最右分支上增加新结点生成新树。同时充分利用已生成的频繁模式信息,使得产生的候选模式数量较少。F reqtT ree算法利用频繁k-1模式的支持数计算候选k模式的支持数,该算法只对DOM树遍历一次,具有较高的效率。采用多组数据对此算法的性能进行检验,并与其他算法作对比实验,实验结果表明该算法高效可行。 展开更多
关键词 XML DOM树 频繁模式 增量式挖掘 数据挖掘
暂未订购 下载PDF
一种Deep Web查询结果的实体抽取方法 认领 引用 被引量:4
14
作者 赵海霞 李道申 +1 位作者 刘勇 赵嘉诚 《计算机工程与应用》 CSCD 2012年第36期160-163,共4页
Deep Web中蕴含着丰富的高质量的信息,通过Deep Web集成查询接口可以获取到包含这些信息的结果页面,因此,Deep Web查询结果页面的数据抽取成为Deep Web数据集成的关键。提出了将索引方法和编辑相似度相结合的方法,来完成Deep Web查询结... Deep Web中蕴含着丰富的高质量的信息,通过Deep Web集成查询接口可以获取到包含这些信息的结果页面,因此,Deep Web查询结果页面的数据抽取成为Deep Web数据集成的关键。提出了将索引方法和编辑相似度相结合的方法,来完成Deep Web查询结果页面的数据抽取工作。大量实验结果表明:该方法是可行的,并且能够提高Deep Web数据实体抽取的准确性和召回率。 展开更多
关键词 深度网 数据抽取 文件对象模型(DOM)树 索引 相似度
暂未订购 下载PDF
一种基于网页DOM树的信息采集系统 认领 引用 被引量:3
15
作者 刘文杰 田伟 +1 位作者 马廷淮 崔萌萌 《武汉理工大学学报》 CAS 北大核心 2010年第16期119-122,共4页
在分析Web页面文档对象基础上,提出了一种通过网页DOM树路径进行采集区域定制的算法,进而实现网页信息的定时或实时自动抽取。基于该算法过程,以中国船舶市场研究中心需求为例,采用SSH(Spring、Struts和Hibernat)技术框架设计并实现了... 在分析Web页面文档对象基础上,提出了一种通过网页DOM树路径进行采集区域定制的算法,进而实现网页信息的定时或实时自动抽取。基于该算法过程,以中国船舶市场研究中心需求为例,采用SSH(Spring、Struts和Hibernat)技术框架设计并实现了一个信息采集系统,其执行过程分为网站信息源定制、网页信息抽取和信息管理3个过程;采集后的信息将存放在关系数据库和文件系统中,以便支持查询和其他扩展应用。系统经运行测试可对大多数船舶行业网站进行信息抽取,且抽取效果良好。 展开更多
关键词 信息抽取 DOM树 信息采集 信息管理
暂未订购 下载PDF
基于决策树和马尔可夫链的问答对自动提取 认领 引用 被引量:5
16
作者 刘佳宾 胡国平 +1 位作者 陈超 邵正荣 《中文信息学报》 北大核心 2007年第2期46-51,共6页
问答系统能用准确、简洁的答案回答用户用自然语言提出的问题,很明显系统中问答对的规模是影响问答系统最终性能的主要因素。为了提高问答对的规模、充分利用互联网资源,本文提出了一种基于决策树和马尔科夫链的在互联网上自动抽取问答... 问答系统能用准确、简洁的答案回答用户用自然语言提出的问题,很明显系统中问答对的规模是影响问答系统最终性能的主要因素。为了提高问答对的规模、充分利用互联网资源,本文提出了一种基于决策树和马尔科夫链的在互联网上自动抽取问答对的算法。先根据网页中的HTML标记把网页表示成一棵DOM树;然后利用树中每个节点的结构和文字信息,抽取相应的特征;最后将得到的节点特征通过由决策树和一阶马尔可夫链结合得出的分类模型进行分类。试验结果表明准确率达到了90.398%,召回率达到了86.032%。对大量网页抽取的结果表明该分类模型能够适应对各种各样的网页的抽取。 展开更多
关键词 人工智能 模式识别 信息抽取 DOM树 决策树 马尔可夫链
暂未订购 下载PDF
一种基于SVM及文本密度特征的网页信息提取方法 认领 引用 被引量:14
17
作者 周艳平 李金鹏 宋群豹 《计算机应用与软件》 北大核心 2019年第10期251-255,261,共5页
针对网页的多样性、复杂性和非标准化程度的提高,提出一种基于SVM及文本密度特征的网页信息提取方法。该方法先将网页整体解析成DOM树,然后根据网页结构提出五种网页密度特征,用数学模型进行密度比例分析,并采用高斯核函数(RBF)训练样... 针对网页的多样性、复杂性和非标准化程度的提高,提出一种基于SVM及文本密度特征的网页信息提取方法。该方法先将网页整体解析成DOM树,然后根据网页结构提出五种网页密度特征,用数学模型进行密度比例分析,并采用高斯核函数(RBF)训练样本数据。该方法训练出的数据模型能够准确地去除网页广告、导航、版权信息等噪音信息,保留正文信息块,最后进行正文信息块内除噪。实验表明,该方法不仅有较高的精度,而且通用性好。 展开更多
关键词 SVM 正文抽取 DOM树 文本密度特征
暂未订购 下载PDF
XML文档对象模型研究与应用 认领 引用 被引量:8
18
作者 熊光彩 莫 蓉 +1 位作者 赵歆波 张定华 《计算机工程与设计》 2002年第5期1-4,共4页
摘 要:从XML文档的基本结构出发,详细论述了DOM树、节点树结构特征及DOM的基本接口。结合产品定单实例实现 XML文档结构树的动态创建、遍历,并通过XML DOM接口实现对文档结构树的操作等核心应用。
关键词 电子数据交换 可扩展标记语言 XML文档 对象模型
暂未订购 下载PDF
基于DOM树与领域本体的Web抽取方法 认领 引用 被引量:6
19
作者 郭建兵 崔志明 +1 位作者 陈明 赵朋朋 《计算机工程》 CAS CSCD 2012年第5期56-58,共3页
为解决异构DeepWeb结果页面中数据区域及数据记录的自动抽取问题,提出一种基于DOM树与领域本体的Web抽取方法。利用数据内容特征以及领域本体库标记DOM树的节点,按照结果页面展示规律定位数据区域,根据改进的简单树匹配算法,定位数据区... 为解决异构DeepWeb结果页面中数据区域及数据记录的自动抽取问题,提出一种基于DOM树与领域本体的Web抽取方法。利用数据内容特征以及领域本体库标记DOM树的节点,按照结果页面展示规律定位数据区域,根据改进的简单树匹配算法,定位数据区域及数据记录。实验结果表明,该方法定位数据区域及数据记录的F-measure值比传统的抽取方法高2.93%~6.67%。 展开更多
关键词 自动抽取 DOM树 领域本体 数据区域定位 简单树匹配
暂未订购 下载PDF
基于DOM树与模板的自适应网络信息抽取方法 认领 引用 被引量:4
20
作者 柏志安 廖健 曾剑平 《计算机应用与软件》 北大核心 2022年第8期15-20,81,共6页
针对论坛型网站的特性,包括标签的重复出现和文本内容的特定模式等,提出一种基于DOM树与模板的自适应信息抽取算法。以拥有共同父节点的邻近结构的相似子树为基础,提出生成候选集以及候选集过滤细分的抽取规则生成方法。该算法能很好地... 针对论坛型网站的特性,包括标签的重复出现和文本内容的特定模式等,提出一种基于DOM树与模板的自适应信息抽取算法。以拥有共同父节点的邻近结构的相似子树为基础,提出生成候选集以及候选集过滤细分的抽取规则生成方法。该算法能很好地适应论坛网页结构的变化,当网页结构改变后自动生成新的抽取规则。实验结果表明,在多个不同论坛型网站页面及相应改版页面上,该方法能够有效生成抽取规则以实现Web论坛信息抽取,并获得比现有信息抽取方法更好的性能。 展开更多
关键词 信息抽取 自适应 DOM树 模板
暂未订购 下载PDF
上一页 1 2 5 下一页 到第
在线咨询 使用帮助 返回顶部 意见反馈