您好,欢迎来到华佗小知识。
搜索
您的当前位置:首页网页信息抽取方法和装置[发明专利]

网页信息抽取方法和装置[发明专利]

来源:华佗小知识
专利内容由知识产权出版社提供

专利名称:网页信息抽取方法和装置专利类型:发明专利

发明人:刘旭东,孙海龙,周子龙,张日崇申请号:CN201310455343.2申请日:20130929公开号:CN103559199A公开日:20140205

摘要:本发明提供一种网页信息抽取方法和装置。该方法包括:根据多个已标注属性的样本网页构建对应的多个第一DOM树,并根据多个第一DOM树构建决策树;根据多个未标注属性的样本网页构建对应的多个第二DOM树,并根据多个第二DOM树优化决策树;根据优化后的决策树抽取待抽取网页的结构化信息;其中,已标注属性的样本网页、未标注属性的样本网页和待抽取网页属于同一领域。本发明提供的网页信息抽取方法和装置,根据多个已标注属性的样本网页构建决策树,根据多个未标注属性的样本网页优化该决策树,由于决策树的构建和优化不单单依赖于网页的布局风格,因此优化后的决策树可以适用于同一领域各种布局风格的网页的信息抽取,省时省力。

申请人:北京航空航天大学

地址:100191 北京市海淀区学院路37号

国籍:CN

代理机构:北京同立钧成知识产权代理有限公司

代理人:刘芳

更多信息请下载全文后查看

因篇幅问题不能全部显示,请点此查看更多更全内容

Copyright © 2019- huatuo0.cn 版权所有 湘ICP备2023017654号-2

违法及侵权请联系:TEL:199 18 7713 E-MAIL:2724546146@qq.com

本站由北京市万商天勤律师事务所王兴未律师提供法律服务