专利内容由知识产权出版社提供
专利名称:网页信息抽取方法和装置专利类型:发明专利
发明人:刘旭东,孙海龙,周子龙,张日崇申请号:CN201310455343.2申请日:20130929公开号:CN103559199A公开日:20140205
摘要:本发明提供一种网页信息抽取方法和装置。该方法包括:根据多个已标注属性的样本网页构建对应的多个第一DOM树,并根据多个第一DOM树构建决策树;根据多个未标注属性的样本网页构建对应的多个第二DOM树,并根据多个第二DOM树优化决策树;根据优化后的决策树抽取待抽取网页的结构化信息;其中,已标注属性的样本网页、未标注属性的样本网页和待抽取网页属于同一领域。本发明提供的网页信息抽取方法和装置,根据多个已标注属性的样本网页构建决策树,根据多个未标注属性的样本网页优化该决策树,由于决策树的构建和优化不单单依赖于网页的布局风格,因此优化后的决策树可以适用于同一领域各种布局风格的网页的信息抽取,省时省力。
申请人:北京航空航天大学
地址:100191 北京市海淀区学院路37号
国籍:CN
代理机构:北京同立钧成知识产权代理有限公司
代理人:刘芳
更多信息请下载全文后查看