您好,欢迎来到华佗小知识。
搜索
您的当前位置:首页一种网页内容抽取装置和方法[发明专利]

一种网页内容抽取装置和方法[发明专利]

来源:华佗小知识
专利内容由知识产权出版社提供

专利名称:一种网页内容抽取装置和方法专利类型:发明专利发明人:王志刚

申请号:CN2013104472.8申请日:20131008公开号:CN103559202A公开日:20140205

摘要:本发明公开了一种网页内容抽取装置和方法。所述方法包括:根据训练数据定义不同类型的块,以及不同的分类特征;将网页解析成文档对象模型DOM树,获取DOM树的每个结点的分类特征值集合,根据所定义的所有分类特征以及每种类型的块对应的分类特征值集合,确定DOM树的每个结点是否为块,以及块的类型,最后对于DOM树的被确定为块的结点,如果对应的块类型为需要抽取的类型,则取出该结点的内容。本发明的技术方案中,分类特征和块的类型根据训练数据自动生成,无须维护规则,当解决新问题时,只需标注新的训练数,然后根据新的训练数据生成新的块类型和分类特征即可,操作简单,复杂度低,易于维护。

申请人:北京奇虎科技有限公司,奇智软件(北京)有限公司

地址:100088 北京市西城区新街口外大街28号D座112室(德胜园区)

国籍:CN

代理机构:北京市隆安律师事务所

更多信息请下载全文后查看

因篇幅问题不能全部显示,请点此查看更多更全内容

Copyright © 2019- huatuo0.cn 版权所有 湘ICP备2023017654号-2

违法及侵权请联系:TEL:199 18 7713 E-MAIL:2724546146@qq.com

本站由北京市万商天勤律师事务所王兴未律师提供法律服务