专利内容由知识产权出版社提供
专利名称:一种网页内容抽取装置和方法专利类型:发明专利发明人:王志刚
申请号:CN2013104472.8申请日:20131008公开号:CN103559202A公开日:20140205
摘要:本发明公开了一种网页内容抽取装置和方法。所述方法包括:根据训练数据定义不同类型的块,以及不同的分类特征;将网页解析成文档对象模型DOM树,获取DOM树的每个结点的分类特征值集合,根据所定义的所有分类特征以及每种类型的块对应的分类特征值集合,确定DOM树的每个结点是否为块,以及块的类型,最后对于DOM树的被确定为块的结点,如果对应的块类型为需要抽取的类型,则取出该结点的内容。本发明的技术方案中,分类特征和块的类型根据训练数据自动生成,无须维护规则,当解决新问题时,只需标注新的训练数,然后根据新的训练数据生成新的块类型和分类特征即可,操作简单,复杂度低,易于维护。
申请人:北京奇虎科技有限公司,奇智软件(北京)有限公司
地址:100088 北京市西城区新街口外大街28号D座112室(德胜园区)
国籍:CN
代理机构:北京市隆安律师事务所
更多信息请下载全文后查看