发明

基于强化学习的自适应网页结构变化的数据采集方法及系统2026

2024-04-16 07:24:49 发布于四川 58
  • 申请专利号:CN202410057127.0
  • 公开(公告)日:2026-04-17
  • 公开(公告)号:CN117874318A
  • 申请人:安徽大学
摘要:本发明涉及数据爬取技术领域,更具体的,涉及基于强化学习的自适应网页结构变化的数据采集方法及系统。本发明预先构建了两个Docker容器,其中一个安装了浏览器程序、爬虫程序、守护进程,另一个用于存放及更新Actor‑Critic模型;本发明基于强化学习的方式对Actor‑Critic模型进行训练,使Actor‑Critic模型可以适应于目标网页的结构变化,自动学习到新的爬取流程,减少去修改爬虫程序代码的人力成本。本发明解决了现有的数据采集不能够自适应网页结构变化的问题。

专利内容

(19)国家知识产权局 (12)发明专利申请 (10)申请公布号 CN 117874319 A (43)申请公布日 2024.04.12 (21)申请号 202410268836.3 (22)申请日 2024.03.11 (71)申请人 江西顶易科技发展有限公司 地址 330000 江西省南昌市红谷滩区学府 大道899号慧谷创意产业园味粽空间B 座2层B5室 (72)发明人 陈景宏 孙斌  (74)专利代理机构 南昌明佳知识产权代理事务 所(普通合伙) 36132 专利代理师 杨晨辉 (51)Int.Cl. G06F 16/951 (2019.01) G06F 16/955 (2019.01) G06F 16/33 (2019.01) G06F 40/30 (2020.01) 权利要求书2页 说明书6页 附图4页 (54)发明名称 基于搜索引擎的信息挖掘方法、装置及计算 机设备 (57)摘要 本发明公开了一种基于搜索引擎的信息挖 掘方法、装置及计算机设备,属于计算机技术领 域。本发明根据主题词利用引擎搜索确定种子链 接,根据种子链接进行用户信息挖掘。通过第一 拓展词调整子链接的继承权重,进而调整第二队 列的顺序,通过第二拓展词调整目标URL的引用 权重,进而调整第一队列的顺序,增加关联页面 的聚集程度,提高爬虫效率。通过链接索引表避 免子链接被重复解析。通过计算网页下载数,能 够清楚地了解信息挖掘的进度。通过设置最大下

最新专利