网络爬虫的设计与实现(完整版)VIP免费

下载本文档

阅读 73
下载 21
格式 doc
大小 1.85 MB
约27页
2024-11-16 发布于河南
收藏
评论
点赞(0)
海报
举报

1/27页

2/27页

3/27页

在线预览已结束，请下载后查看完整版，加入VIP享文档下载特权

/27

文本预览下载提示常见问题

网络爬虫的设计与实现I摘要网络爬虫将下载的网页和收集到的网页信息存储在本地数据库中以供搜索引擎使用，它是一个专门从万维网上下载网页并分析网页的程序。随着网络的快速发展，人们对搜索引擎的要求也越来越高，而网络爬虫的效率直接影响着搜索引擎的质量。本课题研究的是通用网络爬虫，它是从一个或若干个初始网页的链接开始进而得到一个链接队列。伴随着网页的抓取又不断从抓取到的网页中抽取新链接放入到链接队列中，直到爬虫系统满足了停止条件。该课题主要涉及到了缓冲池技术，多线程技术，套接字技术，HTTP和SSL协议，正则表达式，Linux网络编程技术，PHP+Apache的使用等相关技术。本说明书叙述的网络爬虫是以LinuxC实现的，加以PHP语言编写的界面使用户更加方面的操作，利用Shell脚本和Apache服务器使得爬虫系统和界面很好的结合在一起。关键词：网络爬虫缓冲池正则表达式SSL协议多线程II目次1引言..........................................................................................................................11.1课题选题背景..................................................................................................11.2课题研究的意义..............................................................................................22需求分析..................................................................................................................32.1功能需求分析..................................................................................................32.2系统性能分析..................................................................................................43系统设计..................................................................................................................53.1系统工作流程图..............................................................................................53.2数据结构设计..................................................................................................63.3系统各功能流程图..........................................................................................74系统实现................................................................................................................104.1相关技术分析................................................................................................104.2系统功能模块的实现....................................................................................115测试与结果............................................................................................................17结论..............................................................................................................................23致谢..........................................................................................................................24参考文献................................................................................................................25III1引言随着网络技术日新月异的发展，互联网俨然已成为信息的最大载体。为了能够在浩瀚的信息海洋中精确地查询用户所需要的信息，搜索引擎技术应运而生。目前比较流行的搜索引擎是Google和百度，他们拥有着庞大的用户数量。作为搜索引擎的重要组成部分，网络爬虫的设计直接影响着搜索引擎的质量。网络爬虫是一个专门从万维网上下载网页并分析网页的程序。它将下载的网页和采集到的网页信息存储在本地数据库中以供搜索引擎使用。网络爬虫的工作原理是从一个或若干初始网页的链接开始进而得到一个链接队列。伴随着网页的抓取又不断从抓取到的网页里抽取新的链接放入到链接队列中，直到爬虫程序满足系统的某一条件时停...

1、当您付费下载文档后，您只拥有了使用权限，并不意味着购买了版权，文档只能用于自身使用，不得用于其他商业用途（如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利）。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。
3、如文档内容存在违规，或者侵犯商业秘密、侵犯著作权等，请点击“违规举报”。

碎片内容

网络爬虫的设计与实现(完整版)

网络爬虫的设计与实现I摘要网络爬虫将下载的网页和收集到的网页信息存储在本地数据库中以供搜索引擎使用，它是一个专门从万维网上下载网页并分析网页的程序

随着网络的快速发展，人们对搜索引擎的要求也越来越高，而网络爬虫的效率直接影响着搜索引擎的质量

本课题研究的是通用网络爬虫，它是从一个或若干个初始网页的链接开始进而得到一个链接队列

伴随着网页的抓取又不断从抓取到的网页中抽取新链接放入到链接队列中，直到爬虫系统满足了停止条件

该课题主要涉及到了缓冲池技术，多线程技术，套接字技术，HTTP和SSL协议，正则表达式，Linux网络编程技术，PHP+Apache的使用等相关技术

本说明书叙述的网络爬虫是以LinuxC实现的，加以PHP语言编写的界面使用户更加方面的操作，利用Shell脚本和Apache服务器使得爬虫系统和界面很好的结合在一起

关键词：网络爬虫缓冲池正则表达式SSL协议多线程II目次1引言

1课题选题背景

2课题研究的意义

22需求分析

您可能关注的文档

学海无涯书城 + 关注: 实名认证
内容提供者

热爱教育事业，爱好互联网行业

收藏店铺进入空间

网络爬虫的设计与实现(完整版)VIP免费

网络爬虫的设计与实现(完整版)

您可能关注的文档

相关文档

热门下载

相关标签