PHP 采集程序原理分析篇

网络编程 2025/1/9 佚名

3 1 2

苦想了几天，终于弄明白了里面的道理。在这里写出来，请高手指正。
采集程序的思路很简单，无非就是先打一个页面，一般都是列表页，取得里面全部链接的地址，然后打开逐条链接，寻找我们感兴趣的东西，如果找到，就把它入库或别的处理。下面以一个很简单的例子来说说。

首先确定一个采集页，一般就是列表面了。这里目标是:https://www.jb51.net/article/11/index.htm。这是一个列表页，我们的目的就是采集这个列表页上全部的文章。

有列表页了，第一步先打开它，把它的内容纳入到我们的程序中来。一般用fopen或是file_get_contents这两个函数，我们这里用fopen作例子。怎么打开它呢？很简单：$source=fopen("https://www.jb51.net/article/11/index.htm",'r')；实际上已经把内容纳入到我们的程序中来了。注意得到的$source是一个资源，不是可处理的文本，所以再用函数fread将内容读到一个变量中，这次就是真正的可编辑的文本了。例子：
$content=fread($source,99999);后面的数字表示字节数，填个大的就行。你用file_put_contents将$content写入到一个文本文件，可以看出里面的内容其实就是网页的源码。得到了网页的源码，我们就要分析里面的文章链接地址，这里要用到正则表达式了，[推荐正则表达式教程（https://www.jb51.net/article/7/all/545.1.htm）]。通过查看源代码，我们可以看到里面文章的链接地址全是这个样子<div class="in_arttitle"><a href="https://www.jb51.net/article/10/all/273.1.htm">　　将数据库连接代码封装在函数里，在需要读取时调用..</a>
我们就可以写正则表达式了。$count=preg_match_all("/<div class=\"in_arttitle\"><a\shref=\"(.+?)\">(.+?)<\/a>/",$content,$art_list);
其中数组$art_list[1][$s]里面包含的就是某个文章的链接地址。而$art_list[2][$s]包含的就是某一文章的标题。到了这一步就可以算成功了一半了。
接着用for循环依次打每个链接，然后像取得标题一样的方法取得内容即可。以上这些和我在网上找的教程都差不多，但是到了这个for循环网上的教程可就差劲，还没找到一篇可以说清这个事的文章，刚开始我是用js来帮助循环的，还是用实例说吧，刚开始我是这样做的：
for($i=0;$i<20;4i++ {
中间就是采集内容的部分了，省略了
采集了一页，肯定要采集再一页啊
可是再用fopen打开链接时就不行了。请求失败什么的，用js也不行，最后才知道要用这句echo "<META HTTP-EQUIV=REFRESH CONTENT='0;URL=aa.php?id=1'>";其中aa.php就是我们的程序的文件名， id后面的数字就可以帮助我们实现循环，采集多个页面。这就是能真正循环起来的关键
}
脑子有点难受，写得有点乱，将就着看吧，在高手看来这可能没什么大不了的，可是对于我等菜鸟来说，实在是很有帮助。

PHP,采集程序

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“PHP 采集程序原理分析篇”

暂无评论...

P70系列延期，华为新旗舰将在下月发布

3月20日消息，近期博主@数码闲聊站透露，原定三月份发布的华为新旗舰P70系列延期发布，预计4月份上市。

而博主@定焦数码爆料，华为的P70系列在定位上已经超过了Mate60，成为了重要的旗舰系列之一。它肩负着重返影像领域顶尖的使命。那么这次P70会带来哪些令人惊艳的创新呢？
根据目前爆料的消息来看，华为P70系列将推出三个版本，其中P70和P70 Pro采用了三角形的摄像头模组设计，而P70 Art则采用了与上一代P60 Art相似的不规则形状设计。这样的外观是否好看见仁见智，但辨识度绝对拉满。

更新日志

2025年01月09日

PHP 采集程序原理分析篇

PHP用mysql数据库存储session的代码

2010年最新PHP类的精髓归纳第1/2页

评论“PHP 采集程序原理分析篇”

P70系列延期，华为新旗舰将在下月发布

更新日志

友情链接