软件开发培训班 >> 编程开发 >> PHP

基于curl数据采集之单页面并行采集函数get_htmls的使用

用第一篇的get_html()实现简单的数据采集，由于是一个一个执行才采集数据的传输时间就会是所有页面下载的总时长，一个页面假设1秒，那么10个页面就是10秒了。所幸curl还提供了并行处理的功能。

要写一个并行采集的函数，先要了解要采集什么样的页面，对采集的页面用什么请求，才能写出一个相对常用的函数。

功能需求分析：

Win7怎么设置待机不断网？win7待机不断网设置方法介绍	三星博客暗示未来折叠屏手机形态，三折屏和卷轴屏
iPhone12mini和华为P40 Pro你觉得谁更香？	笔记本上的 GTX 1650 与台式机的有什么区别？

返回什么？

当然每一个页面的html集合成的数组

传递什么参数？

编写get_html()时，我们知道了可以用options数组来传递更多的curl参数，那么多页面同时采集函数的编写这种特性也得保留下来。

什么类型的参数？

大型垂直网站的SEO的分析	不用重装系统大神帮你在线体验Win11
一招教你识别买的新电脑是不是库存二手	半价矿卡到底香不香？为了给大家排雷我买了

无论是请求网页HTML，还是调用互联网api接口，get和post传递参数总是请求同一个页面或者接口，只是参数不同罢了。那么参数的类型是：

get_htmls($url,$options);

$url 是string

$options，是一个二维数组，每一个页面的参数为一个数组。

这样的话，貌似解决了问题。但是我找遍了curl的手册都没有看到get的参数传递在什么地方，所以只能$url 是数组的形式传递并且增加一个method参数

Win7能上QQ但是无法上网无法访问网页的解决方法	北大博士后送外卖半年发论文，涉及一个核心问题
精锐教育垮台？7万家长退款无门其实败局早已注定	瑞星：中国曾最牛逼的互联网公司，10年后却为上新三板苦苦挣扎

函数的原型就定下来了get_htmls($urls,$options = array, $method = ‘get);代码如下：

复制代码代码如下:

function get_htmls($urls, $options = array(), $method = get){
     $mh = curl_multi_init();
     if($method == get){//get方式传值 最常用
         foreach($urls as $key=>$url){
             $ch = curl_init($url);
             $options[CURLOPT_RETURNTRANSFER] = true;
             $options[CURLOPT_TIMEOUT] = 5;
             curl_setopt_array($ch,$options);
             $curls[$key] = $ch;
             curl_multi_add_handle($mh,$curls[$key]);
         }
     }elseif($method == post){//post方式传值 
         foreach($options as $key=>$option){
             $ch = curl_init($urls);
             $option[CURLOPT_RETURNTRANSFER] = true;
             $option[CURLOPT_TIMEOUT] = 5;
             $option[CURLOPT_POST] = true;
             curl_setopt_array($ch,$option);
             $curls[$key] = $ch;
             curl_multi_add_handle($mh,$curls[$key]);
         }
     }else{
         exit("参数出错!\n");
     }
     do{
         $mrc = curl_multi_exec($mh,$active);
         curl_multi_select($mh);//减少CPU压力 注释掉CPU压力变大
     }while($active);
     foreach($curls as $key=>$ch){
         $html = curl_multi_getcontent($ch);
         curl_multi_remove_handle($mh,$ch);
         curl_close($ch);
         $htmls[$key] = $html;
     }
     curl_multi_close($mh);
     return $htmls;
 }

常用的get请求是通过改变url参数来实现的，又因为我们的函数是针对数据采集的。必然是分类采集，所以网址类似于这种：

http://www.baidu.com/s?wd=shili&pn=0&ie=utf-8

http://www.baidu.com/s?wd=shili&pn=10&ie=utf-8

http://www.baidu.com/s?wd=shili&pn=20&ie=utf-8

http://www.baidu.com/s?wd=shili&pn=30&ie=utf-8

http://www.baidu.com/s?wd=shili&pn=50&ie=utf-8

新电脑到手后要做的几个优化配置 90%以上的人都不知道	英伟达显卡中的“Ti”怎么发音？官方：随便念，只要写对就行
花呗“提前还”和“按时还”，到底有啥区别？支付宝员工给出答案	女子地铁照被AI一键脱衣传播网友：无下限的开发

上面五个页面是很有规律的，改变的仅仅是pn的值。

复制代码代码如下:

$urls = array();
 for($i=1; $i<=5; $i++){
     $urls[] = http://www.baidu.com/s?wd=shili&pn=.(($i-1)*10).&ie=utf-8;
 }
 $option[CURLOPT_USERAGENT] = Mozilla/5.0 (Windows NT 6.1; rv:19.0) Gecko/20100101 Firefox/19.0;
 $htmls = get_htmls($urls,$option);
 foreach($htmls as $html){
     echo $html;//这里得到html 就可以进行数据处理了
 }

模拟常用的post请求：

写一个post.php文件如下：

复制代码代码如下:

 if(isset($_POST[username]) && isset($_POST[password])){
     echo 用户名是: .$_POST[username]. 密码是: .$_POST[password];
 }else{
     echo 请求错误!;
 }

然后调用如下:

复制代码代码如下:

$url = http://localhost/yourpath/post.php;//这里是你的路径
 $options = array();
 for($i=1; $i<=5; $i++){
     $option[CURLOPT_POSTFIELDS] = username=user.$i.&password=pass.$i;
     $options[] = $option;
 }
 $htmls = get_htmls($url,$options,post);
 foreach($htmls as $html){
     echo $html;//这里得到html 就可以进行数据处理了
 }

这样这个get_htmls函数也基本能实现一些数据采集的功能了

今天分享就到这里写的不好的讲得不清楚的请多多指教

技术文章快速查找

PHP不用第三变量交换2个变量的值的解决方法

php调用方法mssql_fetch_row、mssql_fetch_array、mssql_fetch_assoc和mssql_fetch_objcect读取数据的区别

PHP 函数学习简单小结

php实现的美国50个州选择列表实例

php下通过IP获取地理位置的代码(小偷程序)

新手必看PHP上传文件进度全面揭秘

正确理解PHP程序编译时的错误信息

php出租房数据管理及搜索页面

相关下载

在线教程导航

软件应用
·Windows8	·Windows7	·Word
·Excel	·PPT	·WPS
Web开发
·ASP	·JavaScript	·DIV+CSS
·JSP	·VbScript	·XML
·PHP
开发语言
·VB	·VC	·ASP.NET
·Java	·C++	·Delphi
数据库开发
·MySQL	·MsSQL	·Access
·Oracle	·DB2
手机系统
·Android	·iOS	·WindowsPhone
网站设计
·Flash	·Dreamweaver	·Fireworks
平面设计
·Photoshop	·CorelDraw	·AutoCAD
·3DsMAX	·Illustrator
网络技术
·网站运营	·网络安全	·网络搭建