`

PHP多线程批量采集下载图片

    博客分类:
  • PHP
阅读更多

 

使用curl的多线程,另外curl可以设置请求时间,遇到很慢的url资源,可以果断的放弃,这样没有阻塞,另外有多线程请求,效率应该比较高,参考:《CURL的学习和应用[附多线程]》,我们再来测试一下;

核心代码:

 

/**
     * curl 多线程
     *
     * @param array $array 并行网址
     * @param int $timeout 超时时间
     * @return mix
     */
	public function Curl_http($array,$timeout='15'){
		    $res = array();

		    $mh = curl_multi_init();//创建多个curl语柄

		    foreach($array as $k=>$url){
		        $conn[$k]=curl_init($url);//初始化

		        curl_setopt($conn[$k], CURLOPT_TIMEOUT, $timeout);//设置超时时间
		        curl_setopt($conn[$k], CURLOPT_USERAGENT, 'Mozilla/5.0 (compatible; MSIE 5.01; Windows NT 5.0)');
		        curl_setopt($conn[$k], CURLOPT_MAXREDIRS, 7);//HTTp定向级别 ,7最高
		        curl_setopt($conn[$k], CURLOPT_HEADER, false);//这里不要header,加块效率
		        curl_setopt($conn[$k], CURLOPT_FOLLOWLOCATION, 1); // 302 redirect
		        curl_setopt($conn[$k], CURLOPT_RETURNTRANSFER,1);//要求结果为字符串且输出到屏幕上
				curl_setopt($conn[$k], CURLOPT_HTTPGET, true);

		        curl_multi_add_handle ($mh,$conn[$k]);
		    }
		     //防止死循环耗死cpu 这段是根据网上的写法
		        do {
		            $mrc = curl_multi_exec($mh,$active);//当无数据,active=true
		        } while ($mrc == CURLM_CALL_MULTI_PERFORM);//当正在接受数据时
		        while ($active and $mrc == CURLM_OK) {//当无数据时或请求暂停时,active=true
		            if (curl_multi_select($mh) != -1) {
		                do {
		                    $mrc = curl_multi_exec($mh, $active);
		                } while ($mrc == CURLM_CALL_MULTI_PERFORM);
		            }
		        }

		    foreach ($array as $k => $url) {
		          if(!curl_errno($conn[$k])){
		          	$data[$k]=curl_multi_getcontent($conn[$k]);//数据转换为array
		          	$header[$k]=curl_getinfo($conn[$k]);//返回http头信息
		          	curl_close($conn[$k]);//关闭语柄
		          	curl_multi_remove_handle($mh  , $conn[$k]);   //释放资源
		          }else{
		          	unset($k,$url);
		          }
		        }

		        curl_multi_close($mh);

		        return $data;

		 }

//参数接收
$callback = $_GET['callback'];
$hrefs = $_GET['hrefs'];
$urlarray = explode(',',trim($hrefs,','));
$date = date('Ymd',time());
//实例化
$img = new HttpImg();
$stime = $img->getMicrotime();//开始时间

$data = $img->Curl_http($urlarray,'20');//列表数据
mkdir('./img/'.$date,0777);
foreach ((array)$data as $k=>$v){
	preg_match_all("/(href|src)=([\"|']?)([^ \"'>]+\.(jpg|png|PNG|JPG|gif))\\2/i", $v, $matches[$k]);

	if(count($matches[$k][3])>0){
		$dataimg = $img->Curl_http($matches[$k][3],'20');//全部图片数据二进制
		$j = 0;
		foreach ((array)$dataimg as $kk=>$vv){
			if($vv !=''){
				$rand = rand(1000,9999);
				$basename = time()."_".$rand.".".jpg;//保存为jpg格式的文件
				$fname = './img/'.$date."/"."$basename";
				file_put_contents($fname, $vv);
				$j++;
				echo "创建第".$j."张图片"."$fname"."<br/>";
			}else{
				unset($kk,$vv);
			}
		}
	}else{
		unset($matches);
	}
}
$etime = $img->getMicrotime();//结束时间
echo "用时".($etime-$stime)."秒";
exit;

 

 

测试一下效果

337张图片用时260秒左右,基本上可以做到一秒内就可以采集一张的效果,而且发现图片越到优势采集速度越明显。

image我们可以看一下文件命名:也就可以做到同一时刻可以生成10张图片,

由于采用了20秒请求的时间限制,有些图片生成后有明显不全,也就是图片资源在20秒内未能完全采集,这个时间大家可以自行设置。

 

分享到:
评论
1 楼 love1989 2012-08-08  
好东东 收藏

相关推荐

    php多线程批量采集下载图片的实现代码函数类.zip

    分享一个使用php多线程批量采集下载图片的实现代码函数类,curl的多线程,另外curl可以设置请求时间,遇到很慢的url资源,可以果断的放弃,这样没有阻塞,另外有多线程请求,效率应该比较高

    php多线程批量采集下载图片的实现代码函数类

    一个使用php多线程批量采集下载图片的实现代码函数类,curl的多线程,另外curl可以设置请求时间,遇到很慢的url资源,可以果断的放弃,这样没有阻塞,另外有多线程请求,效率应该比较高

    PHP多线程批量采集下载美女图片的实现代码(续)

    之前写过一篇《PHP批量采集下载美女图片》文中主要采用file_get_content做采集图片,今天发现采集了400张图片 居然需要70分钟以上,真是难以忍受

    php的curl模块采集任意网页.zip

    批量采集用于处理程序内部接口的并发使用,偶尔代替一下多线程并发处理操作 如果使用请自行测试! 就目前来说,使用该类足以应付大部分的采集工作需求!无需其他工具 采集回来的网页使用正则处理...

    云采集.zip

    优点:功能强大,不需要写任何规则,软件使用简单,多线程,速度快,可以多个关键词采集,可以批量采集批量入库,傻瓜式采集,可以定时采集和发布,无人值守,适合做网站专题。能够和任意CMS,如PHP、ASP.NET(C#)、...

    php的curl模块采集任意网页

    批量采集用于处理程序内部接口的并发使用,偶尔代替一下多线程并发处理操作 如果使用请自行测试! 就目前来说,使用该类足以应付大部分的采集工作需求!无需其他工具 采集回来的网页使用正则处理即可

    xise寄生虫破解版

    支持SHELL收录量、BR、PR、快照时间多线程批量查询并保存 真正及时同步百度算法优化,只要百度算法更新,第二天软件就更新 支持多线程状态查询,查询正确率高达99% 支持批量多线程删除上传下载,弥补旧菜刀无法...

    XISE WBMS管理 V8.86 破解版

    支持SHELL收录量、BR、PR、快照时间多线程批量查询并保存 真正及时同步百度算法优化,只要百度算法更新,第二天软件就更新 支持多线程状态查询,查询正确率高达99% 支持批量多线程删除上传下载,弥补旧菜刀无法批量...

    低调点扫描器v1.3 网站安全扫描器

    一、软件功能  1.查询旁站域名,快速查询网站信息  2.目录扫描,支持ASP,PHP,ASPX,JSP,网站目录,等扫描方式,配置... 11.iP/域名多线程快速扫描 12.增加EXP批量扫描功能 13.增加SQL注入功能 14.增加MD5加密解密功能

    低调点扫描器v1.1 网站安全扫描器 功能强大的网站扫描器

    1.查询旁站域名,快速查询网站信息  2.目录扫描,支持ASP,PHP,ASPX,JSP,网站目录,网站识别等扫描方式,配置可自定义更改  3.EXP漏洞扫描,可扫描一个脚本,也可全部脚本进行扫描,支持...增加iP/域名多线程快速扫描

    正式版帝国网站管理系统源码 4.0

    支持多线程(节点)采集 ·方便性:采集可选是否马上入库(特别对于挂机采,非常方便);填写采集正则后可预览采集结果;复制、清空节点;入库可选择“选择式入库”与“全部入库式”;对采集的临时数据进行管理; ·其他...

Global site tag (gtag.js) - Google Analytics