首页 > php教程 > php手册 > 正文

献给所有想学习正则和采集的朋友

php中文网
发布: 2016-06-13 10:35:37
原创
1440人浏览过

php
function get_url_content($Url,$Method = c) {
    //引入需要的语言编码.如果没有, 就会默认为utf-8,不必担心.
    global $Charset;
    $Urlarr = parse_url($Url);
    //如果检测不出域名,就返回.
    if (!isset($Urlarr[host])) {
        return false;
    }
    //我们用智能方式定义header头倍信息.
    foreach (@getallheaders() as $key => $val){
        $key===Host && $val = $Urlarr[host];
        $key===Referer && $val =http://.$Urlarr[host];
        $str .= "$key:$val, ";
    }
    //虚拟来路.
    !eregi(Referer,$str) && $str .="Referer:http://{$Urlarr[host]}, ";
    //经过修正, 基本上, 来路也是那个站, 主机也是Url站点.
    $Header = array(trim($str));
    //下面仅仅是选择用哪个程序来采集.
    if($Method === f&&function_exists(file_get_contents)) {
    $opts = array(
          http=>array(
        method=>"GET",
        header=>$Header,
          )
    );
        $cxContext = stream_context_create($opts);
        $file_contents = @file_get_contents($Url, false, $cxContext);
    } elseif ($Method === c&&function_exists(curl_init)) {
    $Ch = curl_init();
    $Timeout = 5;
        curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
        curl_setopt ($Ch, CURLOPT_URL, $Url);
        curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
        curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
    $file_contents = curl_exec($Ch);
    curl_close($Ch);
    }
    //为了让样式显示得漂亮,我们给它加一句目标引向.
    $file_contents = str_replace(," ",$file_contents);
    //处理最常见的几种编码, 如果目标网站没有编码, 就默认为GBK
    !preg_match(/charset=([^"]*)"/isU,$file_contents,$lang) && $lang[1]=GBK;
    function_exists(mb_convert_encoding) && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?UTF-8:$Charset,$lang[1]);
    //注销部分代码;
    unset($Url,$lang,$Timeout,$Urlarr,$Charset);
    return $file_contents;
    }
   
//测试开始 测试用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html  这是采集不到.
$file = get_url_content("http://www.hao123.com",f);
$file = strip_tags($file,);
preg_match_all(/(http:[^"]*)>/isU,$file,$link);unset($link[0]);
$link = $link[1];

//我们来模拟获得数据. 自己更换数字.0-151  下面是用curl方式
$x = 10;
$file = get_url_content($link[$x]);
echo $file;
?>

全部写上说明,  注释..

有不明白的回复..   我来给采集普及一下知识.

淘宝客API2.0
淘宝客API2.0

淘宝客asp语言api2.0 简单版程序是自己用了一段时间整理出来的,采用的是asp语言,为的是那些想做淘宝开放平台(api)的朋友提供一个学习的案例,而做了一个简单的API2.0接口的网站,主要有一个产品列表的API接口和一个产品展示的属性接口,希望能对朋友们有所帮助,能在网赚上获得一份收获。

淘宝客API2.0 0
查看详情 淘宝客API2.0

原文地址:http://bbs.phpchina.com/viewthread.php?tid=99263

相关标签:
php
最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
热门推荐
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号