PHP使用3种方法实现数据采集
来源:互联网 发布:开淘宝店要花钱吗 编辑:程序博客网 时间:2024/05/18 03:31
什么叫采集?
就是使用PHP程序,把其他网站中的信息抓取到我们自己的数据库中、网站中。
PHP制作采集的技术:
从底层的socket到高层的文件操作函数,一共有3种方法可以实现采集。
1. 使用socket技术采集:
socket采集是最底层的,它只是建立了一个长连接,然后我们要自己构造http协议字符串去发送请求。
例如要想获取这个页面的内容,http://tv.youku.com/?spm=a2hww.20023042.topNav.5~1~3!2~A,用socket写如下:
打印出的结果如下,包含了返回的头信息及页面的源码:
2. 使用curl_一套函数
curl把HTTP协议都封装成了很多函数,直接传相应参数即可,降低了编写HTTP协议字符串的难度。
前提:在php.ini中要开启curl扩展。
打印出的结果如下,只包含页面的源码:3. 直接使用file_get_contents(最顶层的)
前提:在php.ini中设置允许打开一个网络的url地址。
3种方式的选择
网络之间通信主要使用的是以上三种。其中后两种用的较多:如果要批量采集大量的数据时使用第二种【CURL】,性能好、稳定。
偶尔发几个请求发的频繁不密集时使用第三种。
扩展:图片的防盗链如何破?
比如7060网站上的图片做了防盗链:在他的网站中可以看到图片,把图片拿到站外就无法访问。
原理:在HTTP协议中有一个referer项,代表发这个请求的来源地址,服务器会判断如果这个请求不是这个网站发来的就会过滤掉这个请求:
解决办法:发HTTP时自己模拟referer即可:
扩展:有些要采集数据时时必须先登录,可以使用模拟的试模拟在登录状态下的采集:
a. 先用浏览登录一下,登录完,浏览器的COOKIE中就会有SESSIONID
b. 发PHP发HTTP协议时,把浏览器中的SESSIONID放到PHP的HTTP协议请求里,这样就在以登录的状态发请求。
总结:所有客户端发过来的数据都可以被模拟,所以服务器上的程序必须要必要的地方过滤客户端的数据。
什么时候用以上东西?接口开发时、采集时。
二、数据采集
例如我要采集这个url里的所有美国电影的信息,
http://list.youku.com/category/show/c_96_a_%E7%BE%8E%E5%9B%BD_s_1_d_1_p_3.html
则先要知道电影所在的节点的结构,我们使用firebug查看。
然后开始写代码:完整代码如下
测试:
打印$list;
打印$img
打印$video
最终效果:
如果需要把图片拷贝到硬盘上,则在foreach循环里加上以下代码:
效果如下:在当前目录下的youkuimg目录下就会有下载好的图片。
my github: https://github.com/lensh
转载来自:http://blog.csdn.net/zls986992484/article/details/52894526
- PHP使用3种方法实现数据采集
- PHP使用3种方法实现数据采集
- PHP使用3种方法实现数据采集
- PHP使用3种方法实现数据采集
- php实现采集电影数据
- 使用php laravel进行数据数据采集
- PHP数据采集常用的方法
- php:数据采集的实现的想法
- 使用PHP实现采集远程图片功能
- 使用PHP实现采集远程图片功能
- 使用多线程实现数据实时采集
- php数据采集
- PHP数据采集
- php数据采集
- php+snoopy 数据采集
- 大型数据库数据采集方法简介(3)
- PHP中使用snoopy采集类进行数据抓取
- 网页数据采集实现
- 集合框架Collection集合的基本功能及ArrayList类的使用
- STM32F系列ARM Cortex_M3核微控制器基础之系统时钟三
- 决策树模型组合之随机森林与GBDT
- ionic2 -- 环境搭建和ionic2项目目录介绍
- 创建maven项目时报错Error merging velocity templates
- PHP使用3种方法实现数据采集
- 复习
- React Native之导航器Navigator实现导航功能(一)
- React Native学习笔记
- 两种常见挂载Jenkins slave节点的方法
- ARM中常用的汇编指令集
- iOS富文本和html字符串互转
- Flex 布局
- Android中moveTo、lineTo、quadTo、cubicTo、arcTo详解(实例)