放牛班的春天
火车头使用Post方法采集Ajax页面教程_我的网站

A | 76人东部冠军概率23%,热火才8%,热火才是东部冠军首选
米切尔:9.3分6.5助,三分39.5%,
汤普森:11.7分,三分38.3%
维金斯:15.4分4.8板1帽1.1断,三分41.4%
字母哥:27.6分9.8板5.4助0.7帽0.9断
阿德巴约:20.1分10板1.2断0.7帽
替补:波蒂斯、拉松,小哈达威。
阿里云优惠券 先领券再下单 前面有写过一篇瀑布流的采集方法,今天在添加一个POST方法来采集Ajax刷新页面的教程。 之前的文章请看:火车头采集动态加载Ajax数据(无分页瀑布流网站) 如果遇到POST方法来架子Ajax数据,这和我之前写的是两个类型,瀑布流是直接刷新出数据的页面。

B | 采集网站分析 采集任何一个新站前我们都要对他进行一番分析才好下手。 列表页分析 这个网站的列表页,前面并不是通过Ajax加载的。

C |
热火平均身高:199
VJ新秀赛场均16分5.6板4.2助攻1.4断
马克西场均28.3分4.1板6.6助1.9断0.8帽
恩比德场均26.9分7.7板3.9助1.2帽
布朗场均28.7分6.9板5.1助1断0.4帽
詹姆斯场均20.9分6.1板7.2助1.2断
替补:小西蒙斯、韦德,波普
76人平均身高:200
1.米切尔VS马克西,都是矮个子后卫,米切尔主要功能是组织加防守➕三分,是个3D后卫,不要小看米切尔,关键球不含糊,身高矮,但是类似年轻的洛瑞。CTRL+U可以直接看到列表内容,通过浏览器也看不到相关请求地址。

D |


因为习惯原因,我直接看了下尾页列表页。马克西得分高手,基本很难限制,这组对位马克西73开
2.克莱VSVJ,克莱有经验和身高,三分手感来了挡不住,但是防守已经跟不上了,VJ攻防一体,这组对位VJ64开
3.威金斯PK布朗,布朗同样砍分高手,只不过三分差点,嘴哥三分把握更强,防守更强,这组对位布朗64开
4.字母哥PK詹姆斯,啥也不说了,字母哥82开
5.阿德巴约PK恩比德,健康的恩比德64开,不健康的话0:10开
总体而言,首发阵容不相上下,不能单纯看对位,还要看战术,以及替补阵容。
热火强在内线,更加均衡,76人内线隐患大,詹姆斯年龄大,恩比德出勤低,这二人有一人伤退,内线将会成为真空。76人外线火力应该是联盟第一的存在,但是很多球星都需要持球,恐怕一个球不够分,目前还没有树立绝对核心,到底是恩比德?还是马克西?还是布朗?或者说詹姆斯?76人内线失守的话,字母哥将大杀四方。然后顺手CTRL+U看看网站代码结构有没有大的变化。防止后期采集出错。而字母哥作为绝对球星。

E | 结果就发现无法看到列表内容。
替补方面,波蒂斯能里能外,哈达威三分把握强,76人只有西蒙斯有一定进攻能力,但是防守真空,他是被凯尔特人放弃的球员。韦德基本没进攻能力,波普能否找回夺冠时期的状态还是未知数,总体而言,82场比赛和季后赛的漫长周期,有利于热火胜出,热火的教练也不是76人可以对比的,临场战术一定由于纳斯。

F | 所以说大热必死,76人太热了,而热火才是阵容均衡的那一方。浏览器可以看到一个通过post请求的地址。

G |


这时候就意识到这网站列表页可能后面的应该全是通过Ajax加载的。 通过笨方法,手动访问页面看看Ajax加载大概是哪些。最后找到大概从2200页左右开始Ajax加载。

H | 那我们采集的时候,前面的列表页就可以使用普通方式去采集(速度更快)。 2200页开始到尾页就通过post请求Ajax页面数据。

I | 抓包获取Post数据 这个Ajax地址我在浏览器看不到任何跟页码有关的数据。最后只能使用抓包工具看一下详细的请求内容了。

使用抓包工具Fiddler
Fiddler下载地址:OneDrive-Fiddler-Setup_v5.0.20204.45441.zip 安装设置完成后我们打开浏览器。重新访问一下采集页面,Fiddler会抓到很多请求地址。

J | 查看分析Post数据 Ctrl+F 我们搜索那个Ajax地址

Fiddler会以黄色将搜索到的结果显示出来,我们点击一下他。

在Fiddler右侧会显示这个请求地址的相关详细信息。

信息顶部可以看到是post请求方法。 可以看到有我们请求的页码相关内容。

访问不同页码的页面,经过研究发现规律。

currentPageIndex的值和页码相关,值等于页码减一。我们访问6139页时,currentPageIndex值是6138。 这就找到了规律,我们打开火车头采集器。 火车头采集器配置分页设置 起始网址填入Ajax请求地址

点“高级模式”。

点“分页设置”,http请求方式“post”。

把我们Fiddler抓包获取的内容填进去。

将currentPageIndex值的内容替换成火车头采集器的“分页”标签。

下面填入页码。 页面地址是从2200到6140,上面我们分析得出post请求内容的currentPageIndex值是实际页码减一。所以这里面我们填2199到6139.

网址获取选项设置 为了筛选出我们需要的内容,我们设置一下网址获取选项。 打开浏览器F12开发工具,预览一下Ajax获取的内容。

可以看到链接的形式是
自考成考报名条件有哪些? 完整的链接地址是 https://域名/chengrenzikao/20200611152022.html 那我们就可以使用下面的规则提取地址。
我们测试一下网址采集。 测试网址采集 点击测试可能提示“post请求必须选择网页编码”我们在火车头其他设置中将编码选为“UTF8”即可。
可以看到已经正确获取到了链接。不放心可以复制链接实际访问一下看看是否正确。
注意事项 采集过程注意运行线程和请求间隔时间。教程在测试时因为开的线程较多,频率过高导致对方网站开启了防CC设置。拉黑了我一个服务器IP,此教程写完用了两台服务器。 我们实际采集可以只开1个线程,并设置合适的间隔时间,比如1000ms到1500ms左右。
K | 本文来自2号站长网,转载请注明出处:https://www.zz2zz.com/331414.html
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。

L |
Current article:http://o1f.cheshenzhuaduanza.buzz/list_k8ugx5/jeyof.html
Published on:13:24:10