【从零开始学爬虫】通过新浪财经采集上市公司高管信息

颜青手机智库 2024-12-22 2 576

l 采集网站

【场景描述】采集新浪财经所有行业板块中上市公司的高管信息。

【源网站介绍】

新浪财经，提供7X24小时财经资讯及全球金融市场报价,覆盖股票、债券、基金、期货、信托、理财、管理等多种面向个人和企业的服务。

【使用工具】前嗅ForeSpider数据采集系统，点击下方链接可免费下载

http://www.forenose.com/view/forespider/view/download.html

【入口网址】

http://finance.sina.com.cn/stock/sl/#sinaindustry_1

【采集内容】

采集新浪财经所有行业板块中上市公司的高管信息。

【采集效果】如下图所示：

l 思路分析

配置思路概览：

l 配置步骤

1. 新建采集任务

选择【采集配置】，点击任务列表右上方【+】号可新建采集任务，将采集入口地址填写在【采集地址】框中，【任务名称】自定义即可，点击下一步。

选择列表链接，点击完成按钮，即创建任务完成。

2.获取行业链接

①用浏览器打开该网页，查看各行业的链接规律，发现行业链接规律为：http://vip.stock.finance.sina.com.cn/mkt/#new_+行业名称首字母

比如：

http://vip.stock.finance.sina.com.cn/mkt/#new_cbzz （船舶制造）

http://vip.stock.finance.sina.com.cn/mkt/#new_tchy （陶瓷行业）

②所以获取行业链接的方法为：将各行业关键词的首字母设置为关键词，用脚本拼接行业链接。

③设置关键词，具体步骤如下所示：

关键词文本如下：

new_blhy;new_cbzz;new_cmyl;new_dlhy;new_dqhy;new_dzqj;new_dzxx;new_fdc;new_fdsb;new_fjzz;new_fzhy;new_fzjx;new_fzxl;new_glql;new_gsgq;new_gthy;new_hbhy;new_hghy;new_hqhy;new_jdhy;new_jdly;new_jjhy;new_jrhy;new_jtys;new_jxhy;new_jzjc;new_kfq;new_ljhy;new_mtc;new_mthy;new_nlmy;new_nyhf;new_qczz;new_qtxy;new_slzp;new_snhy;new_sphy;new_stock;new_swzz;new_sybh;new_syhy;new_tchy;new_wzwm;new_ylqx;new_yqyb;new_ysbz;new_ysjs;new_zhhy;new_zzhy

④高级设置，设置一个关键词参数，具体操作如下图所示：

⑤编写关键词拼写链接的脚本：

具体脚本文本如下：

var sear=EXTRACT.GetSearch(this); //关键词获取

var k=sear.Search();//查找关键词

while(k){ //遍历关键词

url u;//定义一个url

u.urlname="http://vip.stock.finance.sina.com.cn/mkt/#"+k.wd;//拼接行业链接

u.title="新浪行业@"+k.wd;//将标题设置为关键词名称

u.entryid=this.id;

u.tmplid=1;//关联模板1

k=sear.Search();//查找下一个关键词

RESULT.AddLink(u);//输出一个url值

}

⑥采集预览，查看行业链接是否正确。

3. 获取翻页链接

①观察发现，有部分行业数据量比较大，有多页数据，需要翻页。

打开【其他行业】板块，发现4页数据，点击F12，右侧出现请求，点击第二页，观察发现请求：是翻页请求链接。如下图所示

补充：下图为请求response转译后内容，可看出其中有第二页中的内容，故确定此链接为翻页请求链接。

②复制翻页请求链接：

③同样方法，找到第三页和第四页请求链接，并复制出来。

④观察链接，发现规律如下图所示：

⑤写翻页链接脚本，具体操作如下所示：

脚本文本：

var hangye=URL.title.Right("@");//定义hangye为当前链接标题@右侧内容，即行业名称首字母

url u;//定义一个url

for(var i=1;i<=3;i++){//for循环表示翻页

u.urlname = "http://vip.stock.finance.sina.com.cn/quotes_service/api/json_v2.php/Market_Center.getHQNodeData?page="+i+"&num=80&sort=symbol&asc=1&node="+hangye;//根据翻页链接规律，拼翻页

u.title = hangye; //返回链接名称为行业

u.tmplid = 2;//关联模板2

RESULT.AddLink(u);

}

⑥采集预览，如下图所示，表示翻页链接已生成。