【年报文本分析】第二辑:python+selium实现根据股票代码和对应年份获取上市公司年报链接(巨潮资讯网)

embedded/2024/9/25 9:51:39/

目录

  • 序言
  • excel文件准备
  • 函数模块介绍
    • 创建模拟浏览器对象
    • 只需要执行一次的部分
    • 需要批量执行的重复操作部分(信息录入excel)
    • 主函数
  • 本地文件结构
  • 全部代码
  • 结果预览

本文以指定的A股公司年报为例,从巨潮资讯网上获取。
该方法建议需要特定年报数据的采用,如单独分析某一行业等,如果无差别的使用全部A股上市公司,建议直接某宝买现成的。

序言

巨潮资讯网链接:http://www.cninfo.com.cn/new/commonUrl/pageOfSearch?url=disclosure/list/search&lastPage=index

需要提前下载好三个库,都可以用pip install轻松下载,稍微麻烦点儿的是需要去下载个对应版本的chromedriver.exe驱动,放到python或者Anaconda的文件夹目录下,然后添加环境变量(这部分报错了自行百度即可,操作起来不麻烦的)

注意time.sleep()是必要的,一是为了避免频繁操作被浏览器提醒,二是在网络不好的情况下让网页加载完全,否则都会导致报错

一定不要图快,目前我是2s左右完成一次。建议在网络环境较好的情况下运行

这之中还会遇到诸多问题,在代码的注释里也都写到了,其他需求可以做参考。

excel文件准备

文件名建议直接命名为result.xlsx,读取和保存时均使用改路径,如果中断后,修改起点,可以直接覆盖

文件需要至少包括code(股票代码)和year(年份),再建立一个url空列存储链接

在这里插入图片描述

函数模块介绍

创建模拟浏览器对象

# 返回虚拟浏览器对象
def openUrl(url):driver = webdriver.Chrome()driver.get(url)time.sleep(2)return driver

只需要执行一次的部分

xpath如何获取百度一下即可

def oneclick(driver):driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[6]/div/span[13]/span').click()time.sleep(1)

需要批量执行的重复操作部分(信息录入excel)

# 每一页的XPATH都是一样的,只需处理好一页即可
def geturl(driver,code,year,i):    #输入股票代码if i==1:driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(code)time.sleep(0.5)else:driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(6*Keys.BACKSPACE)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(code)time.sleep(0.5)#点击年报driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[6]/div/span[1]').click()time.sleep(0.5)#输入日期driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[1]').send_keys(8*Keys.BACKSPACE)time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[1]').send_keys(str(year)[-2:]+'-01-01')time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[2]').send_keys(8*Keys.BACKSPACE)time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[2]').send_keys(str(year)[-2:]+'-12-31')time.sleep(0.5)#点击查询driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/div[1]/button').click()time.sleep(1.0)#判断是否为年报而非摘要,是打开新网页保存年报网址for j in range(1,3):        try:element=driver.find_element_by_xpath(f'//*[@id="main"]/div[2]/div[1]/div[1]/div[2]/div/div[3]/table/tbody/tr[{j}]/td[3]/div/span/a')except:breaktext=element.text    if '年度报告' in text and '摘要' not in text:reporturl=element.get_attribute('href')driverreport=openUrl(reporturl)time.sleep(2.5)urlelement = driverreport.find_element_by_xpath('//*[@id="noticeDetail"]/div/div[2]/div[1]/a')url=urlelement.get_attribute('href')  df['url'][i]=urldf.to_excel('result.xlsx')driverreport.close()break    driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/div[2]/div/div/button').click()time.sleep(0.5)

主函数

#主函数
if __name__ =='__main__':driver=openUrl('http://www.cninfo.com.cn/new/commonUrl/pageOfSearch?url=disclosure/list/search&lastPage=index')oneclick(driver)dtype={'code':str}df=pd.read_excel('result.xlsx',sheet_name='Sheet1',dtype=dtype)for i in range(0,len(df)):code=df['code'][i]year=int(df['year'][i])geturl(driver,code,year+1,i)print(str(i)+'完成')driver.close()

本地文件结构

只需要将excel文件和代码文件放一起即可,或者用绝对路径也可

全部代码

from selenium import webdriver 
from selenium.webdriver.common.keys import Keys
import time 
import pandas as pd# 返回虚拟浏览器对象
def openUrl(url):driver = webdriver.Chrome()driver.get(url)time.sleep(2)return driverdef oneclick(driver):driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[6]/div/span[13]/span').click()time.sleep(1)# 每一页的XPATH都是一样的,只需处理好一页即可
def geturl(driver,code,year,i):    #输入股票代码if i==1:driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(code)time.sleep(0.5)else:driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(6*Keys.BACKSPACE)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[1]/div/div/div/div[1]/input').send_keys(code)time.sleep(0.5)#点击年报driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[6]/div/span[1]').click()time.sleep(0.5)#输入社会责任#driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[2]/div[2]/div/div/div/input').send_keys('社会责任')#time.sleep(0.5)#输入日期driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[1]').send_keys(8*Keys.BACKSPACE)time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[1]').send_keys(str(year)[-2:]+'-01-01')time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[2]').send_keys(8*Keys.BACKSPACE)time.sleep(0.5)driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/form/div[1]/div/div/input[2]').send_keys(str(year)[-2:]+'-12-31')time.sleep(0.5)#点击查询driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/div[1]/button').click()time.sleep(1.0)#判断是否为年报而非摘要,是打开新网页保存年报网址for j in range(1,3):        try:element=driver.find_element_by_xpath(f'//*[@id="main"]/div[2]/div[1]/div[1]/div[2]/div/div[3]/table/tbody/tr[{j}]/td[3]/div/span/a')except:breaktext=element.text    if '年度报告' in text and '摘要' not in text:reporturl=element.get_attribute('href')driverreport=openUrl(reporturl)time.sleep(2.5)urlelement = driverreport.find_element_by_xpath('//*[@id="noticeDetail"]/div/div[2]/div[1]/a')url=urlelement.get_attribute('href')  df['url'][i]=urldf.to_excel('result.xlsx')driverreport.close()break    driver.find_element_by_xpath('//*[@id="main"]/div[2]/div[1]/div[2]/div/div[2]/div[2]/div/div/button').click()time.sleep(0.5)#主函数
if __name__ =='__main__':driver=openUrl('http://www.cninfo.com.cn/new/commonUrl/pageOfSearch?url=disclosure/list/search&lastPage=index')oneclick(driver)dtype={'code':str}df=pd.read_excel('result.xlsx',sheet_name='Sheet1',dtype=dtype)for i in range(0,len(df)):code=df['code'][i]year=int(df['year'][i])geturl(driver,code,year+1,i)print(str(i)+'完成')driver.close()

结果预览

在这里插入图片描述

从excel文件中下载年报详见:https://blog.csdn.net/weixin_43956523/article/details/136265883?spm=1001.2014.3001.5501


http://www.ppmy.cn/embedded/16489.html

相关文章

家庭环境如何异地组网装修?

家庭异地组网装修是如今越来越受到人们关注的问题。在现代社会中,家庭成员经常因为各种原因而分散在不同的地区。这种情况下,如何实现家庭网络的高效通信变得尤为重要。本文将介绍一款异地组网产品——【天联】组网,它能够帮助家庭解决异地组…

字符串漏洞注入深入学习

字符串型漏洞注入,特别是针对Web应用程序的SQL注入,是一种常见的网络安全威胁。它涉及攻击者在不受控制的情况下,通过构造特定的字符串输入,干扰或改变应用程序中原有的SQL查询语句,从而执行恶意的SQL代码。 要深入学…

李沐66_使用注意力机制的seq2seq——自学笔记

加入注意力 1.编码器对每次词的输出作为key和value 2.解码器RNN对上一个词的输出是query 3.注意力的输出和下一个词的词嵌入合并进入RNN 一个带有Bahdanau注意力的循环神经网络编码器-解码器模型 总结 1.seq2seq通过隐状态在编码器和解码器中传递信息 2.注意力机制可以根…

设计模式-行为型模式-观察者模式

观察者模式用于定义对象间的一种一对多的依赖关系,使得当一个对象状态变化时,其所有依赖对象都会收到通知并自动更新 /*** 行为型模式--观察者模式* 观察者模式用于定义对象间的一种一对多的依赖关系,使得当一个对象状态变化时,其…

C++修炼之路之多态---多态的原理(虚函数表)

目录 一:多态的原理 1.虚函数表 2.原理分析 3.对于虚表存在哪里的探讨 4.对于是不是所有的虚函数都要存进虚函数表的探讨 二:多继承中的虚函数表 三:常见的问答题 接下来的日子会顺顺利利,万事胜意,生活明朗--…

C++之类与对象(2)

目录 一、类的六个默认成员函数简介 二、构造函数 2.1 概念 2.2 特性 三、析构函数 3.1 概念 3.2 特性 四、拷贝构造函数 4.1 概念 4.2 特性 五、运算符重载 5.1 运算符重载 5.2 赋值运算符重载 5.3 前置和后置的重载 六、const成员 七、取地址及const取地址操作…

【ARMv9 DSU-120 系列 10 -- PMU 详细介绍】

请阅读【Arm DynamIQ™ Shared Unit-120 专栏 】 文章目录 DSU-120 PMUPMU features事件接口系统寄存器计数器PMU寄存器接口PMU eventsPMU interruptExternal cluster PMU registersDSU-120 PMU DynamIQ™共享单元-120(DSU-120)包括性能监视器,这些监视器使您能够在运行时收…

如何3分钟,快速开发一个新功能

背景 关于为什么做这个代码生成器,其实主要有两点: 参与的项目中有很多分析报表需要展示给业务部门,公司使用的商用产品,或多或少有些问题,这部分可能是历史选型导致的,这里撇开不不谈;项目里面也有很多C…