百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

Python爬虫案例:爬取全国天气、生活指数信息另外方法(完整版)

zhezhongyun 2025-01-31 16:15 52 浏览

犹豫再三、应粉丝的要求,经过几个小时的整理,爬虫案例:全国7天天气、3小时预报、7天生活指数信息的方法,这才与粉丝见面。这次预报信息的提取方法,与Python编程实践网络爬虫案例:爬取全国天气网,天气信息不用愁所用方法有所不同,这次在这一个案例里,对1-7天的日期、天气、温度、风速等天气预报和分时段3小时日期、天气、温度、风速等天气预报、1-7天生活指数预报信息,以及发布时间等信息进行了提取,希望粉丝对预报信息的提取有更深的理解。

一、数据网站介绍

中央气象台网站提供了1-7天的各要素天气预报和分时段3小时天气预报、1-7天生活指数预报信息。该网站通过气象观测数据和数值模型分析,提供了全国范围内各地区未来7天的天气预报和生活指数。用户可以通过该网站获取准确的天气预报,以便做出相应的气象决策和安排。无论是个人还是专业人士,都可以在中央气象台网站上获取可靠的天气预报信息,以帮助其日常生活或工作中的气象需求。

二、天气预报信息爬虫的基本流程

首先对网站发起请求,获取相应内容,对返回的内容进行解析,最后就保存数据。

三、实现过程

第一步:导入库

import requests
from bs4 import BeautifulSoup
import json

第二步:获取网页源代码

# 1 获取网页内容
# 发送请求,获取响应
url = 'http://www.weather.com.cn/weather/101200101.shtml'
response = requests.get(url)
# 从响应中获取数据
page = response.content.decode()

第三步:解析网页

1.查找天气预报信息的节点

通过分析网站返回的内容,天气预报有效信息都在 id="7d",天气预报信息的节点内。如图所示:

2.html5lib方式解析天气信息

我们使用BeautifulSoup模块对网页内容,进行html5lib方式的解析。(BeautifulSoup模块具体使用,后面有时间整理出来分享给粉丝)

查找标签:id='7d',获取标签内容,id_7d_conent就包含了7天天气预报、分时段天气预报和生活指数预报)。

# 2 提取天气预报信息
# 构建bs对象
soup = BeautifulSoup(page, 'html5lib') 

# 查找标签
id_7d_conent = soup.find(id='7d')

3.获取7天天气预报更新时间和开始时间

分析id_7d_conent的内容,发现7天的天气预报开始时间和更新时间在两个input里面,如下图箭头所示。

一个是id="
fc_24h_internal_update_time"中'value'预报的开始日期时间,另外一个是id="update_time"中'value'是更新时间。代码实例如下:

#7天天气预报的开始日期时间
fc_24h_internal_update_time = id_7d_conent.find(id='fc_24h_internal_update_time')['value']

#提取天气预报更新时间
update_time = id_7d_conent.find(id='update_time')['value']

通过提取,获得7天天气预报的开始日期时间和天气预报结论更新时间。

4、获取7天天气预报具体内容

分析id_7d_conent的内容,发现7天的天气预报

    class="t clearfix">....
里面,每天的预报在
  • .....
  • 里面,日期、天气、温度、风级,如下图箭头所示。

    代码实例如下:

    #获取7天气预报的内容
    ul = id_7d_conent.find('ul')
    li = ul.find_all('li')
    dates = []
    wws = []
    temps = []
    ddffs = []
    # 获取日期dates、天气wws、温度temps、风级ddffs
    for i in range(len(li)):
        date = li[i].find('h1').text
        p = li[i].find_all('p')
        ww = p[0].text
        temp = p[1].text.strip()
        ddff = p[2].text.strip()
        dates.append(date)
        wws.append(ww)
        temps.append(temp)
        ddffs.append(ddff)

    使用了find_all,获得每天预报的html信息,然后对每天的预报html进行进一步解析,得到每天的日期、天气、温度、风级,7天的天气预报分别储存在dates、wws、temps、ddffs。分解结果如下图所示:

    5.获取3小时天气预报信息的更新时间

    分析id_7d_conent的内容,发现3小时天气预报信息的更新时间以个input里面,如下图箭头所示。

    id="
    fc_3h_internal_update_time
    " 中 'value' 3小时天气预报信息的更新时间。代码实例如下:

    fc_3h_update_time = id_7d_conent.find(id='fc_3h_internal_update_time')['value']
    print(fc_3h_update_time)

    6、获取3小时天气预报信息的内容

    如上图的下面的连个箭头显示,我们发现,分时段天气预报的信息在以,var hour3data= 开头的一行字符串中,7d为7天的分时段天气预报内容。具体内容如下所示:

    var hour3data={"1d":["27日20时,n02,阴,25℃,无持续风向,<3级,0","27日23时,n01,多云,22℃,北风,<3级,0","28日02时,n01,多云,21℃,北风,<3级,0","28日05时,n01,多云,22℃,北风,<3级,0","28日08时,d01,多云,23℃,北风,<3级,2","28日11时,d01,多云,28℃,东北风,<3级,2","28日14时,d01,多云,30℃,北风,<3级,2","28日17时,d01,多云,29℃,东北风,<3级,2","28日20时,n01,多云,26℃,北风,<3级,0"],"23d":[["30日08时,d07,小雨,22℃,北风,<3级,3","30日11时,d02,阴,26℃,北风,<3级,3","30日14时,d02,阴,25℃,东北风,<3级,3","30日17时,d02,阴,24℃,东北风,<3级,3","30日20时,n02,阴,24℃,北风,<3级,0","01日02时,n01,多云,23℃,东北风,<3级,0"],["01日08时,d07,小雨,21℃,东北风,<3级,3","01日14时,d00,晴,24℃,东北风,<3级,1","01日20时,n00,晴,22℃,东北风,<3级,0","02日02时,n01,多云,21℃,东北风,<3级,0"]],"7d":[["27日20时,n02,阴,25℃,无持续风向,<3级,0","27日23时,n01,多云,22℃,北风,<3级,0","28日02时,n01,多云,21℃,北风,<3级,0","28日05时,n01,多云,22℃,北风,<3级,0"],["28日08时,d01,多云,23℃,北风,<3级,2","28日11时,d01,多云,28℃,东北风,<3级,2","28日14时,d01,多云,30℃,北风,<3级,2","28日17时,d01,多云,29℃,东北风,<3级,2","28日20时,n01,多云,26℃,北风,<3级,0","28日23时,n01,多云,25℃,东北风,<3级,0","29日02时,n01,多云,23℃,东北风,<3级,0","29日05时,n01,多云,24℃,东北风,<3级,0"],["29日08时,d01,多云,26℃,东北风,<3级,2","29日11时,d02,阴,27℃,东北风,<3级,3","29日14时,d02,阴,29℃,北风,<3级,3","29日17时,d02,阴,27℃,西北风,<3级,3","29日20时,n02,阴,26℃,东北风,<3级,0","29日23时,n01,多云,24℃,北风,<3级,0","30日02时,n01,多云,22℃,北风,<3级,0","30日05时,n07,小雨,21℃,北风,<3级,0"],["30日08时,d07,小雨,22℃,北风,<3级,3","30日11时,d02,阴,26℃,北风,<3级,3","30日14时,d02,阴,25℃,东北风,<3级,3","30日17时,d02,阴,24℃,东北风,<3级,3","30日20时,n02,阴,24℃,北风,<3级,0","01日02时,n01,多云,23℃,东北风,<3级,0"],["01日08时,d07,小雨,21℃,东北风,<3级,3","01日14时,d00,晴,24℃,东北风,<3级,1","01日20时,n00,晴,22℃,东北风,<3级,0","02日02时,n01,多云,21℃,东北风,<3级,0"],["02日08时,d01,多云,21℃,东北风,<3级,3","02日14时,d02,阴,24℃,东风,<3级,3","02日20时,n02,阴,23℃,北风,<3级,0","03日02时,n01,多云,22℃,北风,<3级,0"],["03日08时,d07,小雨,21℃,北风,<3级,3","03日14时,d01,多云,23℃,北风,<3级,3","03日20时,n01,多云,20℃,北风,<3级,0","04日02时,n02,阴,22℃,西北风,<3级,0"],["04日08时,d02,阴,23℃,北风,<3级,3","04日14时,d07,小雨,24℃,北风,<3级,3","04日20时,n07,小雨,21℃,北风,<3级,0"]]}

    为了得到分时段天气预报的具体信息,我编写了get_section_forecast函数,lines:就是forecast_text每行的内容,prefix:即使字符串的前缀,取值:var hour3data=,

    # 获取标签id='7d'的文字内容
    forecast_text = id_7d_conent.text
    
    # 以'\n'切分,获得每行的内容lines[]
    lines = forecast_text.split('\n')
    
    def get_section_forecast(lines,prefix):    
        str_len = len(prefix)
        for i in range(len(lines)):
            if lines[i][0:str_len]==prefix:
                return lines[i][str_len:] 
        return ''

    去掉前缀后,后面的信息就是分时段天气预报的具体信息,而且还是json字符串。

    7、json解析分时段天气预报

    # 提取3小时预报,json字符串
    json_str = get_section_forecast(lines,"var hour3data=")
    
    forecast = json.loads(json_str)
    ww_3h_7d = forecast['7d']
    ww_3h_forecast=[]
    for i in range(len(ww_3h_7d)):
        ww_3h = ww_3h_7d[i]
        for ii in range(len(ww_3h)):
            ww_3h_forecast.append(ww_3h[ii])
    print(ww_3h_forecast)

    运行结果如下:

    8、解析生活指数信息的发布时间

    分析id_7d_conent的内容,发现生活指数预报信息的更新时间以以个input里面,其id="zs_7d_update_time",如下图箭头所示。

    id="zs_7d_update_time" 中 'value' 生活指数预报信息的更新时间。代码实例如下:

    zs_7d_update_time = id_7d_conent.find(id='zs_7d_update_time')['value']
    print(zs_7d_update_time)

    9、解析生活指数信息函数

    分析forecast_text的内容,我们发现,共有6种指数,分别为:感冒指数、运动指数、过敏指数、穿衣指数、洗车指数、紫外线指数,而且每种指数有三行内容。

    为了解析指数内容,我编写了如下函数,lines:就是forecast_text每行的内容,index:取值,感冒指数、运动指数、过敏指数、穿衣指数、洗车指数、紫外线指数6种中的其中一种。返回值为index的7天的指数预报。

    def get_index(lines,index):
        index_str = '';
        for i in range(len(lines)):
            if lines[i]==index:
                index_str = index_str + lines[i-1]+' '+ lines[i]+' '+lines[i+1]+'\n'
        return index_str

    10.调用函数解析获得生活指数

    调用函数get_index,并打印出来。

    # 提取生活指数
    print(get_index(lines,"感冒指数"))
    print(get_index(lines,"运动指数"))
    print(get_index(lines,"过敏指数"))
    print(get_index(lines,"穿衣指数"))
    print(get_index(lines,"洗车指数"))
    print(get_index(lines,"紫外线指数"))

    运行结果如下:

    看到结果,是不是很兴奋。网络爬虫,也没有想象中的那么高大上,那么高深的理论。希望本教程,给粉丝一个完整的爬虫的思路,对学习有所裨益。

    最后,由于平台规则,只有当您跟我有更多互动的时候,才会被认定为铁粉。如果您喜欢我的文章,可以点个“关注”,成为铁粉后能第一时间收到文章推送。

    相关推荐

    JavaScript中常用数据类型,你知道几个?

    本文首发自「慕课网」,想了解更多IT干货内容,程序员圈内热闻,欢迎关注!作者|慕课网精英讲师Lison这篇文章我们了解一下JavaScript中现有的八个数据类型,当然这并不是JavaScr...

    踩坑:前端的z-index 之bug一二(zh1es前端)

    IE6下浮动元素bug给IE6下的一个div设置元素样式,无论z-index设置多高都不起作用。这种情况发生的条件有三个:1.父标签position属性为relative;2.问题标签无posi...

    两栏布局、左边定宽200px、右边自适应如何实现?

    一、两栏布局(左定宽,右自动)1.float+margin即固定宽度元素设置float属性为left,自适应元素设置margin属性,margin-left应>=定宽元素宽度。举例:HTM...

    前端代码需要这样优化才是一个标准的网站

      网站由前端和后端组成,前端呈现给用户。本文将告诉您前端页面代码的优化,当然仍然是基于seo优化的。  就前端而言,如果做伪静态处理,基本上是普通的html代码,正常情况下,这些页面内容是通过页面模...

    网页设计如何自学(初学网页设计)

    1在Dreamweaver中搭建不同的页面,需要掌握HTML的语句了,通过调整各项数值就可以制作出排版漂亮的页面,跟着就可以学习一些可视化设计软件。下面介绍网页设计如何自学,希望可以帮助到各位。Dre...

    1、数值类型(数值类型有)

    1.1数据类型概览MySQL的数据类型可划分为三大类别:数值类型:旨在存储数字(涵盖整型、浮点型、DECIMAL等)。字符串类型:主要用于存储文本(诸如CHAR、VARCHAR之类)。日期/...

    网页设计的布局属性(网页设计的布局属性是什么)

    布局属性是网站设计中必不可少的一个重要的环节,主要用来设置网页的元素的布局,主要有以下属性。1、float:该属性设置元素的浮动方式,可以取none,left和right等3个值,分别表示不浮动,浮在...

    Grid网格布局一种更灵活、更强大的二维布局模型!

    当涉及到网页布局时,display:flex;和display:grid;是两个常用的CSS属性,它们都允许创建不同类型的布局,但有着不同的用法和适用场景。使用flex布局的痛点当我们使...

    React 项目实践——创建一个聊天机器人

    作者:FredrikStrandOseberg转发链接:https://www.freecodecamp.org/news/how-to-build-a-chatbot-with-react/前言...

    有趣的 CSS 数学函数(css公式)

    前言之前一直在玩three.js,接触了很多数学函数,用它们创造过很多特效。于是我思考:能否在CSS中也用上这些数学函数,但发现CSS目前还没有,据说以后的新规范会纳入,估计也要等很久。然...

    web开发之-前端css(5)(css前端设计)

    显示控制一个元素的显示方式,我们可以使用display:block;display:inline-block;display:none;其中布局相关的还有两个很重要的属性:display:flex;和...

    2024最新升级–前端内功修炼 5大主流布局系统进阶(分享)

    获课:keyouit.xyz/14642/1.前端布局的重要性及发展历程前端布局是网页设计和开发的核心技能之一,它决定了页面元素如何组织和呈现。从早期的静态布局到现代的响应式布局,前端布局技术经历了...

    教你轻松制作自动换行的CSS布局,轻松应对不同设备!

    在网页设计中,自动换行的CSS布局是非常常见的需求,特别是在响应式设计中。它可以让网页内容自动适应不同屏幕尺寸,保证用户在不同设备上都能够获得良好的浏览体验。本文将介绍几种制作自动换行的CSS布局的方...

    晨光微语!一道 CSS 面试题,伴你静享知识治愈时光

    当第一缕阳光温柔地爬上窗台,窗外的鸟鸣声清脆悦耳,空气中弥漫着清新的气息。在这宁静美好的清晨与上午时光,泡一杯热气腾腾的咖啡,找一个舒适的角落坐下。前端的小伙伴们,先把工作的疲惫和面试的焦虑放在一边,...

    2023 年的响应式设计指南(什么是响应式设计优缺点)

    大家好,我是Echa。如今,当大家考虑构建流畅的布局时,没有再写固定宽度和高度数值了。相反,小编今天构建的布局需要适用于几乎任何尺寸的设备。是不是不可思议,小编仍然看到网站遵循自适应设计模式,其中它有...