使用 Beautiful Soup 在 Python 中进行网页抓取和解析 HTML

wufei123 2025-01-26 阅读:9 评论:0
利用python和beautiful soup从网络抓取midi数据,训练magenta神经网络生成经典任天堂风格音乐。本文将引导您完成整个过程,从环境搭建到数据下载,并提供代码示例。 准备工作与依赖安装 首先,确保已安装Python 3和...

利用python和beautiful soup从网络抓取midi数据,训练magenta神经网络生成经典任天堂风格音乐。本文将引导您完成整个过程,从环境搭建到数据下载,并提供代码示例。

准备工作与依赖安装

首先,确保已安装Python 3和pip。建议创建一个虚拟环境,以避免包冲突。 激活虚拟环境后,运行以下命令安装必要的库:

pip install requests==2.22.0 beautifulsoup4==4.8.1

我们使用Beautiful Soup 4,因为它比已不再维护的版本3更稳定。

使用requests抓取数据,Beautiful Soup解析

以下代码从指定网页获取HTML,并创建一个Beautiful Soup对象用于解析:

import requests
from bs4 import BeautifulSoup

vgm_url = 'https://www.vgmusic.com/music/console/nintendo/nes/'
html_text = requests.get(vgm_url).text
soup = BeautifulSoup(html_text, 'html.parser')

soup 对象允许您遍历和搜索HTML中的数据。例如,soup.title 获取页面标题,print(soup.get_text()) 打印所有文本内容。

了解Beautiful Soup的核心方法

find() 和 find_all() 是Beautiful Soup中最常用的方法。find() 用于查找单个元素,例如 soup.find(id='banner_ad').text 获取指定ID元素的文本。 find_all() 用于查找所有匹配条件的元素,例如以下代码打印页面上所有超链接的URL:

for link in soup.find_all('a'):
    print(link.get('href'))

find_all() 支持多种参数,例如正则表达式或属性,以精确过滤搜索结果。

解析和导航HTML

在编写解析代码之前,建议使用浏览器开发者工具检查目标网页的HTML结构。 下图显示了目标网页截图和开发者工具的使用方法。

使用 Beautiful Soup 在 Python 中进行网页抓取和解析 HTML使用 Beautiful Soup 在 Python 中进行网页抓取和解析 HTML

我们的目标是从网页下载MIDI文件,但需要排除重复曲目和混音版本。

使用Beautiful Soup过滤和下载MIDI文件

以下代码使用正则表达式过滤链接,仅下载不包含括号的MIDI文件:

import re
import requests
from bs4 import BeautifulSoup

vgm_url = 'https://www.vgmusic.com/music/console/nintendo/nes/'
html_text = requests.get(vgm_url).text
soup = BeautifulSoup(html_text, 'html.parser')


def download_track(count, track_element):
    track_title = track_element.text.strip().replace('/', '-')
    download_url = '{}{}'.format(vgm_url, track_element['href'])
    file_name = '{}_{}.mid'.format(count, track_title)
    r = requests.get(download_url, allow_redirects=True)
    with open(file_name, 'wb') as f:
        f.write(r.content)
    print('Downloaded: {}'.format(track_title))


if __name__ == '__main__':
    attrs = {'href': re.compile(r'.mid$')}
    tracks = soup.find_all('a', attrs=attrs, string=re.compile(r'^((?!().)*$'))
    count = 0
    for track in tracks:
        download_track(count, track)
        count += 1
    print(len(tracks))

运行此代码将下载所有过滤后的MIDI文件。

使用 Beautiful Soup 在 Python 中进行网页抓取和解析 HTML

总结与展望

通过Beautiful Soup,您可以轻松地从网页中抓取所需数据。 请记住,网页结构可能会发生变化,需要定期检查和更新代码。 您可以使用mido等库进一步处理MIDI数据,并使用Magenta训练神经网络生成音乐。 希望您能利用这些技术创建令人惊叹的项目!

以上就是使用 Beautiful Soup 在 Python 中进行网页抓取和解析 HTML的详细内容,更多请关注知识资源分享宝库其它相关文章!

版权声明

本站内容来源于互联网搬运,
仅限用于小范围内传播学习,请在下载后24小时内删除,
如果有侵权内容、不妥之处,请第一时间联系我们删除。敬请谅解!
E-mail:dpw1001@163.com

分享:

扫一扫在手机阅读、分享本文

发表评论
热门文章
  • 华为 Mate 70 性能重回第一梯队 iPhone 16 最后一块遮羞布被掀

    华为 Mate 70 性能重回第一梯队 iPhone 16 最后一块遮羞布被掀
    华为 mate 70 或将首发麒麟新款处理器,并将此前有博主爆料其性能跑分将突破110万,这意味着 mate 70 性能将重新夺回第一梯队。也因此,苹果 iphone 16 唯一能有一战之力的性能,也要被 mate 70 拉近不少了。 据悉,华为 Mate 70 性能会大幅提升,并且销量相比 Mate 60 预计增长40% - 50%,且备货充足。如果 iPhone 16 发售日期与 Mate 70 重合,销量很可能被瞬间抢购。 不过,iPhone 16 还有一个阵地暂时难...
  • 酷凛 ID-COOLING 推出霜界 240/360 一体水冷散热器,239/279 元

    酷凛 ID-COOLING 推出霜界 240/360 一体水冷散热器,239/279 元
    本站 5 月 16 日消息,酷凛 id-cooling 近日推出霜界 240/360 一体式水冷散热器,采用黑色无光低调设计,分别定价 239/279 元。 本站整理霜界 240/360 散热器规格如下: 酷凛宣称这两款水冷散热器搭载“自研新 V7 水泵”,采用三相六极马达和改进的铜底方案,缩短了水流路径,相较上代水泵进一步提升解热能力。 霜界 240/360 散热器的水泵为定速 2800 RPM 设计,噪声 28db (A)。 两款一体式水冷散热器采用 27mm 厚冷排,...
  • 惠普新款战 99 笔记本 5 月 20 日开售:酷睿 Ultra / 锐龙 8040,4999 元起

    惠普新款战 99 笔记本 5 月 20 日开售:酷睿 Ultra / 锐龙 8040,4999 元起
    本站 5 月 14 日消息,继上线官网后,新款惠普战 99 商用笔记本现已上架,搭载酷睿 ultra / 锐龙 8040处理器,最高可选英伟达rtx 3000 ada 独立显卡,售价 4999 元起。 战 99 锐龙版 R7-8845HS / 16GB / 1TB:4999 元 R7-8845HS / 32GB / 1TB:5299 元 R7-8845HS / RTX 4050 / 32GB / 1TB:7299 元 R7 Pro-8845HS / RTX 2000 Ada...
  • python怎么调用其他文件函数

    python怎么调用其他文件函数
    在 python 中调用其他文件中的函数,有两种方式:1. 使用 import 语句导入模块,然后调用 [模块名].[函数名]();2. 使用 from ... import 语句从模块导入特定函数,然后调用 [函数名]()。 如何在 Python 中调用其他文件中的函数 在 Python 中,您可以通过以下两种方式调用其他文件中的函数: 1. 使用 import 语句 优点:简单且易于使用。 缺点:会将整个模块导入到当前作用域中,可能会导致命名空间混乱。 步骤:...
  • python中def什么意思

    python中def什么意思
    python 中,def 关键字用于定义函数,这些函数是代码块,执行特定任务。函数语法为 def (参数列表)。函数可以通过其名字和圆括号调用。函数可以接受参数作为输入,并在函数体中使用参数名访问。函数可以使用 return 语句返回一个值,它将成为函数调用的结果。 Python 中 def 关键字 在 Python 中,def 关键字用于定义函数。函数是代码块,旨在执行特定任务。 语法 def 函数定义的语法如下: def (参数列表): # 函数体 示例 定义...