当前位置:首页 > 文章列表 > 文章 > 前端 > Rvest爬虫实战:NPB数据抓取技巧分享

Rvest爬虫实战:NPB数据抓取技巧分享

2026-02-05 12:15:40 0浏览 收藏

各位小伙伴们,大家好呀!看看今天我又给各位带来了什么文章?本文标题《Rvest爬虫实战:抓取NPB官网数据技巧》,很明显是关于文章的文章哈哈哈,其中内容主要会涉及到等等,如果能帮到你,觉得很不错的话,欢迎各位多多点评和分享!

Rvest 网络爬虫实战:高效抓取日本职业棒球联盟(NPB)官网数据

本文详解如何使用 R 语言的 rvest 包稳定抓取 npb.jp 网站上的棒球统计表格,重点解决 SSL 证书错误、动态结构识别与 CSS 选择器失效等常见问题,并提供可复用的健壮代码方案。

在使用 rvest 抓取日本职业棒球联盟(NPB)官网(如 https://npb.jp/bis/eng/2022/stats/std_c.html)时,初学者常遇到“无法定位表格”的问题——这并非因为网页结构复杂,而多源于三个关键因素:HTTPS 证书验证失败、HTML 实际结构与开发者工具显示不一致、以及过度嵌套的 CSS 选择器导致节点匹配失败

原始代码中使用的 CSS 选择器 #stdivmaintbl > table > tbody > tr > td > div:nth-child(1) 过于具体且依赖 DOM 渲染路径,而 NPB 官网实际采用的是语义化类名(如 .stdtblmain)包裹表格,且页面中存在多个同类型表格(例如投手/打者统计),直接硬编码层级极易断裂。

✅ 推荐做法是:优先使用语义清晰的 class 名称定位,避免深度层级依赖。实测表明,.stdtblmain 是该页面所有主统计表的统一容器类,配合 html_table() 可自动解析其内部

元素:

library(rvest)
library(magrittr)

# 方案一:绕过 SSL 证书问题(推荐用于调试)
# 将网页另存为本地 HTML 文件(右键 → “另存为” → 纯文本 HTML)
url <- "baseball.html"  # 替换为你的本地路径
tables <- url %>% 
  read_html() %>% 
  html_nodes(".stdtblmain") %>% 
  html_table(header = TRUE, fill = TRUE)

# 获取第一个主表(通常为打者综合统计)
df_batters <- tables[[1]]
head(df_batters[, 1:10])  # 查看前10列预览

⚠️ 注意事项:

  • 证书错误处理:若直接读取 URL 报错 SSL certificate problem(常见于 macOS 或旧版 libcurl),请先用浏览器保存网页源码为 baseball.html,再本地读取;或临时启用证书忽略(仅限测试环境):
    Sys.setenv("CURL_CA_BUNDLE" = "")  # 不推荐生产环境使用
  • 表格空值与合并单元格:NPB 表格大量使用 rowspan/colspan 和空
占位,html_table(fill = TRUE) 可自动填充缺失值,但需后续清洗(如删除重复标题行、清理 "***" 占位符)。
  • 多表提取:页面通常包含多个 .stdtblmain 表格(如打者、投手、守备),可用 length(tables) 查看数量,再按索引提取:
    df_pitchers <- tables[[2]]  # 第二个主表常为投手数据
  • ? 总结:成功抓取的核心在于「简化选择器 + 善用容错参数 + 本地化调试先行」。不要迷信浏览器开发者工具中看到的完整路径,而应观察

    的顶层容器类;始终开启 fill = TRUE 应对不规则 HTML;并将网络请求问题隔离为本地文件处理,大幅提升开发效率与稳定性。

    好了,本文到此结束,带大家了解了《Rvest爬虫实战:NPB数据抓取技巧分享》,希望本文对你有所帮助!关注golang学习网公众号,给大家分享更多文章知识!

    清除浮动技巧:让背景完整覆盖内容清除浮动技巧:让背景完整覆盖内容
    上一篇
    清除浮动技巧:让背景完整覆盖内容
    PPT插入实时网页教程及方法
    下一篇
    PPT插入实时网页教程及方法
    查看更多
    最新文章
    查看更多
    课程推荐
    • 前端进阶之JavaScript设计模式
      前端进阶之JavaScript设计模式
      设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
      543次学习
    • GO语言核心编程课程
      GO语言核心编程课程
      本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
      516次学习
    • 简单聊聊mysql8与网络通信
      简单聊聊mysql8与网络通信
      如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
      500次学习
    • JavaScript正则表达式基础与实战
      JavaScript正则表达式基础与实战
      在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
      487次学习
    • 从零制作响应式网站—Grid布局
      从零制作响应式网站—Grid布局
      本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
      485次学习
    查看更多
    AI推荐
    • ljg-skills -
      ljg-skills
      ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
      291次使用
    • MELO音乐 - AI 音乐生成平台,支持多模态创作能力
      MELO音乐
      MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
      306次使用
    • UniScribe - AI 免费在线音视频转文字平台
      UniScribe
      UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
      277次使用
    • 剧云 - 免费 AI 智能中文剧本创作平台
      剧云
      剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
      451次使用
    • 万象有声 - AI 一站式有声内容创作平台
      万象有声
      万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
      437次使用
    微信登录更方便
    • 密码登录
    • 注册账号
    登录即同意 用户协议隐私政策
    返回登录
    • 重置密码