Golang实现基础爬虫抓取网站数据

P粉602998670

发布时间：2025-09-02 09:13:01

266人浏览过

来源于php中文网

原创

用Golang写基础爬虫需发送HTTP请求并解析HTML。首先通过net/http库发起GET请求获取网页内容，如http.Get读取响应体；接着使用goquery库解析HTML，类似jQuery语法提取h1标题和p段落文本；最后将数据结构化为JSON输出。注意设置User-Agent、处理超时与编码，遵守robots.txt规则。完整流程包括错误处理、资源释放及数据存储，可扩展并发与反爬应对。

golang实现基础爬虫抓取网站数据

用Golang写一个基础爬虫抓取网页数据并不复杂，核心是发送HTTP请求、解析HTML内容并提取所需信息。下面是一个简单但完整的实现流程，适合初学者快速上手。

发送HTTP请求获取网页内容

Go语言标准库net/http可以轻松发起GET请求。通过http.Get获取网页响应，再读取返回的body数据。

示例代码：

resp, err := http.Get("https://httpbin.org/html")
if err != nil {
log.Fatal(err)
}
defer resp.Body.Close()

body, err := io.ReadAll(resp.Body)
if err != nil {
log.Fatal(err)
}

这里我们访问一个测试页面，实际使用时替换为目标网站URL。注意检查错误并关闭响应体，避免资源泄露。

立即学习“go语言免费学习笔记（深入）”；

解析HTML提取数据

Go没有内置的jQuery式选择器，但可以使用第三方库golang.org/x/net/html或更易用的github.com/PuerkitoBio/goquery。

HiDream AI

全中文AIGC创作平台和AI社区

下载

使用goquery解析并提取标题和段落文本：

doc, err := goquery.NewDocumentFromReader(strings.NewReader(string(body)))
if err != nil {
  log.Fatal(err)
}

doc.Find("h1").Each(func(i int, s *goquery.Selection) {
  fmt.Printf("标题: %s\n", s.Text())
})

doc.Find("p").Each(func(i int, s *goquery.Selection) {
  fmt.Printf("段落: %s\n", s.Text())
})

goquery语法类似jQuery，适合习惯前端开发的用户，能快速定位元素。

处理常见问题与优化

真实爬虫会遇到反爬机制、编码问题或结构化输出需求，以下是一些实用建议：

设置User-Agent：有些网站会屏蔽默认的Go请求头，添加头信息更像浏览器行为
使用http.Client自定义超时和重试机制，避免程序卡住
对中文网站注意字符编码，必要时用golang.org/x/text/encoding转码
提取的数据可存为JSON或CSV，方便后续处理
遵守robots.txt，控制请求频率，尊重网站规则

完整示例：抓取标题和段落保存为结构体

type PageData struct {
  Title string `json:"title"`
  Content []string `json:"content"`
}

func main() {
  resp, err := http.Get("https://httpbin.org/html")
  if err != nil {
    log.Fatal(err)
  }
  defer resp.Body.Close()

  body, _ := io.ReadAll(resp.Body)
  doc, _ := goquery.NewDocumentFromReader(strings.NewReader(string(body)))

  data := PageData{}
  doc.Find("h1").First().Each(func(i int, s *goquery.Selection) {
    data.Title = s.Text()
  })

  doc.Find("p").Each(func(i int, s *goquery.Selection) {
    data.Content = append(data.Content, s.Text())
  })

  jsonBytes, _ := json.MarshalIndent(data, "", " ")
  fmt.Println(string(jsonBytes))
}

这段代码抓取页面主标题和所有段落，整理成结构化JSON输出。

基本上就这些。Golang写爬虫简洁高效，配合goroutine还能轻松实现并发抓取。关键是理解HTTP流程和HTML解析逻辑，后续可扩展代理、登录、动态渲染等功能。

如何在Golang中实现责任链模式_Go请求链式处理设计

如何在Golang中实现CI/CD部署策略_Golang流水线自动化部署方法

如何使用Golang实现中介者模式_Go组件解耦实现思路

Golang服务如何暴露Prometheus指标_指标接口实现说明

如何使用Golang go mod tidy清理依赖_Golang模块依赖整理方法

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Golang微服务消息队列与事件驱动设计下一篇：当一个Golang函数可能返回多种不同类型的错误时如何设计接口

作者最新文章

拳皇97怎么无限连招_拳皇97新手连招表与操作教程

2026-01-12 19:34

微博网页版最新访问地址微博网页版主页安全直达入口

2026-01-12 19:34

steam官网在线登录入口 steam网页端官方页面直达通道

2026-01-12 19:35

春节期间学生还能用学生票吗_铁路12306寒假学生票使用时间与规定

2026-01-12 19:35

个人所得税专项附加扣除怎么填报_七项专项附加扣-除填报指南

2026-01-12 19:36

红果短剧网页版首页入口红果短剧在线短剧快速进入方法

2026-01-12 19:36

一斤等于多少两_斤与两的重量单位换算

2026-01-12 19:37

螃蟹交易平台网页版入口螃蟹交易平台官网账号安全登录方法

2026-01-12 19:37

百度地图怎么查找附近的充电桩_新能源汽车充电地图

2026-01-12 19:38

谷歌邮箱网页版登录直达谷歌邮箱网页版快速访问方法

2026-01-12 19:38

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

golang如何定义变量

golang定义变量的方法：1、声明变量并赋予初始值“var age int =值”；2、声明变量但不赋初始值“var age int”；3、使用短变量声明“age :=值”等等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

178

2024.02.23

golang有哪些数据转换方法

golang数据转换方法：1、类型转换操作符；2、类型断言；3、字符串和数字之间的转换；4、JSON序列化和反序列化；5、使用标准库进行数据转换；6、使用第三方库进行数据转换；7、自定义数据转换函数。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

226

2024.02.23

golang常用库有哪些

golang常用库有：1、标准库；2、字符串处理库；3、网络库；4、加密库；5、压缩库；6、xml和json解析库；7、日期和时间库；8、数据库操作库；9、文件操作库；10、图像处理库。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

337

2024.02.23

golang和python的区别是什么

golang和python的区别是：1、golang是一种编译型语言，而python是一种解释型语言；2、golang天生支持并发编程，而python对并发与并行的支持相对较弱等等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

208

2024.03.05

golang是免费的吗

golang是免费的。golang是google开发的一种静态强类型、编译型、并发型，并具有垃圾回收功能的开源编程语言，采用bsd开源协议。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

388

2024.05.21

golang结构体相关大全

本专题整合了golang结构体相关大全，想了解更多内容，请阅读专题下面的文章。

194

2025.06.09

golang相关判断方法

本专题整合了golang相关判断方法，想了解更详细的相关内容，请阅读下面的文章。

189

2025.06.10

golang数组使用方法

本专题整合了golang数组用法，想了解更多的相关内容，请阅读专题下面的文章。

192

2025.06.17

Java 项目构建与依赖管理（Maven / Gradle）

本专题系统讲解 Java 项目构建与依赖管理的完整体系，重点覆盖 Maven 与 Gradle 的核心概念、项目生命周期、依赖冲突解决、多模块项目管理、构建加速与版本发布规范。通过真实项目结构示例，帮助学习者掌握从零搭建、维护到发布 Java 工程的标准化流程，提升在实际团队开发中的工程能力与协作效率。

2026.01.12

热门下载

网站特效

网站源码

网站素材

前端模板