0

0

Golang如何高效读取大文件内容

P粉602998670

P粉602998670

发布时间:2026-01-06 15:58:02

|

400人浏览过

|

来源于php中文网

原创

bufio.Scanner默认64KB缓冲区遇超长行报错,需调用scanner.Buffer扩容;大文件禁用ReadFile,应依场景选Scanner、Reader或流式解析器;Reader.Read须检查io.EOF;mmap跨平台差且未必更快;顺序读勿滥用O_DIRECT。

golang如何高效读取大文件内容

bufio.Scanner 逐行读取时内存不爆但容易丢数据

默认情况下 bufio.Scanner 的缓冲区只有 64KB,遇到超长行(比如单行 JSON、日志中带大段 base64)会直接报错 scanner: token too long。这不是性能问题,是安全限制,但很多人误以为是“读得慢”。

解决方法是手动扩容缓冲区:

scanner := bufio.NewScanner(file)
buf := make([]byte, 0, 64*1024) // 初始 64KB,动态增长
scanner.Buffer(buf, 10*1024*1024) // 最大允许 10MB 行长

注意第二参数不能设为 math.MaxInt32 —— 某些系统调用会因过大的值返回 EINVAL

真正的大文件(GB 级)别用 ioutil.ReadFileos.ReadFile

这两个函数会把整个文件一次性加载进内存,哪怕文件只有 500MB,也极可能触发 OOM 或让 GC 压力陡增。Golang 进程 RSS 突然飙高、卡顿几秒,往往就是这个原因。

立即学习go语言免费学习笔记(深入)”;

替代方案取决于你要做什么:

  • 只统计行数或简单匹配?用 bufio.Scanner + 自定义分隔符
  • 需要随机访问某几行?先用 bufio.Reader 配合 Seek 定位,再读小块
  • 要解析 CSV/JSONL?用流式解析器(如 encoding/csvcsv.NewReader,或 jsonl 包)

bufio.Reader.Read 手动控制读取粒度更灵活但易出错

当 Scanner 不够用(比如按固定字节块处理、跳过 BOM、处理粘包式二进制格式),就得退到 bufio.Reader。它的 Read 方法返回实际读到的字节数,必须检查 err == io.EOF 而非仅靠返回长度判断结束。

极品模板多语言企业网站管理系统1.2.2
极品模板多语言企业网站管理系统1.2.2

【极品模板】出品的一款功能强大、安全性高、调用简单、扩展灵活的响应式多语言企业网站管理系统。 产品主要功能如下: 01、支持多语言扩展(独立内容表,可一键复制中文版数据) 02、支持一键修改后台路径; 03、杜绝常见弱口令,内置多种参数过滤、有效防范常见XSS; 04、支持文件分片上传功能,实现大文件轻松上传; 05、支持一键获取微信公众号文章(保存文章的图片到本地服务器); 06、支持一键

下载

常见错误写法:

for {
    n, err := reader.Read(buf)
    if n == 0 { break } // ❌ 错!n==0 不代表结束,可能是临时阻塞或空行
    // ...
}

正确写法:

for {
    n, err := reader.Read(buf)
    if n > 0 {
        // 处理 buf[:n]
    }
    if err == io.EOF {
        break
    }
    if err != nil {
        // 处理其他错误(如 io.ErrUnexpectedEOF)
        break
    }
}

Linux 下用 mmap 不一定更快,且跨平台差

有人会想到用 golang.org/x/sys/unix.Mmap 做内存映射。它在某些场景(如反复随机读同一块大文件)确实减少拷贝,但代价明显:

  • Windows 不支持,syscall.Mmap 在 Windows 上行为不同
  • 映射后仍需手动管理 Munmap,漏掉会导致资源泄漏
  • 对 SSD 友好,但对 NFS 或 FUSE 文件系统可能反而变慢
  • Go 的 GC 不感知 mmap 内存,可能导致 RSS 报告失真

除非你明确压测对比过,并确认瓶颈真在内核拷贝而非业务逻辑,否则优先用 bufio + 合理 buffer size。

最常被忽略的一点:文件打开时的 flag。如果只是顺序读,加上 os.O_RDONLY | syscall.O_DIRECT(Linux)或 syscall.FILE_FLAG_NO_BUFFERING(Windows)看似能绕过 page cache,但实际会显著降低吞吐——因为失去了预读和合并 IO 的优势。普通场景老老实实用默认打开方式就行。

相关专题

更多
golang如何定义变量
golang如何定义变量

golang定义变量的方法:1、声明变量并赋予初始值“var age int =值”;2、声明变量但不赋初始值“var age int”;3、使用短变量声明“age :=值”等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

177

2024.02.23

golang有哪些数据转换方法
golang有哪些数据转换方法

golang数据转换方法:1、类型转换操作符;2、类型断言;3、字符串和数字之间的转换;4、JSON序列化和反序列化;5、使用标准库进行数据转换;6、使用第三方库进行数据转换;7、自定义数据转换函数。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

226

2024.02.23

golang常用库有哪些
golang常用库有哪些

golang常用库有:1、标准库;2、字符串处理库;3、网络库;4、加密库;5、压缩库;6、xml和json解析库;7、日期和时间库;8、数据库操作库;9、文件操作库;10、图像处理库。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

336

2024.02.23

golang和python的区别是什么
golang和python的区别是什么

golang和python的区别是:1、golang是一种编译型语言,而python是一种解释型语言;2、golang天生支持并发编程,而python对并发与并行的支持相对较弱等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

208

2024.03.05

golang是免费的吗
golang是免费的吗

golang是免费的。golang是google开发的一种静态强类型、编译型、并发型,并具有垃圾回收功能的开源编程语言,采用bsd开源协议。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

388

2024.05.21

golang结构体相关大全
golang结构体相关大全

本专题整合了golang结构体相关大全,想了解更多内容,请阅读专题下面的文章。

194

2025.06.09

golang相关判断方法
golang相关判断方法

本专题整合了golang相关判断方法,想了解更详细的相关内容,请阅读下面的文章。

189

2025.06.10

golang数组使用方法
golang数组使用方法

本专题整合了golang数组用法,想了解更多的相关内容,请阅读专题下面的文章。

191

2025.06.17

PPT动态图表制作教程大全
PPT动态图表制作教程大全

本专题整合了PPT动态图表制作相关教程,阅读专题下面的文章了解更多详细内容。

13

2026.01.07

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PostgreSQL 教程
PostgreSQL 教程

共48课时 | 6.7万人学习

Git 教程
Git 教程

共21课时 | 2.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号