使用 bufio.Scanner 和 bufio.Reader 可高效读取大文件。推荐通过 bufio.NewScanner 配合 os.File 逐行读取,自动处理换行符;对超大文件,应设置合理缓冲区大小(如64KB)以平衡内存与性能;可通过 scanner.Split 自定义分隔符,支持空字符或单词分割等场景;避免使用已弃用的 ReadLine 方法,优先用 strings.Builder 减少拼接开销,并结合 bufio.Writer 提升写入效率。

在Go语言中,bufio 包是处理文件I/O操作时提升性能的关键工具。当需要读取大文本文件时,直接使用 os.File 的 Read 方法效率较低,而通过 bufio.Reader 可以显著减少系统调用次数,提高读取速度。本文将介绍如何使用 bufio 高效读取文本文件,并提供实用代码示例。
使用 bufio.Reader 逐行读取大文件
对于日志文件、CSV数据等按行组织的文本内容,最常见的方式是逐行读取。使用 bufio.Reader 的 ReadString 或 ReadLine 方法可以高效完成该任务。
推荐使用 ReadString('\n') 结合 strings.TrimSuffix 去除换行符,代码简洁且稳定。
Reader.ReadLine() 方法。
示例如下:
立即学习“go语言免费学习笔记(深入)”;
package main
import (
"bufio"
"fmt"
"os"
"strings"
)
func readLines(filename string) error {
file, err := os.Open(filename)
if err != nil {
return err
}
defer file.Close()
scanner := bufio.NewScanner(file)
for scanner.Scan() {
line := scanner.Text() // 自动去除换行符
fmt.Println(line)
}
return scanner.Err()
}
上面的例子使用了 bufio.Scanner,它内部封装了 bufio.Reader,更适合大多数逐行读取场景。
处理超大文件:控制内存与性能平衡
当文件非常大(如数GB)时,需避免一次性加载到内存。使用 bufio.Reader 配合固定大小缓冲区可有效控制内存占用。
关键点:
- 创建
bufio.Reader时指定缓冲区大小(如4096或65536字节) - 使用
scanner.Split(bufio.ScanWords)可按单词切分,适用于词频统计等场景 - 自定义分割函数支持更复杂的解析逻辑
示例:设置64KB缓冲区读取文件
reader := bufio.NewReaderSize(file, 64*1024) scanner := bufio.NewScanner(reader)
自定义分隔符与高级解析场景
默认情况下,Scanner 按行分割。但可通过 Split 方法更换分隔策略。
例如,读取以空字符(\x00)分隔的记录:
scanner.Split(func(data []byte, atEOF bool) (advance int, token []byte, err error) {
if i := bytes.IndexByte(data, '\x00'); i >= 0 {
return i + 1, data[0:i], nil
}
if atEOF && len(data) > 0 {
return len(data), data, nil
}
return 0, nil, nil
})
这种机制适用于解析二进制混合文本、自定义格式日志等特殊需求。
性能建议与常见陷阱
为了最大化读取效率,请遵循以下实践:
- 始终使用
defer file.Close()确保资源释放 - 对频繁读取的大文件,缓冲区大小设为页大小倍数(如4KB、64KB)更高效
- 避免在循环中进行大量字符串拼接,考虑使用
strings.Builder - 若需写入文件,搭配
bufio.Writer批量输出 - 遇到编码问题时,可结合
golang.org/x/text处理非UTF-8文本
基本上就这些。合理使用 bufio 能让文本处理程序既快速又节省资源。掌握 Scanner 和 Reader 的配合使用,足以应对绝大多数文件读取任务。










