使用 Java 从文本文件中提取所有单词

心靈之曲

发布时间：2025-09-11 22:31:01

949人浏览过

来源于php中文网

原创

使用 java 从文本文件中提取所有单词

本文旨在解决使用 StringTokenizer 读取文本文件时跳过第一行的问题，并提供一种更现代、更强大的方法来从文本文件中提取所有单词。我们将探讨如何使用 BufferedReader 和 BreakIterator 类，结合 Java 8 的 Stream API，高效地实现这一目标，并提供详细的代码示例和注意事项。

在使用 BufferedReader 读取文件时，如果发现第一行被跳过，通常是因为在循环开始前已经调用了一次 reader.readLine() 方法。例如，以下代码片段：

BufferedReader reader = new BufferedReader(new FileReader("C://Java-projects//EsameJava//prova.txt"));
String line = reader.readLine(); // 第一次读取
List str = new ArrayList<>();

while ((line = reader.readLine()) != null) { // 从第二次读取开始
    StringTokenizer token = new StringTokenizer(line); 

    while (token.hasMoreTokens()) {
        str.add(token.nextToken());
    }
}

这段代码在进入 while 循环之前，已经使用 reader.readLine() 读取了文件的第一行，并将结果存储在 line 变量中，但并未对其进行处理，导致第一行被忽略。

要解决这个问题，一种简单的方法是移除循环前的 reader.readLine() 调用。但是，StringTokenizer 本身在处理复杂的文本时存在一些局限性，例如难以处理标点符号和多种语言的单词分割。

立即学习“Java免费学习笔记（深入）”；

因此，更推荐使用 BreakIterator 类来更准确地提取单词，并结合 Java 8 的 Stream API 来简化代码：

名品购物网店系统

适合品牌专卖店专用，从前台的美工设计就开始强调视觉形象，有助于提升商品的档次，打造网店品牌!后台及程序核心比较简洁，着重在线购物，去掉了繁琐的代码及垃圾程式，在结构上更适合一些中高档的时尚品牌商品展示. 率先引入语言包机制，可在1小时内制作出任何语言版本，程序所有应用文字皆引自LANG目录下的语言包文件，独特的套图更换功能，三级物品分类，购物车帖心设计，在国内率先将购物车与商品显示页面完美结合，完

下载

import java.text.BreakIterator;
import java.util.ArrayList;
import java.util.List;
import java.util.stream.Stream;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.io.IOException;

public class WordCollector {

    public static void main(String[] args) {
        try {
            List words = WordCollector.getWords(Files.lines(Paths.get(args[0])));
            System.out.println(words);
        } catch (IOException e) {
            e.printStackTrace();
        }
    }

    public static List getWords(Stream lines) {
        List result = new ArrayList<>();
        BreakIterator boundary = BreakIterator.getWordInstance();
        lines.forEach(line -> {
            boundary.setText(line);

            int start = boundary.first();
            for (int end = boundary.next(); end != BreakIterator.DONE; start = end, end = boundary.next()) {
                String candidate = line.substring(start, end).replaceAll("\\p{Punct}", "").trim();
                if (candidate.length() > 0) {
                    result.add(candidate);
                }
            }
        });
        return result;
    }
}

代码解释:

导入必要的类: 导入 BreakIterator, ArrayList, List, Stream, Files, Paths 和 IOException。
main 方法: 接收文件路径作为命令行参数，使用 Files.lines() 读取文件内容，然后调用 getWords() 方法提取单词，最后打印结果。使用 try-catch 块处理 IOException。
getWords 方法:
- 创建一个 ArrayList 来存储提取的单词。
- 使用 BreakIterator.getWordInstance() 获取一个用于单词分割的 BreakIterator 实例。
- 使用 lines.forEach() 遍历文件的每一行。
- 对于每一行，使用 boundary.setText(line) 设置 BreakIterator 的文本。
- 使用 boundary.first() 获取第一个单词的起始位置。
- 使用一个循环来迭代所有单词，循环条件是 end != BreakIterator.DONE。
- 在循环中，使用 line.substring(start, end) 提取单词。
- 使用 replaceAll("\\p{Punct}", "") 移除标点符号。
- 使用 trim() 移除首尾空格。
- 如果提取的单词长度大于 0，则将其添加到 result 列表中。
- 最后，返回 result 列表。

使用方法:

将代码保存为 WordCollector.java。
使用 javac WordCollector.java 编译代码。
使用 java WordCollector 运行代码，其中是要读取的文本文件的路径。

注意事项:

确保文件路径正确。
BreakIterator 类可以处理多种语言的单词分割，但可能需要根据具体情况进行配置。
replaceAll("\\p{Punct}", "") 用于移除所有标点符号。如果需要保留某些标点符号，可以修改正则表达式。
此方法使用了 Java 8 的 Stream API，需要 Java 8 或更高版本才能运行。

总结:

通过使用 BreakIterator 类和 Java 8 的 Stream API，我们可以更有效地从文本文件中提取单词，并避免 StringTokenizer 的一些局限性。这种方法更灵活、更强大，并且可以更好地处理复杂的文本数据。同时也解决了BufferedReader读取文件时跳过第一行的问题。

解决Docx4J 3.3.3处理Word文档出现“内容不可读”错误的方案

解决Docx4J 3.3.3生成Word文档的“不可读内容”错误：源码修补指南

解决Docx4J v3.3.3生成Word文档的“内容不可读”错误

Docx4j PDF转换中页眉页脚临时图片残留问题解析与规避

将 Docx4j 文档转换为 PDF 时如何处理临时图片文件