
本文旨在解决使用 StringTokenizer 读取文本文件时跳过第一行的问题,并提供一种更现代、更强大的方法来从文本文件中提取所有单词。我们将探讨如何使用 BufferedReader 和 BreakIterator 类,结合 Java 8 的 Stream API,高效地实现这一目标,并提供详细的代码示例和注意事项。
在使用 BufferedReader 读取文件时,如果发现第一行被跳过,通常是因为在循环开始前已经调用了一次 reader.readLine() 方法。例如,以下代码片段:
BufferedReader reader = new BufferedReader(new FileReader("C://Java-projects//EsameJava//prova.txt"));
String line = reader.readLine(); // 第一次读取
List str = new ArrayList<>();
while ((line = reader.readLine()) != null) { // 从第二次读取开始
StringTokenizer token = new StringTokenizer(line);
while (token.hasMoreTokens()) {
str.add(token.nextToken());
}
} 这段代码在进入 while 循环之前,已经使用 reader.readLine() 读取了文件的第一行,并将结果存储在 line 变量中,但并未对其进行处理,导致第一行被忽略。
要解决这个问题,一种简单的方法是移除循环前的 reader.readLine() 调用。但是,StringTokenizer 本身在处理复杂的文本时存在一些局限性,例如难以处理标点符号和多种语言的单词分割。
立即学习“Java免费学习笔记(深入)”;
因此,更推荐使用 BreakIterator 类来更准确地提取单词,并结合 Java 8 的 Stream API 来简化代码:
import java.text.BreakIterator;
import java.util.ArrayList;
import java.util.List;
import java.util.stream.Stream;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.io.IOException;
public class WordCollector {
public static void main(String[] args) {
try {
List words = WordCollector.getWords(Files.lines(Paths.get(args[0])));
System.out.println(words);
} catch (IOException e) {
e.printStackTrace();
}
}
public static List getWords(Stream lines) {
List result = new ArrayList<>();
BreakIterator boundary = BreakIterator.getWordInstance();
lines.forEach(line -> {
boundary.setText(line);
int start = boundary.first();
for (int end = boundary.next(); end != BreakIterator.DONE; start = end, end = boundary.next()) {
String candidate = line.substring(start, end).replaceAll("\\p{Punct}", "").trim();
if (candidate.length() > 0) {
result.add(candidate);
}
}
});
return result;
}
} 代码解释:
- 导入必要的类: 导入 BreakIterator, ArrayList, List, Stream, Files, Paths 和 IOException。
- main 方法: 接收文件路径作为命令行参数,使用 Files.lines() 读取文件内容,然后调用 getWords() 方法提取单词,最后打印结果。 使用 try-catch 块处理 IOException。
-
getWords 方法:
- 创建一个 ArrayList 来存储提取的单词。
- 使用 BreakIterator.getWordInstance() 获取一个用于单词分割的 BreakIterator 实例。
- 使用 lines.forEach() 遍历文件的每一行。
- 对于每一行,使用 boundary.setText(line) 设置 BreakIterator 的文本。
- 使用 boundary.first() 获取第一个单词的起始位置。
- 使用一个循环来迭代所有单词,循环条件是 end != BreakIterator.DONE。
- 在循环中,使用 line.substring(start, end) 提取单词。
- 使用 replaceAll("\\p{Punct}", "") 移除标点符号。
- 使用 trim() 移除首尾空格。
- 如果提取的单词长度大于 0,则将其添加到 result 列表中。
- 最后,返回 result 列表。
使用方法:
- 将代码保存为 WordCollector.java。
- 使用 javac WordCollector.java 编译代码。
- 使用 java WordCollector
运行代码,其中 是要读取的文本文件的路径。
注意事项:
- 确保文件路径正确。
- BreakIterator 类可以处理多种语言的单词分割,但可能需要根据具体情况进行配置。
- replaceAll("\\p{Punct}", "") 用于移除所有标点符号。如果需要保留某些标点符号,可以修改正则表达式。
- 此方法使用了 Java 8 的 Stream API,需要 Java 8 或更高版本才能运行。
总结:
通过使用 BreakIterator 类和 Java 8 的 Stream API,我们可以更有效地从文本文件中提取单词,并避免 StringTokenizer 的一些局限性。 这种方法更灵活、更强大,并且可以更好地处理复杂的文本数据。 同时也解决了BufferedReader读取文件时跳过第一行的问题。










