
本文旨在解决使用 StringTokenizer 读取文本文件时跳过第一行的问题,并提供一种更现代、更强大的方法来从文本文件中提取所有单词。我们将探讨如何使用 BufferedReader 和 BreakIterator 类,结合 Java 8 的 Stream API,高效地实现这一目标,并提供详细的代码示例和注意事项。
在使用 BufferedReader 读取文件时,如果发现第一行被跳过,通常是因为在循环开始前已经调用了一次 reader.readLine() 方法。例如,以下代码片段:
BufferedReader reader = new BufferedReader(new FileReader("C://Java-projects//EsameJava//prova.txt"));
String line = reader.readLine(); // 第一次读取
List<String> str = new ArrayList<>();
while ((line = reader.readLine()) != null) { // 从第二次读取开始
StringTokenizer token = new StringTokenizer(line);
while (token.hasMoreTokens()) {
str.add(token.nextToken());
}
}这段代码在进入 while 循环之前,已经使用 reader.readLine() 读取了文件的第一行,并将结果存储在 line 变量中,但并未对其进行处理,导致第一行被忽略。
要解决这个问题,一种简单的方法是移除循环前的 reader.readLine() 调用。但是,StringTokenizer 本身在处理复杂的文本时存在一些局限性,例如难以处理标点符号和多种语言的单词分割。
立即学习“Java免费学习笔记(深入)”;
因此,更推荐使用 BreakIterator 类来更准确地提取单词,并结合 Java 8 的 Stream API 来简化代码:
import java.text.BreakIterator;
import java.util.ArrayList;
import java.util.List;
import java.util.stream.Stream;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.io.IOException;
public class WordCollector {
public static void main(String[] args) {
try {
List<String> words = WordCollector.getWords(Files.lines(Paths.get(args[0])));
System.out.println(words);
} catch (IOException e) {
e.printStackTrace();
}
}
public static List<String> getWords(Stream<String> lines) {
List<String> result = new ArrayList<>();
BreakIterator boundary = BreakIterator.getWordInstance();
lines.forEach(line -> {
boundary.setText(line);
int start = boundary.first();
for (int end = boundary.next(); end != BreakIterator.DONE; start = end, end = boundary.next()) {
String candidate = line.substring(start, end).replaceAll("\p{Punct}", "").trim();
if (candidate.length() > 0) {
result.add(candidate);
}
}
});
return result;
}
}代码解释:
使用方法:
注意事项:
总结:
通过使用 BreakIterator 类和 Java 8 的 Stream API,我们可以更有效地从文本文件中提取单词,并避免 StringTokenizer 的一些局限性。 这种方法更灵活、更强大,并且可以更好地处理复杂的文本数据。 同时也解决了BufferedReader读取文件时跳过第一行的问题。
以上就是使用 Java 从文本文件中提取所有单词的详细内容,更多请关注php中文网其它相关文章!
每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。
Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号