首页 > Java > java教程 > 正文

使用 Java 从文本文件中提取所有单词

心靈之曲
发布: 2025-09-11 22:31:01
原创
940人浏览过

使用 java 从文本文件中提取所有单词

本文旨在解决使用 StringTokenizer 读取文本文件时跳过第一行的问题,并提供一种更现代、更强大的方法来从文本文件中提取所有单词。我们将探讨如何使用 BufferedReader 和 BreakIterator 类,结合 Java 8 的 Stream API,高效地实现这一目标,并提供详细的代码示例和注意事项。

在使用 BufferedReader 读取文件时,如果发现第一行被跳过,通常是因为在循环开始前已经调用了一次 reader.readLine() 方法。例如,以下代码片段:

BufferedReader reader = new BufferedReader(new FileReader("C://Java-projects//EsameJava//prova.txt"));
String line = reader.readLine(); // 第一次读取
List<String> str = new ArrayList<>();

while ((line = reader.readLine()) != null) { // 从第二次读取开始
    StringTokenizer token = new StringTokenizer(line); 

    while (token.hasMoreTokens()) {
        str.add(token.nextToken());
    }
}
登录后复制

这段代码在进入 while 循环之前,已经使用 reader.readLine() 读取了文件的第一行,并将结果存储在 line 变量中,但并未对其进行处理,导致第一行被忽略。

要解决这个问题,一种简单的方法是移除循环前的 reader.readLine() 调用。但是,StringTokenizer 本身在处理复杂的文本时存在一些局限性,例如难以处理标点符号和多种语言的单词分割。

立即学习Java免费学习笔记(深入)”;

因此,更推荐使用 BreakIterator 类来更准确地提取单词,并结合 Java 8 的 Stream API 来简化代码:

提客AI提词器
提客AI提词器

「直播、录课」智能AI提词,搭配抖音直播伴侣、腾讯会议、钉钉、飞书、录课等软件等任意软件。

提客AI提词器 64
查看详情 提客AI提词器
import java.text.BreakIterator;
import java.util.ArrayList;
import java.util.List;
import java.util.stream.Stream;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.io.IOException;

public class WordCollector {

    public static void main(String[] args) {
        try {
            List<String> words = WordCollector.getWords(Files.lines(Paths.get(args[0])));
            System.out.println(words);
        } catch (IOException e) {
            e.printStackTrace();
        }
    }

    public static List<String> getWords(Stream<String> lines) {
        List<String> result = new ArrayList<>();
        BreakIterator boundary = BreakIterator.getWordInstance();
        lines.forEach(line -> {
            boundary.setText(line);

            int start = boundary.first();
            for (int end = boundary.next(); end != BreakIterator.DONE; start = end, end = boundary.next()) {
                String candidate = line.substring(start, end).replaceAll("\p{Punct}", "").trim();
                if (candidate.length() > 0) {
                    result.add(candidate);
                }
            }
        });
        return result;
    }
}
登录后复制

代码解释:

  1. 导入必要的类: 导入 BreakIterator, ArrayList, List, Stream, Files, Paths 和 IOException。
  2. main 方法: 接收文件路径作为命令行参数,使用 Files.lines() 读取文件内容,然后调用 getWords() 方法提取单词,最后打印结果。 使用 try-catch 块处理 IOException。
  3. getWords 方法:
    • 创建一个 ArrayList 来存储提取的单词。
    • 使用 BreakIterator.getWordInstance() 获取一个用于单词分割的 BreakIterator 实例。
    • 使用 lines.forEach() 遍历文件的每一行。
    • 对于每一行,使用 boundary.setText(line) 设置 BreakIterator 的文本。
    • 使用 boundary.first() 获取第一个单词的起始位置。
    • 使用一个循环来迭代所有单词,循环条件是 end != BreakIterator.DONE。
    • 在循环中,使用 line.substring(start, end) 提取单词。
    • 使用 replaceAll("\p{Punct}", "") 移除标点符号。
    • 使用 trim() 移除首尾空格。
    • 如果提取的单词长度大于 0,则将其添加到 result 列表中。
    • 最后,返回 result 列表。

使用方法:

  1. 将代码保存为 WordCollector.java
  2. 使用 javac WordCollector.java 编译代码。
  3. 使用 java WordCollector <file_path> 运行代码,其中 <file_path> 是要读取的文本文件的路径。

注意事项:

  • 确保文件路径正确。
  • BreakIterator 类可以处理多种语言的单词分割,但可能需要根据具体情况进行配置。
  • replaceAll("\p{Punct}", "") 用于移除所有标点符号。如果需要保留某些标点符号,可以修改正则表达式
  • 此方法使用了 Java 8 的 Stream API,需要 Java 8 或更高版本才能运行。

总结:

通过使用 BreakIterator 类和 Java 8 的 Stream API,我们可以更有效地从文本文件中提取单词,并避免 StringTokenizer 的一些局限性。 这种方法更灵活、更强大,并且可以更好地处理复杂的文本数据。 同时也解决了BufferedReader读取文件时跳过第一行的问题。

以上就是使用 Java 从文本文件中提取所有单词的详细内容,更多请关注php中文网其它相关文章!

最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号