0

0

在Java中如何编写简单的文本统计程序_Java字符串处理项目解析

P粉602998670

P粉602998670

发布时间:2026-01-23 11:26:03

|

913人浏览过

|

来源于php中文网

原创

统计字符频次用HashMap遍历toCharArray()最稳妥,注意大小写和空白符处理;单词统计先清洗标点再split("\s+")并过滤空串;文件读取用Files.lines()防OOM,注意编码和路径;输出用stream排序+String.format对齐。

在java中如何编写简单的文本统计程序_java字符串处理项目解析

统计字符串中每个字符出现次数

直接用 HashMap 遍历字符是最稳妥的方式,避免用 String.charAt() 配合 String.indexOf() 这类低效组合。注意区分大小写和空白符——如果需求是“忽略大小写”,得先调用 toLowerCase();如果要跳过空格、换行等,需显式判断 Character.isWhitespace(c)

常见错误是把 char 当作 String 传给 put(),导致编译失败;或在循环里反复调用 map.get(c) == null 而不是用 getOrDefault(c, 0),多一次哈希查找。

Map count = new HashMap<>();
for (char c : text.toCharArray()) {
    if (Character.isWhitespace(c)) continue;
    count.put(c, count.getOrDefault(c, 0) + 1);
}

按单词统计频次(不依赖正则)

String.split("\\s+") 简单但有隐患:它无法处理标点粘连,比如 "hello,world" 会被当做一个词。更健壮的做法是用 StreamTokenizer 或手动扫描——但对简单项目,先用 replaceAll("[^a-zA-Z0-9\\s]", " ") 清洗再分割更直观。

注意 split(" ")split("\\s+")区别:前者只切空格,后者切所有空白符(包括制表、换行),且能自动合并连续空白;空字符串过滤必须加 .filter(s -> !s.isEmpty()),否则数组头尾可能有空项。

立即学习Java免费学习笔记(深入)”;

塔猫ChatPPT
塔猫ChatPPT

塔猫官网提供AI一键生成 PPT的智能工具,帮助您快速制作出专业的PPT。塔猫ChatPPT让您的PPT制作更加简单高效。

下载
String cleaned = text.replaceAll("[^a-zA-Z0-9\\s]", " ");
String[] words = cleaned.split("\\s+");
Map wordCount = new HashMap<>();
for (String w : words) {
    if (!w.isEmpty()) {
        wordCount.put(w.toLowerCase(), wordCount.getOrDefault(w.toLowerCase(), 0) + 1);
    }
}

读取文件并统计时的编码与异常处理

Files.readAllLines(path, StandardCharsets.UTF_8)FileReader 更安全,后者默认用系统编码,中文 Windows 下容易乱码。必须捕获 IOException,不能只写 throws 丢给上层——命令行工具没人接这个异常。

大文件别用 readAllLines(),会 OOM;改用 Files.lines(path) 返回 Stream,配合 try-with-resources 自动关闭。另外,路径含空格或中文时,确保传入的是 Path 对象而非裸字符串,避免 java.nio.file.InvalidPathException

  • Paths.get("data.txt")new File("data.txt").toPath() 更推荐
  • 统计前检查文件是否存在:Files.exists(path),避免 FileNotFoundException
  • 空文件要单独处理,lines.count() 为 0 时别直接进统计逻辑

输出结果时保留排序与格式对齐

Java 默认 HashMap 不保证顺序,想按频次降序输出得转成 LinkedHashMap 或用 stream().sorted()。别用 Collections.sort(list) 手动排序 list 再遍历 map——效率低还容易索引错位。

控制台对齐靠 String.format("%-15s %d", word, count),其中 %-15s 表示左对齐、占15字符宽;数字用 %6d 右对齐更清晰。如果导出 CSV,记得对字段中的逗号、换行做转义,否则 Excel 打开会错列。

wordCount.entrySet().stream()
    .sorted(Map.Entry.comparingByValue().reversed())
    .limit(10)
    .forEach(e -> System.out.println(String.format("%-20s %6d", e.getKey(), e.getValue())));
实际跑起来最常卡在文件编码和标点清洗这两步,尤其是测试用的文本从网页复制过来,藏着零宽空格或软连字符,length() 看着正常,split() 却分不出词。先用 text.codePoints().forEach(System.out::println) 打印码点,比猜快得多。

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

844

2023.06.15

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

742

2023.07.05

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

740

2023.07.31

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

397

2023.08.01

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

400

2023.08.02

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

446

2023.08.02

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

431

2023.08.02

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

16926

2023.08.03

C++ 高级模板编程与元编程
C++ 高级模板编程与元编程

本专题深入讲解 C++ 中的高级模板编程与元编程技术,涵盖模板特化、SFINAE、模板递归、类型萃取、编译时常量与计算、C++17 的折叠表达式与变长模板参数等。通过多个实际示例,帮助开发者掌握 如何利用 C++ 模板机制编写高效、可扩展的通用代码,并提升代码的灵活性与性能。

6

2026.01.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Excel 教程
Excel 教程

共162课时 | 13万人学习

成为PHP架构师-自制PHP框架
成为PHP架构师-自制PHP框架

共28课时 | 2.4万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号