0

0

解决JVM堆内存溢出:大数据量读取优化方案

聖光之護

聖光之護

发布时间:2025-07-10 19:38:01

|

351人浏览过

|

来源于php中文网

原创

解决jvm堆内存溢出:大数据量读取优化方案

本文旨在解决从数据库读取大量数据时遇到的JVM堆内存溢出问题。通过分析问题代码,我们将提供一种使用分页查询(LIMIT和OFFSET)的解决方案,以及相应的代码示例和注意事项,帮助开发者避免一次性加载大量数据,从而有效控制内存使用,提升系统稳定性。

在微服务架构中,处理大量数据迁移或归档任务时,一次性加载百万级甚至更多的数据记录很容易导致JVM堆内存溢出(Resource Exhaustion Event: the JVM was unable to allocate memory from the heap)。直接增加应用内存虽然可以暂时解决问题,但并非长久之计。更优的方案是采用分页查询,分批次处理数据,从而降低单次操作的内存消耗。

分页查询:LIMIT 和 OFFSET 的妙用

核心思想是将原本一次性读取所有数据的操作,分解为多次小批量读取。在SQL查询中,LIMIT 用于限制返回的记录数量,OFFSET 用于指定从哪条记录开始返回。

以下是一个简化的SQL示例:

企奶奶
企奶奶

一款专注于企业信息查询的智能大模型,企奶奶查企业,像聊天一样简单。

下载
SELECT *
FROM your_table
WHERE your_condition
ORDER BY your_order_column
LIMIT batch_size
OFFSET offset_value;
  • your_table: 你要查询的表名。
  • your_condition: 查询条件,例如 update_dts
  • your_order_column: 用于排序的列,确保每次获取的数据都是连续的,避免重复读取。推荐使用自增主键ID,或者能确保数据顺序的列。
  • batch_size: 每次读取的记录数,例如 1000。
  • offset_value: 偏移量,表示从第几条记录开始读取。

Java代码实现分页读取

结合上述SQL,我们可以将原有的archiveTableRecords方法进行改造,实现分页读取:

@Value("${batch-size}")
private int batchSize;

public void archiveTableRecords(JdbcTemplate sourceDbTemplate, JdbcTemplate targetDbTemplate,
    ArchiveConfigDTO archiveObj) {
    try {
        String sourceTable = archiveObj.getSourceTable();
        String archive_months = archiveObj.getArchiveCriteriaMonths();
        String compareDate1 = getCSTDateNew(archive_months);
        String primaryKeyColumn = archiveObj.getPrimaryKeyColumn();

        logger.info("Archive criteria date: {}", compareDate1);

        int offset = 0;
        List> sourceRecords;

        do {
            // 构建分页查询SQL
            String sql = buildSQLQueryToFetchSourceRecords(sourceTable, compareDate1, batchSize, offset, primaryKeyColumn);
            sourceRecords = sourceDbTemplate.queryForList(sql);
            int sourceRecordsSize = sourceRecords.size();
            logger.info("Fetched {} {} record(s) from offset {}", sourceRecordsSize, sourceTable, offset);

            if (sourceRecordsSize > 0) {
                List primaryKeyValueList = new ArrayList<>();
                int recordsInserted = copySourceRecords(targetDbTemplate, archiveObj.getTargetTable(),
                        primaryKeyColumn, sourceRecords, primaryKeyValueList);
                if (recordsInserted > 0) {
                    deleteSourceRecords(sourceDbTemplate, sourceTable, primaryKeyColumn,
                            primaryKeyValueList);
                }
                offset += sourceRecordsSize; // 更新偏移量
            }

        } while (!sourceRecords.isEmpty()); // 当没有更多数据时结束循环

    } catch (Exception e) {
        logger.error("Exception in archiveTableRecords: {} {}", e.getMessage(), e);
    }
}


public String buildSQLQueryToFetchSourceRecords(String sourceTable, String compareDate, int batchSize, int offset, String primaryKeyColumn) {
    StringBuilder sb = new StringBuilder("SELECT * FROM " + sourceTable + " where update_dts <= ? ORDER BY " + primaryKeyColumn + " LIMIT " + batchSize + " OFFSET " + offset);
    return sb.toString();
}

代码解释:

  1. batchSize: 通过@Value注解从配置文件中读取每次读取的记录数。建议根据实际情况调整。
  2. offset: 记录当前已经读取的记录数,用于计算下一次读取的偏移量。
  3. do...while 循环: 循环读取数据,直到没有更多数据为止。
  4. buildSQLQueryToFetchSourceRecords: 构建带分页参数的SQL查询语句。
  5. offset += sourceRecordsSize: 在每次成功读取一批数据后,更新偏移量。

注意事项

  • ORDER BY 子句: 务必包含ORDER BY子句,并选择合适的排序列,例如自增主键,确保每次读取的数据都是连续的,避免重复读取或遗漏数据。
  • batchSize 调整: batchSize 的大小会影响内存使用和性能。如果内存仍然溢出,可以减小 batchSize。如果性能较差,可以适当增加 batchSize。
  • 事务控制: 如果需要保证数据一致性,请确保将整个分页处理过程放在一个事务中。
  • 异常处理: 在循环中处理异常,例如数据插入失败等,避免整个流程中断。

总结

通过使用分页查询,我们可以有效地避免一次性加载大量数据导致的JVM堆内存溢出问题。这种方法不仅降低了内存消耗,还提高了系统的稳定性和可扩展性。在实际应用中,请根据数据量和系统资源合理调整batchSize,并结合事务控制和异常处理,确保数据迁移或归档的正确性和完整性。

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

835

2023.06.15

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

741

2023.07.05

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

736

2023.07.31

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

397

2023.08.01

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

399

2023.08.02

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

446

2023.08.02

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

430

2023.08.02

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

16926

2023.08.03

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

43

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
誉天教育RHCE视频教程
誉天教育RHCE视频教程

共9课时 | 1.4万人学习

尚观Linux RHCE视频教程(二)
尚观Linux RHCE视频教程(二)

共34课时 | 5.7万人学习

尚观RHCE视频教程(一)
尚观RHCE视频教程(一)

共28课时 | 4.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号