猿问

java处理比较大的xml文件

如题,我用java需要处理一个300多M的xml文件。这个文件的核心结构如下:

然后现在我需要做的就是找到相当<sha1>内容的两个revision标签(如示例中的id为111和119的两个revision),然后将其中间的(包括最后一个119)revision全部删除.(按例子xml来说,最后就只剩一个id为111的revision)
下面是我用java写的核心算法:
https://img.mukewang.com/5cb6d8eb0001f07b07850302.jpg

其中sha跟revision都是arraylist的数组,sha存的是所有sha1标签的内容,revision存的是所有revision的内容。因为是一一对应的,所以我直接用的一个三层的循环来实现(前两层是寻找有相同sha1内容的,第三个循环则是删除这两个标签的之间的revision标签)。。

这个算法在处理一部分的测试xml时是没问题的,可是一旦用于测试300多M的那个源文件时会出现这样的错误:
https://img.mukewang.com/5cb6d8f00001c82807310074.jpg

我查了一些网上的说法,也调整了虚拟机的最大内存,但是依然会出现这样的错误。应该是我算法本身复杂度就比较高吧,但是我也没想到其他比较合适的处理思路了。求各位大神指教下orz


慕仙森
浏览 751回答 1
1回答
随时随地看视频慕课网APP

相关分类

Java
我要回答