「java大数据集比较大小」java 比较大小

admin 2023-01-12 00:15:11 773

今天给各位分享java大数据集比较大小的知识，其中也会对java 比较大小进行解释，如果能碰巧解决你现在面临的问题，别忘了关注本站，现在开始吧！

本文目录一览：

1、如何用java程序对一个大数据集进行排序,排序后再进行组合，在排序，找出最大与最小值? 谢谢
2、如何调整java虚拟机内存大小
3、Java和Java大数据有哪些区别？零基础能学习Java大数据吗？
4、什么是java大数据
5、java遍历大数据量比较一个内容，怎样写效率会快点
6、java与大数据分析有关系吗？如果有，是什么关系呢？如果没有，那能链接上关系吗？

如何用java程序对一个大数据集进行排序,排序后再进行组合，在排序，找出最大与最小值? 谢谢

1、数据库排序：将数据存入数据库，利用数据库进行索引排序后再取出数据

2、分段排序：规定一个内存大小，据此对数据集进行分段，每次取一部分进行排序

如何调整java虚拟机内存大小

在一些规模稍大的应用中，Java虚拟机（JVM）的内存设置尤为重要，想在项目中取得好的效率，GC（垃圾回收）的设置是第一步。

PermGen space：全称是Permanent Generation space.就是说是永久保存的区域,用于存放Class和Meta信息,Class在被Load的时候被放入该区域Heap space：存放Instance。

GC(Garbage Collection)应该不会对PermGen space进行清理,所以如果你的APP会LOAD很多CLASS的话,就很可能出现PermGen space错误

Java Heap分为3个区

1.Young

2.Old

3.Permanent

Young保存刚实例化的对象。当该区被填满时，GC会将对象移到Old区。Permanent区则负责保存反射对象，本文不讨论该区。

JVM的Heap分配可以使用-X参数设定，

-Xms

初始Heap大小

-Xmx

java heap最大值

-Xmn

young generation的heap大小

JVM有2个GC线程

第一个线程负责回收Heap的Young区

第二个线程在Heap不足时，遍历Heap，将Young 区升级为Older区

Older区的大小等于-Xmx减去-Xmn，不能将-Xms的值设的过大，因为第二个线程被迫运行会降低JVM的性能。

为什么一些程序频繁发生GC？

有如下原因：

1.程序内调用了System.gc()或Runtime.gc()。

2.一些中间件软件调用自己的GC方法，此时需要设置参数禁止这些GC。

3.Java的Heap太小，一般默认的Heap值都很小。

4.频繁实例化对象，Release对象此时尽量保存并重用对象，例如使用StringBuffer()和String()。

如果你发现每次GC后，Heap的剩余空间会是总空间的50%，这表示你的Heap处于健康状态,许多Server端的Java程序每次GC后最好能有65%的剩余空间

经验之谈：

1．Server端JVM最好将-Xms和-Xmx设为相同值。为了优化GC，最好让-Xmn值约等于-Xmx的1/3。

2．一个GUI程序最好是每10到20秒间运行一次GC，每次在半秒之内完成。

注意：

1．增加Heap的大小虽然会降低GC的频率，但也增加了每次GC的时间。并且GC运行时，所有的用户线程将暂停，也就是GC期间，Java应用程序不做任何工作。

2．Heap大小并不决定进程的内存使用量。进程的内存使用量要大于-Xmx定义的值，因为Java为其他任务分配内存，例如每个线程的Stack等。

Stack的设定

每个线程都有他自己的Stack。

-Xss

每个线程的Stack大小

Stack的大小限制着线程的数量。如果Stack过大就好导致内存溢漏。-Xss参数决定Stack大小，例如-Xss1024K。如果Stack太小，也会导致Stack溢漏。

硬件环境

硬件环境也影响GC的效率，例如机器的种类，内存，swap空间，和CPU的数量。

如果你的程序需要频繁创建很多transient对象，会导致JVM频繁GC。这种情况你可以增加机器的内存，来减少Swap空间的使用。

4种GC

1、第一种为单线程GC，也是默认的GC，该GC适用于单CPU机器。

2、第二种为Throughput GC，是多线程的GC，适用于多CPU，使用大量线程的程序。第二种GC与第一种GC相似，不同在于GC在收集Young区是多线程的，但在Old区和第一种一样，仍然采用单线程。-XX:+UseParallelGC参数启动该GC。

3、第三种为Concurrent Low Pause GC，类似于第一种，适用于多CPU，并要求缩短因GC造成程序停滞的时间。这种GC可以在Old区的回收同时，运行应用程序。-XX:+UseConcMarkSweepGC参数启动该GC。

4、第四种为Incremental Low Pause GC，适用于要求缩短因GC造成程序停滞的时间。这种GC可以在Young区回收的同时，回收一部分Old区对象。-Xincgc参数启动该GC。

单文件的JVM内存进行设置

默认的java虚拟机的大小比较小，在对大数据进行处理时java就会报错：java.lang.OutOfMemoryError。

设置jvm内存的方法，对于单独的.class，可以用下面的方法对Test运行时的jvm内存进行设置。

java -Xms64m -Xmx256m Test

-Xms是设置内存初始化的大小

-Xmx是设置最大能够使用内存的大小（最好不要超过物理内存大小）

tomcat启动jvm内存设置

Linux：

在/usr/local/apache-tomcat-5.5.23/bin目录下的catalina.sh添加：JAVA_OPTS='-Xms512m -Xmx1024m'要加“m”说明是MB，否则就是KB了，在启动tomcat时会报内存不足。

-Xms：初始值

-Xmx：最大值

-Xmn：最小值Windows

在catalina.bat最前面加入

set JAVA_OPTS=-Xms128m -Xmx350m 如果用startup.bat启动tomcat,OK设置生效.够成功的分配200M内存.但是如果不是执行startup.bat启动tomcat而是利用windows的系统服务启动tomcat服务,上面的设置就不生效了,就是说set JAVA_OPTS=-Xms128m -Xmx350m 没起作用.上面分配200M内存就OOM了..windows服务执行的是bin\tomcat.exe.他读取注册表中的值,而不是catalina.bat的设置.解决办法:

修改注册表HKEY_LOCAL_MACHINE\SOFTWARE\Apache Software Foundation\Tomcat Service Manager\Tomcat5\Parameters\JavaOptions

原值为

-Dcatalina.home="C:\ApacheGroup\Tomcat 5.0"

-Djava.endorsed.dirs="C:\ApacheGroup\Tomcat 5.0\common\endorsed"

-Xrs加入 -Xms300m -Xmx350m

重起tomcat服务,设置生效

weblogic启动jvm内存设置

在weblogic中，可以在startweblogic.cmd中对每个domain虚拟内存的大小进行设置，默认的设置是在commEnv.cmd里面。

JBoss

默认可以使用的内存为64MB

$JBOSSDIR$/bin/run.config

JAVA_OPTS = "-server -Xms128 -Xmx512"

Eclipse

在所在目录下，键入

eclipse.exe -vmargs -Xms256m -Xmx512m

256m表示JVM堆内存最小值

512m表示JVM堆内存最大

Websphere

进入控制台去设置：应用程序服务器 server1 进程定义 Java 虚拟机

Java和Java大数据有哪些区别？零基础能学习Java大数据吗？

单独提起Java或者大数据，很多人对此都略知一二，但对于Java大数据这样一个名词，多少有些疑惑。那Java和Java大数据学习的内容是一样的吗？两者有什么区别呢？今天就从Java和Java大数据的以下方面谈谈两者的区别。

一、Java和Java大数据有什么区别

Java和大数据的关系：

Java是计算机的一门编程语言；可以用来做很多工作，大数据开发属于其中一种；大数据属于互联网方向，就像现在建立在大数据基础上的AI方向一样，他两不是一个同类，但是属于包含和被包含的关系；

Java可以用来做大数据工作，大数据开发或者应用不必要用Java，可以Python，Scala，go语言等。

目前最火的大数据开发平台是Hadoop，而Hadoop则是采用java语言编写。一方面由于hadoop的历史原因，Hadoop的项目诞生于一个java高手；另一方面，也有Java跨平台方面的优势；基于这两个方面的原因，所以Hadoop采用了Java语言。但是也因为Hadoop使用了java所以就出现了“Java大数据”。

Java是我们耳熟能详的编程语言，大数据更是当今科技的明星技术。而java大数据则是java和大数据的结合产物，也可以说是java程序员向大数据程序员的过渡阶段。

二、Java和大数据课程区别

从课程方面来看，java和java大数据的区别：

1、Java学习课程：Java基础(Java面向对象，常用基础类，线程I/O，异常处理等)，javaWeb(HTML5，CSS3，javascript，jQuery，JDBC连接池，servlet等)，Java框架(Struts2，Hibernate5，JPA，Spring4，BootStrap，svn；git；Jenkins持续集成等)。

2、Java大数据学习课程：是在java课程的基础上加上了部分初级大数据的技术知识，就是让你在精通java之余，还能掌握一些大数据的技术知识。比如说亿级并发架构演进、Linux基础、搭建tomcat环境以及大数据开发云计算等高级Java教程，是Java技术的高端知识。

3、从以后的就业薪资待遇来看，Java和Java大数据的区别：

Java以后的就业方向单一，薪资就是java程序员的基本水平；java大数据工程师，以后的就业可以从事java方面的工作，也可以涉猎大数据方面的工作，因为对大数据技术知识有所涉猎，所以谈薪资的资本会高一些，但终究高不过大数据的薪资待遇。

Java开发薪资：

可以看到，Java薪资处在20K-30K的为普遍情况。

Java大数据薪资：

由于大数据产业的火爆，相关职位的待遇也是水涨船高。可以看到，大数据相关职位的平均薪资已经超过月薪28K。

三、Java和大数据职业发展区别

从以后的发展来看，Java和Java大数据的区别：

Java工程师的发展：初级java工程师、中级java工程师、高级java工程师；而java大数据工程师以后的发展，相比于java而言，多了一个大数据的方向，利于想向大数据工程师转型的学习者。

因为想要成为大数据工程师，需要一定的编程基础，而java语言又是现在大数据技术常用的开发语言，所以java大数据是向大数据学习的奠基课程。

综上所述，java大数据就是升级版的java，学习大数据一定要有Java基础。如果你是0基础，那么也可以从Java开始学习，逐渐做到大数据，薪资会更高。

昆明北大青鸟的Java大数据课程是从零基础开始讲授，先学Java基础，再学大数据基础，五个月让你掌握企业最需要的前沿技术，高薪就业。当然现在填写下面的表单还可以申请昆明北大青鸟Java或者Java大数据的免费试听课程。

什么是java大数据

大数据（big data），是指无法在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。

java遍历大数据量比较一个内容，怎样写效率会快点

深圳远标有大数据的，现在的社会是一个高速发展的社会，科技发达，信息流通，人们之间的交流越来越密切，生活也越来越方便，大数据就是这个高科技时代的产物.在现今的社会，大数据的应用越来越彰显他的优势，它占领的领域也越来越大，电子商务、O2O、物流配送等，各种利用大数据进行发展的领域正在协助企业不断地发展新业务，创新运营模式。有了大数据这个概念，对于消费者行为的判断，产品销售量的预测，精确的营销范围以及存货的补给已经得到全面的改善与优化。

“大数据”在互联网行业指的是这样一种现象：互联网公司在日常运营中生成、累积的用户网络行为数据。这些数据的规模是如此庞大，以至于不能用G或T来衡量。

java与大数据分析有关系吗？如果有，是什么关系呢？如果没有，那能链接上关系吗？

众所周知，java在处理数据量比较大的时候，加载到内存必然会导致内存溢出，而在一些数据处理中我们不得不去处理海量数据，在做数据处理中，我们常见的手段是分解，压缩，并行，临时文件等方法；

例如，我们要将数据库（不论是什么数据库）的数据导出到一个文件，一般是Excel

或文本格式的CSV；对于Excel来讲，对于POI和JXL的接口，你很多时候没有办法去控制内存什么时候向磁盘写入，很恶心，而且这些API在内存构

造的对象大小将比数据原有的大小要大很多倍数，所以你不得不去拆分Excel，还好，POI开始意识到这个问题，在3.8.4的版本后，开始提供

cache的行数，提供了SXSSFWorkbook的接口，可以设置在内存中的行数，不过可惜的是，他当你超过这个行数，每添加一行，它就将相对行数前

面的一行写入磁盘（如你设置2000行的话，当你写第20001行的时候，他会将第一行写入磁盘），其实这个时候他些的临时文件，以至于不消耗内存，不过

这样你会发现，刷磁盘的频率会非常高，我们的确不想这样，因为我们想让他达到一个范围一次性将数据刷如磁盘，比如一次刷1M之类的做法，可惜现在还没有这

种API，很痛苦，我自己做过测试，通过写小的Excel比使用目前提供刷磁盘的API来写大文件，效率要高一些，而且这样如果访问的人稍微多一些磁盘

IO可能会扛不住，因为IO资源是非常有限的，所以还是拆文件才是上策；而当我们写CSV，也就是文本类型的文件，我们很多时候是可以自己控制的，不过你

不要用CSV自己提供的API，也是不太可控的，CSV本身就是文本文件，你按照文本格式写入即可被CSV识别出来；如何写入呢？下面来说说。。。

在处理数据层面，如从数据库中读取数据，生成本地文件，写代码为了方便，我们未必要

1M怎么来处理，这个交给底层的驱动程序去拆分，对于我们的程序来讲我们认为它是连续写即可；我们比如想将一个1000W数据的数据库表，导出到文件；此

时，你要么进行分页，oracle当然用三层包装即可，mysql用limit，不过分页每次都会新的查询，而且随着翻页，会越来越慢，其实我们想拿到一

个句柄，然后向下游动，编译一部分数据（如10000行）将写文件一次（写文件细节不多说了，这个是最基本的），需要注意的时候每次buffer的数据，

在用outputstream写入的时候，最好flush一下，将缓冲区清空下；接下来，执行一个没有where条件的SQL，会不会将内存撑爆？是的，这个问题我们值得去思考下，通过API发现可以对SQL进行一些操作，例如，通过：PreparedStatement

statement =

connection.prepareStatement(sql)，这是默认得到的预编译，还可以通过设置：PreparedStatement

statement = connection.prepareStatement(sql ,

ResultSet.TYPE_FORWARD_ONLY ,

ResultSet.CONCUR_READ_ONLY);

来设置游标的方式，以至于游标不是将数据直接cache到本地内存，然后通过设置statement.setFetchSize(200);设置游标每次遍历的大小；OK，这个其实我用过，oracle用了和没用没区别，因为oracle的jdbc

API默认就是不会将数据cache到java的内存中的，而mysql里头设置根本无效，我上面说了一堆废话，呵呵，

我只是想说，java提供的标准API也未必有效，很多时候要看厂商的实现机制，还有这个设置是很多网上说有效的，但是这纯属抄袭；对于oracle上面

说了不用关心，他本身就不是cache到内存，所以java内存不会导致什么问题，如果是mysql，首先必须使用5以上的版本，然后在连接参数上加上

useCursorFetch=true这个参数，至于游标大小可以通过连接参数上加上：defaultFetchSize=1000来设置，例如：

jdbc:mysql://xxx.xxx.xxx.xxx:3306/abc?zeroDateTimeBehavior=convertToNulluseCursorFetch=truedefaultFetchSize=1000

上次被这个问题纠结了很久（mysql的数据老导致程序内存膨胀，并行2个直接系统

就宕了），还去看了很多源码才发现奇迹竟然在这里，最后经过mysql文档的确认，然后进行测试，并行多个，而且数据量都是500W以上的，都不会导致内

存膨胀，GC一切正常，这个问题终于完结了。

我们再聊聊其他的，数据拆分和合并，当数据文件多的时候我们想合并，当文件太大想要

拆分，合并和拆分的过程也会遇到类似的问题，还好，这个在我们可控制的范围内，如果文件中的数据最终是可以组织的，那么在拆分和合并的时候，此时就不要按

照数据逻辑行数来做了，因为行数最终你需要解释数据本身来判定，但是只是做拆分是没有必要的，你需要的是做二进制处理，在这个二进制处理过程，你要注意

了，和平时read文件不要使用一样的方式，平时大多对一个文件读取只是用一次read操作，如果对于大文件内存肯定直接挂掉了，不用多说，你此时因该每

次读取一个可控范围的数据，read方法提供了重载的offset和length的范围，这个在循环过程中自己可以计算出来，写入大文件和上面一样，不要

读取到一定程序就要通过写入流flush到磁盘；其实对于小数据量的处理在现代的NIO技术的中也有用到，例如多个终端同时请求一个大文件下载，例如视频

下载吧，在常规的情况下，如果用java的容器来处理，一般会发生两种情况：

其一为内存溢出，因为每个请求都要加载一个文件大小的内存甚至于更多，因为java

包装的时候会产生很多其他的内存开销，如果使用二进制会产生得少一些，而且在经过输入输出流的过程中还会经历几次内存拷贝，当然如果有你类似nginx之

类的中间件，那么你可以通过send_file模式发送出去，但是如果你要用程序来处理的时候，内存除非你足够大，但是java内存再大也会有GC的时

候，如果你内存真的很大，GC的时候死定了，当然这个地方也可以考虑自己通过直接内存的调用和释放来实现，不过要求剩余的物理内存也足够大才行，那么足够

大是多大呢？这个不好说，要看文件本身的大小和访问的频率；

其二为假如内存足够大，无限制大，那么此时的限制就是线程，传统的IO模型是线程是

一个请求一个线程，这个线程从主线程从线程池中分配后，就开始工作，经过你的Context包装、Filter、拦截器、业务代码各个层次和业务逻辑、访

问数据库、访问文件、渲染结果等等，其实整个过程线程都是被挂住的，所以这部分资源非常有限，而且如果是大文件操作是属于IO密集型的操作，大量的CPU

时间是空余的，方法最直接当然是增加线程数来控制，当然内存足够大也有足够的空间来申请线程池，不过一般来讲一个进程的线程池一般会受到限制也不建议太多

的，而在有限的系统资源下，要提高性能，我们开始有了new

IO技术，也就是NIO技术，新版的里面又有了AIO技术，NIO只能算是异步IO，但是在中间读写过程仍然是阻塞的（也就是在真正的读写过程，但是不会

去关心中途的响应），还未做到真正的异步IO，在监听connect的时候他是不需要很多线程参与的，有单独的线程去处理，连接也又传统的socket变

成了selector，对于不需要进行数据处理的是无需分配线程处理的；而AIO通过了一种所谓的回调注册来完成，当然还需要OS的支持，当会掉的时候会

去分配线程，目前还不是很成熟，性能最多和NIO吃平，不过随着技术发展，AIO必然会超越NIO，目前谷歌V8虚拟机引擎所驱动的node.js就是类

似的模式，有关这种技术不是本文的说明重点；

将上面两者结合起来就是要解决大文件，还要并行度，最土的方法是将文件每次请求的大

小降低到一定程度，如8K（这个大小是经过测试后网络传输较为适宜的大小，本地读取文件并不需要这么小），如果再做深入一些，可以做一定程度的

cache，将多个请求的一样的文件，cache在内存或分布式缓存中，你不用将整个文件cache在内存中，将近期使用的cache几秒左右即可，或你

可以采用一些热点的算法来配合；类似迅雷下载的断点传送中（不过迅雷的网络协议不太一样），它在处理下载数据的时候未必是连续的，只要最终能合并即可，在

服务器端可以反过来，谁正好需要这块的数据，就给它就可以；才用NIO后，可以支持很大的连接和并发，本地通过NIO做socket连接测试，100个终

端同时请求一个线程的服务器，正常的WEB应用是第一个文件没有发送完成，第二个请求要么等待，要么超时，要么直接拒绝得不到连接，改成NIO后此时

100个请求都能连接上服务器端，服务端只需要1个线程来处理数据就可以，将很多数据传递给这些连接请求资源，每次读取一部分数据传递出去，不过可以计算

的是，在总体长连接传输过程中总体效率并不会提升，只是相对相应和所开销的内存得到量化控制，这就是技术的魅力，也许不要太多的算法，不过你得懂他。

类似的数据处理还有很多，有些时候还会将就效率问题，比如在HBase的文件拆分和

合并过程中，要不影响线上业务是比较难的事情，很多问题值得我们去研究场景，因为不同的场景有不同的方法去解决，但是大同小异，明白思想和方法，明白内存

和体系架构，明白你所面临的是沈阳的场景，只是细节上改变可以带来惊人的效果。

关于java大数据集比较大小和java 比较大小的介绍到此就结束了，不知道你从中找到你需要的信息了吗？如果你还想了解更多这方面的信息，记得收藏关注本站。

标签：java大数据集比较大小