论文部分内容阅读
随着下一代测序技术的到来,单机版Last比对软件已经不能满足海量数据的处理需求。使用HadoopStreaming技术将Last比对软件快速部署到云计算环境中,解决当前单机版Last比对软件处理大数据能力差的问题。通过自定义的基于NFS文件系统的数据集切分方法和基于Partitioner的任务分配方式能够实现均衡高效的教据切分,并保证并行化粒度可控。实验结果表明,在保证与单机运行结果一致的情况下,这种方法能有效缩减软件运行时间,具有较高的加速比。