[转] 用SBT编译Spark的WordCount程序

问题导读：
1.什么是sbt？
2.sbt项目环境如何建立？
3.如何使用sbt编译打包scala?

【sbt介绍
sbt是一个代码编译工具，是scala界的mvn，可以编译scala，java等，需要java1.6以上。

sbt项目环境建立
sbt编译需要固定的目录格式，并且需要联网，sbt会将依赖的jar包下载到用户home的.ivy2下面，目录结构如下：

复制代码

以上建立目录如下：

然后拷贝spark安装目录的sbt目录的 sbt脚本和sbt的jar包

由于spark的sbt脚本默认查找./sbt目录，修改如下

拷贝spark的jar包到，sbt的lib目录

cp /path/to/spark/assembly/target/scala-2.10/spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar \
> ~/spark_wordcount/lib/

建立build.sbt配置文件,各行需要有一个空行分割

由于spark的sbt脚本需要到project的build.properties文件找sbt的版本号，我们建立该文件，增加如下内容：

Spark WordCount程序编写及编译
建立WordCount.scala源文件，假设需要包为spark.example

添加具体的程序代码，并保存

到spark_wordcount目录，执行编译：

打成jar包

编译过程，sbt需要上网下载依赖工具包，jna，scala等。编译完成后可以在target/scala-2.10/目录找到打包好的jar

WordCount执行
可以参考Spark分布式运行于hadoop的yarn上的方法，写一个执行脚本

#!/usr/bin/env bash
SPARK_JAR=./assembly/target/scala-2.10/spark-assembly_2.10-0.9.0-incubating-hadoop2.2.0.jar \
./bin/spark-class org.apache.spark.deploy.yarn.Client \
--jar ~/spark_wordcount/target/scala-2.10/wordcount_2.10-1.0.0.jar \
--class spark.example.WordCount \
--args yarn-standalone \
--args /testWordCount.txt \
--args /resultWordCount \
--num-workers 3 \
--master-memory 4g \
--worker-memory 2g \
--worker-cores 2

然后，拷贝一个名为testWordCount.txt的文件进hdfs

然后执行脚本，过一会就可以看到结果了

巴特西