linux

よく忘れるので備忘録

AWS

BODY:

EMRではSparkでファイルを開く際には*が使えるみたいだ 

こんな感じのBOWを数えるスクリプトを作成

s3にはgzで固められたファイルがたくさんある場合には

このような ...

AWS

SparkからHiveが使いづらいというか使えない?のでSparkSQLを使ってみました。

そこそこ試行錯誤する必要があったのでメモです。

データファイル

のフォーマットのファイルを用意しておきます。こんな感じ。 ...

AWS

emr-4.2.0をベースにAdvancedOptionでSpark1.5.2を追加しクラスターを作成しておきます

今回はPiをモンテカルロシミュレーションで計算するSpark付属のサンプルプログラムをちょっと改造して使用 ...

AWS, java

ポイントは2回InputStreamを作成することです。

docker, linux

dockerで今までうまくいっていたBuildが突然落ちるようになったりすることがあります

こういう時には一度キャッシュをクリーンすれば治ります

AWS

こんな感じでディレクトリ作成しますpom.xmlを作成しますeclipseで読み込めるようにしますJavaファイルはこんな感じ WordCountMain.javaWordCountMapper.javaWordCountReducer. ...

AWS

結構はまってしまったのでメモ

VPC内に作成したEMRでSparkを動かしました。サンプルはいろいろなところにそこそこあるのですが、どうもきちっと動くものがなく結構苦労してしまいました。

EMR

まずはVPC内に ...

AWS, R

AWSEMRとは、SparkやらHiveやらそれら一式を簡単に使える様にしてくれている仕組みです。

ぽちぽちっとEMRでサーバを作成。

この間10分程度

SparkRでサンプルデータを解析してみます ...

R

最近、Deeplearning、いいキーワードになっていますね。

これで解析さえすればバンバン売れる!なんて事は無いと思いますが、

Rで使い方を調べてみました。

h2oパッケージというものをRから使 ...