SkillStack
テクノロジ系18 / 25問

データベーススペシャリスト試験 令和3年度 秋期 午前II 問18

ビッグデータ処理基盤に利用され、オープンソースソフトウェアの一つであるApache Sparkの特徴はどれか。

選択肢を押すと答え合わせができます。

正解と解説を見る

【正解】イ

Apache Sparkは、大量のデータを複数のコンピュータで並列処理するためのオープンソースの分散処理基盤です。その中心的なデータ表現がRDD(Resilient Distributed Dataset、耐障害性分散データ集合)です。RDDは複数ノードに分割して配置される変更不能なデータ集合で、map、filterなどの変換を適用すると、元のRDDを書き換えずに新しいRDDが作られます。また、変換の履歴であるリネージを保持しているので、一部のデータが失われても再計算できます。したがって、イが適切です。

アの、MapReduceに基づくバッチ処理に特化しているという説明は誤りです。これは主にApache HadoopのMapReduce処理の説明です。Sparkはバッチ処理だけでなく、ストリーム処理、SQL、機械学習、グラフ処理などにも対応します。

ウの、パブリッシュ/サブスクライブ型のメッセージングモデルという説明は誤りです。これはApache KafkaやMQTTなどで用いられるメッセージングの説明です。Sparkは、それらから受け取ったデータを処理する側になれますが、これがSparkの基本モデルではありません。

エの、マスタノードをもたないキーバリューストアという説明は誤りです。これはApache Cassandraなどの分散データストアの特徴です。Sparkはデータを分析・処理する基盤であり、キーバリューストアそのものではありません。

【ポイント】 RDDは「分散配置」「変更不能」「耐障害性」が重要なキーワードです。 変換処理は遅延評価され、結果が必要になるアクションの実行時に初めて計算されます。 頻繁に使うRDDはメモリへキャッシュでき、反復処理を高速化できます。

出典:令和3年度 秋期 データベーススペシャリスト試験 午前II 問18
※ 解説は SkillStack 編集部が作成したものです。Web 表示のため、図表の配置や表記を一部改めています。

この回の25問を、アプリで通しで解く

  • 本番と同じ問題数・制限時間で通し演習(模試モード)
  • 間違えた問題は自動で「復習すべき問題」に回る
  • 解説で分からない点はAIに質問できる
SkillStackで無料で始める