データベーススペシャリスト試験 令和3年度 秋期 午前II 問18
ビッグデータ処理基盤に利用され、オープンソースソフトウェアの一つであるApache Sparkの特徴はどれか。
選択肢を押すと答え合わせができます。
正解と解説を見る
【正解】イ
Apache Sparkは、大量のデータを複数のコンピュータで並列処理するためのオープンソースの分散処理基盤です。その中心的なデータ表現がRDD(Resilient Distributed Dataset、耐障害性分散データ集合)です。RDDは複数ノードに分割して配置される変更不能なデータ集合で、map、filterなどの変換を適用すると、元のRDDを書き換えずに新しいRDDが作られます。また、変換の履歴であるリネージを保持しているので、一部のデータが失われても再計算できます。したがって、イが適切です。
アの、MapReduceに基づくバッチ処理に特化しているという説明は誤りです。これは主にApache HadoopのMapReduce処理の説明です。Sparkはバッチ処理だけでなく、ストリーム処理、SQL、機械学習、グラフ処理などにも対応します。
ウの、パブリッシュ/サブスクライブ型のメッセージングモデルという説明は誤りです。これはApache KafkaやMQTTなどで用いられるメッセージングの説明です。Sparkは、それらから受け取ったデータを処理する側になれますが、これがSparkの基本モデルではありません。
エの、マスタノードをもたないキーバリューストアという説明は誤りです。これはApache Cassandraなどの分散データストアの特徴です。Sparkはデータを分析・処理する基盤であり、キーバリューストアそのものではありません。
【ポイント】 RDDは「分散配置」「変更不能」「耐障害性」が重要なキーワードです。 変換処理は遅延評価され、結果が必要になるアクションの実行時に初めて計算されます。 頻繁に使うRDDはメモリへキャッシュでき、反復処理を高速化できます。
出典:令和3年度 秋期 データベーススペシャリスト試験 午前II 問18
※ 解説は SkillStack 編集部が作成したものです。Web 表示のため、図表の配置や表記を一部改めています。
この回の25問を、アプリで通しで解く
- 本番と同じ問題数・制限時間で通し演習(模試モード)
- 間違えた問題は自動で「復習すべき問題」に回る
- 解説で分からない点はAIに質問できる