ITパスポート試験 令和6年度 公開問題 問78
利用者がスマートスピーカーに向けて話し掛けた内容に対して、スマートスピーカーから音声で応答するための処理手順が(1)~(4)のとおりであるとき、音声認識に該当する処理はどれか。 (1)利用者の音声をテキストデータに変換する。 (2)テキストデータを解析して、その意味を理解する。 (3)応答する内容を決定して、テキストデータを生成する。 (4)生成したテキストデータを読み上げる。
選択肢を押すと答え合わせができます。
正解と解説を見る
【正解】ア
(1)が音声認識に該当します。音声認識とは、人が発した音声をコンピュータが認識し、文字列などのテキストデータへ変換する技術です。例えば、利用者が「明日の天気を教えて」と話した音声を、「明日の天気を教えて」という文字列に変換する処理が音声認識です。その後の意味の理解や返答の作成とは区別します。
イの(2)は誤りです。これは、音声認識によって得られたテキストを解析し、利用者の意図や単語の意味を捉える自然言語処理、特に自然言語理解の処理です。文字に変換する処理ではありません。
ウの(3)は誤りです。これは、理解した要求に基づいて回答内容を決め、返答用の文章を作る応答生成の処理です。対話システムの制御や自然言語生成に当たります。
エの(4)は誤りです。これは、作成されたテキストを人工的な音声に変換して読み上げる音声合成です。TTSとも呼ばれ、音声をテキストにする音声認識とは変換の向きが反対です。
処理の流れを具体的に追うと、利用者の声が(1)で文字列に変わり、(2)で質問の意図が特定され、(3)で回答文が作られ、(4)で回答文が音声として出力されます。
【ポイント】 音声認識は「音声から文字へ」、音声合成は「文字から音声へ」という変換です。 意味の理解は自然言語理解、回答文の作成は自然言語生成として整理すると、処理の違いを判断しやすくなります。
出典:令和6年度 ITパスポート試験 公開問題 問78
※ 解説は SkillStack 編集部が作成したものです。Web 表示のため、図表の配置や表記を一部改めています。
この回の100問を、アプリで通しで解く
- 本番と同じ問題数・制限時間で通し演習(模試モード)
- 間違えた問題は自動で「復習すべき問題」に回る
- 解説で分からない点はAIに質問できる