本文へスキップ
BecomeCoder

AWSコース · 第12章 AIと機械学習 ― 学習済みの賢さを借りる · レッスン60

すぐ使えるAIサービス ― 画像・音声・言語

導入

「アップロードされた画像に不適切なものが混じっていないか判定したい」「電話の音声を文字にしたい」「レビュー文が好意的か否定的か知りたい」——こうした要望には、対応する専用のAIサービスがそれぞれ用意されています。

説明

代表的なAIサービスを、扱う対象ごとに整理します。名前と用途の対応がそのまま試験に出ます。

サービス何をするか
Amazon Rekognition画像・動画の分析。物体や顔の検出、不適切コンテンツの判定
Amazon Textract書類の画像やPDFから文字とテーブル・フォームの項目を抽出する(OCR+構造理解)
Amazon Transcribe音声を文字起こしする(会議録・コールセンターの記録)
Amazon Polly文字を自然な音声で読み上げる(Transcribeの逆)
Amazon Translate文章を別の言語へ翻訳する
Amazon Comprehend文章の意味を分析する。感情(ポジ/ネガ)、キーフレーズ、固有名詞、個人情報の検出
Amazon Lex対話型のチャットボット・音声ボットを作る(Alexaと同じ技術)
Amazon Kendra社内文書を対象にした、自然文で聞ける高精度な検索
Amazon Personalize利用者ごとのレコメンド(おすすめ)を出す
Amazon Forecast過去の実績から需要予測を行う
Amazon Fraud Detectorオンライン取引の不正検知
flowchart LR
    Img["画像・動画"] --> Rek["Rekognition"]
    Doc["書類・PDF"] --> Tex["Textract"]
    Voice["音声"] --> Tra["Transcribe"]
    Text["テキスト"] --> Pol["Polly(読み上げ)"]
    Text --> Trl["Translate(翻訳)"]
    Text --> Com["Comprehend(意味の分析)"]

紛らわしいペアは先に整理しておきましょう。Transcribeは「音声→文字」、Pollyは「文字→音声」で向きが逆です。Textractは「画像の中の文字を取り出す」、Comprehendは「取り出した文字の意味を読む」で、この2つは組み合わせて使われます。

読んでみよう

11個を丸暗記するのは大変なので、「目(Rekognition・Textract)」「耳と口(Transcribe・Polly)」「言葉の意味(Comprehend・Translate・Lex・Kendra)」「予測(Personalize・Forecast・Fraud Detector)」の4グループで覚えましょう。