Amazon Pollyとは?導入事例・料金や対応言語・使い方・商用利用を徹底解説
最終更新日:2026年09月28日
記事監修者:森下 佳宏|BizTech株式会社 代表取締役

動画や音声サービスのナレーションをAI音声で対応したいと考えている方も多いのではないでしょうか。
今回紹介するAWSの人気サービスAmazon Pollyは、低価格かつ高速なText to Speech(テキストデータを音声へ変換)を実現するツールとして注目されています。
まるで人間が話しているかのような流暢な音声を日本語、英語などで生成可能です。商用利用もできるため、ビジネスにも利用可能です。
本記事では、Amazon Pollyの料金や対応言語、日本企業の導入事例を解説。具体的な使い方も紹介していますので、使い勝手や精度を知りたい方は、本記事を参考にAmazon Pollyを試してみてはいかがでしょうか。
音声合成・音声認識に強いAI開発会社を自力で選びたい方はこちらで特集していますので併せてご覧ください。
関連記事:「AWSとAzureを徹底比較!強みや弱み、適したケースなどを徹底解説」
目次
Amazon Pollyとは?

Amazon Pollyは、テキストデータを音声データに変換するAWS(Amazon Web Services)のサービスです。標準音声のほか、ディープラーニングを活用した音声エンジンも提供しており、用途に応じて音声を選べます。
これまで、音声を利用したコンテンツを高品質で作るには、アナウンサーやナレーターなどの人員が必要でした。Amazon Pollyのようなテキスト読み上げ(TTS:Text to Speech)サービスを利用すれば、原稿から音声を生成し、案内や教材などに活用できます。
Amazon Pollyの4つの音声エンジン
Amazon Pollyには、以下の4つの音声エンジンがあります。
- 標準音声(Standard TTS):録音された音声の音素をつなぎ合わせて音声を生成する
- ニューラル音声(Neural TTS/NTTS):ニューラルネットワークを用いて、より自然で滑らかな音声を生成する
- ロングフォーム音声(Long-form TTS):ニュース記事や研修資料など、長いコンテンツの読み上げに適した音声を生成する
- 生成音声(Generative TTS):会話で使うような口調や表現を取り入れた音声を生成する
標準音声は、録音された音声を構成する音素を連結して読み上げます。一方、ニューラル音声は、音素の並びから音声の特徴を生成し、音声波形へ変換します。ロングフォーム音声と生成音声も、それぞれ異なる用途に向けた音声エンジンです。
日本語の音声は標準音声とニューラル音声で提供されています。ロングフォーム音声は英語(米国)とスペイン語(スペイン)に対応し、生成音声の提供リストにも日本語は含まれていません。
関連記事:「ディープラーニングとは?機械学習との違い・使い分け方法・注意点を徹底解説!」
関連記事:「音声合成・音声生成とは?AIで何が変わる?仕組み活用事例4選を紹介!」
参照:AWS|Amazon Polly の音声エンジン
参照:AWS|利用可能な音声
Amazon Transcribeとの違い
Amazon TranscribeとAmazon Pollyは、どちらもAWS(Amazon Web Services)が提供する音声関連サービスです。両者は、変換するデータの方向が異なります。
| 項目 | Amazon Polly | Amazon Transcribe |
|---|---|---|
| 主な機能 | 音声合成(TTS:Text to Speech) | 自動音声認識(ASR) |
| 入力 | テキスト | 録音・動画内の音声や、リアルタイムの音声 |
| 出力 | 読み上げ音声 | 文字起こしされたテキスト |
| 主な用途 | ナレーション、音声案内、教材の読み上げ | 会議や通話の文字起こし、字幕の作成 |
Amazon Pollyは「テキストから音声を作る」サービス、Amazon Transcribeは「音声をテキストにする」サービスです。音声コンテンツを作りたい場合はPolly、話された内容を文字に起こしたい場合はTranscribeを利用します。
関連記事:「Amazon Transcribeとは?日本語対応の音声認識機能・料金・活用事例・使い方を解説!」
Amazon Pollyの料金
Amazon Pollyは音声に変換したテキストの文字数に応じた従量課金制です。初めて利用する場合には、音声タイプごとに無料利用枠も用意されています。
標準音声に加え、より自然な発話を生成するニューラル音声、長い文章の読み上げに適したロングフォーム音声、ジェネレーティブ音声を利用できます。
| 音声タイプ | 料金(100万文字あたり) | 無料利用枠(月間) |
|---|---|---|
| 標準音声 | 4.00 USD | 500万文字 |
| ニューラル音声 | 16.00 USD | 100万文字 |
| ロングフォーム音声 | 100.00 USD | 50万文字 |
| 生成音声 | 30.00 USD | 10万文字 |
無料利用枠は、Amazon Pollyで最初に音声リクエストを送信してから12カ月間、上記の文字数まで毎月利用できます。
例えば、1件1,000文字のテキストを1,000件音声化すると、合計100万文字です。無料利用枠を考慮しない場合、標準音声は4.00 USD、ニューラル音声は16.00 USDとなります。
生成した音声は保存して再生でき、再生のたびに文字数分の料金が発生することはありません。
生成AIに強いAI会社の選定・紹介を行います
今年度生成AI相談急増中!紹介実績1,000件超え!

・ご相談からご紹介まで完全無料
・貴社に最適な会社に手間なく出会える
・AIのプロが貴社の代わりに数社選定
・お客様満足度96.8%超
完全無料・最短1日でご紹介 生成AIに強い会社選定を依頼する
Amazon Pollyの7つのメリット

Amazon Pollyを利用すると、以下のようなメリットを享受できます。
- 多言語・地域別の音声に対応
- 日本語で選べるAmazon Pollyの音声
- 音声変換が高速
- 低価格
- 音声のカスタマイズが容易
- 商用利用可能
- 幅広いプログラミング言語に対応
それぞれについて解説します。
多言語・地域別の音声に対応
Amazon Pollyは、日本語や英語、アラビア語、フランス語など、さまざまな言語の音声合成に対応しています。
AWSの音声一覧には、地域による違いを含めて42の言語・地域別バリエーションが掲載されています。海外向けの音声案内や教材など、利用者の言語に合わせたコンテンツ作成に活用できます。
英語では、米国、英国、オーストラリア、インド、アイルランド、ニュージーランド、シンガポール、南アフリカに加え、ウェールズ英語の音声も選べます。同じ英語でも、対象地域に合わせて音声を選択できます。
参照:AWS|利用可能な音声
日本語で選べるAmazon Pollyの音声
Amazon Pollyでは、同じ言語でも複数の音声から選択できます。日本語で利用できる音声は、女性のMizuki、Kazuha、Tomokoと、男性のTakumiの4種類です。
| 項目 | Mizuki | Takumi | Kazuha | Tomoko |
|---|---|---|---|---|
| 性別 | 女性 | 男性 | 女性 | 女性 |
| 標準音声 | 対応 | 対応 | ― | ― |
| ニューラル音声 | ― | 対応 | 対応 | 対応 |
日本語は標準音声とニューラル音声に対応しています。ロングフォーム音声と生成音声には、現在、日本語の音声は用意されていません。
参照:AWS|利用可能な音声
音声変換が高速
Amazon Pollyは、短いテキストをほぼリアルタイムで音声に変換できます。
AWSが紹介するHaptikの導入事例では、約85文字の音声ファイルを作成する時間は平均17ミリ秒でした。
この応答速度を活かし、アプリの音声案内や会話型サービスで、入力に応じた音声を生成できます。
参照:Amazon Polly|長いオーディオファイル
参照:AWS|Amazon Polly を使用した Haptik のパーソナルアシスタントサービス
低価格
Amazon Pollyは無料利用枠を用意しているうえに、有料のサービスも低価格で提供しています。標準音声なら100万文字を音声に変換しても4ドルと、企業としては無視できるほどの料金でサービスを提供しています。
また、従量課金制を利用しているため、利用が少ない場合は少額の投資で音声変換サービスを利用できます。利用機会が少ない企業でも安く利用できるでしょう。
音声のカスタマイズが容易
Amazon Pollyでは、音声や読み上げ方を用途に応じて調整できます。例えば、以下のような設定が可能です。
- 音声の種類を選ぶ
- 読み上げる速度や音量を調整する
- 文章の途中に間を設ける
- 固有名詞などの発音を調整する
読み上げ方の調整にはSSML、単語の発音調整には発音レキシコンを利用できます。
対応する設定は音声エンジンによって異なり、強調・呼吸音・ささやき声は標準音声、ニュースキャスターの話し方は一部のニューラル音声で利用できます。
参照:AWS|サポートされている SSML タグ
参照:AWS|レキシコンの管理
商用利用可能
Amazon Pollyで出力した音声データは、公式ページで以下のように表明されているとおりサービス利用者が権限を有するため、商用利用が可能です。
Q: Polly レコーディングの所有者は誰ですか?
お客様と AWS との間で、Polly の出力はお客様に帰属します。第三者に帰属するテキストを Polly に入力する場合は、その権限の取得をお願いしています。
音声を利用した施策を安価に行えるため、動画配信サービスへの参入やテキスト読み上げ機能の搭載などを低リスクで実施できるでしょう。
幅広いプログラミング言語に対応
Amazon Pollyでは、JavaやC++、PythonなどのAWS SDK(AWSのソフトウェア開発キット)に含まれるプログラム言語で利用できます。普段からAWSで開発しているエンジニアは、新たな言語を習得することなくAmazon Pollyの開発に取り組めるでしょう。
また、Amazon PollyはHTTP APIが利用できるため、自社のアプリやウェブなどでもAmazon Pollyを活用できます。既存のサービスにも容易にText to Speechを導入できるでしょう。
Amazon Pollyを5分で使い始める方法ステップ
Amazon Pollyは、AWSアカウントを作成し、コンソールで音声と言語を選んで試せます。以下では、テキストの入力から音声のダウンロードまでの流れを紹介します。
標準音声には、最初の音声リクエストから12カ月間、毎月500万文字の無料利用枠があります。
1.AWSアカウント作成

Amazon PollyはAWSのサービスの一つです。AWSを利用するにはAWSアカウントが必要ですので、アカウントを持っていない方は作成しましょう。
AWSアカウントは、AWSのサインアップページから作成できます。登録にはメールアドレスと電話番号、クレジットカードなどの支払い情報が必要です。
登録が完了すれば、上のような画面が出てきます。「AWSマネジメントコンソールにお進みください」を選択しましょう。
2.条件を指定してテキストを入力
AWSアカウントが作成できれば、AWSのコンソールホーム検索画面に「Amazon Polly」と入力し、Amazon Pollyを開きます。

3.テキストを音声に変換
次に、「Pollyを試す」を選択すると、テキスト読み上げ機能に移ります。

テキスト読み上げ機能で「エンジン・言語・音声・テキスト」を入力すれば、入力したテキストを音声に変換できます。
4.音声のダウンロード
画面右上の「ダウンロード」を選択すれば、音声のダウンロードも可能です。

生成AIに強いAI会社の選定・紹介を行います
今年度生成AI相談急増中!紹介実績1,000件超え!

・ご相談からご紹介まで完全無料
・貴社に最適な会社に手間なく出会える
・AIのプロが貴社の代わりに数社選定
・お客様満足度96.8%超
完全無料・最短1日でご紹介 生成AIに強い会社選定を依頼する
Amazon Pollyの導入事例
Amazon Pollyは、日本の企業でもすでに活用されています。ここでは、山陽新聞社とエフエム和歌山の活用事例を解説します。
新聞記事の電子版読み上げ機能を実現(山陽新聞社)

山陽新聞社は、Amazon Pollyを利用することで、新聞の電子版読み上げ機能を月400円で実現しました。以前から同社には、主に高齢者から電子版の記事の読み上げ機能の要望が寄せられていました。
アナウンサーによる読み上げは多額のコストがかかりますが、Amazon Pollyを活用すれば月400円程度でAIアナウンサーを利用できたそうです。このように同社では、非常に低いコストで記事の読み上げ機能の搭載に成功しました。
読み上げているのはAmazon Pollyの音声ですが、山陽新聞の電子版では「瀬戸内あい」として親しまれています。また記事の読み上げ機能は電子記事だけでなく、気象予報にも対応しています。
テキストを扱う業種から、新聞社はAIアナウンサーを積極的に活用しています。山陽新聞社のほか、朝日新聞社や読売新聞社、日本経済新聞社などもAmazon Pollyを活用しています。
年間400~800円で24時間の無人放送(エフエム和歌山)

ラジオ番組を手がけるエフエム和歌山は、2017年よりAmazon Pollyを活用してニュースや天気予報を放送しています。同社のアナウンサーは「人工知能アナウンサー・ナナコ」として親しまれています。
同社はスポンサー収入のみで番組を運用しているため、人手を十分に確保できないという課題がありました。そこでAIアナウンサーを導入し、少ない人手でも運用できる体制を構築しました。
また、普段のニュースや天気予報だけでなく、24時間放送にもAIアナウンサーを採用することにより、アナウンサー不在時や災害時にも放送できるようになりました。同社は、AIアナウンサーの活用は災害時の人命救助にも役立つと考えています。
Amazon PollyとLLMの連携で新たな可能性

Amazon PollyとLLM(大規模言語モデル)が組み合わさることで、より洗練されたオーディオコンテンツの生成へと進化しています。
Amazon Pollyはテキストを自然に聞こえる音声に変換するサービスであり、主にテキストベースのデータをオーディオ形式に変換することに特化しています。
一方、LLM(大規模言語モデル)は、文章生成、言語理解、質問応答システムなど、より広範な自然言語処理のタスクを実行する能力を持っています。
既に使われている活用事例として以下があります。
カスタマーサポートや教育コンテンツの作成
例えば、LLM(大規模言語モデル)を用いてユーザーからの質問に対する答えを生成し、そのテキスト回答をAmazon Pollyを使用して音声化することで、リアルタイムのオーディオフィードバックシステムを実現できます。
このようなシステムは、視覚障害があるユーザーや、画面を見ることが難しい状況にあるユーザーにとって非常に有益です。
教育分野でのeラーニングコースやオンライン講座
LLM(大規模言語モデル)がカリキュラムや学習資料のテキストを生成し、そのテキストをAmazon Pollyが音声化することで、学習者がテキストコンテンツを聴くことで学習できるオーディオブックやポッドキャスト形式の教材を提供できます。
この連携により、よりアクセシブルで多様な学習方法を提供することが可能になります。
生成AIに強いAI会社の選定・紹介を行います
今年度生成AI相談急増中!紹介実績1,000件超え!

・ご相談からご紹介まで完全無料
・貴社に最適な会社に手間なく出会える
・AIのプロが貴社の代わりに数社選定
・お客様満足度96.8%超
完全無料・最短1日でご紹介 生成AIに強い会社選定を依頼する
Amazon Pollyについてよくある質問まとめ
- Amazon Pollyでは何ができますか?
テキストを読み上げ音声に変換できます。音声案内、記事の読み上げ、教材のナレーションなどに利用できます。
- Amazon Pollyは日本語に対応していますか?
対応しています。日本語では標準音声とニューラル音声を選べます。
まとめ
Amazon Pollyは低価格かつ高速でテキストデータを音声データに変換できるAWSのサービスです。従量課金制のため小規模利用にも適しています。
音声データの制作をナレーターや声優に依頼している企業は、Amazon Pollyを活用することで大幅なコストカットを実現できるかもしれません。

AI Market 運営、BizTech株式会社 代表取締役|2021年にサービス提供を開始したAI Marketのコンサルタントとしても、お客様に寄り添いながら、現場のお客様の課題ヒアリングや企業のご紹介を5年以上実施しています。これまでにLLM・RAGを始め、画像認識、データ分析等、1,000件を超える様々なAI導入相談に対応し、参加累計8,000人を超えるAIイベントを主催。AIシステム開発PM歴8年以上。AI Marketの記事では、AIに関する情報をわかりやすくお伝えしています。(JDLA GENERAL 資格保有)
▶ 監修者の実績・経歴を詳しく見る
AI Market 公式𝕏:@AIMarket_jp
Youtubeチャンネル:@aimarket_channel
TikTok:@aimarket_jp
運営会社:BizTech株式会社
掲載記事に関するご意見・ご相談はこちら:ai-market-contents@biz-t.jp
