Voice AI エージェントの起動準備
早期アクセス
Voice AIエージェント は、音声固有の機能で AI エージェントを拡張し、音声認識、生成 AI、自然な音声合成を使用して、音声通話で自然な双方向の会話を可能にします。
Voice AI エージェント がライブ通話を処理する前に、自然な音声出力のシステム プロンプトを構成し、IVR (自動音声応答) セットアップを確認し、主要なシナリオでエージェントをテストします。AIエージェントをすでに作成して公開し、IVR (自動音声応答)フローでAIエージェントへの通話の転送エレメントを設定していることを確認してください。
音声フォーマットルールをシステムプロンプトに書き込む
Voice 書式設定ルールは、言語モデルに音声配信に適した出力を強制的に生成する、システム プロンプトに追加される明示的な命令です。Voice AI エージェントがこれらのルールを必要としているのは、これらのルールがないと、モデルはデフォルトで箇条書き、番号付きリスト、マークダウン、長い段落などのテキストに最適化された応答になり、どれも音声にうまく変換されないためです。
| ルール | なぜ重要なのか | 説明例 |
|---|---|---|
| 短い回答のみ | 呼び出し元は、再読み取りまたはスクロールバックすることはできません。長い応答に圧倒されます。 | すべての回答は、最大で 2 つまたは 3 つの短い文にしてください。1文に1つのアイデア。 |
| 箇条書きやリストなし | TTS(Text-to-Speech) は箇条書き文字を読み上げたり、ぎこちなく一時停止したりします。 | 箇条書き、番号付きリスト、またはその他の視覚構造は絶対に使用しないでください。 |
| 値下げなし | アスタリスク、ハッシュ、アンダースコアが読み上げられるか、奇妙な一時停止を引き起こします。 | いかなる種類のマークダウン形式も使用しないでください。 |
| URL またはリンクなし | 発信者は音声コンテンツをクリックできません。 | URLやリンクについては決して言及しないでください。情報を直接提供してください。 |
| 数字を綴る | TTS(Text-to-Speech) は、特にシーケンスで数字を読み間違える可能性があります。 | 言葉で数字を書く:23kgではなく23kg。 |
| 日付と時刻を綴る | 数値の日付と 24 時間時刻が読み間違えられます。 | 2026 年 4 月 7 日ではなく、4 月 7 日 26 日とします。14時30分ではなく、午後2時30分としましょう。 |
| 略語を展開 | TTS(Text-to-Speech)は、略語を文字ごとに綴ることができます。 | kgではなくキログラム、EUではなく欧州連合と書いてください。 |
| 句読点を最小限に抑える | TTS(Text-to-Speech) は、コロン、セミコロン、およびコンマ チェーンで一時停止します。 | コロン、セミコロン、長いコンマ チェーンは避けてください。単純な文末のみを使用してください。 |
| ペアの電話番号 | 数字ごとの読み上げに一時停止が不均一になり、TTS(Text-to-Speech) が途切れる場合があります。 | 電話番号を 3 8 5 1 2 3 ではなく 38 51 23 の 2 桁のグループで読み取ります。 |
| 後方参照なし | 発信者は、上にスクロールして以前のコンテンツを表示することはできません。 | 「上記を参照」、「前述のように」と言ったり、前のターンを位置で参照したりしないでください。 |
| 明示的な音声モード宣言 | モデルはデフォルトで、明示的な指示なしでテキストに最適化された出力になります。 | 「あなたは音声チャットボットとして動作しています。すべての応答はテキスト読み上げエンジンによって読み上げられます。」 |
工具実行条件の定義
ツール実行の条件をシステムプロンプトで明示的に定義します。明示的な条件がない場合、言語モデルはツールの説明を読み取り、それを呼び出すタイミングを自律的に決定します。これにより、デバッグが困難な予期しない動作が発生します。
各ツールに正確なトリガーを指定して、定義された条件が満たされた場合にのみエージェントがトリガーを呼び出せるようにします。
| ツール | 条件例 |
|---|---|
| ヒトエージェントへの移行 | 発信者が「エージェント」、「人間」、「代表者」などの単語を明示的に使用している場合にのみ転送します。発信者がイライラしているか、ツールに障害が発生したため、転送しないでください。 |
| 通話終了 | 通話を終了するには、発信者に要約を繰り返し、問題が解決したという確認を受け取った後にのみ終了してください。 |
| 確認SMS送信 | SMSは、国コードを含む完全な電話番号を発信者と確認した後にのみ送信してください。 |
プラットフォームは、転送ツールまたはエンドコールツールが呼び出されると、発信者にアナウンスを自動的に再生します。これらのアナウンスをシステムプロンプトに含めないでください。ツールを呼び出すタイミングのみを指定します。
幻覚はテキストよりも音声の方が危険です。発信者が誤った情報を話しているのを聞くと、それは権威のあるものに聞こえ、疑問を抱くのが難しくなります。回答を承認された情報源のみに制限し、推測や見積もりを行わず、情報が利用できない場合に明確なフォールバックを提供するようにエージェントに指示します。
言語とトーンを設定する
言語ロック:エージェントが話すのと同じ言語でシステムプロンプトを作成します。プロンプトを 1 つの言語で記述し、モデルに依存して内部で翻訳すると、毎ターン処理のオーバーヘッドが増加します。会話の途中で言語を切り替えないように明示的な指示を含めます。
トーン: 簡単な語彙で温かくプロフェッショナルな口調を使用するようにエージェントに指示します。発信者が意図を述べるのを待つのではなく、何が役立つかを提示して、エージェントに積極的に開くように指示します。否定 (「いいえ」、「キャンセル」、「それは間違っています」などの単語) を認識し、発信者が拒否したときに現在のフローを停止するようにエージェントに指示します。
起動前に構成を確認する
コールのテストを開始する前に、すべての設定項目が設定されていることを確認します。
- AI エージェントが作成され、音声に最適化された命令で構成され、公開されます。
- すべてのツールが追加され、テストされ、エラー処理が定義されました。
- 電話番号がプロビジョニングされ、正しい IVR (自動音声応答) フローに接続されています。
- 正しいエージェント、エージェントタイプ、言語、音声で構成されたAIエージェントエレメントにコールを転送します。
- エージェントの挨拶メッセージが作成およびテストされました (音声テキスト読み上げモードのみ)。
- IVR (自動音声応答) フローがアクティブになりました。
エージェントをテストする
| テストエリア | 確認する内容 |
|---|---|
| 基本的な通話接続 | 通話が接続されます。エージェントが挨拶を再生します。Voiceはクリアで自然です。 |
| 音声認識 | エージェントは、ターゲット言語とアクセントに合わせて発信者の音声を正しく書き起こします。 |
| インテント処理 | エージェントは、定義したすべてのユースケースの意図を正しく識別します。 |
| ツール呼び出し | すべてのバックエンド統合は正しい結果を返します。エージェントは、音声フォーマットルールを使用して自然に話します。 |
| レイテンシー | 発信者の発話の終わりからエージェントの応答の開始までの時間は、自然で会話的に感じられます。 |
| 割り込み処理 | 発信者は、エージェントが応答している間に話すことができます。エージェントは正常に回復します。 |
| 人による移送 | エージェントは、システムプロンプトで定義された条件下でのみ転送されます。 |
| 通話終了 | エージェントは、プロンプトで定義された条件下で通話を正常に終了します。 |
| エッジケース | 無音、バックグラウンド ノイズ、アクセント付きの音声、および範囲外の要求はすべて処理されます。 |
| 多言語 (該当する場合) | 各言語は、代表的な発信者と独立してテストされました。 |
| アウトバウンド フロー (該当する場合) | アウトバウンドコールが開始されました。エージェントに正しく渡されたコンテキスト変数。 |