OpenAIは2026年9月10日、自然な音声会話をアプリや業務システムに組み込める「GPT-Live-1」をAPIで提供開始しました。GPT-Live-1は、相手の声を聞きながら話せるフルデュプレックス(全二重)方式を採用し、会話中の割り込みや間、周囲の雑音にも対応する音声AIモデルです。
この記事では、OpenAIの公式発表、APIモデルページ、安全性資料をもとに、GPT-Live-1の特徴、料金、使い方、導入前の注意点を解説します。情報は2026年9月16日時点で確認しています。
GPT-Live-1とは
GPT-Live-1は、リアルタイムの音声対話に特化したOpenAIのモデルです。従来の音声AIでは、音声認識、言語モデル、音声合成を順番につなぐ構成が一般的でした。GPT-Live-1は会話の音声部分を1つのモデルで扱い、聞く処理と話す処理を同時に進めます。
聞きながら話せるフルデュプレックス方式
フルデュプレックス方式では、AIが話している途中でも利用者が割り込めます。利用者が考えるために少し黙った場合は、すぐに発話を始めず、会話の流れを保ちながら待つこともできます。ターンが明確に終わるまで処理を止める方式より、人同士の会話に近い応答を作りやすいのが特徴です。
複雑な処理は別モデルやツールへ委任
GPT-Live-1は音声会話を担当し、検索、推論、ツール操作などの処理をバックエンドのテキストモデルやエージェントに委任できます。たとえば、受付の会話を続けながら予約システムを確認したり、問い合わせ内容を調べて結果を音声で返したりする構成が可能です。
OpenAIは、バックエンドの候補としてGPT-6 Astraなどを挙げています。モデルごとに性能と料金が異なるため、単純な予約変更には軽量モデル、複雑な相談には高性能モデルを使うといった設計が考えられます。
GPT-Live-1の主な特徴
割り込みや言い直しへの対応
利用者がAIの発話中に質問を変えたり、言い直したりした場合でも、その変化を会話の流れとして処理します。OpenAIの初期評価では、語学学習サービスのSpeakにおいて、従来のターン制システムと比べて、学習者が考えている途中で割り込む回数が約80%減ったと報告されています。
声の調子や会話スタイルの指定
システムプロンプトを使って、話す速さ、口調、受け答えのスタイルを調整できます。音声の選択肢も増えており、サービスの利用者や用途に合わせた声を選びやすくなっています。ただし、カスタム音声の利用条件は一般提供の音声とは異なるため、必要な場合はOpenAIへの問い合わせが必要です。
雑音と長時間セッションへの配慮
背景の会話や環境音をすべて利用者の指示として扱わないように設計されています。長い会話でも文脈と会話品質を維持しやすいことが案内されていますが、実際の精度はマイク、回線、話者の発音、利用環境によって変わります。
電話対応への利用
GPT-Live-1は電話回線を使う音声エージェントにも対応します。飲食店の予約、注文受付、カスタマーサポートなどが想定例です。電話対応に使う場合は、本人確認、録音の告知、個人情報の取り扱い、AIから人への切り替え条件を事前に設計する必要があります。
GPT-Live-1のAPI料金
OpenAIの公式モデルページでは、GPT-Live-1の音声セッション料金は1分あたり0.05ドルで、秒単位で請求されます。1分未満の利用が自動的に1分へ切り上げられる方式ではありません。
| 項目 | 料金・条件 |
|---|---|
| 音声セッション | 1分あたり0.05ドル |
| 請求単位 | 秒単位 |
| バックエンドモデル | 別料金 |
| ツール利用 | 利用内容に応じて別料金 |
たとえば、音声セッションを月に1,000分使うと、音声レイヤーだけで50ドルです。ここにバックエンドモデルの入出力トークン、Web検索などのツール、電話回線や自社インフラの費用が加わる可能性があります。導入費用を試算するときは、1分あたり0.05ドルだけで判断しないことが重要です。
テキストや画像を含む生成AI APIの選び方も確認したい方は、生成AIのAPIを無料で使う方法とおすすめサービス12選も参考にしてください。
GPT-Live-1 APIの使い方
GPT-Live-1を利用するには、OpenAI APIのアカウントと利用可能なAPIキー、音声を送受信するクライアントが必要です。公式モデルページに記載されたモデルIDはgpt-live-1です。
基本的な導入フロー
- OpenAI APIで利用条件と請求設定を確認します。
- Live APIのセッションを作成し、モデルに
gpt-live-1を指定します。 - ブラウザーやアプリからマイク音声を送信します。
- 返ってきた音声とテキストを利用者へ提示します。
- 必要に応じてバックエンドモデルや業務ツールへの委任処理を追加します。
GPT-Live-1はLiveエンドポイント向けのモデルです。Chat CompletionsやResponses APIへ通常のテキストモデルと同じ形で指定するものではないため、実装前に公式のLive APIガイドを確認してください。
バックエンドモデルとの組み合わせ
音声会話だけで完結する場合と、検索や業務処理が必要な場合では構成が異なります。複雑な作業を担当するモデルとしてGPT-6 Astraを検討する場合は、GPT-6 Astraの特徴・料金・提供状況も確認してください。音声セッションとは別に、バックエンドモデルの料金と権限管理が必要です。
ChatGPT Voiceとの違い
ChatGPT Voiceは、利用者がChatGPTのアプリやWeb画面で使う完成済みの音声機能です。一方、GPT-Live-1 APIは、開発者が自社アプリ、電話受付、音声アシスタントなどへ組み込むための仕組みです。
ChatGPTで音声会話を使いたいだけなら、APIを実装する必要はありません。自社サービスの画面や業務システムと連携させたい場合に、GPT-Live-1 APIが選択肢になります。ChatGPTの音声検索の流れは、ChatGPT Searchの全ユーザー開放に関する記事でも紹介しています。
GPT-Live-1が向いている用途
- 電話予約や注文を受け付ける音声エージェント
- 自然な割り込みが必要なカスタマーサポート
- 発音練習や会話練習を行う語学学習アプリ
- ハンズフリーで操作する業務アシスタント
- 検索やツール操作を音声で依頼するサービス
一方、短い音声を一方向に読み上げるだけなら、一般的な音声合成APIの方が構成と費用を抑えられる場合があります。双方向の会話が本当に必要かを先に確認すると、過剰な実装を避けやすくなります。
導入前の注意点
バックエンド処理は別料金
音声セッション料金には、委任先モデルや外部ツールの費用が含まれません。会話時間、委任回数、利用するモデル、検索回数を記録し、実際の業務に近い条件で費用を測る必要があります。
個人情報と録音データの管理
電話番号、氏名、予約情報などを扱う場合は、必要な情報だけを送信し、保存期間とアクセス権限を決めます。録音や文字起こしを行う場合は、利用地域の法令と自社のプライバシーポリシーに合わせて、利用者への告知方法も確認してください。
人への切り替えと誤操作対策
AIが対応できない内容、本人確認が必要な処理、金銭や契約に関わる操作は、人へ切り替える条件を明確にします。予約の確定や解約など、利用者への影響が大きい操作では、音声による復唱と最終確認を入れる設計が安全です。
まとめ
GPT-Live-1は、聞く処理と話す処理を同時に行い、割り込みや間を含む自然な音声会話を実現するAPI向けモデルです。音声セッションは1分あたり0.05ドルで、バックエンドモデルとツールの利用料金は別に発生します。
電話受付、語学学習、音声サポートなどに向いていますが、費用は会話時間だけでなく委任処理まで含めて試算する必要があります。導入時は、小規模なテストから始め、個人情報の管理、人への切り替え、重要操作の確認を含めて設計してください。



コメント