SysTecevo

GPT-Live-1 APIとは?話しながら聞ける音声AIの料金・新機能を整理

初回掲載日:2026/09/12
最終更新日:

ノートPC、スマートフォン、イヤホン、コーヒー、AI Agentと書かれたメモを置いた個人開発者の机を表すオリジナル画像
音声AIを「話して、返事を待つ」だけで終わらせず、会話と裏側の処理を分けて考える選択肢が出てきました。

GPT-Live-1は、話しかける人との会話を続けながら、必要に応じてバックエンドのモデルやAgentへ作業を委譲できる音声AIのためのAPIです。OpenAI公式ドキュメントでは、話しながら聞くfull-duplexな会話と、裏側のAgent作業を両立する構成が案内されています。

先に結論

GPT-Live-1は「音声で会話を担当する層」、調査・検索・業務処理などは「バックエンドAgent」が担当する、と分けると理解しやすい仕組みです。音声Sessionは秒単位で課金され、公式Pricingでは$0.05/分。バックエンドのモデルやToolの料金は別にかかります。

項目要点
会話聞きながら話すfull-duplexの会話構成
深い処理必要に応じてbackend model / Agentへ委譲
接続ブラウザ向けWebRTC、サーバー向けWebSocket、電話向けSIPが案内されています
料金GPT-Live-1は$0.05/分。秒単位で計算、backend・Toolは別料金

GPT-Live-1 APIとは? 会話を続けながら仕事を進める音声AI

通常の音声機能は、ユーザーが話す、音声を文字にする、AIが答えを作る、音声で返す、という順番を意識しがちです。GPT-Liveの公式ガイドは、会話を担当するGPT-Liveが、バックエンドAgentの作業中も利用者との会話を続ける構成を示しています。

たとえば「近くの営業時間を調べて」と話しかけたとき、会話側は「確認しますね」と応答し、裏側では別のモデルやAgentが検索・Tool利用・結果の整理を進める、という分担です。すべての判断を音声側だけに任せるのではなく、会話と重い処理を役割で分けられるのがポイントです。

従来の「話す→待つ」と何が違う?

従来の音声AIの話す、文字化、AI、音声化、返答の流れと、GPT-Live-1の聞く、話す、同時進行を対比するオリジナル図解
会話の自然さは、単に返答を読むだけでなく、利用者の発話と処理をどう途切れさせないかで変わります。

full-duplexは、相手が話している最中でも聞き続け、会話の流れを保ちやすくする考え方です。OpenAIは、GPT-Liveが話しながら聞けること、バックエンド作業をしている間も会話を継続できることを案内しています。

ただし、自然に感じるかはマイク、通信、周囲の雑音、発話の長さ、アプリ側の会話設計にも左右されます。雑音や無音を万能に処理するものと考えず、実機・実環境での検証が必要です。

GPT-Live-1は会話担当。調査や実行はバックエンドへ委譲できる

ユーザーからGPT-Live-1、バックエンドモデル、ToolまたはAgentへと進む委譲の流れを示すオリジナル図解
会話を止めずに、必要な仕事だけをバックエンドへ渡す構成を考えられます。

公式ガイドでは、GPT-Liveは会話を聞き、話し、どの処理を委譲するかを判断し、backendはより詳しい業務・Tool・workflowを扱う役割として説明されています。Responses対応モデルへ委譲する構成だけでなく、client delegationで任意のモデル、Agent harness、サービスへつなぐ方法も案内されています。

ここでCodexとの接点を考えるなら、GPT-Live-1がCodexを内蔵するという意味ではありません。コード調査や修正のような長い作業を別のAgent側で担い、音声側は利用者に進行を伝える、といった役割分担として設計を検討できます。

割り込み・文字起こし・確認フローで気を付けたいこと

話しかけて割り込んでも、裏側の仕事は自動では止まらない

OpenAIのガイドは、利用者が音声を割り込ませても、バックエンドの仕事は自動的にはキャンセルされないと明記しています。たとえば予約処理や送信のような副作用があるToolでは、キャンセル方法、再確認、完了通知をアプリ側で設計する必要があります。

文字起こしはUIやログに使えるが、確定文ではない

入力・出力のtranscriptはdeltaイベントで取得でき、開始・終了時刻も扱えます。一方で、断片的な内容は未完成だったり誤りを含んだりする可能性があります。画面表示やアプリ状態の管理では、最終状態を自分で持つ設計が安全です。

音声の区切り検出、確認の出し方、割り込み後の状態は、アプリごとに試験すべき部分です。金額の確定や外部送信などは、音声会話だけで完結させず、明示的な確認画面・確認フローを用意しましょう。

ブラウザ、サーバー、電話でのつなぎ方

方法向く場面注意点
WebRTCブラウザのマイク・スピーカーを使う会話アプリブラウザではHTTPS(またはlocalhost)が必要。APIキーはサーバー側で扱います。
WebSocketサーバー側で音声を扱う構成接続と音声ストリーム、認証の設計が必要です。
SIP電話回線とつなぐ音声Agent電話連携向けの運用・通話品質・本人確認を別途検討します。

利用者の端末から直接秘密鍵を扱うのではなく、公式Quickstartどおりサーバー側でSessionを準備する構成を基本にすると安全です。

料金は$0.05/分。導入前にバックエンド費用も見る

OpenAI公式Pricingでは、GPT-Live-1 Sessionは$0.05/分です。Sessionは1分単位への切り上げではなく、秒単位で課金されます。目安として音声Sessionだけなら10分で$0.50、30分で$1.50、60分で$3.00です。

ただし、これは音声Session分だけです。委譲先のモデル、Web searchなどのTool、保存、通信、外部サービスは別の費用になり得ます。料金を考えるときは「会話時間」と「1会話あたりのバックエンド作業量」を分けて見積もりましょう。

試しやすい用途

  • 画面を見ずに使う音声ナビ
  • 学習の口頭練習や読み上げ
  • 家計・タスクの音声入力
  • 作業中の短い質問と進捗確認

慎重に設計したい用途

  • 送金・注文など取り消しにくい処理
  • 個人情報を扱う外部連携
  • 誤認識が重大な影響を持つ操作
  • 長時間の常時接続

まとめ

GPT-Live-1 APIは、音声会話を続けながら、必要な仕事をバックエンドのモデルやAgentへ渡せる仕組みです。full-duplexの会話、WebRTC・WebSocket・SIP、transcript、委譲を組み合わせることで、単純な読み上げより一歩進んだ音声体験を設計できます。

一方で、自然な会話はモデルだけで完成しません。割り込み時に何を止めるか、文字起こしをどう確定するか、確認が必要な操作をどう守るかまで設計して、まず小さな用途から検証するのが現実的です。

参考にしたOpenAI公式情報