OpenAI、応答性を高めた連続音声AIシステム「GPT-Live」の全容公開
OpenAIは8月3日(現地時間)、連続的な音声対話を実現する第三世代音声AIシステム「GPT-Live」について、詳細な技術概要を公開しました。従来の音声AIシステムにあったターン検出器を音声パスから除去し、全二重音声モデルを採用することで、より自然で応答性の高い会話を可能にしています。低遅延アーキテクチャと効率的なメディアフロー管理が、その核となる要素です。
Tag
2 件の関連記事
OpenAIは8月3日(現地時間)、連続的な音声対話を実現する第三世代音声AIシステム「GPT-Live」について、詳細な技術概要を公開しました。従来の音声AIシステムにあったターン検出器を音声パスから除去し、全二重音声モデルを採用することで、より自然で応答性の高い会話を可能にしています。低遅延アーキテクチャと効率的なメディアフロー管理が、その核となる要素です。
Simon Willisonは2026年6月12日(現地時間)、自身が開発する「OpenAI WebRTC Audio Session」ツールの更新版を公開した。このツールは、OpenAIが先月発表した新たなリアルタイム音声モデル「GPT‑Realtime‑2」に対応し、ユーザーが大量の文書コンテキストを貼り付け、その内容について音声で対話できる機能を加えた。今回の更新により、開発者は自らのアプリケーションに高度なリアルタイム音声対話機能と文書解析能力を統合し、専門分野での効率化や新たなサービス創出の可能性を探ることが期待される。