OpenAI 正式在 API 中推出 GPT-Realtime-2,標誌著語音人工智慧的重大突破。這是 OpenAI 首次將「GPT-5 等級推理」能力下放至語音模型,讓語音代理人能即時聆聽、推理並解決複雜問題,而非只能做預设回覆。
GPT-Realtime-2 採用 speech-to-speech(語音對語音)架構,配合可調整的推理 effort 參數,開發者可根據延遲需求灵活配置。此模型搭配 Streaming 模型一同上架,為語音代理應用開闢了新可能。
目前該模型已向所有 API 用戶開放,價格為每百萬音頻輸入 tokens 32 美元。推文發布以來已累積超過 13,000 個愛心、637 條回覆與 2,000 次轉分享,顯示社群對語音 AI 的高度期待。
來源: OpenAI (@OpenAI)