1. Realtime语音对话
MoYunAPI
  • MoYun API
    • 快速开始
    • 充值与价格说明
    • 接入Agent指南
      • IDE与终端AI(IDE & AI CLI)
        • VS Code配置指南
          • VS Code安装与配置指南
        • JetBrains系列配置指南
          • JetBrains系列IDE下载与安装
        • 国产桌面IDE配置指南
          • IDE 配接 Cline 使用指南
          • CodeBuddy CN IDE 配置指南
          • Trae CN IDE 配置指南
        • AI CLI配置指南
          • Kimi Code CLI
          • MiMo Code CLI 配置指南
          • OpenCode CLI 配置指南
          • Cursor CLI
          • Grok CLI
          • ChatGPT(Codex CLI)配置指南
          • Claude Code CLI配置指南
      • 桌面级Agent(Desktop Agent)
        • WorkBuddy 配置指南
        • QoderWork
        • ZCode配置指南
        • Claude Code Desktop
        • ChatGPT(Codex Desktop)配置指南
        • Grok Desktop配置指南
        • MiniMax Code配置指南
        • Cursor Desktop
        • OpenCode Desktop配置指南
      • 工作流(WorkFlows)
        • n8n 配置使用 MoYunAPI 教程
        • Dify 配置使用 MoYunAPI 教程
      • 自动化工具(Automation)
        • CC Switch 安装与配置教程
      • 开源项目(Open Source)
        • OpenClaw下载与API配接(Windows)
        • OpenClaw下载与API配接(Linux)
    • 提示词指南
      • Seedream 4.0-5.0 提示词指南
    • API 文档
      • Models模型
        • 获取模型列表
      • Chat对话
        • 对话补全 (Chat Completions) — 核心接口
      • Completions文本
        • 文本补全 (Completions)
      • Embeddings向量
        • 文本嵌入 (Embeddings)
      • Images图片
        • Doubao-Seedream 图生图(单图参考)
        • Doubao-Seedream 多图融合生图
        • Doubao-Seedream 文生图
        • Doubao-Seedream 组图生成
        • MiniMax-Image 文生图
        • MiniMax-Image 图生图(人物主体参考)
        • GLM-Image 文生图
        • GLM-CogView 文生图
        • Qwen-Image 文生图
        • Qwen-Image 3.0 图生图/图像编辑
      • Audio音频
        • MiMo-TTS语音系列
        • 语音合成 (Text-to-Speech)
        • 语音识别 (Audio Transcription)
      • Realtime语音对话
        • 实时语音对话 (WebSocket)
          GET
      • Moderations内容安全审核
        • 内容安全审核 (Moderations)
      • Rerank文档重排序
        • 文档重排序 (Rerank)
      • Video视频
        • 生成视频 (Video Generation, 异步任务)
        • 查询视频任务状态
    • Images图片
    • 数据模型
      • Error
      • ErrorResponse
      • Usage
      • StyleObject
      • ChatMessage
      • SubjectReference
      • Tool
      • FunctionCall
  1. Realtime语音对话

实时语音对话 (WebSocket)

GET
https://moyunapi.com/v1/realtime
Realtime
建立 WebSocket 连接进行低延迟实时语音对话。

连接方式#

使用 WebSocket 协议连接:wss://moyunapi.com/v1/realtime?model=gpt-4o-realtime
需在握手时携带认证头:Authorization: Bearer sk-xxxxxx,并通过 query 指定 model。

交互流程#

1.
客户端连接成功后发送 session.update 事件配置会话(音色、格式、工具等);
2.
发送 input_audio_buffer.append 流式上传音频;
3.
发送 input_audio_buffer.commit 或配置自动提交触发识别;
4.
服务端返回 response.audio.delta(增量音频)、response.text.delta(增量文本)、conversation.item.created 等事件;
5.
可随时发送 response.cancel 中断。
⚠️ 这是一个 WebSocket 端点,HTTP 客户端无法直接调用,需使用 WebSocket 客户端库。

请求参数

Authorization
Bearer Token
在 Header 添加参数
Authorization
,其值为在 Bearer 之后拼接 Token
示例:
Authorization: Bearer ********************
or
Query 参数

Header 参数

返回响应

⚪101
application/json
WebSocket 协议切换成功,连接已建立。随后通过事件(JSON 消息)进行双向交互。
Bodyapplication/json

🟠400
🟠401
🟠429
🔴500
请求示例请求示例
Shell
JavaScript
Java
Swift
curl --location 'https://moyunapi.com/v1/realtime?model=' \
--header 'Accept;' \
--header 'Authorization: Bearer <token>'
响应示例响应示例
101 - 客户端→服务端:配置会话
{
    "type": "session.update",
    "session": {
        "voice": "alloy",
        "output_format": "pcm16",
        "turn_detection": {
            "type": "server_vad",
            "threshold": 0.5,
            "silence_duration_ms": 500
        },
        "modalities": [
            "text",
            "audio"
        ]
    }
}
上一页
语音识别 (Audio Transcription)
下一页
内容安全审核 (Moderations)
Built with