跳到正文
  1. Inworld AI Blog57

    Inworld AI 发布 Realtime TTS-2 实时对话语音模型

    Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。

    推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。

  1. Inworld AI Blog49

    Inworld 用 Realtime TTS-2 联手 Stream Vision Agents,搭出能看能听的实时语音智能体

    Inworld 联手 Stream 搭出参考实现 Crashout Buddy,组合最新语音模型 Realtime TTS-2 与 Stream 开源的 Vision Agents 框架,可实时看表情、听语音并调整表达。

    推荐理由:文中给出了把视觉信号与情绪上下文转成语音表达指令的做法,可据此判断这条实时语音链路能否接进自己的项目。

已经到底了