Inworld AI 发布 Realtime TTS-2 实时对话语音模型
Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。
推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。
Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。
推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。
Inworld 宣布对整条语音栈降价,多数开发者在文本转语音、语音识别、LLM 和算力各层降幅达一半以上,新价格已面向所有开发者生效。Realtime TTS-2 降至约 $10/1M 字符,语音识别降至约 $0.10/小时,Router 可接入 100+ 模型且第三方模型不加价。
推荐理由:Inworld 把语音栈各层价格下调并对 TTS、语音识别和 LLM 给出阶梯单价,可用来估算消费级应用的推理成本。
Inworld 联手 Stream 搭出参考实现 Crashout Buddy,组合最新语音模型 Realtime TTS-2 与 Stream 开源的 Vision Agents 框架,可实时看表情、听语音并调整表达。
推荐理由:文中给出了把视觉信号与情绪上下文转成语音表达指令的做法,可据此判断这条实时语音链路能否接进自己的项目。