Inworld 解读 TTS-2 语音引导与评测
Inworld AI 研究负责人 Aleksey Tikhonov 撰文解释 TTS-2 的语音引导机制:用指令告诉语音模型该怎么念出台词。文章重点是如何衡量这些指令是否真正生效——自动化音频评判在其测试中表现不足,团队转而测量语音本身的变化。他还谈到指令措辞为何重要、同一方向在不同音色上结果为何不同,这些度量用于追踪模型版本之间的变化,并有其局限。
Inworld AI 研究负责人 Aleksey Tikhonov 撰文解释 TTS-2 的语音引导机制:用指令告诉语音模型该怎么念出台词。文章重点是如何衡量这些指令是否真正生效——自动化音频评判在其测试中表现不足,团队转而测量语音本身的变化。他还谈到指令措辞为何重要、同一方向在不同音色上结果为何不同,这些度量用于追踪模型版本之间的变化,并有其局限。
Inworld AI 宣布 Meta 的推理与编码模型 Muse Spark 1.3 已在 Inworld Realtime Router 上线,采用闭源权重,支持 1M token 上下文,定价为每 1M token 输入 1.25 美元、输出 4.25 美元。据其披露,在 Meta 内部编码测试中,该版本比 Spark 1.2 少用约 25% 的 token。
GPT-6.1 Sol 现已在 Inworld Realtime Router 上线。 - OpenAI 升级后的 Sol 档位 - 据 OpenAI 称,智能接近 Astra,价格只有五分之一 - 1M token 上下文,128K 输出 - 每 1M tokens 输入 $2.00 / 输出 $10.00。 按供应商费率,无加价。替换模型字符串即可直接使用!
这是我们在语音到语音体验工作上的重要一步,它让语音理解、推理与富有表现力的语音生成更加紧密地结合,而我们才刚刚开始。 完整文章谈我们为何走到一起、今天你能获得什么,以及下一步计划:https://tinyurl.com/inworldultravox
Inworld 宣布收购实时语音智能体平台 Ultravox,Ultravox 团队成员已加入 Inworld 并继续开发该平台。收购后的首项更新是 Ultravox 内置的 Inworld 语音改用 Realtime TTS-2,已有语音 ID 继续可用,无需改动代码,升级不额外收费。
推荐理由:收购把语音理解、推理与语音生成并入同一套实时推理基础设施,读者可据此判断语音智能体技术栈的整合走向。
Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。
推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。
Inworld AI 开源 TTS Open Evaluation Toolkit,这是一套可自定义的 TTS 评估框架,用于采样 TTS 系统、离线评估音频并生成可对比的报告。
推荐理由:原文解释了同一 TTS 模型在不同团队手上会得到不同 WER 的原因,并给出这套评估工具的运行方式与首批指标。
Inworld 推出 @mastra/voice-inworld-realtime,将 STT、LLM 与实时 TTS 合并为单个 WebSocket 会话,并绑定到 Mastra Agent。
推荐理由:原文对比级联语音管线与单 WebSocket 会话的差别,并给出不到 100 行 TypeScript 的参考 CLI,读者可据此判断接入成本。
Inworld 宣布对整条语音栈降价,多数开发者在文本转语音、语音识别、LLM 和算力各层降幅达一半以上,新价格已面向所有开发者生效。Realtime TTS-2 降至约 $10/1M 字符,语音识别降至约 $0.10/小时,Router 可接入 100+ 模型且第三方模型不加价。
推荐理由:Inworld 把语音栈各层价格下调并对 TTS、语音识别和 LLM 给出阶梯单价,可用来估算消费级应用的推理成本。
Inworld 联手 Stream 搭出参考实现 Crashout Buddy,组合最新语音模型 Realtime TTS-2 与 Stream 开源的 Vision Agents 框架,可实时看表情、听语音并调整表达。
推荐理由:文中给出了把视觉信号与情绪上下文转成语音表达指令的做法,可据此判断这条实时语音链路能否接进自己的项目。