Inworld 解读 TTS-2 语音引导与评测
Inworld AI 研究负责人 Aleksey Tikhonov 撰文解释 TTS-2 的语音引导机制:用指令告诉语音模型该怎么念出台词。文章重点是如何衡量这些指令是否真正生效——自动化音频评判在其测试中表现不足,团队转而测量语音本身的变化。他还谈到指令措辞为何重要、同一方向在不同音色上结果为何不同,这些度量用于追踪模型版本之间的变化,并有其局限。
Inworld AI 研究负责人 Aleksey Tikhonov 撰文解释 TTS-2 的语音引导机制:用指令告诉语音模型该怎么念出台词。文章重点是如何衡量这些指令是否真正生效——自动化音频评判在其测试中表现不足,团队转而测量语音本身的变化。他还谈到指令措辞为何重要、同一方向在不同音色上结果为何不同,这些度量用于追踪模型版本之间的变化,并有其局限。
这是我们在语音到语音体验工作上的重要一步,它让语音理解、推理与富有表现力的语音生成更加紧密地结合,而我们才刚刚开始。 完整文章谈我们为何走到一起、今天你能获得什么,以及下一步计划:https://tinyurl.com/inworldultravox
中秋节期间,造梦次元的AI主播紫樱在直播间挑战限时营业任务,支撑她的实时互动模型是前不久发布的Vidu S2,当天直播间一度涌入2万人。紫樱没有固定流程,观众可点歌、投票选造型、送礼物,她要在互动中换装和表演,被打断后还得接回前面的内容。作者还实测了Vidu S2的Avatar和Editing,上传真人照片或动漫图片并补充设定即可创建数字人,开启摄像头后能在拍摄过程中实时换装、改画风和换背景。
推荐理由:以一场无固定流程的AI主播直播为样本,实测Vidu S2的实时互动与换装能力,并讨论其在游戏NPC上的落地可能。
Inworld 宣布收购实时语音智能体平台 Ultravox,Ultravox 团队成员已加入 Inworld 并继续开发该平台。收购后的首项更新是 Ultravox 内置的 Inworld 语音改用 Realtime TTS-2,已有语音 ID 继续可用,无需改动代码,升级不额外收费。
推荐理由:收购把语音理解、推理与语音生成并入同一套实时推理基础设施,读者可据此判断语音智能体技术栈的整合走向。
NVIDIA 面向 RTX 游戏开发者公布本月更新,包括带 3D-Guided Neural Rendering 控制的 DLSS 5、NVIDIA ACE 的语音管线扩展与推理框架更新,以及包含 RTX Mega Geometry 2.0 的 RTX Kit 2026.3。官方在推文中给出这条更新的开发者博客链接,具体能力与接入方式见 developer.nvidia.com 上的原文。
推荐理由:官方把 DLSS 5、NVIDIA ACE 与 RTX Kit 三块更新并排列出,开发者可对照自己项目的接入优先级与升级顺序。
Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。
推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。
Inworld AI 开源 TTS Open Evaluation Toolkit,这是一套可自定义的 TTS 评估框架,用于采样 TTS 系统、离线评估音频并生成可对比的报告。
推荐理由:原文解释了同一 TTS 模型在不同团队手上会得到不同 WER 的原因,并给出这套评估工具的运行方式与首批指标。
Inworld 推出 @mastra/voice-inworld-realtime,将 STT、LLM 与实时 TTS 合并为单个 WebSocket 会话,并绑定到 Mastra Agent。
推荐理由:原文对比级联语音管线与单 WebSocket 会话的差别,并给出不到 100 行 TypeScript 的参考 CLI,读者可据此判断接入成本。
Inworld 宣布对整条语音栈降价,多数开发者在文本转语音、语音识别、LLM 和算力各层降幅达一半以上,新价格已面向所有开发者生效。Realtime TTS-2 降至约 $10/1M 字符,语音识别降至约 $0.10/小时,Router 可接入 100+ 模型且第三方模型不加价。
推荐理由:Inworld 把语音栈各层价格下调并对 TTS、语音识别和 LLM 给出阶梯单价,可用来估算消费级应用的推理成本。
Inworld 联手 Stream 搭出参考实现 Crashout Buddy,组合最新语音模型 Realtime TTS-2 与 Stream 开源的 Vision Agents 框架,可实时看表情、听语音并调整表达。
推荐理由:文中给出了把视觉信号与情绪上下文转成语音表达指令的做法,可据此判断这条实时语音链路能否接进自己的项目。