跳到正文
  1. 游戏陀螺43

    Vidu S2 驱动 AI 主播紫樱中秋开播,30多万人在直播间围观整活

    中秋节期间,造梦次元的AI主播紫樱在直播间挑战限时营业任务,支撑她的实时互动模型是前不久发布的Vidu S2,当天直播间一度涌入2万人。紫樱没有固定流程,观众可点歌、投票选造型、送礼物,她要在互动中换装和表演,被打断后还得接回前面的内容。作者还实测了Vidu S2的Avatar和Editing,上传真人照片或动漫图片并补充设定即可创建数字人,开启摄像头后能在拍摄过程中实时换装、改画风和换背景。

    推荐理由:以一场无固定流程的AI主播直播为样本,实测Vidu S2的实时互动与换装能力,并讨论其在游戏NPC上的落地可能。

  2. Inworld AI Blog51

    Inworld 收购实时语音智能体平台 Ultravox

    Inworld 宣布收购实时语音智能体平台 Ultravox,Ultravox 团队成员已加入 Inworld 并继续开发该平台。收购后的首项更新是 Ultravox 内置的 Inworld 语音改用 Realtime TTS-2,已有语音 ID 继续可用,无需改动代码,升级不额外收费。

    推荐理由:收购把语音理解、推理与语音生成并入同一套实时推理基础设施,读者可据此判断语音智能体技术栈的整合走向。

  1. NVIDIA GameDev39

    NVIDIA 公布面向 RTX 游戏开发者的本月更新,含 DLSS 5、ACE 升级与 RTX Kit 2026.3

    NVIDIA 面向 RTX 游戏开发者公布本月更新,包括带 3D-Guided Neural Rendering 控制的 DLSS 5、NVIDIA ACE 的语音管线扩展与推理框架更新,以及包含 RTX Mega Geometry 2.0 的 RTX Kit 2026.3。官方在推文中给出这条更新的开发者博客链接,具体能力与接入方式见 developer.nvidia.com 上的原文。

    推荐理由:官方把 DLSS 5、NVIDIA ACE 与 RTX Kit 三块更新并排列出,开发者可对照自己项目的接入优先级与升级顺序。

  1. Inworld AI Blog57

    Inworld AI 发布 Realtime TTS-2 实时对话语音模型

    Inworld AI 发布新一代实时对话语音模型 Realtime TTS-2,已在 Inworld API 和 Inworld Realtime API 全面开放。

    推荐理由:原文给出多轮音频上下文、自然语言语音指令和低于 200ms 的首音频延迟,可供判断实时语音对话能否接入自己的项目。

  1. Inworld AI Blog56

    Inworld AI 开源 TTS 开放评估工具包

    Inworld AI 开源 TTS Open Evaluation Toolkit,这是一套可自定义的 TTS 评估框架,用于采样 TTS 系统、离线评估音频并生成可对比的报告。

    推荐理由:原文解释了同一 TTS 模型在不同团队手上会得到不同 WER 的原因,并给出这套评估工具的运行方式与首批指标。

  1. Inworld AI Blog47

    用 Mastra 与 Inworld Realtime API 构建实时语音对话智能体

    Inworld 推出 @mastra/voice-inworld-realtime,将 STT、LLM 与实时 TTS 合并为单个 WebSocket 会话,并绑定到 Mastra Agent。

    推荐理由:原文对比级联语音管线与单 WebSocket 会话的差别,并给出不到 100 行 TypeScript 的参考 CLI,读者可据此判断接入成本。

  1. Inworld AI Blog40

    Inworld 下调语音与 LLM 栈价格,多数开发者降幅过半

    Inworld 宣布对整条语音栈降价,多数开发者在文本转语音、语音识别、LLM 和算力各层降幅达一半以上,新价格已面向所有开发者生效。Realtime TTS-2 降至约 $10/1M 字符,语音识别降至约 $0.10/小时,Router 可接入 100+ 模型且第三方模型不加价。

    推荐理由:Inworld 把语音栈各层价格下调并对 TTS、语音识别和 LLM 给出阶梯单价,可用来估算消费级应用的推理成本。

  1. Inworld AI Blog49

    Inworld 用 Realtime TTS-2 联手 Stream Vision Agents,搭出能看能听的实时语音智能体

    Inworld 联手 Stream 搭出参考实现 Crashout Buddy,组合最新语音模型 Realtime TTS-2 与 Stream 开源的 Vision Agents 框架,可实时看表情、听语音并调整表达。

    推荐理由:文中给出了把视觉信号与情绪上下文转成语音表达指令的做法,可据此判断这条实时语音链路能否接进自己的项目。

已经到底了