lithovas.
2026-08-10 · AI 资讯

英伟达发布开源全双工语音模型 VoiceChat 11B

英伟达近期迈出了语音交互技术的重要一步,推出了首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B。该模型改变了传统“识别+大模型+合成”的复杂分步链路,采用统一网络结构直接处理语音流,将系统响应延迟压缩至 448 毫秒,实现了极其流畅的实时交互与插话响应。

VoiceChat 11B 的核心创新在于其支持在对话过程中触发工具调用。模型通过独立的输出通道与预置的“保持”话术机制,能够自动处理 API 等待时间,填充原本会出现的静默期,显著提升了人机沟通的自然度与工程实用性。

尽管该模型目前以开源权重形式发布,但由于其硬件要求苛刻,需至少 80GB 显存的 GPU 才能支持高效运行,且官方暂时将其定位为研究用途。尽管存在部署门槛,但其在联络中心、智能车载等领域展现的巨大潜力,仍为开发者提供了极佳的实验范本,标志着全双工智能体正在走向更深度的工程化探索。