Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/8/2 04:45:33

全球语音大模型,角逐方向盘后的麦克风

AI 中文解读
全球语音大模型正展开一场“毫秒级”竞赛,核心看点是谁能最快开口、听得最准。马斯克旗下SpaceXAI的Grok Voice把回应速度压缩到0.70秒,比上代快了近一半,几乎感觉不到“等机器人”的停顿;而阿里云Qwen虽然准确率刷新世界纪录,达到99.2%,但4秒的延迟让对话体验像“坏了”。两家正好代表了行业的两难:跑得快还是听得准。 这场战争不再局限于手机里的聊天框,而是蔓延到汽车座舱、智能眼镜和耳机里。各家打法不同:OpenAI靠降低API价格吸引开发者,微软把语音功能打包成“一条龙服务”绑定企业客户,Meta则选择开源,让开发者免费使用。背后争论的焦点是:把语音识别、理解、合成合成一个整体,还是拆成多个环节拼装,哪种路线更优? 对普通人来说,最直接的变化是车里的语音助手不再像“对讲机”,能自然对话、帮你订日程;戴耳机时AI可以实时翻译外语,打电话时能自动降噪。但眼下各家的优劣还没统一,车企和硬件厂商需要仔细挑选,用户体验也可能忽快忽慢。未来半年,随着巨头们继续堆算力、改架构,更聪明、更即时的语音助手会逐渐成为我们日常生活的标配。
语音AI的战争,已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。7月,实时语音Agent战场上连爆多颗信号弹。7月23日,Anthropic为Claude Voice做了一次重大升级,语音模式不再局限于Haiku轻量模型,Opus和Sonnet开始驱动语音推理,同时接入了Gmail、Calendar、Slack等应用。7月24日,亚马逊升级Alexa+,支持跨Echo音箱、手机App、车载设备和网页端的无缝多轮对话,背后是Nova和Anthropic Claude混合路由的模型架构。7月28日,阿里云Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Artificial Analysis Big Bench Audio纪录,登顶全球语音推理排行榜,但它的平均首音延迟高达4.02秒。7月29日,SpaceXAI(原xAI)发布Grok Voice Think Fast 2.0,首音延迟压到0.70秒,Big Bench Audio得分97.2%,在衡量Agent自主执行能力的τ-Voice基准上以56.5%遥遥领先,GPT-Realtime-2.1 High是45.7%,Gemini 3.1 Flash High是37.7%。更早一些,7月6日,OpenAI也发布了GPT-Realtime-2.1。SpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦,而是一场从API到硬件终端、从消费电子到智能座舱的全线交火。一场“毫秒级”军备竞赛过去半年,实时语音Agent领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上:首音延迟、语音识别精度、调用成本。先说SpaceXAI。Grok Voice Think Fast 2.0的首音延迟为0.70秒,从用户说完话到AI开口,在大多数人尚未察觉的间隙就已完成了应答。作为对比,v1.0的TTFA是1.25秒,GPT-Realtime-2高推理模式是2.33秒,Gemini 3.1 Flash High是2.98秒,Qwen Audio 3.0 Realtime Plus是4.02秒。在Vapi Humanness Index的TTS延迟实测中,Grok TTS的流式模式首音延迟已压到285毫秒,标准模式460毫秒。2.0在此基础上进一步优化了推理效率:推理token减少60%,工具调用可以在用户说完第一句话之前就开始执行。xAI从一开始就把语音管线做成了一体化,自研语音活动检测、自研音频分词器、自研端到端语音模型,传统ASR→LLM→TTS的三级流水线被xAI压缩成了一个模型。这就是285毫秒的物理学解释:每绕过一层中间件,就省掉一层延迟和一层错误概率。在Artificial Analysis的综合语音质量指数上,Think Fast 2.0总评分82.9%,较v1.0的75.7%提升9.5%,超越了GPT-Realtime-2.1的79.1%和Gemini 3.1 Flash的69.5%;Full Duplex Bench从77.8%跳升至95.1%,逼近GPT-Realtime-2.1的95.7%。转录准确率在嘈杂环境中的提升更是以数量级计,10倍于上一代,远超专业转录模型的水平。但阿里云在7月28日打破了这一格局。Qwen Audio 3.0 Realtime Plus以99.2%的成绩刷新Big Bench Audio纪录,超过了Grok Voice Think Fast 2.0的97.2%、Step-Audio R1.1的97.6%和GPT-Realtime-2.1 High的96.0%。在会话动态和Agent执行维度上也分别以98.4%和54.6%领先。代价是4.02秒的平均首音延迟。Qwen Audio的Plus和Flash双版本策略精准契合不同场景:Flash面向实时交互(首包延迟300毫秒级)、Plus面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中,4秒意味着不可用。这个矛盾暴露了当前技术竞赛中一个绕不开的取舍:追求极致推理精度的模型,往往在延迟上买单,Qwen Big Bench Audio的TTFA是Grok的5.7倍。而在实时语音领域,延迟是物理天花板,0.5秒以内的延迟让人感觉“在对话”,1.5秒左右就变成了“在等机器人”,到4秒,用户只会觉得“这功能坏了”。OpenAI的打法是另一条路。GPT-Realtime-2.1在7月6日发布后,旗舰模型音频输入32/百万token、输出64/百万token,mini版10和20。理论折算约0.05/分钟,独立开发者实测的数据则迅速偏离理论值,一个房产导览AI的实际均价约0.07/分钟,最差情况$0.146/分钟。token计费在长对话场景下的成本膨胀,是OpenAI语音模型商业化绕不开的难题。Google Gemini 3.1 Flash Live在3月发布时曾在ComplexFuncBench Audio上以90.8%的函数调用准确率和90多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉,某些模型版本从500毫秒增至1800毫秒,甚至10秒以上的等待,暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商,这种不稳定性比“慢”更致命。如果再把镜头拉远一点,比七月更早落子的还有两个重量级玩家。微软在6月的Build大会上将Voice Live API正式推入GA阶段。这套API把STT、LLM、TTS、降噪、回声消除、打断处理、Avatar打包成一个统一接口,开发者不需要自己拼接语音管线。更关键的是微软的双重身份:它既是GPT-Realtime-2.1的云平台宿主(企业客户通过Azure调用OpenAI模型),又在推自己的Azure-Realtime自研模型。Voice Live已经和Foundry Agent Service打通,支持WebSocket和WebRTC低延迟连接,直接嵌入了企业级Agent开发的全流程。微软走的是一条“平台即壁垒”的路线,客户一旦把语音Agent跑在Azure上,迁移成本远比切换一个API端点高得多。Meta则在开源侧投下了一枚重弹。4月,Meta以Apache 2.0协议开源了Llama-Voice,一个7B参数的TTS基础模型,支持52种语言,10秒音频即可零样本声音克隆,能在消费级GPU上实时运行。上线48小时下载量突破80万,社区迅速衍生出podcasting、有声书、游戏NPC配音等几十个微调版本。Meta手里还有SeamlessStreaming v2,支持100多种语言的实时语音翻译,延迟约2秒。结合Ray-Ban Meta Gen 2这个已经在售的硬件终端,Meta拥有从开源模型到消费硬件的完整通路,OpenAI恰好缺这一块。端到端、混合路由、轮次制、拼积木SpaceXAI、OpenAI、阿里云和Google被归在“实时语音”这同一个标签下,但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上Anthropic和亚马逊,至少能看到四种截然不同的技术选择。最激进的是Grok Voice的原生端到端路线。音频输入、音频输出,全由一个模型完成。这套架构最大胆的一点,是它在WebSocket连接中直接处理原始音频信号,不经过ASR转文本,也不经过TTS合成。60%的推理token压缩从侧面印证了这一点,2.0不需要把用户说的每句话都拆成详细文本再推理,模型直接在音频语义空间中完成了“理解”。Grok TTS在Vapi Humanness Index上的电话实体识别错误率仅5.0%,而ElevenLabs为12.0%、Deepgram为13.5%。相比之下,OpenAI的Realtime API虽然标称支持端到端,在成本结构和延迟特征上更像一个“多模态ChatGPT加实时音频编解码器”。token计费,上下文越长越贵,缓存机制(0.40/百万输入token旗舰版)只能部分对冲。实际部署中0.05至$0.15/分钟的波动区间意味着,用户的每一轮追问都在悄悄抬高账单。Anthropic和亚马逊则走出了两条既不同于Grok也不同于OpenAI的混合路线。Anthropic选择轮次制(listen→think→speak)而非全双工,以推理深度和工具准确性换取实时流畅度。Claude Voice的Opus模式可以帮用户演练客户提案、推敲逻辑漏洞,同时连接Gmail、Calendar、Slack等应用,每一步操作前都要求用户确认,核心逻辑是语音不只是一个交互界面,它应该能推动真实的工作流程。代价是交互节奏不如全双工自然,但在需要深思熟虑的场景中,轮次制的深度优于全双工的流畅。亚马逊走多模型路由,通过Bedrock平台让Nova处理快速任务、Anthropic Claude处理复杂推理,各司其职。6亿台Echo终端是Alexa的基本盘,但7月升级释放了更重要的信号,Alexa+已经跨出硬件,进入了浏览器、手机App和车载设备。亚马逊同时推进代号Moonraker的Agent项目,投入超过1亿美元GPU算力,目标是实现多任务联动交互,但高昂成本已在内部引发争议。这两家的共同判断是“不为全双工牺牲其他能力&
分享
阅读原文