不知道大伙儿有没有同感,每次想跟 AI 顺畅聊几句,总觉着哪儿不对劲。

尤其是直接语音沟通时,那种人和机器之间的隔阂感特别明显。

说到底,现在的 AI 语音交互还像在玩回合制:你讲完它才接话,它说完你就得听着。

没法自然地插嘴或停顿,它也搞不清你是对它说话,还是跟旁边的人闲聊。

这种交互上的硬伤,直接把 AI 局限在答题机和代码工具的范畴里。

上个月 OpenAI 推出了 GPT-Live,支持边说边听用户输入,外界评价不错。

但很多人觉得这没啥稀奇的,因为今年 4 月,豆包的语音通话模式就已经升级了这项功能。

前两天,豆包又反手升级了视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime,号称能提升音视频理解力,增强抗干扰和打断判停效果。

所谓的全模态全双工交互,核心就是解决前面提到的那些别扭之处,彻底改变回合制对话的模式。

听起来挺有意思,我们也赶紧找几个真实场景试了试。

技术再高大上,咱们更关心的是新能力实不实用,用起来顺不顺手,关键时刻能不能帮上忙。

先来个基础的,看看新版豆包视频电话是不是还在玩回合制。

还真别说,现在的豆包聪明了不少。之前的版本像个单线程生物,耳朵和嘴巴不能同时工作,它说话时就听不见你的新指令;它听你说话时,就没法思考。

如今的豆包就好多了,哪怕它正叭叭叭地说着,只要听到你的声音,立马闭嘴,还会根据你的新提问调整内容。

从测试视频也能看出,它对人类提问和断句的判断更准了。

以前你可能只是卡壳一下,话没说完,它却 get 不到,自顾自地开始回答;现在,它基本能分辨出你是否说完,对话过程更像和一个小姐姐面对面聊天。

不仅如此,豆姐的抗干扰能力也强了不少。

以前它像长了顺风耳,身边有点动静就容易误判是你的新指令,转头去回应杂音;现在,它仿佛有了声纹解锁,基本能做到和你一对一私聊。

我们还发现,如今豆包视频的识别速度杠杠的。

比如下面这个视频,我们玩游戏时让它帮忙选武将,就咱这滑动速度,豆包的识别又快又准。

测试中,即使面对编辑部玩游戏、一个人在前打、后面坐着几个“狗头军师”的情况。

豆包也能 hold 住这种多人对话的复杂场景,随时在线听大家说话,清楚分辨说话对象和内容。

就连沉浸操作的同事小声嘀咕一句“怎么冲刺”,都被豆包精准捕捉,还被打上了“不太会玩”的标签。

接下来,我们给豆包上了点强度。刚好编辑部在装测试平台,我们让豆包当个装机高手,指导怎么操作。

结果豆包简单扫了眼,就知道这台测试平台的进度如何。

紧接着我们发现,豆包不仅能在装机过程中指导操作,还能在误操作时主动提醒。

豆包甚至超有眼力见,实时盯着我的手部动作,在装内存条时,提前提醒注意正反面,别用蛮力硬怼。

而且我们发现,豆包完全可以全流程跟踪装机这种大型任务。就在我们根据豆包的指导装完显卡,觉得大功告成准备收工时。

这哥们儿居然查漏补缺:你丫的显卡供电线还没接呢!

甚至连角落里最容易被忽略的主板 CPU 供电线,都被豆包发现了,主打一个你随便折腾,哥们兜底。

在这个过程中,我们还发现了豆包强大的记忆功能。

因为全程开着视频,等我们装完测试平台,准备离开影棚时,想起来有台测试机不知道放哪儿了。

于是我突然想到,豆包会不会知道?结果它还真记着了。

要知道,这可不仅是听懂话,简直就是 AI 磕了哆啦 A 梦的记忆面包。

我就问,平时和真正的人类打电话,谁会帮你记自己随手放的东西?但豆包偏偏就帮你盯在眼里了。

如果说装机只是在影棚里的极客游戏,那在人声鼎沸、流程复杂的真实医院里,豆包还顶得住吗?

于是,我们把豆包带到了医院,想试试更新后的视频能力能否辅助老人等特殊人群在大医院独自看病。

到医院门口后,咱两眼一抹黑,问豆包先去哪儿取号。

豆包表示,面前的人工挂号窗口,或者边上的自主取号机取号就行。

而且,豆包还贴心建议,如果提前预约好了,人工窗口排队人多,选自助取号比较方便。

按照引导取好预约号后,常见问题是不知道该怎么上楼找诊室。特别是一些大医院,很容易把病人绕晕,但现在,你只要给豆包看一眼,它会告诉你怎么走。

同样的,到了诊室门口,现在很多医院都得先签到才会进入排队队列,但不同医院、科室的签到规则和机器不一样,不少人会傻眼,豆包就能一眼告诉你怎么操作。

我们整了一个测试下来,从医院大门开始,豆包一步步带我们去自助机取号、找到电梯到达指定楼层、签到……除了路过的护士小姐姐和路人会用奇怪的眼光观察世超,几乎挑不出任何毛病。

所以在取号、找楼层、识别签到设备这些流程性任务上,豆包已经能提供全程陪同的帮助。

总的来说,豆包的视频能力确实有了不小提升。但在我们看来,最有意思的进步不是它能多认几个东西,或者反应更快,而是它真的在尝试理解你的语气、声音等,真学会了像人一样和人沟通。

我们也研究了一下,为啥现在豆包的视频能力进步这么快,发现真正的功臣是底层的 SeedRealtime。

以前 AI 所谓的视频通话,本质上都是流水线:

AI 先听到声音,转成文字,看一眼屏幕截图,综合处理思考,最后生成语音回答。

这种串联思路,每个步骤反应再快,连起来也显得慢半拍。

但 SeedRealtime 最狠的一点,是将声音、画面、时序与表达,全都融进了一个端到端模型。

这么一来,看听说在同一套系统里进行,不分步骤不分前后,AI 就能通过手势和现场画面,秒懂你说的“这个,内个儿”指的是啥,也才能精准过滤掉旁人的杂音。

同样的,能持续理解视频里的场景变化,AI 也就能分清啥时候该闭嘴,啥时候能主动开口提醒了。

最后,给人的表现就是懂得察言观色,像个真正的人了。

在搞明白了这些底层逻辑后,你就会发现,豆包这次展现出来的能力,也是目前整个 AI 行业死磕的方向之一。

隔壁海外大厂们也在提实时语音、多模态交互和思考模型,除了咱们前面提到的 GPT-Live,OpenAI 也还拿出 Thinking Machines 露脸,但它的功能还在演示阶段,没法让公众随手敞开用。

所以豆包的这个音视频全双工能力,才是真正开始往我们期待的贾维斯方向进化了。

当然了,这离贾维斯还有不少距离,现在你还得到处举着手机,视频通话也受网络、续航等条件限制。

但至少从这次体验看,AI 助手正在从“你问一句、它答一句”,变成一个能边看、边听、边协助的角色。

再多说两句,咱们突然觉得手机这个形态,有点制约未来 AI 的能力了。如果这个视频能力未来可以跳出手机以外,像是智能眼镜、手环、AI 小硬件(当然,得搞定续航、散热、网络、算力等问题),或许真是一个完全崭新的原生 AI 世界了。

所以,不久的将来,如果看到谁在大街上嘀嘀咕咕,别以为人家是魔怔了,或许他正在和豆包打电话呢。

撰文:八戒

编辑:江江 & 面线

美编:焕妍

图片、资料来源:

豆包