你有没有同感?跟 AI 认真聊两句,怎么听怎么别扭。
尤其是开语音通话的时候,AI 和真人的界限简直一目了然。
说白了,当下的 AI 语音交互,还像是在打回合制 RPG。你出招它挨打,它出招你干瞪眼。
没法自然地插话或停顿,它也搞不清你是对着它说,还是跟旁边人闲聊。
这种交互上的硬伤,直接把 AI 锁死在“答题机”和“代码助手”的框框里。
上个月,OpenAI 发了 GPT-Live,主打说话时能持续接收输入,外界评价还行。
但很多人不以为然:这有啥新鲜的?今年 4 月,豆包的语音通话就已经上线这功能了。
前两天,豆包又放大招,升级视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime。官方说法是,能提升音视频理解力,增强抗干扰和打断判停表现。
所谓的全模态全双工,核心就一件事:针对前面提到的那些拧巴点——特别是回合制对话模式,来个大改版。
听着挺诱人,我们立马找了几个真实场景实测。
技术再牛,咱们更在乎实不实用。用起来顺不顺心?遇到急事能不能顶用?
先测基础款,看看新版豆包视频电话,是不是还在玩回合制。
别说,现在的豆包确实灵光了。以前的版本像个单线程生物,耳朵嘴巴只能用一个。它一开口,你就别想下指令;它一听,脑子就停转。
现在的豆包就不一样了,哪怕它正叭叭个不停,只要捕捉到你的声音,立马闭嘴,还会根据你的新提问调整回答。
从测试视频也能看出,它对人类提问和断句的判断准多了。
以前你可能只是卡壳一下,话没说完,它就自顾自地开始答。现在,它能分清你是不是还没说完,聊天体验更像面对面跟个小姐姐唠嗑。
不仅如此,豆姐的抗干扰能力也强了不少。
以前它像长了顺风耳,旁边有点动静,就容易误判是你的新指令,转头去回应杂音。现在,它像是有了声纹识别,基本做到和你一对一私聊。
我们还发现,豆包视频的识别速度相当快。
比如下面这个视频,我们玩游戏让它帮忙选武将。就我们那手速,豆包识别得又快又准。
测试中还发现,即便编辑部有人在前头打游戏,后面坐着一群“狗头军师”出主意。
豆包也能 hold 住这种多人混战的复杂场景。它随时在线听大家说话,清楚分辨谁在说、说了啥。
就连沉浸操作的同事小声嘀咕一句“怎么冲刺”,都被豆包精准捕捉,顺手打了个“不太会玩”的标签。
接着给豆包上强度。刚好编辑部在装测试平台,我们让豆包当装机高手,指导操作。
豆包只需简单扫一眼,就知道进度如何。
更有趣的是,除了指导步骤,误操作时它还会主动提醒。
豆包甚至很有眼力见,实时盯着我的手部动作。装内存条时,提前提醒注意正反面,千万别用蛮力硬怼。
而且,豆包能全流程跟踪大型任务。当我们按指导装完显卡,以为大功告成准备收工时。
这哥们儿居然查漏补缺:“喂,显卡供电线还没接呢!”
连角落里最容易被忽略的主板 CPU 供电线,都没逃过它的眼睛。主打一个:你随便折腾,我来兜底。
过程中,我们还见识了豆包强大的记忆功能。
全程开着视频,装完平台准备离开影棚时,想起有台测试机不知放哪了。
我突然想,豆包会不会知道?结果还真记着呢。
这不只是听懂话,简直是 AI 吃了哆啦 A 梦的记忆面包。
平时跟真人打电话,谁会帮你记随手搁哪的东西?豆包偏偏就盯住了。
如果说装机只是影棚里的极客游戏,在人声鼎沸、流程复杂的医院里,豆包还能扛得住吗?
我们把豆包带到了医院,想试试更新后的视频能力,能否辅助老人等特殊人群独自看病。
刚到门口,两眼一抹黑,问豆包去哪取号。
豆包提示:面前的自助机或人工窗口都行。
它还贴心建议:如果提前预约好,人工窗口排队人多,选自助更方便。
按引导取好号后,常见问题是找不到诊室。大医院容易把人绕晕,但现在,拍张照给豆包看,它会告诉你怎么走。
到了诊室门口,很多医院要先签到才能进排队队列。不同医院、科室的规则和设备各异,常让人懵圈。豆包却能一眼看清怎么操作。
整套测试下来,从进门取号、找电梯到楼层、签到……除了路过护士和路人用奇怪眼光打量世超外,几乎挑不出毛病。
在取号、找路、识设备这些流程性任务上,豆包已能提供全程陪同。
总体看,豆包视频能力提升明显。但我们觉得,最有意思的不是它多认了几个东西或反应多快,而是它开始尝试理解语气、声音,真正学会了像人一样沟通。
我们研究了一下,为啥进步这么快。功臣是底层的 SeedRealtime。
以前的 AI 视频通话本质是流水线:
听声音→转文字→看截图→综合处理→生成语音。
这种串联思路,每一步再快,连起来也慢半拍。
SeedRealtime 狠就狠在,把声音、画面、时序与表达融进了一个端到端模型。
看听说在同一系统内并行,不分先后。AI 能通过手势和画面,秒懂你说的“这个、那个”指啥,也能精准过滤旁人杂音。
同样,能持续理解视频场景变化,AI 才分得清何时闭嘴、何时主动提醒。
最终呈现的效果,就是懂得察言观色,像个真人。
理清底层逻辑后你会发现,豆包这次展示的能力,正是整个 AI 行业死磕的方向之一。
隔壁海外大厂也在推实时语音、多模态交互和思考模型。除了前面提过的 GPT-Live,OpenAI 还展示了 Thinking Machines,但功能尚处演示阶段,公众没法随意使用。
所以,豆包的音视频全双工能力,才是真正向贾维斯方向进化的关键一步。
当然,离贾维斯还有距离。现在还得举着手机,视频通话也受网络、续航限制。
但至少从这次体验看,AI 助手正从“你问它答”,变成边看、边听、边协助的角色。
多说两句,手机形态似乎制约了未来 AI 的发展。如果视频能力跳出手机,应用到智能眼镜、手环或其他 AI 硬件上(当然,得解决续航、散热、网络、算力等问题),或许能开启一个全新的原生 AI 世界。
不久的将来,要是看到有人在街上嘀嘀咕咕,别以为人家魔怔了,说不定他正在跟豆包视频通话呢。
撰文:八戒
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
豆包









