华潮新闻网
科技

实测!豆包视频全程带逛大医院,AI助力特殊人群就诊更省心

来源:华潮新闻网
实测!豆包视频全程带逛大医院,AI助力特殊人群就诊更省心

不知道大家有没有同感,每次试图跟 AI 好好对话,总觉着哪儿都不对劲。

尤其是直接语音沟通时,那种人与机器之间的隔阂感尤为明显。

究其根本,当下的 AI 语音交互,更像是一场回合制游戏:你讲它听,它答你停。

用户无法自然地进行停顿或插话,AI 也搞不清你是对它说话,还是在跟旁人闲聊。

这种交互层面的硬伤,直接把 AI 牢牢限制在答题机和代码工具的定位里。

上个月,OpenAI 发布了 GPT-Live,实现了边说边听的功能,外界评价不错。

但不少人觉得这不算新鲜事,因为今年 4 月,豆包的语音通话模式就已升级了该功能。

前几日,豆包更是直接升级了视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime,旨在提升音视频理解、抗干扰及打断判停效果。

所谓的全模态全双工交互,核心就是针对前述的交互痛点,对回合制对话模式进行彻底重构。

听起来确实有点意思,于是我们找了几个真实场景实测一番。

技术再高大上,咱们更关心的还是实用性:用起来是否顺手省心?遇事能否真帮上忙?

先来个基础测试,看看新版豆包视频电话,是否还停留在回合制阶段。

还真别说,现在的豆包聪明多了。

此前的版本像个单线程生物,耳朵和嘴巴不能同时工作:它在说话时,很难听见新指令;在听你说话时,便停止思考。

如今的豆包则不同,即便它正滔滔不绝,只要捕捉到你的声音,立马闭嘴,并根据你的新问题调整回答。

从测试视频中也能看出,它对人类提问和断句的判断力提升了。

以前你可能只是稍作迟疑,话未说完,它就自顾自地开始回答;现在,它基本能分辨你是否说完,对话体验更像与一位小姐姐面对面交流。

不仅如此,豆姐的抗干扰能力也显著增强。

过去,它如同顺风耳,周围稍有动静就容易误判为新指令,转头回应杂音;现在,它仿佛拥有了声纹解锁,基本实现与你的一对一私聊。

此外,我们还发现豆包视频的识别速度相当快。

如下面视频所示,我们在玩小游戏时让它协助选择武将,面对如此快速的滑动操作,豆包的识别依然又快又准。

测试中我们发现,即便在编辑部玩游戏,一人操作,身后几位“军师”出谋划策,

豆包也能从容应对这种多人对话的复杂场景,实时在线听取各方发言,清晰分辨说话对象及内容。

就连沉浸操作的同事小声嘀咕一句“怎么冲刺”,都被豆包精准捕捉,并打上了“不太会玩”的标签。

接下来,我们给豆包增加了难度。恰逢编辑部正在搭建测试平台,我们让豆包化身装机高手,指导操作流程。

结果豆包只需简单一扫,便知晓这台测试平台的进度。

紧接着我们发现,豆包不仅能指导装机步骤,还能在误操作时主动提醒。

豆包甚至很有眼力见,实时关注手部动作,在安装内存条时,提前提醒注意正反面,切勿蛮力硬怼。

更令人惊讶的是,豆包能全流程跟踪装机这类大型任务。

当我们根据指导装完显卡,以为大功告成准备收工时,

这位哥们儿居然查漏补缺:“你的显卡供电线还没接呢!”

甚至连角落里最易被忽略的主板 CPU 供电线,也被豆包发现,主打一个让你随意折腾,它来兜底。

在此过程中,我们还见识了豆包强大的记忆功能。

全程开启视频后,等我们装完测试平台准备离开影棚时,想起有一台测试机不知放哪了。

我突然想到,豆包会不会记得?结果它还真记着呢。

要知道,这不仅是听懂话,简直是 AI 吃了哆啦 A 梦的记忆面包。

我问,平时真正的人类打电话,谁会帮你记随手放置的物品?但豆包偏偏就看在眼里了。

如果说装机只是影棚里的极客游戏,那么在嘈杂混乱的真实医院里,豆包还能扛得住吗?

于是我们将豆包带入医院,想试试更新后的视频能力,能否辅助老人等特殊人群在大医院独自就诊。

到达医院门口,我们对环境两眼一抹黑,询问豆包先去何处取号。

豆包建议,面前的窗口或旁边的自助取号机均可。

它还贴心提示,若已提前预约且人工窗口排队人多,选自助取号更方便。

按引导取好预约号后,常见难题是找不到诊室,尤其大医院容易让人迷路,但现在,只需拍给豆包看,它会告知路线。

同理,到了诊室门口,多数医院需先签到才进入排队序列,但不同医院、科室的规则和设备各异,常让人懵圈,豆包却能一眼看清操作指引。

整个测试下来,从医院大门开始,豆包一步步引导我们去自助机取号、乘电梯至指定楼层、签到……除了路过的护士和路人用异样眼光打量世超外,几乎挑不出毛病。

由此可见,在取号、找楼层、识别签到设备等流程性任务上,豆包已能提供全程陪同协助。

纵观整体表现,豆包的视频能力确有大幅提升。但在我们看来,最有意义的进步并非它能多认几个物体或反应更快,而是它真的在尝试理解语气、声音等细节,真正学会了像人一样沟通。

我们也研究了豆包视频能力进步神速的原因,发现幕后功臣正是底层模型 SeedRealtime。

以往 AI 的视频通话本质上是流水线作业:

AI 先听声音转文字,再看屏幕截图,综合处理后生成语音回答。

这种串联思路,即便每一步处理再快,连起来也显得慢半拍。

而 SeedRealtime 的厉害之处在于,将声音、画面、时序与表达全部融合进一个端到端模型。

这样一来,看、听、说在同一系统内同步进行,不分先后步骤。AI 能通过手势和现场画面,秒懂你口中“这个、那个”指代何物,也能精准过滤旁人的杂音。

同样,因能持续理解视频中的场景变化,AI 也就分得清何时该闭嘴,何时可主动开口提醒。

最终呈现的效果,便是懂得察言观色,宛如真人。

理清这些底层逻辑后,你会发现,豆包此次展现的能力,也是目前整个 AI 行业攻坚的方向之一。

海外大厂也在推进实时语音、多模态交互和思考模型,除前述的 GPT-Live,OpenAI 还展示了 Thinking Machines,但其功能尚处演示阶段,公众无法随时使用。

因此,豆包的音视频全双工能力,才是真正向着我们期待的贾维斯方向迈进。

当然,距贾维斯仍有距离,目前仍需手持手机,且视频通话受网络、续航等因素制约。

但至少从这次体验来看,AI 助手正从“一问一答”,转变为能边看、边听、边协助的角色。

再多说两句,我们突然觉得手机形态或许限制了未来 AI 的发展。若视频能力能跳出手机,应用于智能眼镜、手环或其他 AI 硬件(当然需解决续航、散热、网络、算力等问题),或许将迎来一个全新的原生 AI 世界。

所以,不久的将来,若见有人在街头喃喃自语,别以为他魔怔了,也许他正和豆包通电话呢。

撰文:八戒

编辑:江江 & 面线

美编:焕妍

图片、资料来源:

豆包

相关推荐