0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

“AI视频通话”产品化的三条路

脑极体 来源: 脑极体 作者: 脑极体 2024-10-17 09:13 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

wKgaomcP5f2AOYjwAAnfIkAz9HY162.jpg

“做AI产品经理太难了。”近期脑极体的同事参加了一场开发者大会,一位产品经理向我们坦言:“AI时代,做产品的方法论没变,但以往熟悉的东西几乎都被清零了。”

用户需求被清零了,大模型到底能用来做什么,用户自己是不清楚的,需求是空白的,需求调研、产品定义,就要花费好几个月的时间。

好不容易定义好了,基础模型的一个更新,就有可能将前期所做的工作、功能规划等推倒重来。

“比如GPT-4o出现之后,语音对话的能力是我们完全意想不到的,就又得把产品开发过程再来一遍……”

而纵观一年多来推陈出新的数百个大模型,GPT-4o可以说是产品化程度非常高的一个了。

wKgZomcP5f2AUSYDAABr0doA8JI811.jpg

比如OpenAI发布会上展示的“AI视频通话”,使用户与AI进行实时的、跟真人对话一样自然的视频交流。国内模型厂商也很快推出了类似的AI视频通话功能,不少媒体和用户都表示“体验炸裂”。

但半年时间过去,发现在最初的震惊与新鲜感过后,在真正的软件生态里,还是没有看到“AI视频通话”被大规模、高频率地用起来,更别提激活用户的付费欲望了。为什么会这样?

我们就从“AI视频通话”说开去,聊聊AI产品化、商业化到底要经过哪些磨砺。

wKgaomcP5f6ACYcUAAJNgLuXPck977.jpg

钻石原矿被开采出来,其实并不璀璨夺目,是经由工匠们的切割打磨,被镶嵌成钻石首饰,包装为“爱情象征”,才走进大众消费市场,价值实现了百倍千倍攀升。

类GPT-4o大模型就类似于原矿,作为“交互天花板”,潜在商业价值很大,但必须经过产品化的精细打磨与包装,才能被大众用户广泛接受,实现其真正的价值和应用潜力。

而基于类GPT-4o所诞生的“AI视频通话”,虽然向产品化迈进了一步,但依然属于原型的基础能力。

尽管OpenAI、智谱等模厂已经针对“AI视频通话”这一应用,打磨了诸如响应速度、具体用例等产品侧的细节,并融入到ChatGPT、智谱清言APP等产品当中。但作为一种软件应用来说,这种与通用场景相结合的落地模式,还是比较粗陋。

首先,需求过于宽泛。

AI视频通话,技术上相当于让AI拥有“眼睛”和“嘴”,具备察言观色、跟真人对话的能力。这很容易就让人想到AI陪伴,人与AI谈天说地、谈情说爱。

直接将AI视频通话能力嫁接在聊天机器人上,本质依然是AI聊天,能力升级,但无法解决chatbot商业价值低的核心问题。

AI视频聊天,用户容错率高,不在乎AI偶尔犯错或出现幻觉,这也意味着对基础模型能力要求不严苛,无法在技术层面拉开差距。曾经的智能音箱大战、智能助手红海,也会在AI视频聊天领域出现,并且由于聊天并不能帮助用户完成具体任务或解决问题,用户还得自己琢磨在视频里跟AI聊什么,没一会儿就只能跟AI面面相觑,难以带来确定性的产品满足和持久粘性,新鲜感过后就会流失。

而一些直接用途,想要普遍应用,也有大量细节仍待填充。

比如基于AI视频通话的无障碍功能,是一个非常直接的落地场景。AI视频通话,可以将设备摄像头作为“眼睛”,帮助人去理解物理世界,这对视障人群岂不是很友好?

但实际上,大模型APP的视频通话功能,是无法直接被视障人群用起来的,还有大量的产品细节需要考虑。比如我们曾体验过实时图像识别,AI只能认出“面前有两张卡”,但哪张是公交卡,哪张是银行卡,是无法准确识别的,这就需要基于视障群体出行接触的高频物体,进行针对性地精调。

而且,在飞机、高铁、地铁等弱网、无网环境下,也要保证视障人群与AI视频通话的实时性,就需要纯端侧运行的多模态大模型,将模型做小、计算效率做高。

产品设计层面,还有大量的细节,还等待着填充,才能转化为用户可以方便使用的产品和服务。

可以看到,没有更细致的产品化,尽管“AI视频通话”这一基础能力很厉害,却不知道能用来干什么,很可能导致技术找不到市场,倒在了产品化变现的黎明到来之前。

这个“至暗时刻”会发生吗?

欣慰的是,我们发现 “AI视频通话”能力,已经开始向行业输送了,意味着这座AI基础能力的“原矿”,终于开始被打磨成晶光四射的钻石。

我们就从“原矿”流向的应用领域,来分享几个“AI视频通话”的产品化方向。

wKgZomcP5f-ASZ5sAAIRCq2qfR8957.jpg

大模型怎么落地?智能体是方向。

智能体怎么服务?+AI视频通话事半功倍。

如今,手机软件承载着我们日常的绝大多数服务,在各个应用中来回跳转、操作是非常繁琐的。

今年以来,荣耀、vivo等厂商都在基于智能体打造一系列创新功能体验,比如“一句话点奶茶”“一句话订餐厅”等。用户只需要向手机助手发出指令,手机智能体会自动理解需求、拆解任务步骤、调取相关功能,一站到底地完成任务。

Agent手机就很好地解决了数字服务链路长、操作繁琐的问题,但新的问题又来了,那就是智能体还需要“看得懂”“能交流”。

举个例子,在外卖小程序下单时,遇到广告是常态,这时候需要智能体agent执行准确的操作,比如“点击关闭”“跳过”等,来推进到下一步。如果智能体无法识别相关内容,必须用户自己动手操作,那整个链路就被打断了,用户体验会非常不好。有跟智能助手通过文字prompt交流的功夫,用户自己就能点开程序完成下单了。

Agent手机+视频通话,就能用户体验更进一步。

比起打字的繁琐、语音尴尬症,在人机对话时,像跟真人面对面交流一样,通过语音对话完成下单,更符合直觉,也更有被服务的舒适感。对话之后,大模型对视频画面进行实时分析,指导智能体来自动执行,整个体验会从头到尾丝滑无感。

wKgaomcP5f-AfO-hAACIzvedjH8747.jpg

目前,国内终端厂商在端侧智能体方面走得是更快的。脑极体在VDC 2024大会上了解到,蓝河操作系统增添了视觉感知能力,让系统像人类一样“听得懂”“看得清”。智能体能够模拟人类的智能,助力操作系统像人一样进行沟通、执行智能任务。

如果说,智能体可以让人成为数字服务的最小参与者,那么在智能体手机中打磨的AI视频通话,则让人机交互朝着更理想、更符合直觉的体验靠近,让数字生活管家走进现实。

wKgZomcP5gCAH77sAAJain53t2Y560.jpg

将AI视频通话功能集成到垂直应用软件中,可以变成拟人化的垂域专家,提供更专业的服务,解决更具体的问题,从而激活用户的付费意愿和模型API经济。

目前,OpenAI为GPT-4o预设了十几个场景,清言视频通话API上线智谱开放平台时,也列出了智能硬件VR眼镜)、教育培训AI私教、文旅场景AI向导、具身智能等落地方向。通过将AI视频通话API开放出来,鼓励开发者在产品中集成“AI视频通话”功能。

wKgaomcP5gGAAd8iAAS0jUTg9fE461.jpg

9月24日,多邻国(Duolingo)在第六届全球分享大会上,推出了 AI 视频通话(Video Call)。Duolingo Max 用户可以与多邻国的角色 Lily(拽姐)进行视频通话,进行个性化的互动练习。在对话中,AI会根据用户的语言水平灵活调整内容。

学习语言最难的就是高频使用环境和开口说话的心理障碍,通过AI视频通话提供实时的对话机会,可以让小白初学者也能自信开口,进行有效联系。据说,多邻国的这一新功能接入了OpenAI的高级语音API功能。

wKgZomcP5gGAcEKNAADs3-8z5AQ814.jpg

国内头部社交软件Soul,也上线了AI聊天机器人“AI苟蛋”,可以主动跟用户找话题,并且年底将开启AI陪聊机器人的视频通话服务。不同于泛泛聊天,Soul主打的是灵魂交友,平台用户倾向于开展深层交流,探讨深度话题,寻求心灵共鸣。

在这种较为成熟的社区氛围下,用户在使用AI视频通话的预期、内容也是较为明确的,不会出现不知道聊什么的情况。

各行各业都存在大量需要互动的场景,可以跟“AI视频通话”相结合提供拟人化体验。但用户能否由此对应用和AI视频通话产生黏性,还需要行业伙伴把使用门槛降到最低,这不仅需要行业拥有产品开发的能力与意愿,能够洞察缺口与机遇,也需要模厂的生态支持。

wKgaomcP5gKAK5b4AAINByWuuXo804.jpg

从哆啦A梦到阿童木、贾维斯、Her,这些让人类感觉友好温暖的AI,都是拟人化的。也许说明,我们更愿意跟更像人类的AI打交道,而不是冰冷无形的机器。

一位智能机器从业者告诉我们,一开始设计的新车只有虚拟的语音助手,用户上车之后觉得跟空气说话很尴尬,激活率不高,所以设计了一个带有屏幕的车载控件,可以跟车主打招呼、有表情,车主很喜欢跟它对话,逢年过节还会为它买各种装饰物,把它当作用车场景中的家庭一员。

从这个思路看,AI视频通话其实可以被加入各种硬件当中,与用户展开真人一般的对话,从而成为情感共同体,由此衍生的商业空间也非常充裕。

透过AI视频通话,相信大家能够感受到,无论是AI企业或普通大众,对于AI产品化的需求越来越实质。

模型技术只是能力,是原型,而远不到普遍可用的阶段。唯有通过产品化的细致打磨,AI这座商业富矿,才能真正显露出钻石般的光芒。

wKgaomcP5gOAIDl0AAHt8CWDx2M229.jpg

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • AI
    AI
    +关注

    关注

    89

    文章

    38091

    浏览量

    296589
收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    RK3576驱动高端显控系统升级:多屏拼控与AI视觉融合解决方案

    、LVDS、MIPI-CSI 等多媒体接口,可实现屏异显与八摄像头同步输入,且支持 Linux 系统运行与 AI 推理部署。经实测,在同时运行屏显示与八
    发表于 11-21 17:51

    RK3576在智能工程机械中的应用|屏八摄AI视觉解决方案

    盲区事故 矿用卡车导航 + 仪表 + 车外监控前后摄像头AI识别智能避障、远程调度 远程施工终端主屏任务控制 + 副屏视频流 + 监控屏多角度视频采集远程调度与数据可视 借助RK3
    发表于 11-07 22:11

    华为以5G-A×AI网业协同推动网络能力产品化

    网络能力产品化” 分享了核心见解。他指出,AI时代下,端、网、云单点体验已触顶,唯有以5G-A×AI网业协同突破体验瓶颈,推动网络能力产品化,才能为运营商开辟业务体验价值创造的新赛道,
    的头像 发表于 10-17 11:36 563次阅读

    RK3576助力智慧安防:8高清采集与AI识别

    在智慧城市和数字园区的建设过程中,安防监控系统正从“被动记录”走向“主动识别与分析”。随着AI算法的成熟和高清视频处理能力的提升,市场对多路视频采集、实时拼接、智能识别的需求日益增强
    发表于 08-22 17:41

    千方科技推出AI视频充电桩系列产品

    近年来,充电基础设施保有量快速增长,运营管理过程中普遍存在充电桩利用率低、设备维护困难等问题。千方科技推出AI视频充电桩系列产品,从感知系统、控制系统到运维体系实现智能升级,助力充电
    的头像 发表于 07-26 14:47 1911次阅读

    AI通话的N种新玩法,让科幻照进现实

    打破次元壁,AI通话连接世界和未来
    的头像 发表于 07-18 21:39 2880次阅读
    <b class='flag-5'>AI</b><b class='flag-5'>通话</b>的N种新玩法,让科幻照进现实

    智慧视觉:RT-Thread+MC632X高性价比双图像处理方案 | 产品动态

    在智能视觉技术高速发展的浪潮中,行业对芯片性能、能效比和开发效率的需求正呈现爆发式增长。面对多路高清视频处理、实时智能分析和快速产品化落地的重挑战,RT-Thread操作系统携手MC632X智能
    的头像 发表于 07-01 12:05 3301次阅读
    智慧视觉:RT-Thread+MC632X高性价比双<b class='flag-5'>路</b>图像处理方案 | <b class='flag-5'>产品</b>动态

    AI神经网络降噪算法在语音通话产品中的应用优势与前景分析

    随着人工智能技术的快速发展,AI神经网络降噪算法在语音通话产品中的应用正逐步取代传统降噪技术,成为提升语音质量的关键解决方案。相比传统DSP(数字信号处理)降噪,AI降噪具有更强的环境
    的头像 发表于 05-16 17:07 1102次阅读
    <b class='flag-5'>AI</b>神经网络降噪算法在语音<b class='flag-5'>通话</b><b class='flag-5'>产品</b>中的应用优势与前景分析

    【米尔MYC-YM90X安路飞龙DR1开发板】安科技 SALDRAGON开发板介绍

    基于SALDRAGON的核心板、开发板,加速客户产品化进程。例如,双方联合开发的电子后视镜方案已应用于商用车领域。 五、开发板介绍 米尔电子基于安科技DR1M90GEG484 FPGA SoC推出
    发表于 04-28 17:57

    Deepseek海思SD3403边缘计算AI产品系统

    的训练样本和训练 模型,具体商业价值和保密性,采用海思SD3403边缘计算AI服务器+多路安防监控IPC,让差异化AI视频系统, 成本控制极具市场竞争力。 海思SD3403边缘计算AI
    发表于 04-28 11:05

    AI Agent 应用与项目实战》----- 学习如何开发视频应用

    再次感谢发烧友提供的阅读体验活动。本期跟随《AI Agent 应用与项目实战》这本书学习如何构建开发一个视频应用。AI Agent是一种智能应用,能够根据用户需求和环境变化做出相应响应。通常基于深度
    发表于 03-05 19:52

    行业集结:共同定制 RK3566 集成 AI 眼镜的前沿 AR 方案

    高性能、低功耗和多功能集成等优势,适用于多种智能场景。设简约,佩戴轻巧,AI 眼镜不仅是一款智能设备,更是彰显品味的时尚单品。通过丰富的硬件和软件支持,可以快速实现产品化,满足市场需求。 在技术革新前沿
    发表于 02-20 18:44

    ads1248使用三条校准指令校验时,要使用内部的VREF,还是使用外部的REF0?

    我的系统使用外部REF0输入基准电压。现在疑惑的是:使用三条校准指令校验时,要使用内部的VREF,还是使用我外部的REF0?手册中没有提到。
    发表于 01-16 07:00

    AI赋能新通话构筑智能业务入口

    话音作为联结全球80亿人口的纽带,承载着人与人之间最基本、最可靠的沟通需求。在科技发展日新月异的当下,各行各业迎来前所未有的革新契机。特别是AI技术的蓬勃兴起,推动话音业务从传统音视频向多模态
    的头像 发表于 01-06 10:49 965次阅读
    <b class='flag-5'>AI</b>赋能新<b class='flag-5'>通话</b>构筑智能业务入口

    TCL华星赵斌:Micro LED产品化尚需数年

    范围内展开激烈的竞争。 对于备受关注的Micro LED技术,尤其是玻璃级Micro LED,赵斌表示,尽管该技术具有巨大的潜力,但其产品化的道路仍然漫长。目前,Micro LED仍处于相对早期的研发阶段,各项技术和工艺仍在不断完善和优化之中。 赵斌强调,Micro LED要实
    的头像 发表于 12-16 10:19 1229次阅读