0

0

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

爱谁谁

爱谁谁

发布时间:2025-01-08 20:43:42

|

658人浏览过

|

来源于php中文网

原创

「php中文网(公众号:php中文网)」在刚刚结束的堪称「ai 界春晚」的世界人工智能大会(waic 2024)上,「中国版gpt-4o」亮相,它是来自商汤科技发布的“日日新5o”——国内首个「流式交互」多模态大模型。

在商汤的演示下,日日新5o拥有像人一样的实时视觉能力,可以跟人进行流畅的视频交互——能听、能说、能看、无延时,它可以通过摄像头+语音实现和用户的实时交互,并获知用户所在的真实场景下的各种状态信息,打破了与AI交互的次元壁,实现了与AI的“视频通话”,已经具备真人聊天般的交互体验。

两个月前OpenAI推出了GPT-4o,以突破性的智能交互能力,彻底颠覆了我们对AI语音助手的认知,颠覆了过去的人机交互,给业界带来又一次震撼。

震撼之外,中国大模型界对GPT-4o的认知似乎并不如GPT-4那么统一,有人认为「在实现AGI的路上,GPT-4o并不重要」、有人评价「在技术突破上,GPT-4o没那么惊艳」;有人认为GPT-4o的发布是 AI 2.0 时代的标志性事件,会催生全新的应用平台和商业模式。

带来的共识是,多模态可能引领新的交互模式和产品创新,多模态大模型开始成为国内大模型竞争的下一个焦点。

然而,在国内GPT-4o似乎并未成为引领多模态竞争的产品形态时,两个月后商汤率先推出了「中国版GPT-4o」日日新5o大模型,商汤用行动力证明了对GPT-4o的判断。

正如商汤 CEO徐立在WAIC 2024上所讲的:「行业要变化,交互模式一定是先行的」,解释了商汤为什么要做「中国版GPT-4o」,首创流式交互大模型。

1 大模型可以是每个人的贴身AI全能助手

如果你拥有一个能看(现实世界)、能听(读懂指令)、能说(回答问题)的贴身 AI 助手,将会是一种什么体验?

这位贴身助手,拥有丰富的多领域知识,包括生活、学习、工作各方面的知识,关键还能看懂现实世界——摄像头就是它获取现实世界影像的眼睛,而视觉触及到的信息,它能立马进行分析、总结,通过实时对话,像面对面聊天一样,立即告诉你问题的答案,没有延迟和拒绝。

早上起来,准备出门,你想知道现在外面的天气应该做哪些准备,日日新5o可以准确地描述出外面的天气状况,并给出外出准备的建议:

走到一处很美的地方,你想拍照,但是不知道用什么姿势拍出来好看,日日新5o开始充当一个摄影助手,它会指导你如何根据当前景色摆姿势动作、注意光线等等技巧:

晚饭是一顿烧烤,大家一起搭起炭火炉、燃起炭火准备烧烤,日日新5o能准确地知道视频里的人们正在干嘛,而且还能告诉详细的户外烧烤注意事项:

你想知道每种食材分别要如何烧烤才好吃,此时日日新5o化身为一名拥有多年烹饪经验的烧烤大师,它能分辨出每种食材、要如何烤:

回到酒店,你看到一袋咖啡,询问日日新5o后它能识别出这是咖啡粉而不是速溶咖啡,并告诉你咖啡粉对应的冲泡步骤,宛如一个咖啡师:

日日新5o不仅拥有大量、多领域的生活方面的知识,在日常生活场景中分别充当了发型助手、摄影师、烧烤大师、咖啡师……在职场工作环境中,也是一把好手,比如能迅速地总结出这本书该页讲了什么知识。比人的反应、分析、总结速度快多了:

面对一张手写的字条或诗句,它也能立马回答出它的意思和出处:

还能根据前三个字,准确预测出整个成语是什么:

从以上可以看到,日日新5o具备非常丰富的多领域知识,相比其他AI助手,它能看、能听、能读,首创的实时流式交互方式,使其具备真人般的交流对话;能精准地分析、辨别、总结出所「看到」的环境信息,在我们的生活、学习、工作中可以扮演多种助手角色,完全可以充当一款 AI 全能助手。

2 重塑交互的意义

日日新5o能作为一款表现出色的 AI 全能助手,除了展示出了它对标GPT-4o的各种能力:能看到那个现实世界,包括人、物、文字等符号;能听懂用户的话语,并根据其中的指令对现实世界进行识别,再反馈给用户;能看书识字,概括总结所讲的内容……

Runway
Runway

Runway是一个AI创意工具平台,它提供了一系列强大的功能,旨在帮助用户在视觉内容创作、设计和开发过程中提高效率和创新能力。

下载

最大的变革就是交互模式的变化:国内首个流式交互多模态大模型。商汤将流式交互融入到大模型中,给用户带来真人般的交流体验,让日日新5o系统更像人。

我们知道,在人工智能发展中,ChatGPT之所一炮而红,便是因为它开始展露出人类所具备的自主学习、分析、总结能力以及逻辑能力,而让大模型像人一样交流,正如引言所说,交互模式先行似乎并不是业界共识。

而商汤的日日新5o的发布,正是符合商汤对AI 2.0时代的判断,正如CEO徐立所说:行业要变化,交互模式一定是先行的。

在徐立看来,变化是指能定义AI 2.0时代的「超级时刻」,正如iPhone时刻定义了移动互联网的变化。而超级时刻需要一个超级应用,即便是像ChatGPT、Sora都还没有到超级时刻,是因为它们没有真正走进到一个行业的垂直应用中、引起广泛变化。

走向应用,商汤认为需要有几个核心的重点突破:

第一个就是实时的交互性能带来流畅的用户体验,这是推动超级时刻以及应用爆发的一个核心。

第二是构建高阶思维逻辑的合成数据,来提升模型的智力。

最后,不管是文本、图像、视频,如果对它没有可控性,那么它们作为一个工具,本身带来的效能提升就非常有限。

大模型本质上是做记忆的事情,记住世界的知识,就能回答的更准确,在徐立看来,它仅有的一点智力来自于对知识背后的高阶的思维逻辑的记忆,所以,在垂直行业里面怎么构造高阶思维逻辑的合成数据,往往是制胜的关键,并且是差异化的关键,也是中国人工智能之路的关键。

商汤最新发布的日日新5.5基座模型,便用了大量的合成、高阶思维链的数据,把模型能力平均提升了30%。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

商汤CEO徐立认为,如果要推动人工智能超级时刻的到来,需要大模型可以展现出卓越的深度思考的能力。那么合成的人工数据,特别是高阶思维的数据往往是非常重要的。所以越是有应用的场景,才能形成更好的高质量的数据的一些核心。

过去垂直领域是依赖人去构建更加高级的思维链数据,但是商汤认为,往前一步,不应该依赖人,而是应该通过跟真实世界的交互形成执行数据,去做推理。

因此,基于基座模型日日新5.5,商汤研发了日日新5o流式交互多模态大模型,在摄像头不停地移动过程中、跟真实世界互动获取更多新的信息,去进行推理、再得出反馈。

日日新5o的各种功能离不开基座模型日日新5.5的支撑。今年4月发布的日日新5.0是国内首个对标GPT-4 Turbo的大模型,经过两个多月技术迭代,日日新5.5实现了多项功能升级,在数学推理、英文能力、指令跟随等能力上明显增强,交互效果和多项核心指标可比肩GPT-4o。

徐立认为,如果能把这种流式交互多模态大模型置入眼镜、手机、电脑等端侧设备,可能会推动一些应用的爆发。

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

相关专题

更多
php文件怎么打开
php文件怎么打开

打开php文件步骤:1、选择文本编辑器;2、在选择的文本编辑器中,创建一个新的文件,并将其保存为.php文件;3、在创建的PHP文件中,编写PHP代码;4、要在本地计算机上运行PHP文件,需要设置一个服务器环境;5、安装服务器环境后,需要将PHP文件放入服务器目录中;6、一旦将PHP文件放入服务器目录中,就可以通过浏览器来运行它。

2679

2023.09.01

php怎么取出数组的前几个元素
php怎么取出数组的前几个元素

取出php数组的前几个元素的方法有使用array_slice()函数、使用array_splice()函数、使用循环遍历、使用array_slice()函数和array_values()函数等。本专题为大家提供php数组相关的文章、下载、课程内容,供大家免费下载体验。

1660

2023.10.11

php反序列化失败怎么办
php反序列化失败怎么办

php反序列化失败的解决办法检查序列化数据。检查类定义、检查错误日志、更新PHP版本和应用安全措施等。本专题为大家提供php反序列化相关的文章、下载、课程内容,供大家免费下载体验。

1515

2023.10.11

php怎么连接mssql数据库
php怎么连接mssql数据库

连接方法:1、通过mssql_系列函数;2、通过sqlsrv_系列函数;3、通过odbc方式连接;4、通过PDO方式;5、通过COM方式连接。想了解php怎么连接mssql数据库的详细内容,可以访问下面的文章。

952

2023.10.23

php连接mssql数据库的方法
php连接mssql数据库的方法

php连接mssql数据库的方法有使用PHP的MSSQL扩展、使用PDO等。想了解更多php连接mssql数据库相关内容,可以阅读本专题下面的文章。

1419

2023.10.23

html怎么上传
html怎么上传

html通过使用HTML表单、JavaScript和PHP上传。更多关于html的问题详细请看本专题下面的文章。php中文网欢迎大家前来学习。

1235

2023.11.03

PHP出现乱码怎么解决
PHP出现乱码怎么解决

PHP出现乱码可以通过修改PHP文件头部的字符编码设置、检查PHP文件的编码格式、检查数据库连接设置和检查HTML页面的字符编码设置来解决。更多关于php乱码的问题详情请看本专题下面的文章。php中文网欢迎大家前来学习。

1488

2023.11.09

php文件怎么在手机上打开
php文件怎么在手机上打开

php文件在手机上打开需要在手机上搭建一个能够运行php的服务器环境,并将php文件上传到服务器上。再在手机上的浏览器中输入服务器的IP地址或域名,加上php文件的路径,即可打开php文件并查看其内容。更多关于php相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

1306

2023.11.13

PHP WebSocket 实时通信开发
PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践,涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例,帮助开发者掌握 使用 PHP 构建实时通信与推送服务的完整开发流程,适用于即时消息与高互动性应用场景。

11

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Excel 教程
Excel 教程

共162课时 | 12.4万人学习

Go语言web开发--经典项目电子商城
Go语言web开发--经典项目电子商城

共23课时 | 1.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号