大模型+影像:智能手机“上春山”

250f7f37d8cbf31199e0577e0aecf99d.jpeg

这个春节假期,一首《上春山》火了。吃瓜群众热热闹闹学了一个假期的“春山学”,了解了抢占C位的各种技巧。

假期过去,开工大吉,手机行业开始抢占今年的C位。那么问题来了,今年智能手机最大的机会点在哪里?答案呼之欲出,当然是AI大模型。去年下半年,手机厂商陆续推出端侧大模型。春节刚过,OPPO发布了全新的AI战略,宣布进入AI时代。魅族宣布不再生产“传统智能机”,全面拥抱AI时代。显然,大模型就是手机行业的那座“春山”。

但根据“春山学”相关知识,跟着大家一起上山是不够的,必须更上一层才能稳站C位。在大模型+手机的众多结合点中,有一项能力是C位中的C位,妥妥的“真·春山无双”——大模型+手机影像。

ce245db1dd2eab8921b5701597c39d7e.png

据说在这个春节,一线城市的写真店纷纷转变了商业模式。原本大家都是去拍写真,店家负责拍摄和修图。现在都是去拍AIGC照片,店家摇身一变为AI提示工程师,用各种AIGC平台来实现用户种种匪夷所思的需求。

回来对比照片,也不是比你这张光打得不错,你这张P得更自然,而是你这张照片用的什么提示词,你这张一看就模型泛化性比较强……

bec4c5d7be89b1e7136c4173d0855b69.png

总之,AI之风正经由照相馆、写真店、小程序、APP,强烈地吹拂着我们的影像生活。

但是问题来了,这些强烈的AIGC影像需求,真的必须去线下店才能完成吗?为什么不能在手机端一键搞定?最近手机新品动辄搭载几十亿参数的端侧大模型,它们闲着干嘛呢?

事实上,手机里的大模型肯定是闲不住的。目前拥抱AI大模型的手机,基本情况是大模型是大模型,影像是影像,但这种分裂局面必然会很快得到改变。

“大模型与移动影像”的融合赛道,是2024年智能手机行业最为清晰的风口,也是手机厂商急切想要上,也必须上了就不能下来的,具有战略意义的那座“春山”。

大模型+手机影像,这座春山怎么上?我们来弄清其中的“春山学”问题吧。

六年之后

AI影像再上山

b3b7d55fc7c2cab0724c1f68436cb998.png

首先我们需要明确一点,那就是AI+影像绝不是什么新鲜事物,甚至很多人都已经习惯了AI与影像的结合。

这个概念开始受到业界重视,是早在2018年的时候。那一年4月,华为发布了P20手机。这款手机利用麒麟芯片的NPU端侧算力,首次在拍照中搭载了AI功能,能够识别包括宠物、人像、风景、美食等19种场景,覆盖500多个识别目标。在AI识别这些目标物后,会自动调整摄影模式和参数设置。

随后,这种AI摄影模式一度爆火,成为当时最具热度的手机技术升级,并且逐渐为全行业所接受。随着几年发展,AI影像变得越来越复杂,可识别物越来越多,并且加入了动态抓取、去除反光等AI能力,还与此后流行的计算摄影概念结合,成为手机影像系统中的基础能力之一。

但到这个层面,AI摄影的能力依旧有显著的局限性。它对图片的作用集中于“美化”,而不是“修改”和“生成”。我们也探访过一些AI摄影相关赛道的开发者,他们很希望能够利用手机的AI能力做出更具创意的应用,但端侧算力和模型能力是主要的限制。

523ac53f4f19d7c9c9bd205821b12474.png

而伴随着AI大模型的爆火,模型能力的关隘被突破了。在大模型的加持下,用户可以对影像系统提出复杂的指令,影像系统也能够更完整理解用户交互逻辑与意图指向。在能力上,大模型可以帮助完成高精度的图像元素替换,甚至加入AI生成的影像。

或许可以这样说,最初用户听闻AI影像概念的时候,脑海中设想的影像能力,其实是在今天才有可能实现的大模型影像。

伴随着大模型能力落地手机,AI影像终于可以完成关键一跃,实现那些早就许下的诺言。

大模型,就是AI影像的必须上的那座山。

8144847872d918e534682f9c54983bdc.png

春山上,风景如何?

春节还没过去,世界就感受到了来自Sora的视觉震撼。AI行业有句话,叫语言模型为打榜,视觉模型能赚钱。机器视觉能力是让用户感受到AI魅力最快速也最有效的方案。

长期以来,手机影像可谓一卷再卷,卷无可卷,但用户始终能做的只是拍摄图片。AI大模型能力的加入,可以让用户获得无门槛修改图片,以及将AIGC影像与手机拍摄影像结合的能力。AI大模型+手机AI计算能力+手机影像系统的组合,极大拓展了手机影像的边界,既继承了手机厂商多年来的技术与供应链布局,同时还获得了新的增长空间。

目前阶段,这条赛道已经迅速铺开。比如三星就通过图片助手功能,让用户实现了移动图片中目标,自动填充空缺,生成新图片的能力,从而让手机影像具备更大的构图自由。

6633f7dd2e4a35321f05964a9df21584.png

而OPPO Find X7系列则实现了通过AI大模型来提供AIGC消除功能。就像我们最近在广告里看到的那样,用户可以把春节聚会时不想看到的人从合影中消除,同时依靠AIGC补齐背景。目前,Find X7已经可以支持最多6个主体单独提取。除此之外,OPPO还更新了AI超清合影功能,可以智能识别并增强合影中人脸的清晰度。

26b79d4bb18cb0ddd01094c6255498dd.png

可以预见的是,接下来我们会看到大量基于AI大模型实现的影像功能,比如AI抠图,AI替换,AI扩图等。整体而言,大模型+手机影像会呈现三大发展趋势:

1.AIGC内容与拍摄内容结合。AIGC的文生图平台,在过去一年快速赢得了用户青睐,将这种能力与手机本身影像能力融合,是AI手机赛道上最关键的争夺战。

2.AI能力从应用侧上移,与手机本身的影像系统结合。目前,AI大模型带来的视觉能力,更多还是单独的软件应用。接下来,手机厂商会将这些能力上移到系统侧,成为产品本身的差异化卖点。

3.手机影像能力可以OTA。AI大模型的加入,一定程度上让手机自身的影像能力成为可升级,可迭代的软件。让手机自身的系统级能力也可以持续更新,持续运营,是AI大模型带给手机的一种新变化。

总体来看,大模型与手机影像的结合,有着非常充沛的创意发挥空间,有源源不断的可能性。想要抓住这个机会,客观上将带来手机厂商之间新一轮的技术竞赛。

6ff7db2f2b22489e609fe0b23746ea92.png

那座山

就是下一个战略高地

目前阶段,还没有厂商将“大模型+影像”这个概念旗帜鲜明地提出来,但这个概念以各种不同的名称落地,应该已经为期不远。

需要注意的是,在端侧部署大模型,以及发展出一些创意性的AI影像玩法都很容易,但要将AI大模型+影像真正发展为长期赛道,构成品牌的用户心智支点,那还需要厂商投入巨大的精力,来展开一场全新的智能手机行业竞赛。

其原因在于,大模型+手机影像是一场名副其实的综合考验。它需要硬件侧的算力配合,需要影像系统的支撑,同时也需要模型侧的算法加持,更需要应用开发创意以及AIGC专属的视觉审美。从务实到务虚,从底层硬件到顶层应用,大模型+手机影像的竞赛近乎覆盖了手机行业的每个层级。

3ecd97b15c3d7767a3a13e66250c2584.png

而重点来看,抢占大模型+影像的战略高地,需要手机厂商在三个方面集结重兵:

1.AI基础设施更新。这个基础设施包括了AI算力与AI算法两个部分。涉及芯片能力,端云协同能力,以及基础算法能力。手机的AI基础设施更新需求,也将带动产业链展开新一轮洗牌。

2.AI应用的准确把握。AI大模型能够手机影像带来的可能性不是太少,而是太多了。如何在有限的算力条件下,给用户最准确,最吸引人的AI影像应用,将成为手机厂商面对的头一道考题。

3.AI审美能力的建设。最近很多人注意到Sora团队有专门的艺术人才加入。艺术与审美能力在AIGC时代非常重要。随着产业发展,算法能力会趋同,审美能力的差异化则会暴露出来。手机厂商过去更重视的是设计能力,这与艺术表达、审美判断等能力是存在一定差异的。构建属于AI手机的新审美能力,是一项全新的赛事。

最后,说一个有点反常识的判断:大模型+手机影像这座“春山”,其实还是很容易上的。其门槛远没有手机厂商宣传得那么夸张,但如果你最近用心学习了“春山学”教材,就会知道真正困难的不是上山,而是赖在山上不下来。

如何把大模型+手机影像从一个年度噱头,变成可以多年发展的长期赛道,甚至变成改写产业格局的锚点,那才是真正的考验。

不过好消息是,有春山可上至少证明了一件事:包裹手机行业的坚冰正在技术暖风的吹拂下开裂、消融。能否就此别冬入春,选择权在从业者手中。

66b72d11d38cf32b9b91f72c19d9a723.gif

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/699721.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

C++ string常见用法 + 练手习题

部分内容摘抄自http://t.csdnimg.cn/BM0jO 目录 温故:C库函数中和字符串有联系的函数知新:C string常见用法string的初始化 1.常见初始化方式string对象的操作 1.用cin获取键盘输入的值 2.用getline读取一整行 3.string对…

布隆过滤器笔记

课程地址 布隆过滤器由一个很长的二进制向量和一系列哈希函数组成 特性:布隆过滤器可以告诉我们 “某样东西一定不存在或者可能存在”,也就是说布隆过滤器说这个数不存在则一定不存在,布隆过滤器说这个数存在可能不存在。这个特性能很好地被…

如何避免软件测试的遗漏或重复?

在实际软件测试中,经常遇到遗漏测试点,测试不充分;或者重复测试,造成资源浪费的情况。因此如何避免软件测试遗漏或重复,非常重要。 1、实施过程 首先,通过梳理某个领域的相关项目,分析相关业务规…

【鸿蒙 HarmonyOS 4.0】UIAbility、页面及组件的生命周期

一、背景 主要梳理下鸿蒙系统开发中常用的生命周期 二、UIAbility组件 UIAbility组件是一种包含UI界面的应用组件,主要用于和用户交互。 UIAbility组件是系统调度的基本单元,为应用提供绘制界面的窗口;一个UIAbility组件中可以通过多个页…

STL用法

参考原文:C中STL用法超详细总结(收藏级) - 知乎 1 什么是STL? STL(Standard Template Library),即标准模板库,是一个具有工业强度的,高效的C程序库。它被容纳于C标准程…

【Python笔记-设计模式】前端控制器模式

一、说明 常作为MVC(Model-View-Controller)模式的一部分,用来处理用户请求并将其分发给相应的处理程序(即路由匹配)。 (一) 解决问题 将请求的处理流程集中管理,统一处理所有的请求 (二) 使用场景 需…

HTML5技术实现的小钢琴

HTML5技术实现的小钢琴 用HTML5实现的小钢琴&#xff0c;按下钢琴键上的相应字母用或用鼠标点击钢琴键发声&#xff0c;源码如下&#xff1a; <!DOCTYPE html> <html lang"en"> <head><meta charset"UTF-8"><meta name"v…

数据库管理-第154期 Oracle Vector DB AI-06(20240223)

数据库管理154期 2024-02-23 数据库管理-第154期 Oracle Vector DB & AI-06&#xff08;20240223&#xff09;1 环境准备创建表空间及用户TNSNAME配置 2 Oracle Vector的DML操作创建示例表插入基础数据DML操作UPDATE操作DELETE操作 3 多Vector列表4 固定维度的向量操作5 不…

【MATLAB】 EWT信号分解+FFT傅里叶频谱变换组合算法

有意向获取代码&#xff0c;请转文末观看代码获取方式~ 展示出图效果 1 EWT分解算法 EWT分解算法是一种基于小波变换的信号分解算法&#xff0c;它可以将信号分解为一系列具有不同频率特性的小波分量。该算法的基本思想是将信号分解为多个不同尺度的小波分量&#xff0c;并对…

第十二天-ppt的操作

目录 创建ppt文档 安装 使用 段落的使用 段落添加数据 段落中定义多个段落 自定义段落 ppt插入表表格 PPT插入图片 读取ppt 读取ppt整体对象 ​编辑 获取ppt文本 获取表格内容 创建ppt文档 安装 pip install -i https://pypi.tuna.tsinghua.edu.cn/simple python…

day40打卡

day40打卡 343. 整数拆分 状态表示 ​ dp[i] 表示将正整数i拆分成至少两个正整数的和之后&#xff0c;这些正整数的最大乘积 状态转移方程 ​ i > 2 时&#xff0c;对正整数i拆出的第一个正整数是j&#xff0c;则有&#xff1a; 将i拆分为 j 和 i-j&#xff0c;且 i-j…

云原生时代,Nginx是否还是很重要,还是说云原生里的网关能把Nginx消灭掉?

在云原生时代&#xff0c;Nginx 仍然是至关重要的&#xff0c;尽管它可能不再是在所有场景下的默认选择。云原生应用程序通常是由多个微服务组成的&#xff0c;这些微服务需要快速、可靠且安全地进行通信。Nginx 作为一款高性能的 web 服务器和反向代理&#xff0c;长期以来一直…

文心一言4.0 VS ChatGPT4.0 图片生成能力大比拼!

大家好&#xff0c;我是木易&#xff0c;一个持续关注AI领域的互联网技术产品经理&#xff0c;国内Top2本科&#xff0c;美国Top10 CS研究生&#xff0c;MBA。我坚信AI是普通人变强的“外挂”&#xff0c;所以创建了“AI信息Gap”这个公众号&#xff0c;专注于分享AI全维度知识…

单片机tsm32城市环境污染监测与实现

国内经济增速的持续保持不但加快了城市化建设的步伐&#xff0c;同时也使得更多的人口聚集到大城市中求发展&#xff0c;大量的人口对衣食住行等方面的需求使得这些城市环境的污染问题逐渐加剧。当前各级政府虽然对城市环境污染问题越来越重视&#xff0c;但是因缺乏监测手段而…

【VRTK】【Unity】【VR开发】使用注意事项-Simulator没反应

【背景】 建立一个基本的VRTK项目后&#xff0c;用Simulator Rig模拟运行&#xff0c;移动鼠标后发现Simulator Rig没有任何反应。 【分析】 Console中的报错信息类似于没有启用Legacy unity input package&#xff0c;Legacy的意思是经典的&#xff0c;所以应该是指没有在p…

详解AT24CXX驱动开发(linux platform tree - i2c应用)

目录 概述 1 认识AT24Cxx 1.1 AT24CXX的特性 1.2 AT24CXX描述 1.2.1 引脚 1.2.2 容量描述 1.2.3 设备地址 1.3 操作时序 1.3.1 写单个字节时序 1.3.2 写page字节时序 1.3.3 读取当前数据时序 1.3.4 随机读取数据 1.3.5 连续读取多个数据 2 驱动开发 2.1 硬件接口…

Redis能保证数据不丢失吗?

引言 大家即使没用过Redis&#xff0c;也应该都听说过Redis的威名。 Redis是一种Nosql类型的数据存储&#xff0c;全称Remote Dictionary Server&#xff0c;也就是远程字典服务器&#xff0c;用过Dictionary的应该都知道它是一种键值对&#xff08;Key-Value&#xff09;的数…

ESP8266智能家居(5)——开发APP深入篇

1.代码解析 接下来重点介绍一下逻辑代码 这里面主要是设置mqtt服务器的IP地址和端口号&#xff0c;设置服务器的用户名和登录密码 绑定好订阅主题和发布主题&#xff08;和8266上的订阅、发布交叉就行&#xff09; 绑定界面&#xff0c;设置界面标题 绑定6个文本控件 将从mq…

pycharm找不到conda可执行文件怎么办?

问题&#xff1a;pycharm配置conda环境找不到conda可执行文件 解决办法&#xff1a; 1. 找到 anaconda 安装目录&#xff08;D:\Users\wl\anaconda3&#xff09; 2. 打开pycharm &#xff08;看图吧<手动狗头>&#xff09; 找到anaconda3\condabin\conda.bat 选择你要…

第八篇【传奇开心果系列】python的文本和语音相互转换库技术点案例示例:Google Text-to-Speech虚拟现实(VR)沉浸式体验经典案例

传奇开心果博文系列 系列博文目录python的文本和语音相互转换库技术点案例示例系列 博文目录前言一、雏形示例代码二、扩展思路介绍三、虚拟导游示例代码四、交互式学习示例代码五、虚拟角色对话示例代码六、辅助用户界面示例代码七、实时语音交互示例代码八、多语言支持示例代…