谷歌Gemini时代来了!加固搜索护城河、赋能全家桶,Gemini 1.5 Pro升级至200万token

3 月中旬,谷歌宣布 Google I/O 定档北京时间 5 月 15 日凌晨 1 点。而当大会开幕时间临近,本应是讨论度最高的时候,「宿敌」OpenAI 却半路杀出,抢先一天,仅耗时 27 分钟就发布了颠覆性巨作 GPT-4o,将新一轮 AI 争霸带入了「Her 时代」。

正如英伟达科学家 Jim Fan 在评价 GPT-4o 时所言,在 Google I/O 大会之前,OpenAI 发布 GPT-4o 是争取更多时间的明智之举。

抛开双方在公关策略上的博弈不谈,OpenAI 的突然发力或许也预示着,谷歌的 Gemni 也同样来到了语音交互段位。在 Google I/O 开幕前,谷歌官方账号发布了一段与 Gemini 语音交互的视频,在展示 demo 中,Gemini 不仅能够通过手机摄像头实时识别场景,还能够进行流畅的语音交互。

谷歌发布这段 demo 的用意不言而喻,但评论中也不乏质疑其视频造假的声音,毕竟早有「前科」。而在今天的主题演讲中,劈柴哥也并未带来「语音交互」功能的实测,而是再度通过 demo 展示了与 GPT-4o 类似的能力。

具体而言,谷歌 CEO Sundar Pichai 及一众高管在将近 2 小时的主题演讲中一口气介绍了:

  • Gemini 1.5 Pro 的更新
  • Gemini 2.5 Flash
  • Project Astra
  • AI Overviews
  • Veo 和 Imagen 3
  • ……

点击观看完整直播回放:【【中英】Google I/O 2024 Keynote 大会完整版|Gemini 1.5 Pro 重塑搜索引擎,升级到200万tokens!

Gemini 1.5 Pro:拓展至 200 万 tokens

经历了昨天凌晨的 GPT-4o 发布,大家已经基本从「大模型实时通话」的震惊中走出来了,这也意味着,OpenAI 成功将行业竞争拉至新的制高点,所以,谷歌也必须跟上。而作为自家「最大、最强」的 AI 模型,Gemini 必须为公司搭建好天梯。

在这里插入图片描述
Gemini 1.5 与其他模型的上下文长度对比

今年 2 月,谷歌宣布推出了 Gemini 1.5,其中的 Gemini 1.5 Pro 最高可支持 100 万 token 超长上下文,在 token 数量上一度拉开了与同期大模型之间的差距。今天 ,谷歌再次突破上下文窗口限制,Pichai 宣布将 Gemini 1.5 Pro 的上下文窗口扩展到 200 万 tokens,并向开发人员提供私人预览版 (private preview)。

图片

同时,Pichai 宣布将向全球所有开发人员提供改进版的 Gemini 1.5 Pro,其 100 万 token 上下文版本现在可以直接在 Gemini Advanced 中供消费者使用,该版本可用于 35 种语言。

此外,Pichai 还表示 Gemini 1.5 Pro 在过去几个月中通过改进算法得到了增强,在代码生成、逻辑推理和规划、多轮对话以及音频和图像理解方面都有了很大改进。在 Gemini API 和 AI Studio 中,除了图像和视频,Gemini 1.5 Pro 还能对音频进行推理,并通过一种名为系统指令的功能进行引导。

图片

随后,Pichai 还介绍了 Gemini 在 Google Workspace 中的更新,包括 Gmail、Docs、Drive、Slides 和 Sheets 中的 Gemini 将升级至 Gemini 1.5 Pro,Gmail 移动端 APP 推出了新功能(总结邮件、上下文智能回复、Gmail Q&A),「Help me write」支持多语音写作。

Gemini 1.5 Flash:100 万 tokens 超长上下文、多模态

就当大家以为 Gemini 1.5 的更新「仅此而已」时,DeepMind CEO Demis Hassabis 缓步登场,带来了今天的第一个惊喜——Gemini 1.5 Flash。

图片

具体而言,轻量级模型 Gemini 1.5 Flash 是 Gemini 1.5 Pro 的精炼版本,针对大容量、高频率的大规模任务进行了优化,服务成本效益更高,并具有突破性的长上下文窗口。同时,Gemini 1.5 Flash 与 Gemini 1.5 Pro 一样是多模态的,这意味着其可以分析音频、视频和图像以及文本。

Demis Hassabis 表示,Gemini 1.5 Flash 擅长汇总、聊天应用、图像和视频字幕、从长文档和表格中提取数据等任务。这是因为 Gemini 1.5 Pro 通过蒸馏 (distillation) 对其进行了训练,将较大模型中最基本的知识和技能转移到了更小、更高效的模型中。

图片

除此之外,Demis Hassabis 还介绍了关于 Gemma 的更新,谷歌宣布推出新一代开放式人工智能创新模型 Gemma 2,其采用全新架构,旨在实现突破性的性能和效率,并将在 6 月正式发布时推出新尺寸。

Project Astra:实时、多模态 AI Agent

在 Google I/O 开幕前的一众爆料与猜测中,AI Assistant Pixie 呼声极高。有媒体称,预计谷歌将推出一款由 Gemini 支持的全新 Pixel AI Assistant,名为 Pixie,其可能具备多模态功能,可以通过用户设备上的信息,如地图或 Gmail,提供更加个性化的服务。

然而 Pixie 并未如预期般露面,取而代之的是具备多模态理解与实时对话能力的 Project Astra。

图片

Demis Hassabis 表示,在开发能够理解多模态信息的 AI 系统方面,谷歌已经取得了喜人的进展,**但如何将响应时间缩短到可进行实时对话的程度却颇具挑战。**在过去几年中,团队一直在努力改进模型的感知、推理和对话方式,使交互的节奏和质量感觉更加自然。

目前,团队基于 Gemini 开发了 Agent 原型 (prototype agents),通过对视频帧进行连续编码,将视频和语音输入结合到事件时间轴中,并缓存这些信息以便高效调用,从而加快信息处理速度。

图片

谷歌 AI 助手可实时语音交互

同时,**谷歌利用其语音模型,增强了 Agent 的声音,使其具有更广泛的语调,**从而在识别使用环境后,在对话中做出快速反应。

这不禁令人联想到 OpenAI 昨日凌晨展示的新版 ChatGPT,同样是实时对话、可根据情境或用户要求转换语调。不同于谷歌的视频演示,ChatGPT 在直播现场进行了实测,并回答了网上呼声较高的多个问题。如今,基于 GPT-4o 的 ChatGPT 已经免费开放给所有用户,但音频视频功能却出于隐私考虑仍未上线。

Veo 和 Imagen 3:视频+图像双管齐下

谷歌还推出了最新的视频生成模型 Veo 和高质量的文本到图像模型 Imagen 3。

其中,**Veo 是谷歌最强大的视频生成模型,**不知道是否为对标 Sora 而来。

Veo 可生成各种电影和视觉风格的 1080p 分辨率视频,视频时长可超过一分钟。谷歌表示,凭借对自然语言和视觉语义的深入理解,其所生成的视频可完美呈现用户的创意构想,准确捕捉提示语的语气并呈现较长提示语中的细节。

同时,Veo 创建的镜头是一致的、连贯的,因此人、动物和物体在整个拍摄过程中的移动都显得更加真实。

在技术层面,Veo 基谷歌多年的生成视频模型经验,融合了 GQN、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet 和 Lumiere,将架构、缩放规律等技术相结合,以提高质量和输出分辨率。

图片

同样地,Imagen 3 也是谷歌最高质量的文本到图像模型,**能够更好地理解自然语言和 Prompt 背后的意图,并将较长提示中的小细节融入其中,**这种高级理解能力也有助于该模型掌握各种风格。

AI Overviews:谷歌搜索的大模型时代

25 年前,为了帮助人们更好地理解网上繁杂的信息,谷歌搜索由此诞生,人们可以在该引擎上检索各类问题的答案。现如今,Gemini 的出现将谷歌搜索推到了一个新的高度,重新定义了人们获取知识与解答疑惑的方式。

对此,谷歌在会议中表示:「无论您心中有什么,无论您需要完成什么,只要提问,谷歌就会为您搜索。」

图片

谷歌拥有超过万亿关于人、地点和事物的实时信息,搭配其备受信赖质量系统,可以为用户提供网络上最好的内容。而 Gemini 的加入,则进一步解锁了搜索中的新 Agent 能力,拓展了谷歌搜索更多的可能性。

其中,最让人关注的莫过于 AI Overviews 功能的推出。「有了 AI Overviews,用户提出问题后无需自己拼凑所有信息,谷歌搜索将会为你列出信息的概览,包括多种观点和链接进行更深入的探索。」

谷歌搜索业务副总裁 Liz Reid 在会议中讲道,「AI Overviews 将从今天开始在美国向所有人推出,预计到今年年底,AI Overviews 将为全球超过 10 亿谷歌搜索用户提供服务。」

「事实上,这只是第一步,我们正在让 AI Overviews 解锁更复杂的问题,为了使其成为可能,我们在 Google 搜索中引入了多步骤推理 (Multi-step reasoning)。」

图片

简单来说,多步骤推理就是将用户的总问题分解成各个部分,并确定需要按什么顺序解决哪些问题,然后,Google 搜索会基于现实的实时信息和排名等,使用最优质的信息来进行问题的推理。

例如,当用户询问地点时,Google 搜索会根据现实世界的信息,包括超过 2.5 亿个地点,以及它们的评分、评论、营业时间等来进行问题的回复,这些信息用户需要经过几分钟甚至更久的时间进行研究,但 Google 搜索几秒钟就能完成。

图片

除了提供基本的信息检索,Google 搜索也能执行高级推理和富有逻辑的规划任务,帮助用户完成餐饮、旅行、派对、约会、锻炼等活动的规划,让用户的生活更轻松。

图片

最后,**对于那些用文本或图片也无法准确表达的问题,谷歌也给出了解决方案——即将推出视频提问功能,**这意味着未来 Google 搜索的界面将会变得更加多元化。

Trillium:每个芯片的计算性能提高 4.7 倍

据路透社报道,在人工智能数据中心芯片市场上,英伟达占据了大约 80% 的市场份额,剩下的 20% 绝大部分是谷歌各种版本的 TPU。不过谷歌本身并不销售芯片,而是通过其云计算平台出租芯片。

**图片**

作为公司的重要业务,宣布新一代 TPU 似乎已经成为了 Google I/O 的传统。今天,Pichai 发布了谷歌第六代 TPU Trillium,并称这是公司迄今为止性能最好、效率最高的 TPU,**比上一代 TPU v5e 在每个芯片的计算性能上都提高了 4.7 倍。**同时还承诺将在 2024 年底向云客户提供 Trillium。

据 Tech Crunch 报道,在一定程度上,谷歌是通过扩大芯片的矩阵乘法单元 (MXU) 并提高整体时钟速度来实现性能提升的。此外,谷歌还将 Trillium 芯片的内存带宽提高了一倍。

此外,Pichai 还补充介绍了公司上个月发布的全新 Axion 处理器,这是谷歌首款基于 Arm 的定制 CPU,具有业界领先的性能和能效。

图片

随后,Pichai 还宣布谷歌将与英伟达达成合作,将在 2025 年推出与英伟达合作的 Blackwell 芯片。

AI for Science:AlphaFold 3 或将开源

DeepMind 创始人 Demis Hassabis 介绍道,「为了探究计算机能否像人一样思考,构建通用人工智能,我们创立了 DeepMind。」

图片

回顾之前的成果,从将视觉和语言转化为机器人行动的 RT-2、可以遵循自然语言指令在各种视频游戏环境中执行任务的游戏 AI 智能体 SIMA,到可以解决奥赛级别数学问题的 AIphaGeometry、甚至发现新材料的 GNoME。Demis Hassabis 表示:「我一直相信,如果我们能负责任地构建 AGI,它将会以难以置信的方式造福人类。」

图片

此外,在会议中,Demis Hassabis 还重点强调了近期推出的 AlphaFold 3,该模型以前所未有的精确度成功预测了所有生命分子(蛋白质、DNA、RNA、配体等)的结构和相互作用,在模拟多种不同类型的分子相互作用方面取得了重大突破,这对精准确定药物靶点等研发项目至关重要。

事实上,最初发布 AlphaFold 3 时,Google 没有开源其完整代码的计划,只是为该模型发布了一个支持非商业性研究的 AlphaFold Server 的公共接口,向全球科研人员敞开了大门。

图片

然而,仅仅离发布不到一周的时间,Google DeepMind 研究副总裁突然宣布:「我们将在 6 个月内发布 AF3 模型(包括权重),供学术界使用!」Google 在 I/O 大会开始的前一天突然宣布这个开源计划,无论是迫于 OpenAI 的压力,还是为大会造势预热,AlphaFold 3 的开源都对生命健康领域的发展具有深远的意义。

近期,HyperAI超神经还将对谷歌 AI for Science 的最新布局进行追踪,感兴趣的小伙伴可以关注公众号,蹲一波深度报道!

写在最后

至此,连续两日的 AI 狂欢落下帷幕。但 OpenAI 与谷歌的对垒不会停歇——GPT-5 的性能天花板在哪?Gemini 的超长上下文限制能否再有突破?OpenAI 的搜索引擎是否会冲击谷歌的地位……

英伟达科学家 Jim Fan 评价道,「谷歌正在做的一件事是正确的:他们终于在认真努力地将人工智能整合到搜索框中。我感觉到了 Agent:规划、实时浏览和多模态输入,所有这些都来自登陆页面。谷歌最强大的护城河是分销 (distribution)。Gemini 不一定要成为最好的模型,也可以成为世界上最常用的模型。」

诚然,纵览整场发布会,笔者最大的感受是「在大模型时代,搜索或许依旧能够成为谷歌最大的底气」。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/pingmian/12415.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

PyTorch中定义自己的数据集

文章目录 1. 简介2. 查看PyTorch自带的数据集(可视化)3. 准备材料3.1 图片数据3.2 标签数据 4. 方法 1. 简介 尽管PyTorch提供了许多自带的数据集,如MNIST、CIFAR-10、ImageNet等,但它们对于没有经验的用户来说,理解数据加载器的工作原理以及…

【启程Golang之旅】环境设置、工具安装与代码实践

欢迎来到Golang的世界!在当今快节奏的软件开发领域,选择一种高效、简洁的编程语言至关重要。而在这方面,Golang(又称Go)无疑是一个备受瞩目的选择。在本文中,带领您探索Golang的世界,一步步地了…

【Web后端】MVC模式

1、简介 MVC模式,全称Model-View-Controller(模型-视图-控制器)模式,是一种软件设计典范,它将应用程序的用户界面(视图)和业务逻辑(模型)分离,同时提供了一个…

K8S内容

K8S介绍 1、故障迁移:当某一个node节点关机或挂掉后,node节点上的服务会自动转移到另一个node节点上,这个过程所有服务不中断。这是docker或普通云主机是不能做到的 2、资源调度:当node节点上的cpu、内存不够用的时候,可以扩充node节点&…

​​​【收录 Hello 算法】6.2 哈希冲突

目录 6.2 哈希冲突 6.2.1 链式地址 6.2.2 开放寻址 1. 线性探测 2. 平方探测 3. 多次哈希 6.2.3 编程语言的选择 6.2 哈希冲突 上一节提到,通常情况下哈希函数的输入空间远大于输出空间,因此理论上哈希冲突是不可避免的。比如&a…

LeetCode题练习与总结:不同的二叉搜索树--96

一、题目描述 给你一个整数 n ,求恰由 n 个节点组成且节点值从 1 到 n 互不相同的 二叉搜索树 有多少种?返回满足题意的二叉搜索树的种数。 示例 1: 输入:n 3 输出:5示例 2: 输入:n 1 输出&…

从需求角度介绍PasteSpider(K8S平替部署工具)

你是否被K8S的强大而吸引,我相信一部分人是被那复杂的配置和各种专业知识而劝退,应该还有一部分人是因为K8S太吃资源而放手! PasteSpider是一款使用c#编写的linux容器部署工具,简单易上手,非常节省资源,支持…

shell脚本实现linux系统自动化配置免密互信

目录 背景脚本功能脚本内容及使用方法 1.背景 进行linux自动化运维时需要先配置免密,但某些特定场景下,做了互信的节点需要取消免密,若集群庞大节点数量多时,节点两两之间做互信操作非常麻烦,比如有五个节点&#x…

C++——动态规划

公共子序列问题 ~待补充 最长公共子序列 对于两个字符串A和B,A的前i位和B的前j位的最大公共子序列必然是所求解的一部分,设dp[i][j]为串A前i位和B串前j位的最长公共子序列的长度,则所求答案为dp[n][m],其中n,m分别为…

微信小程序主体变更的操作教程

小程序迁移变更主体有什么作用?进行小程序主体迁移变更,那可是益处多多呀!比方说,能够解锁更多权限功能;在公司变更或注销时,还能保障账号的正常使用;此外,收购账号后,也…

详解xlsxwriter 操作Excel的常用API

我们知道可以通过pandas 对excel 中的数据进行处理分析,但是pandas本身对格式化数据方面提供了很少的支持,如果我们想对pandas进行数据分析后的数据进行格式化相关操作,我们可以使用xlsxwriter,本文就对xlsxwriter的常见excel格式…

Salesforce AI研究: 从奖励建模到在线RLHF工作流

摘要 该研究在本技术报告中介绍了在线迭代基于人类反馈的强化学习(Online Iterative Reinforcement Learning from Human Feedback, RLHF)的工作流程,在最近的大语言模型(Large Language Model, LLM)文献中,这被广泛报道为大幅优于其离线对应方法。然而,现有的开源RLHF项目仍然…

Android存储文件路径的区别

一、Android存储简介 Android系统分为内部存储和外部存储 从Android6.0开始不断在更新存储权限 外部存储路径的开头:storage/emulated/0 内部存储文件路径的开头:/data/user/0/应用的包名(packageName) 在设备上对应的目录为/data…

Linux的命名管道 共享内存

目录 命名管道 mkfifo函数 unlink函数 命名管道类 服务端 客户端 共享内存 shmget函数 ftok函数 key和shmid的区别 snprintf函数 ipcs指令 ipcrm指令 shmctl函数 shmat函数 void*做返回值 创建共享内存空间 服务端 客户端 命名管道 基本概念&#xff1…

笔记本黑屏,重新开机主板没有正常运作的解决办法

拆开笔记本后壳,打开看到主板,将主板上的这颗纽扣电池拆下来,如果是带连接线的(如下图),可以将接口处线头拔出,等1分钟再把线接上。 ------------- 以下是科普 首先,电脑主板上的这…

力扣例题(循环队列)

链接 . - 力扣(LeetCode) 描述 思路 我们使用数组来创建循环队列 数组的大小我们就额外对开辟一块空间 MyCircularQueue(k) 开辟一个结构体,存放队列的相关数据 分别为size,数组指针_a,起始位置head,结束位置tail 注意:我们…

移动端自动化测试工具 Appium 之持续集成

文章目录 一、背景二、前置条件三、代码部分1、pom.xml文件配置2、main入口代码 四、Jenkins 部分1、下载Jenkins2、安装插件3、job配置4、选择构建 五、工程目录六、报告示例七、总结 一、背景 持续集成是老生话谈的事情,用的好不好,看自己公司与使用场…

能播放SWF文件的FlashPlayer播放器

问题: 你是不是遇到了 flash 动画 放不了了? 以前的flash游戏玩不了了 在网上很难找到好用的,免费Flashplayer播放器, 找到的也没法保存.exe 以前买的课件放不了了 一打开就更新提示: 再不就是意外能打开了但【创建…

IBM Granite模型开源:推动软件开发领域的革新浪潮

每周跟踪AI热点新闻动向和震撼发展 想要探索生成式人工智能的前沿进展吗?订阅我们的简报,深入解析最新的技术突破、实际应用案例和未来的趋势。与全球数同行一同,从行业内部的深度分析和实用指南中受益。不要错过这个机会,成为AI领…

高中数学:平面向量-加减运算

一、向量的加法运算 三角形法则(推荐) 两个或多个向量收尾相连的加法运算,用三角形法则 简便算法 首尾相连的多个向量,去掉中间点,就是最终的和。 也可以用三角形法则证明 向量加法交换律 向量加法结合律 平行四…