在北京时间 12 月 6 日夜晚时分, Google 往近期略微显得有些沉寂的 AI 模型战场投下了一颗新型炸弹, 一个号称多模态任务处理能力于首次之际超越人类的 AI 模型, Gemini 1.0 正式被发布了。
在昨晚正式发布之时, 之前, 外媒就有一批关于Google这款全新AI模型的消息纷纷流出, Google最早于今年五月的IO大会期间透露了Gemini的存在, 不过, 有别于以前外界所预期的情形谷歌宣称Gemini的发布并没有因任何内部缘由而被延期, 表明其AI模型的研发进程自2012年业已开启, 直至最近2023年发布PaLM2和Bard之后, 就着手为Gemini的正式发布进行准备。
早在OpenAI进入众人视线之前,DeepMind就凭借AI 围棋棋手AlphaGo吸引了世界对AI时代的关注, 也凭借此成为AI领域顶尖研究机构, 如今新一代AI大模型「双子座」正式对外发布, 似旨在夺回主导地位。其名中的双子座在神话里象征着「快速思维」, 还蕴含着包罗万象、良好沟通的寓意。
多模态能力
就实际表现而言, Gemini宣称是有史以来首部原生支持多模态能力的人工智能模型, 也就是说, 在Gemini出现之前那些具备多模态特性的人工智能模型, 它们进行运算当涉及同时处理视频以及文字或者音频照片其中两种以上输入数据信息时, 这种逻辑便是: 各个模态对应组建都是分开培训的, 随后把这些组件理解而来的语义拼接组合, 借此借此模拟人类在处理多模态场景问题时的反应。
这种架构, 虽已足够令人惊艳, 然而在面对复杂逻辑问题之际, 难免会显得有些笨拙, 缘由在于, 在这种架构情形下, AI模型的算力并未得到最为高效的运用。Google的解决方案, 乃是将Gemini设计成原生多模态, 从起始之时便在不同模态上开展预训练。借助额外的多模态数据对其予以微调, 从而进一步提升其有效性。
对于这种训练架构方面的颠覆, Gemini在起始的输入时期, 竟然能够迅速理解人类的各类内容并予以推理, 这一状况在应对复杂问题之际, 其优势显得格外突出: 在发行Gemini的同一时刻, Google另外公告称, Gemini Ultra于行业标准MMLU(多任务语言理解)基准测试里获得了百分之九十的成绩。
这不仅是AI模型在测试结果方面, 有史以来首次超越人类专家, 其测试结果还超过了此前GPT - 4在同类测试里86.5%的结果, 并且在六项独立基准测试中, 分别击败了包括LLAMA - 2、GPT - 4在内的一众竞争对手, 同时在另外三项独立基准测试中亦如此。
Google预备了好些演示场景, 用以展现Gemini的多模态理解能力, 视频里有位测试者, 正以简笔画视频的形式, 给Gemini录入信息, 演示期间, Gemini能够依据简笔画的每一笔变化, 实时针对最新的画面内容进行解读跟描述。还有根据输入视频中毛线颜色的比例, 给测试者推荐适宜的编织玩具, 以及跟Gemini玩猜硬币游戏, 猜错硬币在哪个手掌下后, 马上反应出这是测试者的把戏等场景。
Gemini 与目前市面上其他生成式 AI 模型相比, 最大的区别是能同时处理多种形态的信息输入, 在处理数学、计算机等复杂学科时, 这种优势体现得更为明显, Google 也强调了 Gemini 在数学领域的复杂理解能力, 在其中一个演示里, 展示了通过视频输入一道数学题, 交给 Gemini 辅助解决的场景。
需求看似简单, 实则涵盖对指令语义作准确理解 , 还有手写图像识别 , 与此同时要处理复杂逻辑的 数学问题 , 这是典型的多模态大模型应用场景。
可拓展性
截止至2023 年下半年, 大模型依不同体积并行发展, 此已为行业所趋主流, 特别是模型全然于本地得运行之端侧大模型, 更是生成式AI 行业应用里备受追捧、极其热门之前景。诸如vivo、小米、OPPO等手机品牌, 皆已将面向普通智能手机用户之端侧大模型与云端大模型相结合予以推出应用。
Gemini也未遗漏这一特性, 在Gemini 1.0里, Google总共推出了三个版本, 里面的Gemini Ultra最为聪慧, 可同时却需要更大的计算量, Pro是当中最均衡、适用于最多场景的版本, 而Nano乃是体积最小最高效的版本, 还是主打部署在Android手机等设备上的端侧大模型。
Google没有直接给记者讲Gemini Nano模型的体积, 不过按照DeepMind所讲, Gemini Nano具备完全于端侧离线运行的本事, 当下Google已针对Pixel系统本身带的录音App做了Gemini的适配, 就算没有网络连接, 也能够自动依据录制的对话、采访、演示等内容生成AI摘要。
先看, Gemini Nano 的能力, 除了被整合进 Android 系统中, 还体现在系统自带 App 之外。第三方应用的开发者呢, 能通过应用适配的方式来调用手机自带的 Gemini 模型能力。比如说, 手机自带的输入法, 能依据适配 Gemini 的聊天 App 里对方发送给你的文字信息, 自动为你生成合适的快捷回复。

Google从事研发工作的人员同时提及今后存在这样的计划, 即要把Gemini应用到其他的Android智能手机之上, 然而这一部分进行适配的工作与手机硬件的算力适配相关联, 所以截至目前暂时只有Pixel 8 Pro这款手机是能够适配Gemini的机型。
至于, 不少人所关心的那个问题: Gemini 能不能够完全超越 GPT 4.0 呢? 记者在现场时便也询问了 Google DeepMind 的研发团队, 尽管, Google 并没有正面去回应这个提问, 可是, 又重新强调了 Gemini Ultra 在 MMLU 当中所获得的评分跟 GPT-4 相比而更高, 并且, 还是目前唯一超越人类专家测试结果的 AI 模型。
新硬件开云真人app官方版入口,开云真人app官网入口,新架构
每当谈及 Google 在生成式 AI 领域里的硬件技术时, 常常都得介绍 TPU(张量处理单元)的情况: 这是 Google 专门为神经网络机器学习开发的专用硬件, 自 2015 年发布 TPU v1 起, 至今已迭代了五个大版本。当下 Google 所展示的 Gemini 1.0, 是基于 Google 数据中心的 TPU v4 和 TPU v5e 大规模阵列训练而成的。
这些TPU阵列, 不但被拿来用于训练Gemini, 还在Gmail用途上有近十年历程, 在YouTube用途上有近十年历程, 在Google Play等Google生态应用方面亦有近十年历程。而且开云手机入口app下载开云app在线入口,开云真人官方下载,是从2018年起始开放给予第三方客户去使用的。另外, 存在不少人工智能初创公司将其选作训练大模型的硬件基石。与此同时, Google还提及, 在TPU之上Gemini的运算运行速度显著优于早期那些规格尺寸相对较小的模型, 是这样的。
现今, AI 模型参数依旧以指数级态势增长, 顶级的 AI 大模型已然有着数千亿乃至万亿级别的参数, 哪怕是最厉害的 GPU 配置, 再豪气地大量堆砌 GPU 数量, 去训练出像 GPT - 4 这般的大模型, 也得耗费长达数月之上的时间。能够这么讲, 具备高性价比的高算力平台, 是当下行业里最为急切的需求。所以呢, 实际上适用于下一代人工智能训练的那种硬件架构其实也快要出现了, 在公布Gemini 1.0的同一时间, 谷歌向外界一同展现了最新的TPU v5p系列。

位于 Google 数据中心里的 TPU v5p, 放在 Google Blog 上。
跟 Gemini 所训练的那个“底座”, 也就是当下应用的主力 TPU v4 以及 v5e 相比较, v5p 把可拓展性给进一步增强了, 并且为了去应对复杂模型的推理训练以及调整需求, 设计出了新的硬件架构, 能够依据性能需求灵活地进行部署, 每个 Pod 计算单元里的芯片数量翻了一番, 是由一共 8960 颗芯片相互连接构成的。其浮点运算能力相较于 v4 提高了两倍, 训练速度跟 v4 比起来能提升 2.8 倍以上。
TPU v5p推出的同时, 还有代号为「AI Hypercomputer」的超级计算机架构被一并推出: 按照Google的说法, 这是个经过优化的技术系统, 它能够和Google Cloud计算中心的硬件协同开展工作, 还能对现代AI模型开发的工作负载予以支持。

AlphaCode 2:全新代码生成工具
两年前, Google发布了一款AI代码生成系统AlphaCode , 那时, 生成式AI还没掀起大的波澜, 代码辅助类AI机器人还在占据着主流视野, 而这个时代, 今天Google在Gemini的基础上发布了AlphaCode 2。

第一代Gemini能够理解代码, 还可以解释代码, 更能够生成当前世界上颇为流行的编程语言(像Python、Java、C++以及Go)的代码。基于此的AlphaCode 2, 同样在解决那些既需要具备编码能力, 又需要拥有复杂数学以及理论计算机科学知识的竞赛性编程问题方面表现出色。
当在与最初的AlphaCode相同的平台上开展评估时, AlphaCode 2展现出显著的增进。它所解决的问题数量, 大概是AlphaCode的两倍之多, 其性能相较于AlphaCode, 高出差不多50%。当然, 这些目前暂且都只是演示方面的内容。虽说第一代AlphaCode事实上从未予以发布, 然而DeepMind实际上已经披露了这款产品将来投向市场的可能性。
发布时间线
有至于 Gemini 的开放时间, 三种不同模型尺寸的 Gemini, 在具体开放、使用时间这层面, 以及使用的相应场景方面, 都未曾全然一致相等着情况来讲: 当中 Gemini Pro 将会是最先开始落地呈现的部分, 定好日期在 12 月 13 日, 那时用户便可以具备一种以 Bard with Gemini Pro 的样式形式去体验的机会态势而来。Google 的 CEO 皮查伊更是明确地进行表示表明着 Gemini 会是 Bard 的一次全面性质的升级情形, 多模态能力将会被授予给予 Bard 能够拥有输入输出图像、音频视频内容的能力本事。
新版的Bard经升级后, 会在170多个国家或地区, 提供基于Gemini Pro的英文服务, 当前Gemini Pro版本, 尚不支持更多语言, Google称更多语言支持正在开发。同时, 目前开放版本里, 用户暂时只能通过文字指令体验Gemini, Google还表示, 会在未来几个月内, 允许用户使用音频与图像交互能力。
而Gemini Nano, 除了会登陆在Pixel 8 Pro这款手机之上, 从即日起, 它也将会对所有Android 14开发者予以开放, 这些开发者能够以AICore的形式, 在手机系统里调用Gemini的能力, 将其运用在自己的App中, 去尝试AI功能。

要是说到那个综合能力已然超过GPT - 4的Gemini Ultra, 它要到明年年初的时候才能够逐步地开放测试, 首先呢, 是会开放给一部分的客户, 还有开发者, 让他们用于早期的实验反馈, 那后续普通用户会像是随着以Bard的下一代升级迭代版本, 也就是Bard Advanced的形式, 从而体验到Gemini模型的全部能力。
标签: AI Gemini1.0 多模态 DeepMind TPU
还木有评论哦,快来抢沙发吧~