“物理AI的GPT时刻已经到来。”
2026年1月5日, 在拉斯维加斯的CES展会之上, 英伟达的创始人同时身为CEO的黄仁勋, 宣告AI正式进入到一个新的阶段。
在他的某种看法当中, AI的进化发展能够划分成四个阶段, 分别是: Perception AI、Generative AI、Agentic AI、Physical AI。当模型具备理解质量、摩擦、惯性、动量守恒这些内容的能力时, AI才算是真正从荧幕当中走脱出来。他与此同时还指出, 要使得机器人理解物理世界 , 并不是仅仅依靠单一的模型就行的, 而是需要构建一整套那样的智能系统。
黄仁勋勾勒出了未来的景象, 然而, 一个难题呈现在了每一个人的眼前, 那就是, 处于物理世界的人工智能, 究竟需要何种技术方面的能力呢?
对于AI而言, 当它真正迈向物理世界, 在机器人、无人机、安防摄像头、可穿戴设备等这些场景当中, 所需要的并非是回答问题, 而是要能够持续地进行工作。而物理AI最为关键重要的地方, 其实也就是主动执行的那种能力。
赵天成博士, 这位现任 Om AI 联汇 CEO 同时兼任首席科学家的人士宣称: “在此之前, 整个行业范围之内, 对于通用视觉智能这件事情的关注程度乃是偏低的态势。大家偏向性地将更多关注点放置于一些能够观看表演亦或是可以进行操作的诸多场景上面然而此处所说的通用视觉这个要点呢是未来物理 AI 真正达成规模化应用并实现落地这件事情不可缺失少掉必备的一方面而且还有可能是趋向于更加具备现实意义更加直接呈现出来的核心技术所在它将会以更为广泛的程度应用至所有物理 AI 场景当中”。
通用视觉智能, 也就是那种模型, 它得能如同人一般, 持续地去观察环境, 能够精准地定位目标, 还能自主地驱动行动, 并且, 这所有的一切, 都必须是在端侧完成的。
近些日子发布的, 是VLX端侧的, 流式的, 多模态的, 模型系列, 它恰恰就是这一路径的最新实践。
业界首次提出了“流式多模态”这一全新的模型架构, 它区别于传统模型“采集 - 上传 - 离线处理”的路径, VLX系列面向物理世界中持续涌入的视频流, 能够实现毫秒级实时的感知, 并且首次在端侧打通了“持续感知 - 精准定位 - 行动决策”的完整闭环。
一、三个模型、三层能力、一条链路
什么样的存在, 才被称作通用视觉智能, 其英文表述为General Vision Intelligence呢?
Om AI联汇的定义旨在呈现的是那样的三项核心能力, 其一乃持续感知方面, 此方面具备能够无需人工触发即可达成的特点, 其二为空间智能领域, 该领域涵盖着能够精准定位目标的特性, 其三是行动输出范畴, 但行动输出范畴拥有可直接驱动设备之力, VLX系列有的Flow、Seek、Go这三个模型恰好是对应着刚才所提到的这三项能力呢:
VLX-Flow是持续感知层:
普遍来讲, 传统视频AI运用的是离散式处理逻辑, 借助截取画面达成单次问答交互, 其观测有着显著间断。然而, VLX-Flow运用的是流式视频输入架构, 图像数据流会不间断地被送入模型, 以此来实现持续观测以及时序记忆留存。并且, VLX-Flow着重于底层感知的实时性, 不用人工去下发指令触发展开运行, 能够自主不间断地运行。
VLX-Seek是精准定位层:
在市面上所能见到的通用视觉大模型, 仅仅能够达成对于画面内容的文本描述, 仅仅可以告知画面之中有物体存在, 然而却不能够输出准确的空间位置, 很难去回答目标坐标、数量等具有实操性质的问题。VLX-Seek替换了底层的技术思路, 运用了区域指代机制, 直接输出毫米级别的精准空间锚点。
VLX-Go是行动输出:
传统的视觉模型, 在解析画面内容以后, 仅仅能够生成文字形式的操作指令, 并且是没办法直接去驱动硬件执行的。而VLX-Go则更进取一步, 它有着能够输出设备可直接进行调用的导航航点的能力, 依靠这些导航航点以此支撑机器人自己完成移动动作, 就此实现了低延时实时反馈。
视频流不间断地持续进入, 由Flow负责去“看懂”, Seek负责把“找对”做好, Go负责达成“动起来”的效果。这三块拼图, 只有拼合在一起, 才能够构成完整的物理世界AI。
在基准测试里 , VLX借助三组数据 , 印证出了这样一个趋势: 参数规模 , 和物理世界的实际表现 , 正彼此脱节。
Seek - 3B在目标检测基准MSCOCO val2017中大幅超越Gemini 3.1 Pro和GPT - 5等旗舰大模型, 在复杂语义基准RefCOCO里也大幅超越Gemini 3.1 Pro和GPT - 5等旗舰大模型, 在开放词汇检测基准ODinW13同样大幅超越Gemini 3.1 Pro和GPT - 5等旗舰大模型, 在目标计数基准PixMo Count依旧大幅超越Gemini 3.1 Pro和GPT - 5等旗舰大模型, 它用3B小参数做到了旗舰精度。

于机器人导航跟跟踪任务里, Go(0.6B)凭借极少的参数量达成了85.42%的高成功率, 此成功率超过参数比其大13倍的Qwen - RobotNav - 8B;与此同时, 以94.08%的跟踪率明显领先所有对比模型, 这证实其在动态目标跟随方面拥有极强的视觉 - 运动协同能力, 还更有力地证实了针对端侧物理场景开展专用架构设计的有效性。

于延迟层面而言, 端侧进行推理仅仅只需0.1秒, 然而云端推理一般会超出5秒 ,这般50倍的差距直接就决定了系统“可用”与“不可用”的边界。
实际上结果表明, 当模型一定要运行在端侧之处, 且得是能够实时进行响应的情况, 还必须要做到自主做出决策之时, “大”反倒变成了一种包袱。VLX真正具备的价值, 乃是运用规模更小一点的模型, 于端侧芯片之上跑出更为出色的结果 , 这证实了“依据场景来设计模型”这样的路径 , 要比“把通用模型放入场景当中”更加具有高效性。
二、给物理世界造一套“视觉中枢”
这样亮眼的测试成绩,根源于架构层面的差异。
传统模型处理视觉信息所采用的方式为“截帧 - 上传 - 提问 - 回答”, 也就是去拍一张照片, 或者把一段视频给上传上去, 然后问一句一个问题, 接着得到一句一个回答, 这般模式从本质上来说是离散的, 并且还是被动的。眼下大部分模型的解决方案依靠着长上下文去对视频输入进行处理, 其本质依旧是“离线看一遍”。
Om AI联汇所提出的流式多模态, 这一情况, 就好比是给设备装上了那么一套持续运转着的“视觉中枢”。摄像头采集的视频流, 它就如同水一般地流入模型之中, 接着模型持续不断地进行接收, 然后去理解, 再之后还要记忆, 最终形成一个不间断的感知流。用户或者开发者借助提示词能够自由地定义输出目标, 而这套中枢装置, 是可以按照需求输出文本描述, 或者输出空间锚点, 又或者输出行动轨迹的。
沿着技术路径来看, VLX的流式能力是针对实时交互场景而进行设计的, 系统能够自行持续观察, 能够做到精准锁定, 能够即刻展开行动。这两者的应用场景存在差异, 架构设计也因此出现分化。
行业里普遍通行的做法是, 先去训练那种具有大参数的模型, 之后再凭借量化、蒸馏这类方式把它压缩到端侧, 然而Om AI联汇所采取的却是一条不一样的技术路径。
按照该公司技术团队所讲的话说, VLX自设计起始点开始, 就围绕着端侧算力的约束来开展架构设计工作。Flow运用Linear Attention机制去替换标准Attention, 以此确保在视频流持续不断输入进来的情况下, 显存不会出现溢出的状况;Seek使用区域指代来取代坐标生成, 这样做在提高精度的同时, 还能够降低计算量;Go选取短时航点预测的方式, 用以快速地对周围环境的快速变化做出响应。
三、不再纸上谈兵开云手机入口官网下载,Om AI联汇定义物理AI新范式
从前, 物理AI的落地始终卡在一个尴尬境地, 其演示令人惊艳, 然而量产却缺乏动力。VLX从最初就是冲着落地去设计的, 并且已然实现了大规模落地。

VLX的行业价值开云app官方最新下载,在于验证了一条不同于数字AI的架构路径。
在行业还在较量谁能将云端模型压缩得更小的情况下, VLX选用从端侧算力约束着手来设计模型, 测试数据表明这条路不用等待算力迭代便能实现落地, 布置成本显著压缩, 实时响应能力提高了数十倍, 国产芯片就能够流畅运行。
于此同时, 这套流式多模态路线覆盖了具身智能场景, 覆盖了无人机场景, 覆盖了可穿戴场景, 覆盖了安防场景, 还覆盖了AI PC等多个场景, 物理AI从“Demo展示”到“量产交付”的拐点正在显现。并且, VLX系列模型向开发者开放了体验平台, 此举措进一步降低了端侧智能应用的研发门槛, 为产业链协同创新提供了更大的想象空间。
结语:用流式架构为物理世界重新设计AI
回到一开始的那个问题:物理世界,究竟需要怎样的AI?
针对Om AI联汇, 借助VLX系列模型, 得出了这样的答案, 即采用流式架构这种方式, 去为物理世界再次进行AI的设计。
这儿背后, 是Om AI联汇历经多年的长线布局, 还持续深耕着, 早在2016年画入生成式对话技术领域, 到2021年押注在多模态赛道上, 后来至2022年取得国内首张多模态大模型测评证书, 团队一直行进于行业趋势前段, 坚持不懈沉淀底层技术能力。
望向整个物理人工智能赛道, 行业从来都不缺少愿景, 不缺少概念, 也不缺少演示Demo。真正稀少的, 是能够适配实际场景, 稳定地运行, 并且可以规模化落地的成熟系统。更为要紧的是, 它需要被百万级别的设备验证过。
VLX为物理AI的端侧化路径开云app在线入口,开云真人官方下载,提供了一个可参考的样本。
标签: 物理AI 通用视觉智能 端侧流式多模态 机器人技术 实时感知
还木有评论哦,快来抢沙发吧~