短信登录 企业用户

未注册过的手机号登录即创建广告门账号

综合

综合

案例

公司

专题

2025百大品牌创新营销案例 ai 美团 金瞳奖 联名 王楚钦 招聘 CNY 趋势 京东 中秋 瑞幸 快手 七夕 小红书
清除历史

VLX同参数打赢英伟达LocateAnything,转头就开源了:物理AI的格局可能要变

慢放

发布时间:2026-08-07 23:55     浏览量:60


AI联汇 VLX-Seek 开源模型 具身智能

2026年8月,具身智能赛道的资本温度计还在往上蹿。

宇树科技科创板IPO初步询价,预估发行市值超400亿。智平方赴港在即,估值突破200亿。据Crunchbase统计,2026年上半年全球机器人领域融资达188亿美元,已超过2025年全年总额,其中中国市场占比超43%。平均每天有超过5亿元流向这个赛道。

就在这个节骨眼上,Om AI联汇同一天宣布了两件事:完成数亿元融资,前海母基金领投,政府产业基金协同参投;同时,开源了VLX-Seek 1.5端侧原生感知模型。


本文来源于广告门 adquan.com

拿到钱的第一件事不是闭门筑壁垒,而是把核心模型开放给全行业。而这个模型的跑分,刚刚在多项核心指标上超越了英伟达。

这不是冲动。如果你看懂了"端侧原生"这个概念在物理AI中意味着什么,就会理解这个选择背后的逻辑。

巨头卷参数,有人在卷架构

先说一个行业里不太被讨论的事实:所有人都在谈论物理AI,但绝大多数参与者——从模型公司到本体厂商——用的仍然是云端大模型的架构思路。

英伟达的LocateAnything系列、Google的Gemini、OpenAI的GPT-4o,这些模型一个比一个大,一个比一个强。把模型做更大,喂更多数据,期待能力涌现。这条路径在语言模型上被验证了,但在物理世界遇到了一堵墙。

物理世界的决策窗口以毫秒计。一架无人机在追捕嫌疑人,目标闪了0.3秒就消失在楼宇之间——这个时间窗口里,把画面传到云端、调千亿参数模型做识别、再把结果传回来?差得远,光网络延迟就吃掉一半。

机器人要动、摄像头要看、机器狗要跑。这些场景要的不仅是更聪明的模型,而是能在终端上实时跑的模型。但问题在于,把云端大模型压缩后塞进终端,就像给高个子做的衣服裁剪后给小个子穿——尺码对了,版型不对。

这正是"端侧原生"要解决的问题。但它不是"缩小版大模型",就像云原生不是"缩小版机房"。

云原生从架构层面重新定义了计算资源的组织方式——容器、微服务、弹性伸缩,每一层都是为"云上生存"重新设计的。端侧原生也是同一层级的概念:从模型架构、数据流、推理范式开始,为物理世界重新设计一套AI基础设施。

它和云端大模型的差异是根本性的,不是程度差异,是物种差异。

效果如何?直接看数字。

VLX-Seek 1.5的3B参数版本,在多项核心指标上正面超越英伟达LocateAnything-3B。同参数,正面比较:COCO F1@0.5,75.3 vs 70.1;LVIS F1@0.5,73.6 vs 62.3;无人机极端场景准确率提升62.9%,误报率降低74.8%。


这个结果放在半年前几乎不可想象。一家中国AI公司,用同样的3B参数,在物理感知领域打赢国际巨头,差距不在算力,在架构。

VLX模型系列是Om AI联汇自主研发的端侧原生架构的流式多模态模型——不是在云端大模型上打补丁,而是从物理世界的需求出发,定义AI模型应该怎么感知、怎么思考、怎么决策。

Om AI联汇提出的这一全新范式能不能立住,光看跑分不够。VLX在真实世界里到底有什么不一样?

跑分之外,VLX做对了什么

技术指标证明了端侧原生架构的优势。但VLX在真实场景中和巨头模型的差异,远不止跑分。

先说VLX系列模型最核心的能力——流式多模态。

在真实物理世界中:无人机画面一秒30帧,每帧都在变。嫌疑人0.3秒闪过一栋楼,下一帧只剩半个衣角,再下一帧可能完全消失。

英伟达LocateAnything处理这类场景的方式是:接收一整张图,处理后返回结果,每次推理都是独立的任务。一帧一帧独立处理,30帧就是30次独立的"一问一答"。

VLX用的是流式多模态——模型持续观察视频流,累积信息,增量推理。信息不足时,可以多看几帧再判断,而不是每帧都硬给答案。这是一种批处理模型没有的能力:等待。

想象一个场景:无人机在楼宇间追踪目标,目标突然被遮挡。批处理模型每帧都独立判断——第1帧"看到了",第2帧"没看到",第3帧"没看到"——三次判断,两次"没有",按多数投票就是"目标消失了"。但流式模型会记住"0.1秒前目标还在",在遮挡期间保持追踪状态,等目标重新出现时无缝衔接。

流式多模态并不是VLX独有的能力,很多厂商都在做。但在端侧原生架构下,VLX把它和两个关键设计结合在一起,形成了VLX-Seek 1.5的差异化。

第一个是"怎么定位目标"。传统VLM的定位方式,是让模型像背圆周率一样逐字生成坐标数字"[0.234, 0.567, 0.289, 0.612]"。十个目标念十串数字,少一个括号解析代码就崩了。VLX-Seek 1.5把定位重构为"区域指代"——视觉区域被表示为可寻址实体,模型通过选择和引用区域来回答问题。就像人指东西不说"东经121.47北纬31.23",只说"喏,在那儿"。


第二个是模型能不能承认"我不知道"。传统模型被训练成每次都要输出结果,画面里没有目标,它也倾向于编一个答案。VLX模型把"不确定"设计成显式输出选项——没有就是没有,直接告诉你。VLX-Seek 1.5的误报率仅为LocateAnything-3B的四分之一。

在物理世界,无人机追踪空气、安防系统频繁误报,"乱报"比"漏报"危险得多。一个AI模型能说"我不知道",可能比它会做更多事情更值钱。可靠性的价值远大于能力上限。

流式多模态、区域指代、原生拒识——这三件事不是独立功能的简单叠加,而是端侧原生架构下的一体设计:从模型怎么"看"、怎么"说"、怎么"判断"三个层面,重新定义了物理世界的AI模型应该是什么样的。

范式能不能变成钱

技术再漂亮,最终要回答一个问题:怎么变成钱。

这个问题在当下的具身智能行业尤其尖锐。据中国证券报报道,2026年上半年国内具身智能赛道融资总额已超900亿元,但大多数公司的商业化仍停留在产线试点阶段。"融钱期"和"变现期"之间的裂缝,正在吞噬一批只有技术没有收入的公司。

Om AI联汇的做法,是将VLX打造成通用基座,成为物理AI的基础设施。几条变现路径已经跑通。

无人机智飞大脑OttoPlex御行是一个巴掌大小的盒子,搭配任何普通无人机,就能让它从遥控工具变成自主智能体。公安警情联动场景中,监控发现可疑目标,无人机30秒内自动升空,自主规划航线、识别跟踪,全程无需飞手。海事巡逻中,多架无人机沿标准路线协同巡查,发现可疑船只自动抵近确认。


硬件层面,与联想、苹果联合推出OttoBox AI Studio,将模型能力嵌入AI PC终端。不自己造硬件,通过技术授权和联合方案获取收入。

自有产品也已经在跑。Homer AI可穿戴视觉中枢服务全国近10万视障用户,月均AI调用量达千万次——有用户、有调用、有留存。

再加上基于VLX模型基座的"一脑多形"智能体平台,Om AI联汇通过与具身智能企业合作,为各类终端设备赋予感知与决策能力。

融资到位的根本原因,不是技术故事讲得多好。投资人看到的是已经跑通的变现路径和真实用户数据。Homer AI的10万用户和千万次月调用,是端侧原生范式从理论走向商业的最有力证据。

开源的棋局

回到开头那个问题:拿到钱第一件事为什么是开源?

最直接的好处是降低门槛、扩大生态。越多开发者基于VLX-Seek 1.5做应用,端侧原生范式就越有机会从"一家公司的技术路线"走向行业共识。当然,开源模型不等于范式就能自动成为事实标准——Kubernetes之所以成为标准,不只是因为开源,更因为大量上下游厂商共同参与,形成了难以替代的生态网络。端侧原生要走通同样的路,需要的不仅是一个开源模型,还有时间、场景和足够多的共建者。

开发者社区也是最直接的验证渠道。每一个基于VLX-Seek 1.5开发的场景,都是免费的场景验证和数据回流。模型在更多真实环境中被使用,反馈越多,迭代越快。

而敢把同参数超越英伟达的模型放到公开评测里让所有人比较,这个姿态比任何动作都有说服力。

云原生时代,Kubernetes开源不是为了做慈善,是让所有人都在你的地盘上盖房子。端侧原生同理——开源的是模型,收的是生态。

每天5亿流向这个赛道,但没人问对问题

把这笔融资放到行业大周期里看,时间点意味深长。

宇树IPO询价、智平方赴港,具身智能赛道资本化全面提速。但一个值得注意的分化是:宇树和智平方的估值逻辑建立在出货量上,市场看中的是"卖硬件的闭环";而在部分投资人看来,Om AI联汇的估值逻辑,押注在架构范式的不可替代性上。

同样是具身智能公司的融资,关注的不是同一样东西。

硬件成本持续下降、端侧算力快速提升、场景需求集中爆发——这几个变量同时到位了。巨头们还在云端卷参数,千亿模型一个接一个发,参数记录一个月一破。但端侧模型已经在收用户了——10万视障用户、千万次月调用、公安海事场景常态化部署。

这不是同一个竞赛。巨头在比谁的模型更聪明,端侧原生在比谁的生意先跑通。

2026年下半年,端侧AI赛道大概率会从"技术比拼"逐步切换到"收入验证"。有商业闭环的公司可能率先跑出来,而那些只有技术故事、没有收入支撑的公司,恐怕会迎来更严峻的考验。

物理AI的下半场,谁会是那套"操作系统"?

端侧原生之于物理AI,如同云原生之于云计算。

云原生重新定义了计算资源的组织方式,催生了万亿级云计算市场。端侧原生正在重新定义AI与物理世界的交互架构——当模型不再是"部署在终端的外来大脑",而是"生长在终端的感知神经系统",物理AI的规模化落地才有了真正的地基。

Om AI联汇是这一范式的最早倡议和实践者,但不一定是唯一赢家。范式定义的价值在于开创赛道,不在于垄断赛道。真正决定胜负的,是谁能率先在范式之上建起不可替代的商业闭环。

融资加速商业化,开源扩大生态。但最终衡量一个范式价值的,不是融了多少钱、开源了多少模型,而是有多少人在用它、它创造了多少真实收入。

回到开头那笔融资和开源。

2026年,资本正在疯狂涌入具身智能赛道,每天5个亿。所有人都在问:谁会是最终赢家?答案可能不在今天的任何一张牌桌上。

云原生时代,没有人记得第一个提出"容器"概念的人是谁,但所有人都运行在Docker和Kubernetes之上。端侧原生的故事可能也会这样——多年以后,人们回头看2026年这个夏天,可能记不清是哪家公司最先开源了一个3B参数的感知模型。但当无人机在追捕中不再需要飞手、视障人群靠一块胸牌走遍城市、机器人终于敢在真实世界里说"我不知道"——所有人都会意识到,有一套新的架构范式,已经悄悄接管了物理世界和AI之间的那道接口。

基础设施的价值,最终要靠使用它的人来证明。而使用它的人,正在多起来。


注:本文系作者授权在广告门平台发表,内容仅为作者本人观点,不代表广告门立场和观点。
点赞 1
收藏
微信分享
关闭

意见反馈/举报

反馈/举报信息:

联系方式(选填):