• 首页
  • 国内
  • 国际
  • 军事
  • 财经
  • 房产
  • 汽车
  • 体育
  • 娱乐
  • 教育
  • 科技
  • 社会
  • 当前位置:我的网站主页 > 我的网站国内 >

    {主关键词}

    侠客行

    1.5B开源通用VLA模型,冲进具身智能第一梯队_我的网站

    霍去病

    A |     金磊 发自 上海          量子位 | 公众号 QbitAI          一个新的国产VLA模型诞生了,而且只有1.5B。      “九大战略性新兴产业、六大未来产业,代表了中国经济新旧动能转换的核心方向,也是孕育未来核心资产的沃土。”中国人寿保险股份有限公司(以下简称“中国人寿”,股票代码:601628.SH,2628.HK)有关负责人说,代表中国未来的领域,就是长期资金的投资方向。         Size这么小,能好用吗?          来,话不多说,我们直接看效果:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          在上面这个真机演示里,两只机械臂围着桌面开始做三明治。  S基金、PE基金、并购基金……近几年,中国人寿不断创新实践,将“耐心资本”投向硬科技领域。

    B | 它们分工合作,先取面包,再夹起生菜、火腿和鸡蛋,一层层叠到一起。

    C |          再来看下另一段演示:          视频地址:     https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw          一只宇树机器狗收到“跟随前面的人”这条指令后,开始一路跟在目标身后。仅今年以来,该公司已公告三项股权投资,投向半导体、人工智能、集成电路和生物医药等领域,累计出资额超118亿元。         从室外走进办公楼,再进入电梯、地下停车场,机器狗始终没有跟丢。这是中国人寿作答“科技金融”的投资面,与之同向护航科技的还有保险保障面。  不仅科技金融,中国人寿正通过系统布局与创新实践,将“五篇大文章”深度融入经营中。就算周围不断有人经过,环境和光线也在变化,它还是能认准一开始指定的那个人。         更关键的是,这套能力直接跑在机器狗本地!          电梯和地下停车场往往是网络信号比较差的地方。即使进入弱网甚至无网环境,机器狗依然能继续识别目标、规划动作,保持跟随。         而在这两段Demo背后,则是面壁智能在WAIC期间正式发布并开源的MiniCPM-Robot系列模型。在其看来,做好金融“五篇大文章”既是新时代赋予保险业的必答题,也是公司实现高质量发展的内在路径。         目前包含两个模型:          MiniCPM-RobotManip:也就是开头控制机械臂做三明治的通用VLA模型,参数量只有1.5B。         MiniCPM-RobotTrack:主要负责机器人的跟踪与导航,让机器人能够根据自然语言指令,在动态环境里持续跟住指定目标。  “投资+保险”护航创新全链条  展望“十五五”时期,中国人寿表示,将继续围绕国家培育壮大新兴产业、超前布局未来产业的部署,利用并购基金、PE基金、S基金等多元化的工具,为新质生产力的发展壮大贡献力量。  回顾“十四五”期间,中国人寿深入作答“科技金融大文章”,统筹运用保险资金投资与保险保障两种方式,为科技型企业提供全链条、全生命周期金融服务。

    D |               和它们一起出现的,还有开源具身智能推理框架PhyAI,负责让这些模型更快地适配硬件、跑到真实机器人上。  在投资端,该公司深耕布局,赋能科技自立自强,形成一批“耐心资本”投向硬科技的典型项目。         简单来说,一个负责让机器人“动手干活”,一个负责让机器人“认准人、跟着走”,再配上一套负责高效推理的底座。         面壁这次端出来的,已经是一套逐渐成形的具身智能组合。  2023年,中国人寿出资117亿元以S份额方式受让上海集成电路产业投资基金股权,投资于近二十家集成电路领域领军企业。         跻身第一梯队,延迟接近一半          先来看MiniCPM-RobotManip。  2024年,中国人寿再出资41亿元以S份额方式受让北京市科技创新基金,后者是全国首支聚焦硬科技投资的政府投资母基金。         虽然参数量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA评测里,它的整体表现已经进入第一梯队,与π0.5等模型处在相近水平。         真正把差距拉开的,是对机器人记忆力的考验。         很多VLA模型在执行动作时,主要根据当前这一帧画面做判断。截至2026年6月30日,该基金覆盖75只子基金,穿透投资1597家科技企业,其中国家级“专精特新”企业413家,省级“专精特新”企业445家,“独角兽”企业约60家;穿透投资企业中55家企业已实现上市。  继上述两个S交易之后,中国人寿在2025年探索并购基金,投资“上海芯合创一号私募投资基金”5亿元,为集成电路软件行业的集约化发展与技术迭代提供支撑。         比如让机器人点击画面里的第二个按钮5次。         如果它看不到前面的画面,也记不住自己已经按过几次,就很容易按一下便停,或者一直按下去。  在保险保障端,中国人寿业务精准对接,护航企业安心创新。         MiniCPM-RobotManip会把历史观测和此前执行过的动作一起纳入判断。

    E | 它知道任务已经进行到哪一步,也知道什么时候应该停下来。         在专门考察上下文记忆的RMBench中,π0.5的成绩约为10分,接近随机水平,MiniCPM-RobotManip则达到约53分。         这项能力对真实机器人很重要。2026年上半年,中国人寿战略新兴产业保险保费收入达17.5亿元。

    F |   数字背后是各地探索创新。例如,上海市分公司成立团体科技保险产品开发及推广项目组,深入开展科技保险市场调研,针对科创企业全生命周期风险痛点,设计国寿科技企业员工福利保障计划,为科技型企业员工提供标准化菜单式服务与量身定制综合性解决方案。         叠衣服、收拾桌面、做三明治,看起来都是日常小事,拆开后却包含一连串动作。  深入实践织密民生保障网  保险作为经济减震器和社会稳定器,正深度融入国家民生保障大局。中国人寿作为寿险“头雁”,在做好“普惠金融”、筑牢民生底线上,有更大责任担当,也有更多实践。  今年7月17日,中国人寿辖下西藏自治区阿里地区分公司揭牌运营满一周年。机器人只看眼前,很容易做到一半便“失忆”;能记住此前的状态,才有机会把长任务完整做完。一年前,中国人寿阿里分公司落地揭牌,一举补齐藏西寿险服务空白。         除了记得住,机器人还得反应快。         面壁给出的单帧推理对比中,在H100显卡、bf16精度下,MiniCPM-RobotManip单次决策延迟约为120毫秒,π0.5约为234毫秒,前者接近后者的一半。         这里的“成本减半”,主要是体现在推理延迟和计算量上。这家扎根平均海拔4500米“世界屋脊的屋脊”的全新机构,是中国人寿践行金融工作政治性、人民性,推动金融保险服务向藏西边境、高海拔牧区前移覆盖的标志性实践。         聊天模型多想一秒,用户通常还能等。机械臂每做一步都停顿一秒,动作马上就会变得僵硬,整个任务的完成时间也会被拉长。         对VLA来说,能不能在有限算力下快速输出下一步动作,和榜单分数一样重要。  自开业经营以来,中国人寿阿里分公司立足阿里地域辽阔、高寒缺氧、村组分散、边境线长、文旅客流密集的地域特点,聚焦牧区群众、边境村民、基层干部、景区游客多元群体需求,落地公益保障、上门理赔、全域消保宣教、属地协同发展等多项重点工作。         MiniCPM-RobotTrack也走了类似的小尺寸模型路线。一年来,该公司已累计为超5400人次群众提供风险保障服务,总保障金额超5.8亿元,用力用情服务父老乡亲。  陕西省宝鸡市眉县的汶家滩村是中国人寿“普惠保险全保村”。中国人寿眉县支公司的驻村专员有五个身份——普惠保险服务员、医保政策宣传员、道交基金联络员、医保外伤调查员、综合金融网格员,是村里的“百事通”。

    G |          它以MiniCPM4-0.5B为基础,整体参数规模为0.9B,主要测试三种真实场景。  “医疗理赔不出门,身故理赔不出村”,驻村专员教会了年轻人用手机理赔,对用不惯智能机的老人更直接“上门赔”——进家门、收资料、帮上传。         第一种是单目标跟踪。通过“一个人、一个村”网格化安排,中国人寿将综合服务送到乡亲们身边。给它一句明确指令,机器狗持续跟着指定的人。  这些只是中国人寿在全国范围内广泛开展普惠保险的点滴。

    H |          第二种是多人干扰。中国人寿通过全域覆盖,织牢多层次保障网络。  在支持乡村全面振兴领域,截至2026年6月底,涉农人身保险承保超1.4亿人次,提供人身保险保额超17万亿元,向710余万人次赔付超340亿元。  截至今年5月末,中国人寿累计参与承办200多个大病保险项目、80多个长期护理保险项目和140个城市商业医疗险项目。

    I | 周围几个人同时移动、交叉甚至交换位置,模型依然要认准最初的目标。  围绕“两新”人群、小微企业、学生儿童、老年群体等重点客群,中国人寿持续创新开发产品,兼顾普惠性与实用性,满足多元保障需求。

    J |   写好“五篇大文章”与高质量发展目标契合  不仅科技金融、普惠金融,中国人寿通过系统性布局与创新实践,将“五篇大文章”深度融入经营中。

    K |   在绿色金融领域,中国人寿将绿色理念贯穿经营全流程,构建绿色投资、绿色保险保障、绿色运营三位一体发展体系,主动投身污染防治、“双碳”战略实施,为美丽中国建设注入国寿力量。持续完善责任投资管理流程,在投前、投中、投后全流程纳入ESG考量,以长期保险资金助力清洁能源规模化发展。

    L |          第三种更难,指令本身可能比较模糊。

    M |   在养老金融领域,中国人寿以保险温度守护银龄幸福生活,构建覆盖养老保障、养老产业投资、康养生态建设、适老化便民服务全链条养老金融生态,全方位夯实多层次养老保障体系。

    N | 比如只说“跟着穿黑衣服的人”,现场又恰好有多个穿着相近的人,模型需要结合画面理解人类到底指的是谁。  在数字金融领域,中国人寿将科技创新作为驱动发展的核心引擎,以数字化、移动化、智能化全面重塑业务形态,在数字金融赛道上跑出了加速度。该公司在前沿智能领域引入多个高质量大模型,累计落地数百个智能应用场景,覆盖销售、客服、风控、运营、财务、精算等核心业务领域,在智能承保、智能核保、智能问答、自动理赔、投资分析等关键环节取得成效,业务实现智能化转型升级。         在没有进行下游强化学习优化的情况下,MiniCPM-RobotTrack在三类任务上的追踪率分别达到89.8%、73.4%和80.4%,均取得开源方案中的最优结果。  在中国人寿看来,做好金融“五篇大文章”既是新时代赋予保险业的必答题,也是公司实现高质量发展的内在路径。         相比OpenTrackVLA,三项追踪率分别提高7.0、14.6和6.5个百分点。实践证明,写好“五篇大文章”,与中国人寿做强主业、提升价值、防范风险的经营目标高度契合。         在相同的单视角、纯SFT设定下,与闭源模型TrackVLA++相比,它在单目标跟踪和模糊目标跟踪上的追踪率分别高出8.8和17.0个百分点,模糊目标跟踪的成功率达到58.0%。         参数小,表现却没有明显掉队。

    o |          机器人模型的竞争,也开始从单纯拼规模,转向拼单位算力到底能换来多少能力。

    p | “公司在服务国家发展大局中拓宽了发展空间,在守护人民美好生活中持续厚植了发展根基,这一过程相辅相成、有机统一,构成行稳致远的核心逻辑。”该公司有关负责人表示。         把机器人看到的世界压缩一下          MiniCPM-RobotManip能把尺寸压到1.5B,背后离不开面壁过去在多模态模型上的积累。

    q |          它基于MiniCPM-V 4.6训练而来(开源不到2个月,下载量已突破200万)。         面壁的MiniCPM-V/O系列已经持续迭代两年多,开源总下载量超过2500万。过去积累的图像理解、视频理解和多模态信息处理能力,如今被进一步搬到了机器人身上。         机器人执行一次动作,需要处理的信息其实很多。         一台双臂机器人通常会同时接收三个摄像头的画面,包括两个腕部相机和一个主视角相机,再加上一段文字指令,最后输出一个可以执行的动作。  中国人寿表示,立足“十五五”新起点,公司将以“五篇大文章”为核心战略抓手,踏上高质量发展新程,奋力谱写“头雁领航、五篇成势”的时代新篇。         而且,这个过程一秒要重复好几次。

    r |          如果每一张图片都被转换成大量视觉Token,机器人运行得越久,需要处理的历史信息就越多,计算量很快就会堆起来。         MiniCPM-RobotManip采用的办法,是尽量压缩视觉Token。         桌面纹理、墙面图案等和当前任务关系不大的信息,不必占用太多Token。模型用更短的数据表示保留关键内容,单次推理需要处理的信息量也随之下降。         信息少了,推理自然更快。对应到机械臂上,就是等待时间更短,动作衔接更顺。         视觉Token压缩还有一个更大的用处,可以帮助机器人以更低成本保留历史记忆。         常规方法每获得一张新画面,都要把此前的历史重新计算一遍。任务越长,计算量增长得越快。         MiniCPM-RobotManip采用流式计算,前面已经处理过的信息可以继续复用,新画面进来后,只需要接着往下计算。         这就有点像看连续剧的感觉了。         普通做法每更新一集,都要从第一集重新看起;流式计算则会记住之前的剧情,直接从最新一集接着看。         机器人因此可以带着更长的历史继续执行任务,同时避免计算量一路暴涨。         1.5B的尺寸,也和机器人的实际运行需求有关。         面壁在将约200毫秒视为机器人操作体验的一道临界线。再慢下去,机械臂和机器狗的卡顿感就会明显增加。         当前多数VLA基础模型都控制在4B以内。模型继续做大能带来多少真实操作收益,行业仍在验证。          作者声明:该图片由AI生成          到了MiniCPM-RobotTrack这里,轻量化的思路又换了一种实现方式。         它把视觉画面、自然语言指令和机器人的控制决策放进同一个模型里统一处理。

    s |          用户说一句“跟着前面穿黑衣服的人”,模型会直接结合摄像头画面理解指令,再把判断转换成机器狗的运动控制。         整个过程不需要额外安装一套目标检测模块、一套识别模块,再接一套跟踪系统。也不用外接开发板,只靠宇树Go2 Edu原装摄像头和本地算力,就能完成单目标跟踪、多人干扰跟踪和模糊目标跟踪。         不过,真实世界总会出现训练集里很少见的情况。

    t |          目标可能突然从镜头前横穿过去,也可能快速转弯,被其他人短暂挡住。几个人同时交叉走动时,机器狗还要避免跟错人。         这类场景数量少,却最容易让模型翻车。

    u | 所以,面壁为此搭建了一套自进化数据管线。

    v |          团队先对原始数据进行检查和清洗,把异常轨迹、错误动作和无效交互剔除掉。随后让模型进入仿真和真实机器人环境,在持续运行中主动暴露自己的薄弱环节。         系统再把这些容易出错的场景集中收集起来,通过专家策略进行纠偏,放回下一轮训练。         说得通俗一点,这就像给机器狗准备了一本会自动更新的错题本。         经过一轮轮闭环训练,目标横穿、快速转向、短时遮挡、多人交叉这些长尾问题,也能不断得到加强。         模型训好了,装到真机上仍然有一道关。         摄像头采集、画面编码、模型推理、动作生成、指令传输,任何一个环节慢下来,最终都会反映在机器狗的动作上。         面壁围绕宇树Go2的完整运行链路做了系统级优化。目前MiniCPM-RobotTrack在机器狗原生本地算力上可以稳定达到5Hz以上,端到端响应延迟约180毫秒。         这次开源的内容也不只有模型权重,还包括环境安装、模型加载、摄像头接入、文本指令输入、控制接口和一键启动脚本。

    w |          准备一台Go2 Edu,就能按照开源流程把模型部署起来。         本地部署的好处,在电梯和停车场的演示里体现得很直接。         机器人不用等待画面上传云端,也不用等远程服务器返回结果。摄像头数据和用户指令留在本地,网络信号变差后,完整功能依然可以继续运行。

    x |          直接拔掉网卡,机器狗照样能根据摄像头画面和文字指令,完成目标识别、持续跟踪和运动控制。         除了MiniCPM-Robot系列之外,这次还有一项容易被忽略的发布——PhyAI。         它是一款面向Physical AI的开源推理框架,由明体科技联合北京邮电大学、北京大学研发。         具身模型想从实验室跑到真实机器人上,中间还要经过硬件适配、量化、算子优化和部署。         不同VLA、世界模型的结构差异很大。每发布一个新模型,再从头适配一次,时间和工程成本都不低。         PhyAI想做的,就是把这段路缩短。         在RTX 5090上运行π0、π0.5和GR00T时,PhyAI相较模型官方仓库分别实现约2.85倍、1.82倍和2.28倍加速。         适配MiniCPMRobot系列模型时,PhyAI先通过CUDA Graph把推理帧率从10.12Hz提高到33.28Hz,再加入为模型定制的融合算子,在NVIDIA H20上进一步提高到36.77Hz。

    y |          前面是模型效果,这里解决的是工程效率。         模型能干活,还得尽快跑上硬件,跑得足够快,才能真正进入更多机器人。         机器人需要又好又便宜的大脑          具身智能行业从来不缺精彩Demo。

    z | 真正难的是离开展台之后,机器人还能不能稳定工作。         清华大学人工智能学院助理教授、面壁智能多模态首席科学家姚远在访谈中也提到:          现阶段不少机器人Demo会围绕单一任务采集大量数据,再进行针对性优化,展示效果并不能完全代表基础模型的真实进度。面壁更看重模型的基础性、泛化性和通用性,希望先把数据、Infra和工程链路打磨好,让基础能力提升后自然覆盖更多场景。沿着大语言模型的发展经验,具身智能最终也要走向“先通后专”,先理解物理世界的基本常识,再成为做饭、叠衣服或仓储作业等具体领域的专家。         展馆、园区和工厂里,网络信号不会一直满格。机器人还要面对隐私、数据合规、任务失败和异常恢复等一连串现实问题。         榜单分数再高,走到地下停车场便停摆,落地空间依然有限。         这也是面壁把端侧能力放在重要位置的原因。         在与乐聚机器人的合作中,面壁把端侧多模态大模型、夸父机器人本体和导航系统组合到了一起,推出展厅导览Agent和园区巡检Agent。         展厅导览机器人在无网环境下,也能基于本地知识库完成离线讲解和自由问答。

    | 它可以理解展厅环境和人的指令,规划导览路线,同时完成避障。         园区巡检机器人则可以识别车辆违停、路面异常和公共设施问题。敏感画面直接在本地处理,数据留在客户侧。         与吉利汽车的合作,则进一步走进了生产仓储场景。         面壁和吉利共同训练VLA模型,再通过RoboHarness把VLM、VLA、机器人本体和导航系统接到一起,让机器人执行仓储中的长程任务。         RoboHarness可以理解成物理世界里的Agent执行框架。         上层VLM负责规划任务,VLA和导航系统作为可以调用的工具。框架还会管理长任务的上下文和记忆,遇到失败时进行重试和恢复。

    |          机器人每完成一次任务,运行数据还会进入可治理的数据闭环,继续帮助模型进化。

    |           作者声明:该图片由AI生成          到这里,面壁此次在WAIC带来的具身智能路线已经比较清楚了。         MiniCPM-RobotManip负责操作,让机械臂理解任务、记住过程,再把事情做完。

    |          MiniCPM-RobotTrack负责跟踪导航,让机器狗在复杂环境里认准目标,断网也能继续走。         PhyAI负责把模型更快地部署到真实硬件上。

    |               再往外,乐聚和吉利的合作开始把模型、本体、导航和具体业务流程接起来。         大语言模型时代,人们习惯用参数量判断能力。但机器人真正走进物理世界后,参数只是其中一个数字。         它还得反应够快、记得住、断网能跑,数据留得下来,遇到意外能够恢复,成本也要控制在企业愿意长期使用的范围内。         从这个角度看,1.5B和0.9B的意义,也就不止是“小”。它们更像是在回答一个很现实的问题:          当AI真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。

    |          GitHub链接:          https://github.com/OpenBMB/MiniCPM-Robot          HuggingFace链接:          https://huggingface.co/openbmb/MiniCPM-RobotManip          https://huggingface.co/openbmb/MiniCPM-RobotTrack。

    Current article:http://www.senchuoshaozaodidia.shop/pqr/20260826/37264.xls

    Published on:13:38:42


  • 上一篇:【观点】正信期货:纸浆终端需求未见明显提振,呈区间震荡走势
  • 下一篇:China's zero-tariff policy for 53 African nations yields $106.6 million in tariff savings at Guangzhou Customs

    我的网站热门国内

  • 314591CENTRESTAGE to showcase 270 fashion brands to Hong Kong
  • 3761515中式卤味出海记 绝味鸭脖开拓全球化布局之路
  • 335095外媒:乌克兰外长与乌“第一夫人”同访塞尔维亚,武契奇宣布塞大使将重返基辅
  • 383256五菱缤果S申报信息曝光 定位纯电小型SUV 比亚迪元UP同级
  • 579520让小小五味子造福更多村民
  • 599127Crane brought in to remove historic tree in England that was cut in act of vandalism
  • 108Beijing launches first branded dedicated cargo train service
  • 85078全新外观造型/尺寸加长!还将推出RS Q3?全新奥迪Q3假想图前瞻
  • 63737意甲官方:因罗马教皇离世,今日帕尔马vs尤文等四场意甲推迟
  • 5681235Rare dragon-phoenix clay relics found in 4,300-year-old tomb in Inner Mongolia
  • 452快聊财经事|一张电影票根能干啥?逛景区、享折扣、薅羊毛!
  • 614Chinese 'worst' movie 'Niu Lai' becomes a unlikely global hit, surpassing 40 million yuan at box office
  • 37407连山区数据局深化综合窗口改革
  • 163657United Airlines will soon prioritize window seat boarding to speed things up by 2 minutes
  • 166涓涓流“多闪”视频社交应用内部版本下载,腾讯QQ/TIM秒锁定链接
  • 98306Samajwadi Party patriarch Mulayam Singh Yadav passes away
  • 8768Katrina Kaif Celebrates First Christmas As a Mom, Holds Vicky Kaushal Close in Adorable Picture
  • 2015当20系列移动图形卡到达时,雷神如何玩?
  • 93021漳州公路部门闻汛而动保通畅
  • 7048【仓单】8月26日上期所原油期货仓单较上一日持平
  • 60944第二十六届中韩知名人士论坛在首尔举行
  • 26198研究发现摄入高糖饮食或影响大脑中多巴胺的作用
  • Copyright @ 2016-2017 我的网站 版权所有