多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型


【导语】9月3日,上海人工智能实验室宣布开源通用多模态大模型书生・万象3.5(InternVL3.5),该模型在推理能力、部署效率与通用性上实现全面(miàn)升(shēng)级(jí)。InternVL3.5提(tí)供9种尺寸模型,满足各场景需求,并在多学科推理、多模态感知及文本能力上表现卓越,超越GPT-5等主流模型。此次升级重点强化了面向实际应用的智能体与文本思考能力,在GUI交互、具身空间推理和矢量图形处理等方面实现显著进步,为机器人自动化操作、物品识别与物理交互等领域带来革新。作为书生大模型体系的关键一环,InternVL3.5的全系列下载量已突破2300万次。

多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型

  9 月 3 日消息,上海人工智能实验室(上海 AI 实验室)宣布开源通用多模态大模型书生・万象 3.5(InternVL3.5),其推理能力、部署效率与通用能力全面升级。

  InternVL3.5 本次开源有 9 种尺寸的模型,参数涵盖 10 亿-2410 亿,可满足各场景需求。其中,旗舰模型 InternVL3.5-241B-A28B 在多学科推理基准 MMMU 中获 77.7 分,为开源模型中最高分;多模态通用感知能力超越 GPT-5,文本能力领跑主流开源多模态大模型。

  与 InternVL3.0 相比,InternVL3.5 在图形用户界面(GUI)智能体、具身空间感知、矢量图像理解与生成等多种特色任务上实现显著提升。

  本次升级,上海 AI 实验室研究团队重点强化了 InternVL3.5 面向实际应用的智能体与文本思考能力,在 GUI 交互、具身空间推理和矢量图形处理等多个关键场景实现从“理解”到“行动”的跨越,并得到多项评测验证。

  GUI 交互部分,InternVL3.5 在 ScreenSpot-v2 元素定位任务以 92.9 分超越同类模型,同时支(zhī)持(chí) Windows / Ubuntu 自(zì)动(dòng)化(huà)操作,并在 WindowsAgentArena 任务大幅领先 Claude-3.7-Sonnet。

  在具身智能体测试中,InternVL3.5 表现出理解物理空间关系并规划导航路径的能力,在 VSI-Bench 以 69.5 分超过 Gemini-2.5-Pro。

  在矢量图形理解与生成方面,InternVL3.5 在 SGP-Bench 以 70.7 分刷新开源纪录,生成任务 FID 值也优于 GPT-4o 和 Claude-3.7-Sonnet。

  具体来看,InternVL3.5 可跨 Windows、Mac、Ubuntu、Android等多个平台,识别界面元素并自主执行鼠标、键盘操作,实现恢复已删除文件、导出 PDF、邮件添加附件等任务的自动化。

  InternVL3.5 具备更强的 grounding 能力,可以泛化到全新的复杂大量小样本的具身场景,配合抓取算法,支持可泛化的长程物体抓取操作,助力机器人更高效地完成物品识别、路径规划与物理交互。

  作为上海 AI 实验室书生大模型体系的重要组成部分,InternVL 聚焦视觉模型技术,InternVL 全系列全网下载量已突破 2300 万次


相关新闻


数据瓶颈下的自动化装配:从“无更多数据”到系统效能跃升

数据瓶颈的误判与系统效能的底层逻辑很多人以为,自动化装配系统的效能提升必然依赖海量数据输入,当系统抛出“没有更多数据了”的错误提示时,便判定其已触及性能天花板。其实不然——这一错误本质是数据流管理失效的表征,而非系统能力的物理极限。在工业4.0架构中,数据并非越多越好,其有效性取决于三个关键维度:数据粒度、时序同步性与决策链闭环性。案例:慕尼黑工业博览会上的“数据饥饿”陷阱2023年慕尼黑工业博览


数据边界:当自动化装配系统遭遇数据阈值困境

数据孤岛效应下的系统熵增危机很多人以为自动化装配系统的数据阈值仅受硬件存储容量限制,其实不然。在德国斯图加特某汽车零部件制造商的案例中,其2023年投产的智能产线因传感器数据流超载,导致PLC控制单元在47分钟内产生23次非计划停机。该产线配置了128组力觉传感器与32组视觉检测模块,原始数据生成速率达每秒1.2TB,远超工业以太网协议规定的100Mbps有效带宽。底层逻辑是:现代装配系统普遍采用


数据阈值与自动化装配的底层逻辑

数据阈值:自动化装配的隐形边界很多人以为,自动化装配的精度仅由机械臂的重复定位精度决定,其实不然。在工业4.0的语境下,数据阈值才是决定系统稳定性的关键变量。当传感器采集的原始数据超过预设阈值时,系统会触发容错机制,这种机制的本质是数学模型与物理现实的动态博弈。以某德系汽车零部件供应商的案例为例:其位于巴伐利亚州的工厂曾因传感器数据波动导致装配线停机率上升12%。问题根源并非机械故障,而是阈值设定


数据瓶颈下的自动化装配:从“无更多数据”到“精准突破”

数据瓶颈的底层逻辑:并非“量”的终结,而是“质”的觉醒很多人以为,自动化装配的数据瓶颈源于数据采集的物理限制或存储容量的技术天花板,其实不然。当系统抛出“没有更多数据了”的报错时,真正的矛盾往往隐藏在数据维度单一性、标注效率低下或算法泛化能力不足的底层逻辑中。以汽车底盘焊接产线为例,某头部车企曾因依赖单一传感器数据源,导致装配误差率在0.3mm阈值处频繁波动——看似数据量充足,实则缺乏多模态数据融


当自动化装配系统遭遇数据瓶颈:解码“没有更多数据了”背后的技术真相

数据断流:自动化装配的“隐形刹车”很多人以为,自动化装配系统的效率瓶颈仅存在于机械臂的重复定位精度或PLC的响应速度,其实不然。当系统抛出"{"error":"没有更多数据了"}"的报错时,暴露的往往是数据流架构的深层缺陷——这并非简单的存储容量问题,而是工业物联网(IIoT)与数字孪生(Digital Twin)协同失效的典型症状。底层逻辑:数据供应链的断


深圳市物联网产业协会成功举办《24小时自助图书馆通用规范》团体标准评审会

【导语】2019 年深圳市物联网产业协会发布的《24 小时自助图书馆通用规范》部分指标落后且引用文件有更新,不利行业发展。为此协(xié)会(huì)于(yú) 2024 年(nián) 11 月(yuè)启(qǐ)动(dòng)修(xiū)订(dìng)立(lì)项(xiàng),2025 年(nián) 10 月(yuè) 30 日(rì)召(zhào)开(kāi)评(píng)审(shěn)


全球智能视觉处理芯片龙头冲刺港交所:光环之下,何以冲破增长枷锁?

【导语】近日,智能视觉处理芯片龙头富瀚微递交港交所招股书,吹响“A+H”双上市号角。其虽在全球市场占据领先地位,但2022 - 2025年上半年营收、净利、毛利率均逐年下滑。不过,富瀚微注重研发创新,积极拓展AI新业务版图。此次赴港上市,能否助力其突破瓶颈、续写传奇,值得期待(dài)。 近(jìn)日(rì),智(zhì)能视觉处理芯片龙头富瀚微正式向港交所递交了招股书,吹响“


国家发改委等五部门:探索推动具身智能机器人进社区、进家庭,到 2027 年底建成 50 个以上全域数字化转型城市

【导语】10月31日,国家发展改革委等五部门发布《深化智慧城市发展推进全域数字化转型行动计划》,提出到2027年底建成50个以上全域数(shù)字(zì)化(huà)转(zhuǎn)型(xíng)城(chéng)市(shì),2035年(nián)涌(yǒng)现(xiàn)一(yī)批(pī)具(jù)有(yǒu)国(guó)际(jì)竞(jìng)争(zhēng)力(lì)的(de)现(xià


2025深圳安博会:大公博创揽三奖 低空安防技术引国内外媒体聚焦

【导语】2025年10月28日至31日,第二十届中国国际社会公共安全博览会在深圳启幕。成都大公博创信息技术有限(xiàn)公(gōng)司(sī)携(xié)全系(xì)列(liè)低(dī)空(kōng)安(ān)防(fáng)设(shè)备(bèi)参(cān)展(zhǎn),凭(píng)借(jiè)三(sān)项(xiàng)权(quán)威(wēi)大(dà)奖(jiǎng)、全栈(zh


业内首家:中国电信实现北斗语音消息服务

【导语】中国电信率先公开展示业内首个“北斗语音消息”服务,首创 AI 算法实现语音极速传输;与此同时,华为也在第四届北斗峰会上发布相关功能,其手(shǒu)表(biǎo)成(chéng)首(shǒu)款(kuǎn)支(zhī)持(chí)终(zhōng)端(duān),北(běi)斗(dòu)应(yīng)用(yòng)再(zài)掀(xiān)新(xīn)篇(piān)。 据(jù