欢迎登录山东自动化技术有限公司

新闻资讯

首页

多模态通用感知能力超越 GPT-5，上海 AI 实验室开源书生・万象 3.5 大模型

发布时间：

2025-09-04 09:30:50

【导语】9月3日，上海人工智能实验室宣布开源通用多模态大模型书生・万象3.5（InternVL3.5），该模型在推理能力、部署效率与通用性上实现全面(miàn)升(shēng)级(jí)。InternVL3.5提(tí)供9种尺寸模型，满足各场景需求，并在多学科推理、多模态感知及文本能力上表现卓越，超越GPT-5等主流模型。此次升级重点强化了面向实际应用的智能体与文本思考能力，在GUI交互、具身空间推理和矢量图形处理等方面实现显著进步，为机器人自动化操作、物品识别与物理交互等领域带来革新。作为书生大模型体系的关键一环，InternVL3.5的全系列下载量已突破2300万次。

多模态通用感知能力超越 GPT-5，上海 AI 实验室开源书生・万象 3.5 大模型

　　9 月 3 日消息，上海人工智能实验室（上海 AI 实验室）宣布开源通用多模态大模型书生・万象 3.5（InternVL3.5），其推理能力、部署效率与通用能力全面升级。

　　InternVL3.5 本次开源有 9 种尺寸的模型，参数涵盖 10 亿-2410 亿，可满足各场景需求。其中，旗舰模型 InternVL3.5-241B-A28B 在多学科推理基准 MMMU 中获 77.7 分，为开源模型中最高分；多模态通用感知能力超越 GPT-5，文本能力领跑主流开源多模态大模型。

　　与 InternVL3.0 相比，InternVL3.5 在图形用户界面（GUI）智能体、具身空间感知、矢量图像理解与生成等多种特色任务上实现显著提升。

　　本次升级，上海 AI 实验室研究团队重点强化了 InternVL3.5 面向实际应用的智能体与文本思考能力，在 GUI 交互、具身空间推理和矢量图形处理等多个关键场景实现从“理解”到“行动”的跨越，并得到多项评测验证。

　　GUI 交互部分，InternVL3.5 在 ScreenSpot-v2 元素定位任务以 92.9 分超越同类模型，同时支(zhī)持(chí) Windows / Ubuntu 自(zì)动(dòng)化(huà)操作，并在 WindowsAgentArena 任务大幅领先 Claude-3.7-Sonnet。

　　在具身智能体测试中，InternVL3.5 表现出理解物理空间关系并规划导航路径的能力，在 VSI-Bench 以 69.5 分超过 Gemini-2.5-Pro。

　　在矢量图形理解与生成方面，InternVL3.5 在 SGP-Bench 以 70.7 分刷新开源纪录，生成任务 FID 值也优于 GPT-4o 和 Claude-3.7-Sonnet。

　　具体来看，InternVL3.5 可跨 Windows、Mac、Ubuntu、Android等多个平台，识别界面元素并自主执行鼠标、键盘操作，实现恢复已删除文件、导出 PDF、邮件添加附件等任务的自动化。

　　InternVL3.5 具备更强的 grounding 能力，可以泛化到全新的复杂大量小样本的具身场景，配合抓取算法，支持可泛化的长程物体抓取操作，助力机器人更高效地完成物品识别、路径规划与物理交互。

　　作为上海 AI 实验室书生大模型体系的重要组成部分，InternVL 聚焦视觉模型技术，InternVL 全系列全网下载量已突破 2300 万次。

深圳市物联网产业协会党支部集中收看九三阅兵仪式，铭记抗战历史，弘扬民族精神

2.5 亿元，优必选再次斩获全球人形机器人最大合同

相关新闻

今日科普|C919自动化装配难题

当你在机场看到国产大飞机C919优雅起降时，可能想不到它的“诞生过程”有多硬核——这架拥有6万多个🉐零件、翼展35.8米的“钢铁巨兽”，其装配精度要控制在头发丝直径级别。更让人惊叹的是，沈阳中航沈飞民机工厂的自动化生产线，仅用6个关键零件就能创造年产值3亿元的奇迹。今天咱们就唠唠，C919在自动化装配路上啃下的五大“硬骨头”。第一块硬骨头：百万级制孔(kǒng)的(de)“针(zhēn)尖

今日科普|探秘自动化装配流程

想(xiǎng)象(xiàng)一(yī)下(xià)，过(guò)去(qù)一(yī)条(tiáo)电(diàn)机(jī)装(zhuāng)配(pèi)线(xiàn)需(xū)要(yào)20名工(gōng)人(rén)轮(lún)班(bān)操(cāo)作(zuò)，每(měi)天(tiān)最(zuì)多(duō)生(shēng)产(chǎn)500台(tái)电(diàn)机(jī)；而

今日科普|1. 自动化装配服务新势力

今日科普|10字：细小弹簧自动装配术

10字：小插头自动化装配探秘

深圳市物联网产业协会成功举办《24小时自助图书馆通用规范》团体标准评审会

【导语】2019 年深圳市物联网产业协会发布的《24 小时自助图书馆通用规范》部分指标落后且引用文件有更新，不利行业发展。为此协(xié)会(huì)于(yú) 2024 年(nián) 11 月(yuè)启(qǐ)动(dòng)修(xiū)订(dìng)立(lì)项(xiàng)，2025 年(nián) 10 月(yuè) 30 日(rì)召(zhào)开(kāi)评(píng)审(shěn)

全球智能视觉处理芯片龙头冲刺港交所：光环之下，何以冲破增长枷锁？

【导语】近日，智能视觉处理芯片龙头富瀚微递交港交所招股书，吹响“A+H”双上市号角。其虽在全球市场占据领先地位，但2022 - 2025年上半年营收、净利、毛利率均逐年下滑。不过，富瀚微注重研发创新，积极拓展AI新业务版图。此次赴港上市，能否助力其突破瓶颈、续写传奇，值得期待(dài)。　　近(jìn)日(rì)，智(zhì)能视觉处理芯片龙头富瀚微正式向港交所递交了招股书，吹响“

国家发改委等五部门：探索推动具身智能机器人进社区、进家庭，到 2027 年底建成 50 个以上全域数字化转型城市

【导语】10月31日，国家发展改革委等五部门发布《深化智慧城市发展推进全域数字化转型行动计划》，提出到2027年底建成50个以上全域数(shù)字(zì)化(huà)转(zhuǎn)型(xíng)城(chéng)市(shì)，2035年(nián)涌(yǒng)现(xiàn)一(yī)批(pī)具(jù)有(yǒu)国(guó)际(jì)竞(jìng)争(zhēng)力(lì)的(de)现(xià

2025深圳安博会：大公博创揽三奖低空安防技术引国内外媒体聚焦

【导语】2025年10月28日至31日，第二十届中国国际社会公共安全博览会在深圳启幕。成都大公博创信息技术有限(xiàn)公(gōng)司(sī)携(xié)全系(xì)列(liè)低(dī)空(kōng)安(ān)防(fáng)设(shè)备(bèi)参(cān)展(zhǎn)，凭(píng)借(jiè)三(sān)项(xiàng)权(quán)威(wēi)大(dà)奖(jiǎng)、全栈(zh

业内首家：中国电信实现北斗语音消息服务

【导语】中国电信率先公开展示业内首个“北斗语音消息”服务，首创 AI 算法实现语音极速传输；与此同时，华为也在第四届北斗峰会上发布相关功能，其手(shǒu)表(biǎo)成(chéng)首(shǒu)款(kuǎn)支(zhī)持(chí)终(zhōng)端(duān)，北(běi)斗(dòu)应(yīng)用(yòng)再(zài)掀(xiān)新(xīn)篇(piān)。据(jù

全国服务热线：

400-86019957

手机: 188 6583 0095

联系人：石先生

地址：山东省济南市市中区卧龙路新东方商务大厦306

营业执照

豫ICP备2020036149号网站地图 RSS

热门标签