小米声音理解大模型 MiDashengLM-7B 发布并全量开源,22 个公开评测集刷新最好成绩


【导语】8月4日,小米公司正式发布了自研的声音理解大模型MiDashengLM-7B,并决定全量开源该模型。据官方介绍,MiDashengLM-7B在速度和精度上均实现了显著突破,刷新了多项评测记录。该模型基于创新的训练策略,能够统一理解语音、环境声音和音乐,为(wèi)小(xiǎo)米(mǐ)的“人车家全生态”战略提供关键技术支撑。通过自然语言交互,MiDashengLM-7B能为用户提供更人性化的沟通和反馈,未来还将进一步优化计算效率,拓展更多功能。

小米声音理解大模型 MiDashengLM-7B 发布并全量开源,22 个公开评测集刷新最好成绩

  8 月 4 日消息,小(xiǎo)米(mǐ)自(zì)研(yán)声(shēng)音(yīn)理解大模型 MiDashengLM-7B 正式发布,并全量开源

  据小米官方介绍,MiDashengLM-7B 速度精度上实现双突破:单样本首 Token 延迟仅为同类模型 1/4、同显存下并发超 20 倍,在 22 个公开评测集上刷新多模态大模型最好成绩(SOTA)

  MiDashengLM-7B 基于 Xiaomi Dasheng 作为音频编码器和 Qwen2.5-Omni-7B Thinker 作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。

  2024 年,小米发布的 Xiaomi Dasheng 声音基座模型在国际上首次突破 AudioSet 50+ mAP,在 HEAR Benchmark 环境声、语音、音乐三大领域建立领先优势并保持至今。

  Xiaomi Dasheng 在小米的智能家居和汽车座舱等场景有超过 30 项落地应用。行业首发的车外唤醒防御、手机音箱全天候监控异常声音、“打个响指”环境音关联 IoT 控制能力,以及小米 YU7 上搭载的增强哨兵模式划车检测等,背后都有 Xiaomi Dasheng 作为核心算法的赋能。

  MiDashengLM 的训练数据由 100% 的公开数据构成,模型以宽松的 Apache License 2.0 发布,同时支持学术和商业应用。

  小米表示,不同于 Qwen2.5-Omni 等未公开训练数据细节的模型,MiDashengLM 完整公开了 77 个数据源的详细配比,技术报告中详细介绍了从音频编码器预训练到指令微调的全流程。

  作为小米“人车家全生态”战略的关键技术,MiDashengLM 通过统一理解语音、环境声与音乐的跨领域能(néng)力(lì),不(bù)仅(jǐn)能(néng)听(tīng)懂(dǒng)用(yòng)户(hù)周(zhōu)围(wéi)发(fā)生(shēng)了(le)什(shén)么(me)事(shì)情(qíng),还(hái)能(néng)分(fēn)析(xī)发(fā)现(xiàn)这(zhè)些(xiē)事(shì)情(qíng)的(de)隐(yǐn)藏(cáng)含(hán)义(yì),提(tí)高(gāo)用(yòng)户(hù)场(chǎng)景(jǐng)理(lǐ)解(jiě)的(de)泛(fàn)化(huà)性(xìng)

  基(jī)于(yú) MiDashengLM 的(de)模(mó)型(xíng)通(tōng)过(guò)自(zì)然(rán)语(yǔ)言(yán)和用户交互,为用户提更人性化的沟通和反馈,比如在用户练习唱歌或练习外语时提供发音反馈并制定针对性提升方案,又比如在用户驾驶车辆时实时对用户关于环境声音的提问做出解答。

  MiDashengLM 以 Xiaomi Dasheng 音频编码器为核心组件,是 Xiaomi Dasheng 系列模型的重要升级。在当前版本的基础上,小米已着手对该模型做计算效率的进一步升级,寻求终端设备上可离线部署,并完善基于用户自然语言提示的声音编辑等更全面的功能


相关新闻


数据瓶颈下的自动化装配:从“无更多数据”到系统效能跃升

数据瓶颈的误判与系统效能的底层逻辑很多人以为,自动化装配系统的效能提升必然依赖海量数据输入,当系统抛出“没有更多数据了”的错误提示时,便判定其已触及性能天花板。其实不然——这一错误本质是数据流管理失效的表征,而非系统能力的物理极限。在工业4.0架构中,数据并非越多越好,其有效性取决于三个关键维度:数据粒度、时序同步性与决策链闭环性。案例:慕尼黑工业博览会上的“数据饥饿”陷阱2023年慕尼黑工业博览


数据边界:当自动化装配系统遭遇数据阈值困境

数据孤岛效应下的系统熵增危机很多人以为自动化装配系统的数据阈值仅受硬件存储容量限制,其实不然。在德国斯图加特某汽车零部件制造商的案例中,其2023年投产的智能产线因传感器数据流超载,导致PLC控制单元在47分钟内产生23次非计划停机。该产线配置了128组力觉传感器与32组视觉检测模块,原始数据生成速率达每秒1.2TB,远超工业以太网协议规定的100Mbps有效带宽。底层逻辑是:现代装配系统普遍采用


数据阈值与自动化装配的底层逻辑

数据阈值:自动化装配的隐形边界很多人以为,自动化装配的精度仅由机械臂的重复定位精度决定,其实不然。在工业4.0的语境下,数据阈值才是决定系统稳定性的关键变量。当传感器采集的原始数据超过预设阈值时,系统会触发容错机制,这种机制的本质是数学模型与物理现实的动态博弈。以某德系汽车零部件供应商的案例为例:其位于巴伐利亚州的工厂曾因传感器数据波动导致装配线停机率上升12%。问题根源并非机械故障,而是阈值设定


数据瓶颈下的自动化装配:从“无更多数据”到“精准突破”

数据瓶颈的底层逻辑:并非“量”的终结,而是“质”的觉醒很多人以为,自动化装配的数据瓶颈源于数据采集的物理限制或存储容量的技术天花板,其实不然。当系统抛出“没有更多数据了”的报错时,真正的矛盾往往隐藏在数据维度单一性、标注效率低下或算法泛化能力不足的底层逻辑中。以汽车底盘焊接产线为例,某头部车企曾因依赖单一传感器数据源,导致装配误差率在0.3mm阈值处频繁波动——看似数据量充足,实则缺乏多模态数据融


当自动化装配系统遭遇数据瓶颈:解码“没有更多数据了”背后的技术真相

数据断流:自动化装配的“隐形刹车”很多人以为,自动化装配系统的效率瓶颈仅存在于机械臂的重复定位精度或PLC的响应速度,其实不然。当系统抛出"{"error":"没有更多数据了"}"的报错时,暴露的往往是数据流架构的深层缺陷——这并非简单的存储容量问题,而是工业物联网(IIoT)与数字孪生(Digital Twin)协同失效的典型症状。底层逻辑:数据供应链的断


深圳市物联网产业协会成功举办《24小时自助图书馆通用规范》团体标准评审会

【导语】2019 年深圳市物联网产业协会发布的《24 小时自助图书馆通用规范》部分指标落后且引用文件有更新,不利行业发展。为此协(xié)会(huì)于(yú) 2024 年(nián) 11 月(yuè)启(qǐ)动(dòng)修(xiū)订(dìng)立(lì)项(xiàng),2025 年(nián) 10 月(yuè) 30 日(rì)召(zhào)开(kāi)评(píng)审(shěn)


全球智能视觉处理芯片龙头冲刺港交所:光环之下,何以冲破增长枷锁?

【导语】近日,智能视觉处理芯片龙头富瀚微递交港交所招股书,吹响“A+H”双上市号角。其虽在全球市场占据领先地位,但2022 - 2025年上半年营收、净利、毛利率均逐年下滑。不过,富瀚微注重研发创新,积极拓展AI新业务版图。此次赴港上市,能否助力其突破瓶颈、续写传奇,值得期待(dài)。 近(jìn)日(rì),智(zhì)能视觉处理芯片龙头富瀚微正式向港交所递交了招股书,吹响“


国家发改委等五部门:探索推动具身智能机器人进社区、进家庭,到 2027 年底建成 50 个以上全域数字化转型城市

【导语】10月31日,国家发展改革委等五部门发布《深化智慧城市发展推进全域数字化转型行动计划》,提出到2027年底建成50个以上全域数(shù)字(zì)化(huà)转(zhuǎn)型(xíng)城(chéng)市(shì),2035年(nián)涌(yǒng)现(xiàn)一(yī)批(pī)具(jù)有(yǒu)国(guó)际(jì)竞(jìng)争(zhēng)力(lì)的(de)现(xià


2025深圳安博会:大公博创揽三奖 低空安防技术引国内外媒体聚焦

【导语】2025年10月28日至31日,第二十届中国国际社会公共安全博览会在深圳启幕。成都大公博创信息技术有限(xiàn)公(gōng)司(sī)携(xié)全系(xì)列(liè)低(dī)空(kōng)安(ān)防(fáng)设(shè)备(bèi)参(cān)展(zhǎn),凭(píng)借(jiè)三(sān)项(xiàng)权(quán)威(wēi)大(dà)奖(jiǎng)、全栈(zh


业内首家:中国电信实现北斗语音消息服务

【导语】中国电信率先公开展示业内首个“北斗语音消息”服务,首创 AI 算法实现语音极速传输;与此同时,华为也在第四届北斗峰会上发布相关功能,其手(shǒu)表(biǎo)成(chéng)首(shǒu)款(kuǎn)支(zhī)持(chí)终(zhōng)端(duān),北(běi)斗(dòu)应(yīng)用(yòng)再(zài)掀(xiān)新(xīn)篇(piān)。 据(jù