首页 游戏 软件 资讯 排行榜 专题
首页
AI资讯
微软发布医疗时序底座:4540亿预训练数据,突破不规则采样难题

微软发布医疗时序底座:4540亿预训练数据,突破不规则采样难题

热心网友
97
转载
2026-01-24

在大模型(LLM)与计算机视觉(CV)争相重塑医疗行业的今天,我们似乎已经拥有了无所不能的数字助手:它们能够像放射科医生一样精准解读CT影像,也能像内科医生一样撰写病历摘要。

但医疗AI世界中,仍有一块关键拼图缺失——那就是理解“生命动态演变”的能力。



△图1.不同模态的医疗数据

正如图1所示,如果将患者的生命历程比作一部电影,现有的AI往往只能捕捉到零散的帧画:

影像(Image)是“快照”:定格的仅仅是某一瞬间的解剖结构;

文本(Text)是“叙述”:往往只是对既往病情的主观回顾;

唯有时间序列(Time Series),才忠实记录了生命体征的连续轨迹。

然而,读懂这条“曲线”远比处理静态图像复杂。为此,微软亚洲研究院推出了专为医疗时序数据设计的通用基座模型——MIRA。

该模型基于4540亿个医疗数据点进行大规模预训练,通过两大核心技术突破了传统模型对规则采样的依赖,旨在解决真实世界医疗数据“不规则、异构性”的难题。

实验表明,MIRA在关键预测任务上的表现超越了现有SOTA模型,并展现出卓越的零样本(Zero-shot)迁移能力。

一起来看具体方案。

真实医疗数据:大模型的“噩梦”

长期以来,医疗时序模型的通用化进程面临诸多挑战,其核心问题在于“理想假设”与“现实数据”的错位。

通用深度学习模型通常基于“规则采样”的理想化假设,即数据是整齐划一、均匀分布的。

然而,在真实医疗场景中,尤其是重症监护室(ICU),生命体征的记录往往呈现出“时疏时密”的特点:心跳以秒为单位波动,血压可能以小时为单位记录,而血液检测指标可能需要一天甚至更长时间才能更新一次。

这种多时间尺度交织、采样频率不规则的特性,构成了医疗时序数据最显著的挑战,也是大模型在医疗领域落地应用的核心障碍。



△图2.医疗时间序列数据典型样例

图2医学时间序列数据具有以下特点:①时间间隔不规则,②采样率异质,③由于临床工作流程不标准或仪器按照不到位造成的数据缺失。

传统方法为了让模型处理这些数据,往往不得不采用插值(Imputation)等手段强行对齐。这种做法不仅容易引入人为的“噪声”,还可能丢失原本的时间动力学信息,属于典型的“削足适履”。

而MIRA的提出,正是为了解决这一难题。它不再局限于单一场景训练,而是从海量医疗数据中学习跨场景、跨模态的生理动态模式,成为一个具备卓越迁移能力的通用医疗基座模型。

两大核心技术:读懂不规则律动

面对医疗数据“杂乱无章”的特性,MIRA设计了两大核心技术模块,分别解决了“历史”与“未来”的建模难题。



△图3.MIRA的架构

MIRA的架构如下:①接收不规则时间序列和时间戳作为输入,并应用CT-RoPE进行连续时间编码。②混合专家层根据频率路由到不同的Expert。③Neural ODE模块将潜在状态演化到任意目标时间戳,从而实现灵活的时间感知预测

1.CT-RoPE:给“历史”一把弹性标尺

传统模型处理时间序列习惯用离散的整数索引(1,2,3…)来标记顺序,默认每一步距离相等,忽略了医疗数据中“时疏时密”的真实间隔。

MIRA创新性地提出了连续时间旋转位置编码(CT-RoPE)。它摒弃了离散索引,直接将真实的连续时间戳代入旋转矩阵计算。

这意味着,模型能够精准感知历史记录中任意时间间隔的变化,而不是机械地记录采样次数。

2. Neural ODE:描绘“未来”的连续曲线

人体状态是连续流动的,而非离散跳变。为了精准推演病情走向,MIRA引入了神经常微分方程(Neural ODE)模块。

如果说CT-RoPE是为了读懂过去零散的点,那么Neural ODE就是为了画出未来连续的线。它模拟生物体内部的动力学变化,能基于离散数据推导出连续时间下的潜在状态演化轨迹。

这意味着,即使未来的采样时间点不确定,模型也能依循生理规律,给出符合动力学逻辑的合理预测。

实验验证:零样本与高鲁棒性

研究团队在MIMIC-III、MIMIC-IV等多个权威数据集上对MIRA进行了评估。

1. 零样本(Zero-shot)预测突破

最值得关注的是MIRA的迁移能力。在未经过任何特定目标数据集训练的情况下,MIRA直接被部署到全新的医疗场景中。

数据显示,其在分布外(OOD)测试集上的表现,甚至超越了部分专门训练的全监督模型。这说明MIRA学到了生理信号变化的“通用规律”,而不仅仅是拟合了某家医院的数据分布。



△图4.与baseline相比,MIRA out-of-distribution表现

2.极度稀疏数据的“高鲁棒性”

面对缺失值,传统模型往往依赖插值预处理。这种做法不仅引入人为噪声,还可能破坏数据的原始分布特性。

而MIRA得益于Neural ODE,无需任何插值操作即可原生适配。通过建模时间序列的连续动力学特性,MIRA能够直接处理数据中的缺失值,无需额外的预处理步骤。

实验表明,即便在数据极度稀疏(例如仅保留30%观测点)的条件下,MIRA的性能依然保持稳健,并未像传统预测模型那样出现性能的显著下滑。这种对真实世界“脏数据”的适应能力,证明了其在复杂临床环境下的高鲁棒性。



开启医疗AI的“通用基座”时代

MIRA的提出可谓是医疗时序预测向“通用基座”时代迈进的重要探索。通过解决不规则采样和异构数据难题,MIRA为医疗AI摆脱“烟囱式”开发模式提供了可能。

未来,医院或可利用MIRA作为底座,配合少量本地数据微调,快速获得高精度的定制化模型。这为构建更智能的ICU早期预警、慢病管理以及通用AI助手奠定了坚实基础。

论文链接:

https://arxiv.org/abs/2506.07584
项目链接:

https://github.com/microsoft/MIRA

来源:https://www.163.com/dy/article/KK1R87U60511DSSR.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

清华提出TaH方法大幅提升训练效率与模型准确率
AI资讯
清华提出TaH方法大幅提升训练效率与模型准确率

研究揭示循环Transformer存在“潜空间过度思考”现象,即对已预测正确的词元继续迭代反而降低准确性。为此,团队提出TaH方法,通过轻量级决策器动态识别困难词元并仅对其增加迭代深度。该方法在多个基准测试中平均仅对约7%的词元进行二次迭代,显著减少计算量的同时将模型准确率提升了3 8%至4 4%。

热心网友
05.21
三亿年植物进化史揭示古老基因调控机制
科技数码
三亿年植物进化史揭示古老基因调控机制

来源:环球网 科技日报记者 张梦然 植物王国里,一个埋藏了数亿年的核心秘密,最近被来自全球的数十位科学家联手揭开了。 顶级期刊《科学》近期在线发表了一项堪称里程碑的研究。一个由英国剑桥大学桑斯伯里实验室、以色列耶路撒冷希伯来大学、美国冷泉港实验室及马萨诸塞大学阿默斯特分校等机构牵头的大型国际合作项目

热心网友
05.12
中国团队为破解细菌基因“开关”密码提供关键图谱
科技数码
中国团队为破解细菌基因“开关”密码提供关键图谱

高精度测序技术问世,首次绘制大肠杆菌NAD加帽RNA高分辨率图谱 来源:科技日报 科技日报记者 夏凡 近日,一项来自浙江万&里学院、香港浸会大学及宁波东方理工大学的研究,为微生物RNA研究领域带来了关键突破。团队开发出一种名为pNAD-seq的高精度测序技术,成功绘制出大肠杆菌NAD加帽RNA的最高

热心网友
04.21
浙大突破:普通视频实现4D沉浸式自由漫游空间转换能力提升突破
科技数码
浙大突破:普通视频实现4D沉浸式自由漫游空间转换能力提升突破

INSPATIO-WORLD:将任意视频转化为可自由探索的沉浸式四维世界 这项由浙江大学等顶尖研究机构联合开发的突破性技术,其详细技术报告已于2026年4月发布于预印本平台arXiv,论文编号为arXiv:2604 07209。研究团队将这一创新系统命名为INSPATIO-WORLD,其核心目标直指

热心网友
04.16
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26
AI资讯
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26

面对复杂连续任务的长程规划,现有的生成式离线强化学习方法往往会暴露短板。它们生成的轨迹经常陷入局部合理但全局偏航的窘境。它们太关注眼前的每一步,却忘了最终的目的地。针对这一痛点,厦门大学和香港科技大

热心网友
04.07

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

Cursor AI代码编辑器:智能编程工具的功能与使用指南
AI教程
Cursor AI代码编辑器:智能编程工具的功能与使用指南

在追求极致效率的现代软件开发中,一款名为Cursor的AI代码编辑器正引领着开发范式的变革。它被定义为“面向未来的IDE”,其核心理念清晰而有力:将人工智能深度无缝地集成到编码工作流的每一个步骤,为开发者创造一种前所未有的“AI结对编程”体验。 Cursor sh应用场景 那么,这款AI驱动的编辑器

热心网友
05.23
美图WHEE-WHEE AI视觉创作工具使用指南与功能详解
AI教程
美图WHEE-WHEE AI视觉创作工具使用指南与功能详解

在众多AI图像生成工具中,WHEE凭借其精准的产品定位与持续的功能迭代,正成为越来越多设计师和内容创作者的首选工具。它专注于打造高品质的AI视觉素材生成器,核心使命就是帮助用户快速、高效地获得可直接使用的优质图片素材。 那么,这款AI绘图工具究竟有哪些核心优势?下面我们从其关键特性与功能设计进行深入

热心网友
05.23
NightCafe Creator AI艺术生成器:手机创作数字绘画
AI教程
NightCafe Creator AI艺术生成器:手机创作数字绘画

在AI绘画工具不断涌现的当下,一款名为NightCafe Creator的应用以其全面的AI艺术生成能力脱颖而出。它不仅是一个简单的图片处理工具,更是一个融合了多种前沿人工智能技术的创意平台,帮助用户轻松实现从构思到成品的艺术创作。 NightCafe Creator是什么? NightCafe C

热心网友
05.23
加密市场恐慌蔓延 比特币以太坊为何领跌山寨币
web3.0
加密市场恐慌蔓延 比特币以太坊为何领跌山寨币

近期加密货币市场受到宏观经济不确定性及流动性紧缩影响,比特币(BTC)、以太坊(ETH)以及多种山寨币出现明显下行走势,市场情绪趋于谨慎。 比特币近期走势分析 比特币的价格近期表现如何?简单来说,它跌破了几个市场公认的关键支撑位,而且伴随交易量的放大。这种放量下跌的信号,往往意味着多空分歧加剧。无论

热心网友
05.23
蔡司6月2日发布新品镜头技术迎来重大突破
科技数码
蔡司6月2日发布新品镜头技术迎来重大突破

蔡司宣布将于6月2日发布一款新镜头,并称其为镜头技术的重大突破,标志着全新纪元的开启。官方仅公布了产品剪影,但措辞暗示其可能带来根本性的技术升级,例如全新光学结构、先进镀膜或对焦系统改进。具体细节需待发布日揭晓。

热心网友
05.23