【AI4S】生化环材高可信技术与产业周报(2026-07-08—2026-07-14)
快速导读
- 生命科学: UCE 把 3,600 万个细胞放进同一表征空间,展示了跨实验、组织和物种迁移的可能性;该项目是表征与假设生成工具,不是生物机制的直接证明。
- 医学影像: NeuroVFM 和 MARS 都在尝试摆脱“一任务一模型”,前者依托 20 年临床神经影像,后者面向多序列、全身多部位 MRI;两者都离受监管临床使用还有距离。
- 化学与能源: 一项 ACS Catalysis 研究让智能体围绕催化剂重构后的活性相做闭环筛选,并给出千小时级电解槽结果,证据链比只做计算预测更完整。
- 环境与生物医学工程: 可解释机器学习被用于拆解全球城市极端温度波动的关联因素,也与智能织物电极结合,用于分析脑—肌肉电活动。
- 产业与政策: AWS 给出药物研究知识图谱与 GraphRAG 的参考实现,VERAXA 与 Ardigen 启动靶点组合筛选合作;英国把健康数据研究服务 HDRS 从规划推进到公司化落地。
本周值得看
- UCE 的“新数据直接嵌入”能力。 单细胞基础模型开始认真处理跨实验和跨物种复用,但嵌入空间仍需结合生物实验解释。
- 健康系统数据训练出的 NeuroVFM。 20 年、524 万个临床 MRI/CT 影像展示了纵向医疗数据的价值,也把跨医院复现和数据偏差问题摆到台前。
- 围绕重构活性相工作的催化剂设计智能体。 这项研究没有停在计算建议,而是推进到器件级长时测试,不过能否迁移到其他反应仍未知。
技术突破:高影响期刊与正式科研成果
UCE:把单细胞数据放进跨物种统一表征空间

图:UCE 模型及其构建的统一细胞表征空间(论文图 1)。来源:Nature 论文原文。
Nature 发表的 Universal Cell Embedding(UCE,通用细胞嵌入)是一个面向单细胞 RNA 测序的 foundation model(基础模型),用自监督学习建立跨实验、组织和物种的统一表征空间。作者构建的 Mega-scale Atlas 包含 3,600 万个细胞、1,000 多种命名细胞类型以及 8 个物种;新细胞不需要人工标签、重新训练或微调即可嵌入。对 AI4S 来说,这类“先学通用表征、再做下游分析”的路线可能降低跨数据集比较和假设生成的成本。边界也很明确:嵌入不是生物机制本身,批次效应、测序噪声和数据覆盖仍会影响结果,作者建议使用完整的 1,280 维表征而不是只凭二维可视化判断距离。
相关资源: UCE 官方代码;论文分析复现仓库;Zenodo 处理后嵌入数据(约 157 GB,创建于 2026-04-10)。代码和数据可帮助检查预处理、维度选择及新数据嵌入方式,但大规模复用仍需考虑计算、存储和元数据完整性。
来源: Universal cell embedding provides a foundation model for cell biology|Nature|https://www.nature.com/articles/s41586-026-10689-z|发布时间:2026-07-08|访问时间:2026-07-15 09:55|正式期刊论文。
NeuroVFM:用健康系统的纵向影像训练通用神经影像模型

图:NeuroVFM 的健康系统学习、模型训练与下游应用流程(论文图 1)。来源:Nature Medicine 论文原文。
Nature Medicine 的 NeuroVFM 用 Michigan Medicine 20 年积累的 524 万个 MRI/CT 三维影像进行自监督训练,覆盖 566,915 次检查。研究将诊断、报告生成和紧急程度判断放在同一表征框架中,并在论文设定的神经影像任务上报告了对 GPT-5、Claude Sonnet 4.5 等通用模型的领先。真正值得关注的是,健康系统日常产生的数据能否持续沉淀为通用影像能力,而不只是一次性训练集。模型目前仅供研究、未经 FDA 批准;原始患者数据不公开,部分标签由临床报告自动抽取,因此外部复现、跨医院偏差和实际工作流安全性仍需验证。
相关资源: MLNeurosurg/neurovfm 提供 MIT License 的研究代码,可用于理解影像编码器与语言模型的组合方式。
来源: Health system learning enables generalist neuroimaging models|Nature Medicine|https://www.nature.com/articles/s41591-026-04497-1|发布时间:2026-07-10|访问时间:2026-07-15 09:55|正式期刊论文。
MARS:尝试用一个模型处理多序列、全身多部位 MRI

图:MARS 的多序列、多部位 MRI 预训练及下游任务研究概览(论文图 1)。来源:Nature Biomedical Engineering 论文原文。
Nature Biomedical Engineering 发表的 MARS 通过分离 anatomy-invariant(解剖结构不变)特征与 sequence-specific(序列特异)特征,减少不同 MRI 序列之间的表征冲突。预训练语料包含 34 个数据集、336,476 个三维扫描,整体评测覆盖 64 个数据集、10 个解剖部位和 44 项诊断、分割、配准、进展预测及报告生成任务;论文报告模型在 41 项任务中排名第一。它要解决的是 MRI 设备、扫描序列和身体部位差异造成的模型碎片化。多数私有数据不能开放,多任务基准领先也不等于临床流程中稳定可用,跨机构部署仍需独立验证。
相关资源: zqiuak/MARS 提供多序列 MRI 预训练与下游任务适配代码。由于不少评测数据来自私有来源,公开仓库更适合做方法理解和自有数据验证,不能完整替代论文的全部评测条件。
来源: Large-scale multi-sequence pretraining for generalizable MRI analysis in versatile clinical applications|Nature Biomedical Engineering|https://www.nature.com/articles/s41551-026-01740-5|发布时间:2026-07-13|访问时间:2026-07-15 09:55|正式期刊论文。
智能体把催化剂“反应中会变”纳入设计闭环
ACS Catalysis 的研究将文献抽取、原位表征启发的活性相识别、闭环密度泛函理论(DFT)计算和机器学习串成智能体工作流。它没有只围绕合成前的 MOF 结构筛选,而是关注反应中动态重构的 NiFe-OOH/Ov 活性相,最终得到由 NiFe-MOF 衍生的富氧空位催化剂。阴离子交换膜电解槽在 1.0 A cm⁻² 下工作电压为 1.88 V,并报告了 1.0 A cm⁻² 下 1,100 小时、2.0 A cm⁻² 下 500 小时的稳定运行。这把计算建议推进到了器件级长时测试,但目前仍只覆盖一个材料家族和一类析氧反应。
来源: Intelligent Agent-Driven Design of Dynamically Reconstructed Metal-Organic Frameworks toward Industrial-Scale Anion-Exchange-Membrane Water Electrolysis|ACS Catalysis|https://pubs.acs.org/doi/10.1021/acscatal.6c03989|在线发布时间:2026-07-11|访问时间:2026-07-15 09:55|正式期刊论文。
可解释机器学习追踪全球城市极端温度波动差异
Nature Communications 的研究整理了 1950—2020 年 10,522 个城市的面板数据,发现高人类发展指数城市的极端温度变异增强,低发展水平城市则缓慢减弱,当前差距约为 1.66 °C。可解释机器学习在控制气候和地理条件后,把气溶胶识别为与极端温度变异关联最强的城市因素,蓝绿空间则持续与较低变异相关。AI 在这里的作用是从长时间、多城市、多因素数据中拆分关联,为城市气候治理提供可比较线索。注意,研究属于观察性分析,不能把“关联最强”直接解释为气溶胶造成温度波动。
来源: Urbanization processes widen global divergence in extreme temperature variability|Nature Communications|https://www.nature.com/articles/s41467-026-75457-z|发布时间:2026-07-08|访问时间:2026-07-15 09:55|正式期刊论文,页面标注未经最终编辑版本。
智能织物电极加可解释机器学习,同时读出脑—肌肉活动
一项 Nature Communications 研究开发了混合电子织物电极阵列,同时记录皮层和肌肉表面电信号,并用可解释机器学习分析多点数据。受控实验中,系统可分类抓握物体形状和躯体感觉刺激,还能从皮层活动预测肌肉激活模式。它把柔性材料、可穿戴传感和算法解释连成一套生物医学工程系统,潜在用途包括神经康复、假肢和人机交互。
来源: Body surface potential mapping of the cortico-muscular axis using smart textile electrode arrays|Nature Communications|https://www.nature.com/articles/s41467-026-75134-1|发布时间:2026-07-08|访问时间:2026-07-15 09:55|正式期刊论文,页面标注未经最终编辑版本。
行业资讯与应用进展:从研究到落地
AWS 给出面向药物研究的知识图谱与 GraphRAG 参考架构

图:医学文献经 Amazon Bedrock 和 Amazon Comprehend Medical 处理后加载至 Neptune Analytics 的架构。来源:AWS Machine Learning Blog 原文。
AWS 发布了一套 how-to(操作型参考实现),把 Amazon Neptune Analytics、Amazon Bedrock、Amazon Comprehend Medical 和 BYOKG-RAG toolkit 组合起来,从 PubMed Central 开放论文、Disease Ontology 与 ICD-10 映射中构建药物研究知识图谱。用户可以用自然语言提问,同时沿图中的实体和关系查看证据路径,这比只返回一段生成文本更方便追溯。它适合用来理解企业怎样把领域本体、文献和大模型接到同一个检索工作流。需要注意:这是一篇云服务方案教程,不是已部署客户案例,也没有提供足以独立核验的药物发现命中率或临床价值证据。
相关资源: awslabs/graphrag-toolkit 可用于检查知识图谱构建、实体关系检索和证据路径组织方式。工具不会自动保证知识库正确,医学实体映射、文献版本、证据等级和权限控制仍需领域团队负责。
来源: Powering scientific discovery: BYOKG and GraphRAG for intelligent pharmaceutical research|AWS Machine Learning Blog|https://aws.amazon.com/blogs/machine-learning/powering-scientific-discovery-byokg-and-graphrag-for-intelligent-pharmaceutical-research/|发布时间:2026-07-08|访问时间:2026-07-15 09:55|公司官方技术博客与参考实现。
VERAXA 与 Ardigen 启动 AI 辅助的靶点组合筛选
VERAXA Biotech 7 月 13 日宣布与 Ardigen 开展合作,后者将用 AI 和生物信息学能力为 VERAXA 的 BiTAC® 条件激活 T 细胞连接器与抗体偶联药物管线筛选靶点组合。这个合作瞄准的是一个实际难点:双靶点药物不仅要找“相关靶点”,还要判断组合在肿瘤与正常组织中的共表达和选择性。对产业观察而言,这说明 AI 更常被嵌入候选优先级排序和管线决策,而不是单独作为一个产品发布。公告没有披露候选分子、实验结果、合作金额或时间表,因此目前只能确认合作启动,不能判断它能否提高成功率。
来源: VERAXA Biotech to Launch AI-enabled Drug Discovery Collaboration with Ardigen to Support Growing BiTAC® Pipeline|VERAXA Biotech,经 GlobeNewswire 分发|https://rss.globenewswire.com/news-release/2026/07/13/3326056/0/en/veraxa-biotech-to-launch-ai-enabled-drug-discovery-collaboration-with-ardigen-to-support-growing-bitac-pipeline.html|发布时间:2026-07-13|访问时间:2026-07-15 09:55|公司新闻稿。
政策动态与专家观点:规则、资金与方向
英国生命科学计划进入首年复盘,健康数据服务开始公司化落地

图:英国政府发布的生命科学行业计划配图。来源:GOV.UK 新闻稿原文。
英国政府 7 月 9 日发布生命科学行业计划首年实施更新,称过去 12 个月吸引超过 30 亿英镑公私投资,并正式将 Health Data Research Service(HDRS,健康数据研究服务)注册为公司,推动其从规划转向交付。HDRS 的目标是让获批研究者更安全、简化地访问分散的健康数据,这与医学基础模型、真实世界证据和临床研究基础设施直接相关。政府还称临床试验平均启动时间从 169 天降至 122 天,并提出到 2035 年支持 66,000 个新增岗位所需的 AI、量子和技术技能。
来源: UK life sciences attracts £3bn investment, creating jobs and faster patient treatments|UK Department for Science, Innovation and Technology 等|https://www.gov.uk/government/news/uk-life-sciences-attracts-3bn-investment-creating-jobs-and-faster-patient-treatments|发布时间:2026-07-09|访问时间:2026-07-15 09:55|政府新闻稿与计划年度实施更新。
专家评论:先回答“AI-ready 生物数据到底是什么”
George Mason University 的 Amarda Shehu 与美国国家癌症研究所 Frederick National Laboratory 的 Ruth Nussinov 在 Nature Machine Intelligence 发表评论,提醒全球正在加速建设 AI-ready(可供 AI 有效使用)的生物数据,但这个标签本身仍需要回答一组基础问题。对 AI4S 而言,数据是否可机器读取只是起点,采样偏差、元数据、可追溯性、更新方式和用途边界都会影响模型能学到什么。
来源: Four questions for AI-ready biological data|Nature Machine Intelligence|https://www.nature.com/articles/s42256-026-01270-4|作者:Amarda Shehu、Ruth Nussinov|机构:George Mason University、Frederick National Laboratory for Cancer Research / NCI|发布时间:2026-07-10|访问时间:2026-07-15 09:55|专家评论。
专家观点:医疗场景不一定总需要最大的语言模型

图:由大型语言模型获得小型语言模型的主要路径(文章图 1)。来源:Nature Biomedical Engineering 原文。
Nature Biomedical Engineering 的观点文章由 Tien Yin Wong 等作者撰写,讨论 small language models(小型语言模型)在医疗中的可扩展性、实用性和计算效率。较小模型更容易在院内或设备端运行,也更可能围绕单一任务做审计、更新和成本控制,这对隐私敏感、资源受限的医疗工作流有现实意义。文章同时讨论了局限和落地挑战,因此它不是“越小越好”的结论,而是在提醒团队把模型规模与具体任务、风险和部署环境配对。该文属于观点文章,没有提供新的前瞻性临床试验证据。
来源: Small language models in medicine|Nature Biomedical Engineering|https://www.nature.com/articles/s41551-026-01734-3|作者:Tien Yin Wong 等|发布时间:2026-07-13|访问时间:2026-07-15 09:55|专家观点文章。
更多推荐




所有评论(0)