当前位置:化工仪器网-光谱网首页-技术文章列表-咸聊|实验室里 R² 很漂亮,放大以后为什么预测开始漂

咸聊|实验室里 R² 很漂亮,放大以后为什么预测开始漂

2026年09月17日 15:00 来源:杭州咸数科技有限公司
导读
小试反应器里建出的 Raman 模型,交叉验证 R² 很漂亮,RMSE 也很低。但探头换了、反应器放大了、搅拌和传质环境变了以后,同一个模型可能突然开始漂。真正的问题不是‘拉曼还能不能测’,而是模型到底学到了化学信息,还是把实验室环境本身也一起记住了。

一、先说结论:250 mL 到 2000 L,模型面对的不是“同一个体系放大了”

一个 Raman 模型在 250 mL、1 L 或 5 L 体系里表现优秀,并不等于它天然拥有向 200 L、2000 L 放大的能力。

模型真正面对的,是一个新的数据分布。

在线拉曼做 PAT 时,我们通常会经历这样一条路线:小试反应 → 连续采集光谱 → 同步 HPLC/GC/离线参考值 → 光谱预处理 → PLS/PCR/其他模型 → 交叉验证 → 得到一个看起来很漂亮的 R² 和 RMSE。

到这里最容易产生一个错觉:化学体系没有变,所以模型也应该继续有效。

但模型看到的从来不只有化学组成。它实际看到的是:

化学组成 + 光学系统 + 探头状态 + 荧光背景 + 散射 + 温度 + 混合状态 + 反应器几何 + 原料波动 + 操作条件。

只是在小试阶段,这些变量经常一起变化,模型很难分辨:哪些信号真正来自目标物浓度,哪些只是“碰巧和浓度一起变化”的背景特征。

图 1|从小试到生产,变化的远不止体积
250 mL小试 / 建模环境相对稳定Domain Shift• 探头 / 光路变化• 混合与传质变化• 温度 / 背景 / 散射变化• 原料批次与工艺窗口变化• 仪器响应与安装条件变化2000 L生产尺度模型开始漂?
注:标题中的 250 mL 是工程上常见的小试量级表达,并非对应某一篇论文的固定实验规模。公开研究已经覆盖 3 L→2000 L、3 L→3000 L 等跨尺度案例。

这也是为什么一个在实验室里验证得非常漂亮的模型,换一个环境之后可能突然失效。

二、2000 L 里变化的五件事

1. 光程、散射和窗口状态变了

反应器尺寸、探头安装位置、窗口状态、气泡、固体颗粒、浑浊程度,都会影响进入探头的有效光信号。

浓度没有变化,并不意味着光谱基线、峰强和信噪比不变。

2. 混合状态变了

250 mL 里某一点测到的液体,往往更接近整个体系的平均状态;到了几百升甚至几千升,局部浓度梯度、传质、加料区、温度场都会发生变化。

此时 Raman 探头测到的是探头所在位置的局部状态,而离线参考值可能来自另外一个取样位置,甚至来自已经重新混匀后的样品。

这时候,模型的 X(光谱)和 Y(参考值)从物理意义上就可能开始错位。

3. 仪器和探头发生了变化

即使都是同一激发波长的 Raman,两台设备的光学响应也不会做到数学意义上的一致。

激光功率、探测器响应、光纤、光栅、探头结构、窗口污染,都会留下自己的“设备指纹”。

如果模型把这些设备指纹也当成了预测依据,换设备以后自然会漂。

4. 工艺窗口变宽了

实验室建模时,可能只有十几批比较“听话”的数据;生产现场则会遇到原料批次差异、温度波动、不同操作阶段、不同黏度、不同加料轨迹。

也就是说,生产环境开始出现模型以前没见过的数据。

机器学习里把这种情况称为 Out-of-Distribution(OOD,分布外数据)

5. 模型可能学到了一些“捷径”

这是最危险的一件事。

假设某个目标物浓度在实验阶段总是随时间单调变化,而荧光背景也碰巧随时间变化。PLS 模型可能学到:

荧光背景变化 ≈ 时间变化 ≈ 浓度变化。

在实验室数据里,它甚至会得到很好的交叉验证结果;但到了另一个尺度,荧光规律一变,这条“捷径”马上失效。

所以模型放大失败,并不一定代表 Raman 没有检测到目标物。

更常见的情况是:**模型没有真正把“化学信息”和“环境信息”分开。**

三、R² 很高,为什么还是会翻车?

如果训练集和验证集来自同一台仪器、同一根探头、同一个反应器、相似的几批实验,那么传统随机划分训练集和验证集,很容易得到一个非常漂亮的结果。

但这种验证回答的是:

模型能不能预测“和自己长得很像的数据”?

工业 PAT 真正需要回答的是:

模型能不能预测“下一台反应器、下一批原料、下一个规模的数据”?

这是两件不同的事。

真正准备往生产部署的 Raman 模型,至少应该逐渐增加四层验证:

验证层级怎么做真正回答的问题
跨批次整批数据不参与建模下一批还能不能预测
跨工况主动改变温度、加料、浓度窗口超出舒适区后会不会漂
跨设备换仪器、换探头或换安装位置模型是不是记住了设备
跨尺度小试建模,中试/生产 blind prediction模型能不能真正跟着工艺放大
图 2|“模型验证”从实验室分数走向工业可信
随机交叉验证整批外部验证Leave-one-batch-out跨工况 / 跨设备温度 / 原料 / 探头跨尺度 Blind Prediction小试 → 中试 → 生产真正决定工业可用性越往右,越接近真实生产风险

四、2026 年的新研究,把问题指向了“按变量选择预处理”

2026 年 8 月 29 日发表的一项开放获取研究,专门研究高通量小型生物反应器建立的 Raman 模型,如何迁移到更大尺度反应器。

研究发现:采用一套固定的标准预处理流程时,有些指标可以顺利迁移,有些指标到了更大规模以后预测明显变差;当研究人员针对不同待测变量,分别选择更合适的预处理策略之后,五个原本迁移较差的指标,其跨尺度 RMSEP 相比标准流程下降了 14.0%—56.1%

其中,不同变量对应的改善幅度并不相同,这恰恰说明:不存在一个对所有分析目标都的预处理组合。

更值得注意的是,论文还显示:某些处理方法可以让不同尺度的数据在 PCA 空间里看起来“更接近”,但真正拿去做定量预测时反而变差。

所以,视觉上把两批光谱“对齐”,不等于模型真的更可迁移。真正需要保护的是与目标变量有关的化学信息。


五、另一个新方向:迁移学习的局限性

2026 年 7 月的一项研究系统比较了 CORAL、JDOT、TCA、OPP-MMD 等无监督迁移学习方法,用来处理 Raman 模型在不同培养基、不同尺度下的 domain shift。

结果非常有工程意义:

  • 当主要问题确实来自“源域和目标域之间的差异”时,CORAL、JDOT 等方法能够帮助模型迁移;

  • 但当数据内部本身就有很大的波动时,迁移学习未必有帮助,有时甚至不如认真优化过的传统预处理流程。

这说明未来在线光谱不会是“加一个 AI,迁移问题全部解决”。更现实的工具箱是:

预处理 → Calibration Transfer → Domain Adaptation → 外部验证 → 持续模型维护。


六、也有更乐观的证据:3 L 模型在特定条件下可以直接走到 3000 L

2026 年另一项研究提出了一种针对 Raman 光谱的特定归一化处理方法,使用 3 L 开发规模数据建立模型,并将其直接用于 3000 L 制造规模的监测。

在该研究条件下,作者报告了与 3 L 同尺度监测相当的预测准确度,而且不需要额外再校准或使用迁移学习。当然,作者也明确指出,更广泛的案例仍需要进一步验证。

这件事非常重要,因为它说明跨尺度并不是必然要“推倒重建”。如果前处理策略真正抓住了跨尺度变化的物理来源,有些模型是有机会直接迁移的。


而更早的公开研究已经展示过 3 L、200 L 到 2000 L 的多尺度 Raman 建模,说明“跨尺度 PAT”本身并不是新概念,真正的新问题是:怎样把迁移成本降下来,并把模型维护从专家项目变成日常工程能力。


七、真正工业化的 Raman 模型,应该从开始就为“放大”准备数据

如果知道最后目标是中试甚至生产,那么小试阶段的数据采集方式就应该改变。

传统做法通常是:把工艺尽量稳定地跑好 → 收集十几批正常数据 → 建模型。

但从模型泛化角度看,一个只见过“正常世界”的模型,一旦进入生产现场,很容易遇到陌生数据。

更合理的方法是在开发阶段就有意识地让模型看到合理范围内的变化,例如:

  • 不同温度区间

  • 不同搅拌速度

  • 不同加料轨迹

  • 不同初始浓度

  • 不同原料批次

  • 不同反应阶段

  • 不同探头位置

  • 不同背景和浑浊度

也就是说:模型开发和工艺开发不应该是两件分开的事情。

工艺开发本身,就应该同时为 PAT 模型创造一个覆盖足够广的 Design Space。

八、这也是为什么 Raman100 不应该只是一台“采光谱的仪器”

咸数的 DSI-RAMAN100 在线拉曼属于咸慧在线光谱系列。当前公开产品路线强调“硬件 + 软件 + 工艺知识”,并提供面向常见化学工艺场景的算法包与零代码建模路径,目标是让光谱建模不再只停留在分析专家电脑里。


但如果把前面讨论的跨尺度问题继续往工程上推一步,我们认为 Raman PAT 还需要解决另外一个问题:

光谱数据必须知道自己是在什么工艺条件下产生的。

一条 Raman 光谱本身并不会告诉你:当时温度是多少、搅拌速度是多少、正在以什么速度加料、pH 是否刚发生变化、这一批和上一批到底哪里不同。

这正是 ECP100 / ECP200 这类过程控制与数据平台能够补上的上下文。

ECP100 可连续记录温度、pH、转速、加液量等过程变量,并按预设流程执行实验;ECP200 在此基础上支持两个独立实验并行运行,并可接入温度、pH、浊度、电导、称重、加液等多类过程变量与执行模块。

图 3|真正可维护的 PAT 模型,需要“光谱 + 工艺上下文”
Raman100光谱 / 化学组成信息ECP100 / ECP200温度 / pH / 转速 / 加液...统一时间轴数据集光谱 + 工艺参数 + 离线参考值知道“为什么这条光谱会变”模型生命周期建模验证漂移发现更新 / 再验证

把 Raman100 和 ECP 系列放在一起,数据结构就不再只是:

时间 → Raman 光谱

而是:

时间 → Raman 光谱 + 温度 + pH + 搅拌 + 加料量/速度 + 浊度/电导等过程变量 + 离线参考值。

这对于模型迁移非常重要。因为当预测开始漂移时,工程师才能继续追问:到底是光谱仪器发生了漂移,还是原料体系变化了,还是工艺条件已经跑出了模型训练时的 Design Space?

九、ECP200 还有一个容易被忽略的价值:主动制造“好数据”

模型真正需要的,不一定是更多数据,而是覆盖更合理工艺空间的数据。

如果一天重复跑十批几乎一样的实验,得到的是十批高度相关的数据。对于模型泛化能力,价值可能没有想象中那么大。

ECP200 支持两个独立实验并行运行,并分别控制温度、搅拌、加液等参数。因此在工艺开发阶段,可以设计更有价值的对照:

  • A 通道标准温度,B 通道温度扰动

  • A 通道标准加料,B 通道改变加料速度

  • A 通道中心浓度,B 通道边界浓度

  • A 通道标准搅拌,B 通道改变混合条件

Raman100 同时记录两个体系的光谱。

这样积累下来的数据,不只是在增加样本数量,而是在主动扩展模型见过的“世界”。从机器学习角度,这就是在扩大 Calibration Domain。

模型见过的合理变化越完整,真正放大以后遇到 OOD 数据的概率就越低。

十、从“建一个模型”升级到“管理一个模型生命周期”

跨尺度 Raman 最终至少是四层问题:

层:仪器。 不同设备和探头产生的光谱,如何保证可比较。

二层:数据。 怎样通过基线校正、SNV、导数、去噪等方法,把物理干扰和化学信息分开。

三层:模型。 什么时候继续使用原模型,什么时候做 Calibration Transfer,什么时候需要 Domain Adaptation,什么时候必须重新建模。

四层:工艺。 模型有没有见过足够广的真实工艺变化。

第四层,经常才是最容易被忽略的一层。

过去做 PAT,经常把“模型建立完成”看成项目终点。实际上,当在线光谱真正进入生产以后,模型一次上线才只是开始:

建模 → 验证 → 部署 → 监控 → 漂移发现 → 迁移/更新 → 再验证。

在线 Raman 真正走向工业化的标志,不是某一次实验里做出了一个 R²=0.99 的模型。

而是换一批原料、换一根探头、换一个反应器、换一个规模以后,我们仍然知道:它什么时候可信,为什么不可信,以及怎样用尽量少的新数据把它重新变得可信。

对于咸数来说,Raman100、在线光谱零代码建模和 ECP 系列更值得做的,并不是把“建模”包装得越来越神秘,而是让光谱数据、工艺数据和实验执行逐渐进入同一个闭环,让 PAT 模型真正能够跟着工艺一起被管理。

这可能才是从 250 mL 走到 2000 L 最难,也值得解决的那一步。

对于咸数来说,Raman100、在线光谱零代码建模和 ECP 系列更值得做的,并不是把“建模”包装得越来越神秘,而是让光谱数据、工艺数据和实验执行逐渐进入同一个闭环,让 PAT 模型真正能够跟着工艺一起被管理。

这可能才是从 250 mL 走到 2000 L 最难,也值得解决的那一步

参考资料

  1. Han SH, Park J, Lee KB, et al. Variable-specific preprocessing enables cross-scale transferable Raman models from high-throughput bioreactor data. Bioresources and Bioprocessing. 2026.

  2. Hüpfl B, et al. Limits and benefits of unsupervised transfer learning for Raman spectroscopy-based bioprocess monitoring. 2026. 

  3. Improved methodology for direct monitoring of large-scale manufacturing cell culture using Raman spectroscopy data from process development. 2026. 



发布日期:2026-09-17
作者:咸数科技技术团队


免责声明

  • 凡本网注明“来源:化工仪器网”的所有作品,均为浙江兴旺宝明通网络有限公司-化工仪器网合法拥有版权或有权使用的作品,未经本网授权不得转载、摘编或利用其他方式使用上述作品。已经本网授权使用作品的,应在授权范围内使用,并注明“来源:化工仪器网”。违反上述声明者,本网将追究其相关法律责任。
  • 本网转载并注明自其他来源(非化工仪器网)的作品,目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,不承担此类作品侵权行为的直接责任及连带责任。其他媒体、网站或个人从本网转载时,必须保留本网注明的作品第一来源,并自负版权等法律责任。
  • 如涉及作品内容、版权等问题,请在作品发表之日起一周内与本网联系,否则视为放弃相关权利。

欢迎联系我

有什么可以帮您? 在线咨询