当前位置:化工仪器网-光谱网首页-技术文章列表-咸聊|模型再准,也救不了没有代表性的采样

咸聊|模型再准,也救不了没有代表性的采样

2026年09月17日 16:24 来源:杭州咸数科技有限公司
导读
一根 Raman 探头告诉你当前浓度是 3.12 g/L。仪器没坏,模型也很准。但反应器另一侧可能是 4.2 g/L,加料口附近可能刚刚冲到 5.8 g/L。真正的问题因此不是“3.12 准不准”,而是:探头前这一小块物料,究竟能不能代表整个反应器?

一、先问一个比“模型准不准”更基础的问题

如果一根 Raman 探头非常准确地测出了探头前方液体的浓度,却因为反应器内部没有充分混匀,使这个位置不能代表整个体系——那么这个结果到底算“测准了”,还是“测错了”?

答案是:

仪器可能测准了。

甚至模型也可能没有问题。

真正错的,是我们默认了一个没有经过验证的前提:

探头看到的这一小块物料,可以代表整个反应器。

这可能是在线光谱应用里最容易被忽略的问题之一。

很多 PAT 项目把大量精力放在:

光谱预处理、变量筛选、PLS、机器学习、模型迁移、预测区间、R²、RMSEP……

这些当然重要。

但所有这些事情其实都有一个共同的前提:

进入模型的光谱,首先得代表我们真正想知道的那个过程状态。

如果这个前提不存在,再优秀的算法也只能更加精准地描述一个“不具有代表性的局部状态”。

2026 年一篇专门讨论 PAT 采样可靠性的研究对此说得非常明确:高频采集和大量数据本身,并不能保证数据具有代表性。物料非均一性、传感器位置、采样频率以及 Process Sampling Interface 的设计,共同决定了 PAT 数据究竟能在多大程度上反映真实过程。

这意味着:

PAT 首先是采样问题,其次才是光谱问题,最后才是模型问题。

二、3.12 g/L 可以正确,同时又不能代表整个反应器

先想象一个并不夸张的场景。

图 1|同一个反应器里,可以同时存在多个“真实浓度”
加料口 ↓
5.8 g/L
局部加料区
4.2 g/L
主体区域 A
3.7 g/L
底部区域
3.12 g/L ← Raman
探头局部区域
搅拌正在试图让这四个区域逐渐趋同
Raman 输出 3.12 g/L 并不意味着仪器出错。
真正需要回答的是:3.12 g/L 是否代表你定义的“过程状态”?

这件事情一旦理解清楚,就会发现一个非常重要的区别:

准确性,不等于代表性。

一台 Raman 仪器可以非常准确。

一个 PLS 模型也可以经过非常严格的验证。

但如果探头所在区域刚好靠近:

加料口、釜壁、液面、死区、气泡聚集区、固体沉积区,

那么模型得到的就可能是:

非常准确的局部真相。

而工程师真正需要的,却可能是:

整个反应器的总体状态。

三、必须把 Measurement Error 和 Sampling Error 分开

这是整篇文章最重要的技术区别。

Measurement Error:测量误差

假设探头前物料真实浓度是:

3.10 g/L

Raman + 模型输出:

3.12 g/L

这 0.02 g/L 的差异,可以归入分析测量系统的问题。

它可能来自:

仪器噪声、光谱预处理、校准模型、参考方法误差、探头状态等。

这是大家比较熟悉的“测得准不准”。

Sampling Error:采样误差

现在假设:

探头前方真实浓度确实就是:

3.10 g/L

所以 Raman 输出 3.12 g/L,已经非常好。

但整个反应器经过真正充分混合后的平均状态是:

4.05 g/L

这时候的问题已经不是 0.02 g/L。

而是:

3.10 和 4.05 根本不是同一个 measurand。

也就是:

你究竟想测什么?

是:

探头前方数毫米范围内此刻的局部浓度?

还是:

整个反应体系此刻能够代表批次状态的浓度?

如果问题定义不清楚,后面的 R² 再高也没有意义。

图 2|两种不同的“误差”
问题Measurement ErrorSampling Error
本质有没有把眼前的东西测准眼前的东西能不能代表整体
典型来源噪声、校准、模型、仪器漂移混合、位置、流场、死区、时间差
常见解决方式改善仪器、模型和校准重新设计采样位置和采样策略







最危险的情况不是仪器不准。


而是:

**仪器非常准,却一直在精确测量一个不具有代表性的位置。**

因为这种错误通常不会表现成噪声。

它的曲线甚至可能非常漂亮、非常平滑、非常稳定。

因此反而更容易让人产生信心。

四、高频在线测量,也可能只是“每秒钟把同一个偏差测一遍”

在线光谱的优势之一,是时间分辨率。

离线 HPLC 可能每隔几十分钟甚至几个小时获得一个点。

在线 Raman 可以不断产生光谱。

于是人很容易形成一种直觉:

测得这么频繁,数据一定比人工取样更具有代表性。

但这两个问题其实没有必然关系。

时间分辨率高,不代表空间代表性高。

如果探头始终处在一个局部偏高区域:

每小时测一次,是局部偏高。

每分钟测一次,是局部偏高。

每秒测一次,仍然是局部偏高。

你只是获得了:

非常高时间分辨率的系统性偏差。

2026 年关于 PAT representative sampling 的研究特别指出,连续或高频测量很容易让人误以为“数据多就是代表性好”,而真实传感器通常只能 interrogate 整个物料体系中的有限部分。

所以在线检测真正需要同时回答两个问题:

时间上,我多久看一次?

以及:

空间上,我到底看到了多少?

五、这就是 Process Sampling Interface 为什么重要

PAT 领域有一个特别值得重视、但经常被算法讨论盖过去的概念:

Process Sampling Interface,PSI。

可以把它简单理解成:

真实工艺和传感器之间,究竟是怎么“见面”的。

对 Raman 来说,它不仅包括探头本身。

还包括:

探头的位置、插入深度、光学窗口、物料流动方向、周围流场、视场、穿透深度,以及物料到底怎样经过这个检测区域。

2026 年的采样研究特别强调:

PAT 的代表性受到 sensor positioning、PSI design、Field of View 和 penetration depth 等因素共同影响。

这意味着:

探头怎么安装,本身就是分析方法的一部分。

不是机械工程师最后找一个“有孔的位置”装进去就结束。

六、最近一项 Raman 研究,甚至开始用 CFD 设计探头接口

这个趋势很值得关注。

2025 年发表、持续受到 2026 PAT 研究关注的一项在线 Raman 工作,不是从 PLS 模型开始,而是先研究:

Raman 探头接入工艺流之后,周围流体到底怎么流。

研究人员用:

DoE、CFD、Residence Time Distribution(RTD)

来分析 Raman PAT 接口。

结果显示:

探头浸入深度、体积流量和流体动态黏度都是重要风险因素。

CFD 甚至能够看到接口边缘形成的死区;提高探头浸入深度或者提高体系黏度,都会影响死体积分数和流动行为。

这件事情的意义非常大。

因为过去我们经常认为:

PAT 探头只是“看过程”。

但现实是:

探头被插入过程以后,探头本身甚至可能改变它周围的过程。

当体系:

黏度高、流速低、含固体、容易沉降,

这种问题更加明显。

所以真正成熟的 PAT 集成,不仅应该问:

这个探头能不能测?

还应该问:

这个探头以这种方式装进去以后,它到底测到了什么?

七、2026 年甚至已经有人证明:先改“采样”,模型自己就变好了

一个非常有意思的证据来自今年的连续粉体 PAT 研究。

研究人员监测的是低含量 API 的连续混合过程。

如果按照“算法优先”的思路,通常会继续寻找:

更复杂的预处理、更好的变量筛选、更的回归算法。

但研究团队先改了一件非常物理的东西:

采样界面。

他们重新设计了斜槽几何结构,使粉体流动更加稳定,并增加实际进入 NIR 探头视场的有效样品量。

结果是:

光谱基线漂移和噪声下降。

之后再做预处理和 PLS。

最终模型验证 R² 从原采样接口条件下的 0.9529 提升到 0.9858,RPD 从 5.51 提高到 7.26

这里真正值得注意的是因果顺序:

不是先换算法。

而是:

先让传感器看到更好的样品。

然后模型自然变好了。

这实际上说明了一件特别朴素的事情:

如果输入的数据本身更接近真实过程,再普通的模型也可能工作得很好。

反过来:

如果输入本身带着系统性采样偏差,再复杂的算法也只能学习这个偏差。

八、为什么这个问题到了工艺放大以后会突然恶化?

这正好和我们前面讲过的:

250 mL → 2000 L 模型迁移

连起来。

在一个 250 mL 体系里:

混合距离短、体积小、温度更容易均一、加料产生的局部浓度区消失得更快。

因此很多时候:

一个点 ≈ 整个系统

这个假设即使不,也还能工作。

但到了 2000 L:

混合时间、空间尺度、传质路径和局部流场都发生变化。

于是:

位置开始变成一个变量。

同一时刻可能同时存在:

加料口附近的高浓度区、

远离加料口的低浓度区、

釜壁附近的不同流速区域、

底部沉积区、

气液界面区域。

所以上一篇里我们讨论:

为什么小试模型放大后会漂?

更底层的一个答案就是:

小试阶段,“一条光谱代表整个体系”这个假设可能近似成立;放大以后,这个假设开始崩溃。

这也解释了为什么:

模型迁移问题,

有时并不是“模型问题”。

它背后可能首先是:

空间代表性发生了变化。

九、甚至离线参考值也可能和 Raman 不是在测同一个世界

这个问题更隐蔽。

建立 Raman 定量模型时,通常需要参考分析:

Raman 光谱作为 X。

HPLC / GC 等参考结果作为 Y。

然后建立:

X → Y

但这里隐藏着一个非常严格的假设:

X 和 Y 对应的是同一个物料状态。

现实不一定如此。

例如:

14:32:00
Raman 在釜侧壁实时采谱。

14:32:10
操作员从上部取样口取样。

14:33:00
样品完成淬灭和稀释。

14:50:00
HPLC 得到结果。

如果反应正在快速变化,而且体系还存在空间梯度,那么:

X 和 Y 的物理对应关系可能已经松动。

模型却不知道。

它只会努力寻找 X 和 Y 之间的统计关系。

这也是为什么真正严谨的 PAT 方法开发必须考虑:

空间同步 + 时间同步。

否则模型可能被迫学习一个本来就带有错位的数据集。

十、Raman100 与 ECP 的组合价值,也应该从这里重新理解

咸数的 DSI-RAMAN100 在线拉曼定位本身就是把光谱从单纯的基础检测,进一步转化为工艺信息,并结合零代码建模支持 PAT 应用。

但从采样代表性的角度看,仅有光谱仍然缺一块重要信息:

这条光谱是在什么工艺状态下产生的?

这时候 ECP100 / ECP200 的价值就不只是“自动做实验”。

ECP100 能够持续记录温度、pH、转速、加液等过程数据;ECP200 在此基础上进一步支持并行实验,并可接入温度、pH、浊度、电导等多类过程传感器。

这样 Raman 光谱背后就开始拥有:

Process Context。

十一、一个异常峰,到底是模型坏了,还是探头真的看到了局部事件?

假设某个反应过程中:

Raman 预测浓度突然从:

3.2 → 4.6 → 5.1 → 4.0 → 3.3 g/L

然后恢复正常。

只看光谱模型,很容易怀疑:

模型漂了。

探头脏了。

或者预测异常。

但如果把 ECP 的过程事件叠上去:

图 3|光谱异常,还是局部工艺事件?
14:32:00Raman:3.2 g/L工艺稳定
14:32:10Raman:4.6 g/L开始加料
14:32:18Raman:5.1 g/L探头附近出现局部高浓度区
14:32:45Raman:4.0 g/L搅拌扩散
14:33:20Raman:3.3 g/L重新趋于均匀






突然会发现:Raman 可能根本没有坏。

恰恰相反:

它非常敏锐地看见了加料产生的局部浓度云。

这时候问题就从:

为什么 Raman 出现异常?

变成:

为什么这个局部事件会被探头看到?它多久才能消失?它是否会影响反应选择性?我们的混合是不是足够快?

这已经不再只是分析化学。

而是在用光谱观察:

过程本身。

十二、这也是为什么未来 PAT 很可能不会依赖“一台传感器”

如果一个传感器只能观察过程的一部分,那么一个很自然的发展方向就是:

让多个不同传感器互相提供上下文。

2026 年一项 CHO 细胞培养研究,把 Raman 光谱、过程信息和介电光谱数据进行融合,用于精氨酸浓度预测。

其 ANN Raman 模型的 RMSEP 为 295.4 μM,相比 PLSR 的 342.9 μM 更低;进一步加入过程信息的数据融合后,模型的稳健性继续改善。

另一个 2026 年的多传感研究同时使用:

Raman、ATR-FTIR 和 FBRM

进行过程故障检测。

三种传感器融合后,在 accuracy、recall 和 F1-score 上优于单独使用任意一种传感器的方案。

这背后的思想很重要:

未来 PAT 的方向,可能不是寻找一个都知道的传感器,而是让多个有局限的传感器互相证明。

Raman 看分子组成。

温度看到热状态。

pH 看到酸碱环境。

浊度和颗粒相关传感器看到物理相变化。

加料系统知道外部物质什么时候进入。

搅拌器知道当前混合条件。

单独看,每一个信号都不完整。

放在同一个时间轴上:

过程才逐渐变得完整。

十三、数字孪生之前,先问:物理世界真的被正确地“看见”了吗?

2026 年一项工作正在讨论如何把 PAT、数据互操作和 Digital Twin 连接起来,最终支持 Model Predictive Control。

这是一个非常重要的发展方向。

但从采样角度看,还需要在最前面加一个问题:

真实物理过程 ↓ 传感器究竟看到了什么? ↓ PAT 数据 ↓ 模型 ↓ Digital Twin ↓ 预测 ↓ MPC / 自动控制

如果最前面的传感信息存在系统性的代表性偏差:

后面的 Digital Twin 再精美,

也只是在:

高精度地复制一个被错误观察的世界。

所以数字孪生真正落地之前,有一个看起来非常“不数字化”的基础问题必须先解决:

物理世界究竟被我们正确观察了多少?

Digital Twin 首先不是“数字”问题。

它首先是一个:

**Physical World → Data**

是否可靠的问题。

十四、那一根 Raman 探头应该装在哪里?

这个问题没有一个通用答案。

真正需要验证的是:

你定义的 measurand 是什么。

如果目标是判断:

反应终点,

合适的探头位置可能和监控:

加料瞬间局部浓度,

不同。

如果目标是监控:

结晶过程,

固液分布和探头附近晶体行为会非常重要。

如果体系是:

高黏体系、浆料、气液体系、快速加料体系,

PSI 的重要性还会继续上升。

所以探头位置不能只根据:

“这里比较好安装”。

更合理的思路是把它纳入方法开发:

过程理解 → 风险分析 → 探头位置 → 动态实验 → 与参考取样比较 → 验证代表性。

必要时甚至应该考虑:

多位置实验、循环旁路、CFD、RTD 或多传感器交叉验证。

十五、给正在做在线光谱的团队一个更难的自查问题

下一次看到一条非常漂亮的 Raman 预测曲线时,可以暂时不要先问:

R² 是多少?

先问下面这些问题:

  • 探头实际看到的空间体积有多大?

  • 探头距离加料点和搅拌区域有多远?

  • 当前体系是否可能存在浓度或温度梯度?

  • 高黏度、固体、气泡是否会改变探头附近的物料交换?

  • Raman 光谱与离线参考样是不是来自真正可比较的时间和空间状态?

  • 工艺放大后,原先的小试探头位置是否仍具有相同代表性?

  • 一个异常谱出现时,能不能同时看到加料、温度、pH、转速等过程事件?

  • 如果一个探头不能代表整个过程,是否应该改变 PSI、增加其他传感器,或者重新定义这个信号究竟用来回答什么问题?

这可能比继续尝试第十种预处理算法更值得花时间。

十六、结语:一根探头看到的,不是“整个反应器”,而是一个观察窗口

在线 Raman 的价值之一,就是让过去不可见的化学变化变得连续可见。

但连续可见,并不等于完整可见。

一根探头真正提供的是:

一个观察窗口。

这个窗口非常有价值。

但我们必须知道:

它在哪里,

它有多大,

它看到什么,

它遗漏什么,

以及它什么时候能够代表我们真正关心的过程。

优秀的 PAT 系统,不应该假装一个传感器知道全部真相。

真正成熟的系统应该知道:

**每一个传感器看到的是哪一部分真相,然后把这些局部真相重新拼成对过程的理解。**

从这个角度看:

Raman100 负责提供连续的化学信息。

ECP100 / ECP200 让光谱拥有温度、pH、搅拌、加料等过程上下文。

未来再把中红外、浊度、电导以及更多过程传感器融合进来。

最终形成的就不再只是:

一台在线光谱仪。

而是:

Spectral Information
+ Process Context
+ Sampling Representativeness
+ Model Confidence
+ Process Control

这可能才是在线光谱真正从“分析仪器”走向“过程智能”的路径。

参考研究

  1. Getting “sampling” right for reliable process monitoring: main challenges and solutions, Frontiers in Analytical Science, 2026.

  2. Quality-by-digital-design for the in-process integration of Raman spectroscopy as a PAT tool in continuous manufacturing of pharmaceutical liquids and semi-solids, International Journal of Pharmaceutics, DOI: 10.1016/j.ijpharm.2025.126349.

  3. Achieving performance improvement of PAT in continuous powder blending process: A collective consideration of sampling interface design and chemometrics, International Journal of Pharmaceutics, 2026, 692:126612, DOI: 10.1016/j.ijpharm.2026.126612.

  4. Advancing bioprocess monitoring: data fusion and ANN-based prediction of arginine concentration in monoclonal antibody-producing CHO cell cultures, New Biotechnology, 2026, 93:185–193, DOI: 10.1016/j.nbt.2026.03.003.

  5. Real-time fault detection in multicomponent nuclear-waste slurries through data fusion of spectroscopic sensors, AIChE Journal, 2026.

  6. Operationalizing digital twins in biomanufacturing through interoperable process analytical technology, Bioprocess and Biosystems Engineering, 2026, DOI: 10.1007/s00449-026-03369-9.

发布日期:2026-09-17
作者:咸数科技技术团队

关于咸数科技
杭州咸数科技有限公司(DigitalSalt Tech.)是一家专注于在线检测和控制的智能科学仪器公司,通过传感、物联网和人工智能技术的深度融合,为制药和精细化工行业提供在线光谱(拉曼/中红外)、多参数实时数据采集(ECP系列)、流动相/溶出介质自动配液(LP系列)等智能化设备和解决方案。


关键词: 光谱,PAT

免责声明

  • 凡本网注明“来源:化工仪器网”的所有作品,均为浙江兴旺宝明通网络有限公司-化工仪器网合法拥有版权或有权使用的作品,未经本网授权不得转载、摘编或利用其他方式使用上述作品。已经本网授权使用作品的,应在授权范围内使用,并注明“来源:化工仪器网”。违反上述声明者,本网将追究其相关法律责任。
  • 本网转载并注明自其他来源(非化工仪器网)的作品,目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,不承担此类作品侵权行为的直接责任及连带责任。其他媒体、网站或个人从本网转载时,必须保留本网注明的作品第一来源,并自负版权等法律责任。
  • 如涉及作品内容、版权等问题,请在作品发表之日起一周内与本网联系,否则视为放弃相关权利。

欢迎联系我

有什么可以帮您? 在线咨询