TMS BOOK · ACADEMY 讲义

试验数据分析与不确定度评估

大纲的完整展开版——讲师授课蓝本 / 学员自学材料

L7-03 试验数据分析与不确定度评估

课程代码 L7-03 · 板块 L 试验与验证 / 测量技术与数据 时长 约 3.5 小时(6 讲) 前置 L7-02 数据采集基础;体系外前置(需自备):基础统计学(均值、标准差概念) 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 L7-03 大纲的完整展开版


引言:「我们多测了三十次,所以这个数很准」——加测压得动的,只有分量表里的一半

试验室交出去的从来不是一条曲线,是一个会被拿去做决定的数。麻烦出在这个数被拿去用的那一刻,而不是被测出来的那一刻,而且它有三种很固定的形态。第一种在判限值的时候:实测值离限值只差一点,有人问「这算超差还是通过」——答不上来,因为没有人说得清这个数本身能准到什么程度;再问「那多测几次呢」,于是重复次数从三次提到三十次,标准差除以 √n 变小了,结论从超差改判成通过,而实物一点没变。第二种在对标会上:试验与仿真差了一截,会议室里争「是仿真错了还是试验错了」,两边各端着一个数,没有一边给出误差带——这场争论在方法上就没有胜负手,最后往往靠嗓门或职级收场。第三种在数被拿去异地复用的时候:部件台架的一个数被直接拿去支撑整车结论,或者与另一台架、另一家实验室的数比对,比出来不一样,于是去查对方的仪表——而两边测的可能根本不是同一个被测量。这门课要处理的正是这三件事,而它们没有一件是靠买一台更准的仪表能解决的。

第一根钉子:一个试验结果不是一个数,是三件套——值 + 扩展不确定度 U(含 k 与包含概率)+ 口径声明(被测量怎么定义、在什么设施与边界条件下取得、可外推到哪一层)。三件缺一,这个数就不可比、不可判、不可对标。这三条缺失各有各的后果,且都很具体:缺 U ⇒ 不能与限值比(不知道余量是否显著)、不能与仿真比(第 6 讲的误差带比较无从做起)、不能与另一台架比(实验室间比对判读式的分母缺一半);缺 k ⇒ 别人无法把你的 U 还原成合成标准不确定度 u_c,于是既不能与你的结果合成、也不能与你比大小;缺口径声明 ⇒ 这个数会被拿去用在它从没验证过的地方,而没有任何东西拦得住。全课六讲就是这三件套的六层,⛔ 不是六个互不相干的统计专题。

第二根钉子:A 类/B 类是评定方法的分类(这个分量的数是怎么算出来的:靠本次重复观测的统计,还是靠别的信息),随机/系统是误差行为的分类(重复条件下它变不变、能不能被平均掉)。两套分类是正交的,不是同一件事的两种叫法。判「能不能靠多测几次压掉」看的是后一套,⛔ 不是看它被评成 A 类还是 B 类。这根钉子在交付物上只有一个落点,而且很硬:不确定度分量表除了「评定类型(A/B)」这一列,必须另有一列「重复条件下可压/不可压」,两列各判各的。⚠ 多数现成模板把这两列合并成一列,那正是本课要拆开的地方——合并之后,「B 类分量不能靠多测平均掉」这句听起来完全正确的话,会顺势推出「A 类分量都能靠多测平均掉」这个错的推论;而第 2 讲要画的那个四格全集里,恰好有两格是它的反例:A 类评定出来的系统分量(用一组重复观测做回归、把斜率评成漂移速率,数是本次统计出来的,而它描述的效应在重复条件下不变号)与 B 类评定出来的随机分量(证书或手册给的重复性指标、分辨力引起的量化误差,数不是本次统计出来的,而它在重复条件下确实会变)。

★ 还要先把本课最容易被读反的一句正面点破:「多测几次、取平均,误差就小了。」这句话在统计课上完全正当——均值的标准误差确实按 s/√n 收敛,本课关键公式的第 2 式就是它;而它一进到一张真实的不确定度分量表里,就整个反过来。读者会做错的第一个具体动作非常清楚:把重复次数从 3 次提到 30 次,然后把不确定度只按 s/√n 报,得到一个缩小到约 1/3 的数,据此宣布「测量精度提高了三倍,原来判不出的差异现在判得出了」,并把原先判超差的结论改判为通过。

为什么这是读反:s/√n 只压分量表里在重复条件下真的会变的那几行。凡是重复条件下不变的行——仪表示值误差(同一台表、同一个标定状态)、安装偏差(测点一次没动)、传感器时间常数 τ 造成的峰值削低、被测量定义口径带来的偏差、共用基准(同一个冷端、同一个参考压力、同一台标准器)的偏差——n 从 3 加到 30,一行都不动。把可压与不可压两部分分开写,重复 n 次取平均之后的合成标准不确定度就是 u_c(n) = √(u_可压²/n + u_不可压²):它随 n 增大趋于一个平台,平台高度由不可压分量决定,而读者以为它趋于 0。⇒ 由此得到本课在第 2 讲就交付的一条可执行判据:在决定加测之前先算平台高度——把分量表里不可压的那几行先合成一次,得到 u_不可压;若 k·u_不可压 已经大于你要判别的那个差异,那么加测多少次都判不出来,该换的是仪表、安装或方法,⛔ 不是次数。读者会做错的第二个具体动作是同一处读反的镜像:为了让 U 变小,把「反正它很小」的分量干脆不列进分量表——而一个分量到底小不小,只有列出来、乘上灵敏系数、算过它的贡献 |c_i·u_i| 之后才知道,第 4 讲那三类分量正是被这么整类漏掉的。⚠ 这条读反在本课被点破四次而不是一次:第 2 讲 2.3 用一整节点破它并给出平台判据;第 3 讲用分量表的两列把它落成表格结构;第 4 讲用 u_c(n) 的平台曲线给出定量形态;第 5 讲补一句边界——换人、换设备、换时间再测,压的是另一件事(再现性条件下的散布),它同样压不掉平台里的方法性偏差。

本课凡是要「列一张表」的地方——分量有哪些、异常值有哪几种成因、判据按什么分档、相关从哪里来、不一致怎么归因、对标不吻合怎么处置——一律先把全集画出来、再逐项核射程,⛔ 不顺着自己最熟的那条线索往下数。这不是讲究:沿单一线索枚举时漏掉的从来不是「少了一条」,而是整类不出现,而表面上那张表还是齐的、还是有头有尾。三个已经踩实的例子。其一,沿仪表精度表往下数分量(温度通道一行、流量通道一行、功率通道一行……),必漏三整类——安装与代表性引入的分量、数据处理引入的分量、被测量定义本身引入的分量,它们不在任何一张精度表上,因为精度表只承诺「表本身」那一环;第 4 讲整讲就长在这个漏洞上。其二,沿统计判据往下数异常值(3σ → Grubbs → Dixon → 箱线图),一个成因也数不出来——那条线索回答的是「怎么判」而不是「为什么会出现」,于是「判出来了就剔掉」成了默认动作;按成因建轴只有四类,而只有一类允许剔点其三,沿「是仿真错还是试验错」数对标不吻合的处置,必漏后三类,其中最要紧的一类是「两侧都对,但两条误差带重叠 ⇒ 本来就判不出」——它不是缺陷,是判据给出的正确答案,而它恰恰是沿那条线索永远数不到的一类。

顺带给一个可以自己复算的数学事实,它足以说明本课为什么必须从「先归因」而不是「先套判据」开始:标准化残差 |x_i − x̄|/s 存在一条只由样本量决定的上界 (n−1)/√n,与数据本身、与是否真有异常都无关;n=10 时这条上界是 2.8460,n=11 时才刚过 3.0151。⇒ n≤10 时 3σ 判据不是不够灵敏,是恒不报警。所以小样本下「跑了检验、一个点也没剔出来」不构成任何证据——动作做了、记录写了、闸也过了,而这个动作的检出能力是零。这是本课要打掉的第一个默认做法。

本课六讲要建立的是三个判断力,⛔ 不是一套公式。第一,拿到任何一个偏差,先判它在重复条件下变不变——这决定加测有没有用,也决定它进分量表的哪一列;⛔ 判据不是它被评成 A 类还是 B 类。第二,拿到任何一行分量,先算它的贡献再排序——分量表里真正可比的不是 u_i 而是 |c_i·u_i|,灵敏系数是个带量纲的单位换算器;一个 ±1% 的流量与一个很小的温差谁更要命,看的是两者的贡献而不是两个百分数。第三,拿到任何一个数,先问它的三件套齐不齐——这个数的 U 是多少?U 里的主导分量是什么?这个数能外推到哪一层?三问答不上任何一问,这个数就不该被写进结论。

六讲沿三件套的生成顺序铺。第 1 讲判「哪些点根本不该进这三件套」:剔点先归因、离群判据按样本量分三档、零点漂移与增益漂移要靠两点核查分开、滤波的峰值损失与多轮次时间对齐的残差各留下一行分量。第 2 讲把 U 拆成 A 类与 B 类两种评定方法,立起四格全集、全课统一的符号表、半宽到标准不确定度的除数,以及那条平台判据。第 3 讲给出从分量到 U 的完整算法:灵敏系数与一阶展开的适用边界、十一列分量表、按贡献平方拆账、相关项怎么处置、有效自由度决定包含因子 k。第 4 讲补三类最容易被漏掉或低估的分量——动态、相关、湿度;漏掉它们,U 会偏小而三件套看起来是齐的,这是最难被发现的一种错。第 5 讲把三件套从「一次测量」推广到「一套方法」:重复性、中间精密度、再现性、台架测量系统分析的简化用法、不一致归因的二分、实验室间比对,以及外推边界声明的固定四要素。第 6 讲用三件套重新定义「对标吻合」——吻合是两条误差带的关系,不是两个数的差;并收口到「报数即报三件套」这条本课唯一无条件的纪律。

两条体例先交代清楚。其一,符号在第 2 讲一次立好、全课统一:相关系数写 ρ_ij、重复性限写 r、再现性限写 R_re、决定系数写 R²、标准正态分位写 z_p、能力验证比分数写 Z_PT、t 分布分位写 t_p(ν)、灵敏系数写 c_i、比热写 c_p、温度写 T 并明标单位——⛔ 正文一律禁止裸写 r/R/z/c。这门课的读者要同时拿着两套记法读同一篇东西(一套里 r 与 R 是限值,另一套里 r 是相关系数、R² 是决定系数),撞名不是理论风险而是必然发生。其二,标准只用框架与去向:本课的评定框架按 JJF 1059ISO/IEC Guide 98-3(GUM)讲,重复性与再现性沿用 ISO 5725 体系的记法,离群判据的临界值须查 GB/T 4883ISO 16269-4,实验室间比对与能力认可涉及 ISO/IEC 17025——⚠ 本课只引用它们的框架与去向,⛔ 不写任何条款号与条款内容,条款内容与适用范围一律须按现行版本核;正文与图上也不给任何具体的临界值。反过来,凡是本课自己推出来或自己归纳的东西(重复性限的系数——本课从正态假设推得 2.7719,ISO 5725 体系惯用简记作 2.8,前者是推导值、后者是惯用值;平台判据;十一列分量表;异常值成因四类;外推声明四要素),正文都会写明它是本课归纳,⛔ 不写成任何标准既有。

⚠ 最后交代边界。本课刻意不覆盖的几件事,正文里每次用到都会写明去向:传感器本身的原理、装法与动态特性(含时间常数 τ 的模型与式子)见 L7-01 测量技术:热电偶/红外/PIV/流量测量,本课沿用它的符号、式子与舍入,只做「把那一截损失折成分量表里的一行」这一步;采集侧的布点、抗混叠、判稳判据与原始数据管理L7-02 数据采集、台架搭建与自动化测试,本课从「数据已经采到手」这一刻开始;校准证书怎么判读、溯源链怎么看、期间核查怎么做L7-06 传感器校准、量值溯源与台架期间核查,本课只用证书的结果,且证书超有效期的通道,其 B 类分量在本课框架下不成立;整车级洞—舱—路之间的折算、修正与达标判定L7-05 整车热试验结果的环境折算、修正与达标判定,本课只立层级归因与外推纪律的框架,⛔ 不给折算算法与判定限值;路试的策划、有效数据段筛选与结果有效性判定L4-04 整车道路试验通则:策划、车载数采与结果有效性判定一次性破坏试验(整包热扩散与滥用、外部火烧、底部撞击、爆破)——第 5 讲的重复性框架对它整体失效,因为样本被试验本身消耗、A 类评定无样本可用,单次样本的取样、判据与结果表达见 L1-11 不可逆危险试验的实施与管控:整包热扩散/滥用试验与可燃工质泄漏实测一阶偏导展开失效时改用的抽样(蒙特卡洛)与谱方法,以及仿真侧不确定度怎么量化J7-06 仿真不确定度量化(UQ)与稳健/可靠性设计:从确定性单点到带分布的裕度,本课只要求仿真侧也给出一条带、⛔ 不给它的方法;能量账本身的口径与拆项(控制体怎么切、热源清单怎么列)见 B4-01 整车能量流与热量流协同分析,本课只做判据带这一层;焓湿口径(比焓与含湿量的算式与系数)沿用 A2-04 湿空气物理与焓湿图:空调负荷计算基石,本课不另立一套;Python 脚本的工程化、版本控制与可交接Q3-01 热管理工程师的数据分析与 Python 脚本,本课只讲它与不确定度分析的接口;失效数据的寿命分布推断(分布拟合、置信度-可靠度-样本量换算、零失效样本量、加速条件下的置信传递)见 I6-04 可靠性目标、分配与寿命数据统计(TMS 可靠性量化入门)——⛔ k=2 的包含区间不是寿命置信下限,两者是不同的统计对象,不能混用。

第 1 讲 剔一个点之前,先回答"它为什么在那儿"

一组原始数据递过来,最常见的第一个动作是跑一遍离群检验,把报出来的点删掉,然后开始算均值。这一讲要把这个动作整个拆开重装。它拆出来的是三条互相咬合的判断:归因在判据之前——异常值按成因只有四类,而只有一类允许剔点;判据按样本量分档——最小的那一档里,工程上用得最顺手的那条判据在数学上根本不可能报警;清洗动作本身要留账——漂移修正、滤波、时间对齐、插值,这些看起来只是"把数据整理干净"的动作,每一个都往后面那张不确定度分量表里加了一行,而它们不在任何一张仪表精度表上。

⇒ 这一讲交付的不是一套清洗流程,是"值 + 扩展不确定度 U + 口径声明"这三件套的准入口:哪些点根本不该进这三件套、进来的那些又各自欠着什么账。后面五讲算的每一个 U,都建立在这一讲有没有把账记全上。

1.1 剔点之前必须先归因——四类成因里只有一类允许剔点

沿"3σ → Grubbs → Dixon → 箱线图"这条线索往下数,数出来的全是怎么判,一个为什么会出现都数不出来。于是"判出来了就剔掉"成了默认动作,而这个默认动作是本课要打掉的第一件事。

成因建轴——问的是"这个点还是不是同一个总体里的点"——只有四类,而只有第一类允许剔点

成因 现场特征(靠特征判,不靠阈值判) 正确动作
甲 记录与通道故障 丢帧、量程溢出截顶、断偶跳到满量程、编码错位、单位或标定系数写错;只在一条通道上出现且与物理无关,相邻冗余测点毫无反应 允许剔点,但必须同时记进数据有效性说明
乙 真实的物理瞬变 喘振、气阻、开阀冲击、快充切档;多条通道同时动,且动的方向合乎机理 禁止剔点
丙 工况没稳 判稳判据还没到就开始取数;整段数据带着单调趋势 不剔点,剔整段并回去补测
丁 试件状态变了 脱落、堵塞、泄漏、结霜;回不去了——后续数据不再与前面同分布 整轮作废

⚠ 这个四分法与四组现场特征是本课归纳的组织方式,⛔ 不是哪份标准既有的划分;它的价值在于四类的处置互不相通——把丙当甲处理,剔掉几个点之后剩下的仍然是一段没稳的数据,只是趋势被削得看不见了。

为什么归因必须排在判据前面:统计判据回答的是"这个点离群不离群",它对成因一无所知。把归因交给统计判据,等于把"这台机器到底发生了什么"这个问题,外包给了一个只会算距离的函数。而四类里被误剔代价最大的是乙类——真实峰值往往正是限值判定的依据,剔掉它之后报告上写着"未超限",而实物已经超了。这类错误还有一个恶劣的性质:它不留痕迹。剩下的数据更光滑、离散更小、看起来质量更高,任何只看散布的复核都会给它开绿灯。

四类的判别不给阈值——判它靠的是上表右列那组特征,不是"偏离多少个 s"。其中判稳判据的窗口长度与容差属平台相关量,由试验规程给出,做法归 L7-02 数据采集、台架搭建与自动化测试;本课只用它的结论"这一段算不算稳态",并且要求把这个判据本身也留成分量表上的一行(1.5 给出这一类的处置模板)。

易错点三个,全部发生在归因这一步被跳过之后:① 拿到一组数先跑离群检验,把报出来的点直接删掉;② 把"多条通道同时动"读成"几个通道一起坏了"——多通道同步响应恰恰是乙类的判据,不是甲类的;③ 剔了点但不记录,交付的数据集与原始数据无法互相定位。⚠ 第三条要说清边界:原始数据不可覆盖这条纪律本身归 L7-02 数据采集、台架搭建与自动化测试,本课只要求一件事——剔点动作作为一个参数写进最终的结果表达(剔了哪几个点、按哪一类成因剔的),它和 k 值、包含概率一样属于口径的一部分。

自上而下的归因决策链。顶部入口框写「一个点看起来离群」,向下第一道闸写「先归因,不许先跑判据」。闸下分出四条并列支路,每支一个方框并各挂一行现场特征:甲、记录与通道故障,特征是只在一条通道上出现、相邻冗余测点毫无反应;乙、真实的物理瞬变,特征是多条通道同时动且动的方向合乎机理;丙、工况没稳,特征是整段数据带着单调趋势;丁、试件状态变了,特征是回不去了、后续数据不再与前面同分布。四支各自向下接一个处置框,用四种底色区分并配图例:甲为绿色,写允许剔点并记进数据有效性说明;乙为红色,写禁止剔点,框内另加一行「剔掉它等于把结论抹掉」;丙为橙色,写剔整段并回去补测;丁为橙色,写整轮作废。图右侧另立一个灰框写「统计判据在这张图上的位置」,用一条虚线指向甲支路的下游,并标「判据只回答离群不离群,对成因一无所知」。四类成因的划分与四组现场特征均为本课归纳的组织方式,非某标准既有的划分。本图为结构示意,不含任何数值,不得据图读取任何量。
图1 一个看起来离群的点,先走归因这一关,再谈判据。要从图上读出三件事:① 归因这一步排在统计判据之前,四类成因里只有甲类允许剔点;② 四类各挂一组可核的现场特征,判别靠特征不靠阈值;③ 右侧那个灰框把统计判据挂在甲支路的下游——它不参与归因,只在成因已定之后回答"这个点离群不离群"。四类成因的划分与四组现场特征为本课归纳,非某标准既有的划分。本图为结构示意,不含任何数值,不得据图读取任何量。

1.2 标准化残差有一条只由 n 决定的上界——n≤10 时 3σ 不是不灵敏,是恒不报警

归因走完、确认这个点属于"可疑但成因未定"之后,才轮到判据。而工程上最顺手的那条判据(3σ/拉依达:标准化残差 |x_i − x̄|/s 超过 3 就判离群)在小样本下有一个几乎没人核过的性质。

从样本标准差的定义出发:Σ(x_j − x̄)² = (n−1)s²。这个和里任何单独一项的平方都不可能超过整个和,再考虑到 n 个偏差之和恒为零对单项的挤压,可以直接解出

|x_i − x̄|/s ≤ (n−1)/√n

⚠ 这是恒等式的推论:它与数据服从什么分布无关,与这组数里到底有没有异常也无关。换句话说,标准化残差这个统计量存在一条只由样本量决定的天花板,谁也顶不破。把它逐点算出来(纯数学,可自行复算,全课统一取四位小数):

n 3 4 5 6 8 10 11
(n−1)/√n 1.1547 1.5000 1.7889 2.0412 2.4749 2.8460 3.0151

n≤10 时这条天花板低于 3。也就是说,把 3σ 判据用在十个以内的重复数据上,无论那组数据长什么样、里面有没有一个离谱到不成话的点,判据都不可能给出阳性。这不是"不够灵敏"这种程度问题,是判据的值域与门槛不相交。n=11 时上界才刚刚爬过 3(3.0151),3σ 从这里起才开始有可能报警。

⇒ 由此得到一条可执行动作,一步就能做:拿到一组数,先算 (n−1)/√n;它小于你打算用的那个门槛(3、2.5……),这个判据这一轮就不必跑,直接改走非统计路线(1.3)。这条动作也顺带解释了为什么第二档必须查表——Grubbs 的临界值只有落在这条上界之下才有意义,而临界值表正是按 n 编制的。

这条数学事实翻译成报告语言,就是本课在数据清洗这一层要点破的那种虚假合规小样本下"跑了检验、一个点也没剔出来"不构成任何证据。动作做了、记录写了、走查也过了,而这个动作的检出能力是零——它和"我没做检验"给出的信息完全一样。⇒ 处置只有一条,把它做成固定句式:报告里凡出现离群检验的结论,一律写成

「n = __,判据 = __,该 n 下判据的检出上界 = __,结论 = __」

四段缺一不可,⛔ 不许只写结论。检出上界这一栏按上式随 n 现算,本课不给缺省值。

易错点:① 把这条读成"小样本不容易发现异常"——正确的读法是"用这个判据一个也发现不了";② 反向滥用:n≥11 之后 3σ 确实可能报警了,但"可以报警"不等于"报警就该剔",1.1 的归因仍要先做;③ 把上界当成实际残差的估计值——它是上界,⛔ 不得反过来用它论证"这组数的残差至少有多大";④ 把它当成正态性的证明——离群检验不检验分布,"没剔出异常"更不等于"数据符合正态分布"。

单幅折线图。横轴为样本量 n,整数刻度自 3 到 30,无量纲;纵轴为标准化残差,无量纲,自 0 到 4。主曲线为数学上界 (n−1) 除以根号 n,以实心点连线画出,随 n 单调上升。图中叠三条水平参考线,各带独立文字标签:3.0 标「3σ 门槛」、2.5、2.0。上界曲线与 3.0 线在 n 约等于 11 处相交,交点用一条竖直虚线标出并注「n=11 起 3σ 才可能报警」。曲线上标出五个带数值标签的点:n=3 为 1.1547、n=4 为 1.5000、n=6 为 2.0412、n=10 为 2.8460、n=11 为 3.0151。曲线下方到横轴之间的区域填浅灰并标「任何一个标准化残差都只能落在这条曲线以下」;3.0 线以上、曲线左段以外的区域标「n≤10 时这个区域是空的」。本图为解析计算图而非示意图,图上的无量纲值可据图读取;但它给出的是上界,不得据图反推任何一组数据的实际残差。
图2 标准化残差的天花板只由样本量决定。要从图上读出三件事:① 这条上界与数据本身无关,是 Σ(x_j − x̄)² = (n−1)s² 这个恒等式的直接推论;② n≤10 时上界低于 3.0 ⇒ 3σ 判据在这些样本量下恒不报警,"没剔出异常"因此不构成任何证据;③ 交点在 n=11,这是 3σ 开始有可能报警的最小样本量。本图为解析计算图而非示意图,图上的无量纲值可据图读取;但它给出的是上界,⛔ 不得据图反推任何一组数据的实际残差。

1.3 离群判据按样本量分三档选;n≤4 那一档统计判据整个缺席

有了上一节那条天花板,"小样本别用 3σ"就从一句经验之谈变成了可以自己复算的分档依据。三档如下——⚠ 它们是判据可用性的分档,不是精度的分档

  • n≤4:统计判据交白卷(上界最高只有 1.5000),只剩三条非统计路线;
  • n≈5~10:走 Grubbs 或 Dixon,按 n 与显著性水平查现行版本的临界值表;
  • n>10:3σ/拉依达才开始可用,且只作粗筛。

第二档里两个判据的分工(⚠ 这段分工说明是本课归纳的读法):Grubbs 用的是标准化残差,对单个离群点最灵;Dixon 用的是极差比,不需要算标准差,因而分母不会被离群点自己污染——两个可疑点凑在一起时,前者的 s 被这两个点抬高、灵敏度反而塌下去,后者更稳。⛔ 本课不给这两个判据的临界值表:临界值须按 n 与显著性水平查 GB/T 4883ISO 16269-4 的现行版本,本课只写去向、不写内容。至于显著性水平,常见做法有 0.05 与 0.01 两档,但它是一个方法选择而不是物性——⛔ 必须在试验方案里事先声明,不许看完数据再选。

第一档那三条非统计路线,各自要什么输入、各自的死穴在哪:

  1. 物理合理性核对——要一条机理约束:能量守恒、单调性、上下游温度顺序、相变点。它不需要任何统计量,所以样本量再小也用得上,是三条里唯一随时可用的一条。
  2. 冗余测点互证——要事先布好第二只表。⚠ 这是布点阶段就要决定的事(做法归 L7-02 数据采集、台架搭建与自动化测试),到了分析阶段再想已经晚了:n≤4 的数据集本身不含这条信息,事后补不出来。
  3. 与重复性限 r 比对——要这套方法此前积累的重复性标准差 s_r。两个读数之差超过 r,就判它们"不属于同一重复条件"。

三条路线的共同点,才是这一档的真正机理:它们都从测量之外引入了新信息。而这正是小样本下唯一的出路——n≤4 的数据自己不含足够信息来判自己,无论用什么算法都变不出来。

重复性限 r 与 s_r 的换算:两个独立读数之差的标准差是 √2·s_r(√2 = 1.4142),取双侧 95% 的标准正态分位 z_0.975 = 1.960,得

r = √2 · z_0.975 · s_r = 2.7719 · s_rISO 5725 体系惯用记作 2.8·s_r

⚠ 两件事必须写明:其一,2.7719 这个系数是本课从正态假设推出来的(推导就在上一句里,可自行复算),⛔ 不是标准原文里的既有数字;2.8 是工程上的惯用简记值,与 2.7719 同处出现时要分清哪个是惯用值。ISO 5725 的条款内容与适用范围须按现行版本核。其二,s_r 本身属平台相关量,⛔ 本课不给数——它是"方法 + 设施 + 人"的联合属性,取决于这套方法、这台设备与这个被测量,须由本试验室的历史数据统计给出。

⇒ 这一档最要紧的一条纪律:超限之后的正确动作是补测,⛔ 不是剔点。r 给出的结论是"这两个读数不属于同一重复条件",它没有说是哪一个不属于;n≤4 时你也拿不出第三条证据去判。

易错点:① 先看数据再选显著性水平——那等于给自己发一张想剔就剔的许可证;② 用 Grubbs 连续剔多次却不重算临界值(每剔一次 n 就变了,临界值跟着变);③ 把别的实验室或供应商给的 s_r 直接拿来用;④ 用 r 去判"不同人、不同设备、不同时间"的两个读数——那要用再现性限 R_re(第 5 讲);⑤ 超限之后剔掉那个"看起来更离谱"的读数。

自上而下的判据选择决策链。顶部入口写「已归因为可疑点,现在选判据」,向下第一个判断菱形问「n 是多少」,分三条出口。左支为 n 小于等于 4,接一个方框列三条非统计路线:物理合理性核对、冗余测点互证、与重复性限 r 比对;方框下再接一个处置框写「超限则补测,不是剔点」。中支为 n 约 5 到 10,接方框写「Grubbs 或 Dixon,按 n 与显著性水平查现行版本临界值」,方框内用括号注明两者分工——Grubbs 用标准化残差、对单个离群点最灵,Dixon 用极差比、分母不被离群点污染;方框旁挂一个灰色小框写「临界值本课不给,只写去向」,框内只出现两个标准号 GB/T 4883 与 ISO 16269-4。右支为 n 大于 10,接方框写「3σ 或拉依达可作粗筛」。三条支路下方共用一条横贯的提示带,写「显著性水平须在方案里事先声明,不许看完数据再选」。图左侧另立一列窄框写「上一步:归因(见前一图)」,用虚线接到入口。三档的分界 4 与 10 只作为样本量的分段标注出现,其依据是前一图给出的数学上界。Grubbs 与 Dixon 的分工说明为本课归纳。本图为结构示意,不含任何数值,不得据图读取任何临界值。
图3 判据是按样本量选的,三档之间不是精度差别而是判据可用性差别。要从图上读出三件事:① 三档的分界来自前一张图那条数学上界,不是习惯;② n≤4 那一档里统计判据整个缺席,只剩三条从测量之外引入信息的路线,且超限的动作是补测而不是剔点;③ 临界值本课只给查表去向,显著性水平必须在方案里事先声明。Grubbs 与 Dixon 的分工说明为本课归纳,非标准既有。本图为结构示意,不含任何数值,⛔ 不得据图读取任何临界值。

1.4 零点漂移与增益漂移是两回事,单点核查在数学上分不开它们

清洗的第二件事是系统性偏差。把仪表的输入输出写成线性模型

y = (1 + g)·x + b

其中 b 是零点漂移(全量程上的一个常数平移),g 是增益(量程)漂移(一条随读数放大的斜率变化)。⚠ 只在一个点上做核查,你拿到的是 g·x + b 这一个数——两个未知量、一个方程,无解。这不是精度不够,是信息不够。

取量程内相隔足够远的两点(惯用做法是接近下限与接近上限各一点)核查,得到两个偏差 e_低 与 e_高,解一个二元一次方程组就分开了:

g = (e_高 − e_低)/(x_高 − x_低)  b = e_低 − g·x_低

分不开就修不对,而修错的方向是有规律的:把增益漂移当零点漂移去修,量程低端被修过头、高端仍然偏;反过来把零点漂移当增益漂移修,会在低端制造出一个原本不存在的偏差。⚠ 热管理试验里最吃这一口的是温差类被测量:两支表的零点漂移在做差时会部分相消,而增益漂移不会——它随读数放大,两支表的读数不同,相消不掉。这意味着"零点看着还行"这条常用的自我安慰,恰恰对温差类被测量最没有价值。

⛔ 漂移量 b 与 g 本课不给数:它们取决于器件、使用时长与环境,须由本台架的期间核查数据给出。核查怎么做、多久做一次、超差怎么追溯,归 L7-06 传感器校准、量值溯源与台架期间核查;本课只用核查的结果

修完之后还欠一行。这是钉子 A 与钉子 B 的第一个交汇点,也是本节真正要立的判据:漂移一经修正,修正量的不确定度 u(Δ) 必须作为一行 B 类分量进分量表。⛔ 修正过 ≠ 该分量归零。

理由在于修正这个动作到底做了什么:它把偏差的期望移到零,散布原样留下。任何修正值 Δ 都有它自己的不确定度,来源有三段——核查所用标准本身的不确定度、核查时的读数散布、以及"上一次核查到本次试验之间又漂了多少"这一段外推。⇒ 修正之后的正确表达是

读数 + Δ ± u(Δ)

分量表里为它单开一行:评定类型多为 B 类(数来自证书或核查记录,不是本次统计出来的),重复条件下不可压——同一个标定状态测一百次,这一行一动不动。工程上流传最广的那句"这个表校过了,所以没有误差",错的正是这一步:校准提高的是正确度,它不改善精密度,也不会因为"我已经修过了"而从表里消失。⛔ u(Δ) 本课不给数——它由校准证书给出的 U 与 k 反算,证书判读与溯源链归 L7-06 传感器校准、量值溯源与台架期间核查,本课只用其结果(第 2 讲把这个接口讲完整);期间漂移那一段外推同属平台相关量,须由本台架的核查历史给出。

易错点:① 只在零点做一次核查就宣布仪表正常;② 修正之后把该行从分量表里删掉;③ 用证书上的 U 直接当 u(忘了除以 k);④ 把"两次核查之间读数变了"直接判成仪表漂移——先排除被核查的那个标准本身变了、以及两次核查的环境条件不同;⑤ 把"干脆不修正"当成偏保守的做法——未修正时该项的期望不为零,那是一个偏差而不是一个不确定度,正确的次序是先修正、再评它的散布。

双联横排两格图,两格共用同一套归一化坐标。左格横轴为真值 x,归一化 0 到 1,无量纲;纵轴为仪表输出 y,同样归一化。左格画四条线,各带独立文字标签与引线:理想线 y 等于 x 用细虚线;纯零点漂移线 y 等于 x 加 b,与理想线平行上移;纯增益漂移线 y 等于 1 加 g 乘 x,过原点而斜率变大;两者并存线 y 等于 1 加 g 乘 x 再加 b。右格为同一坐标系,只画两条核查点连线,标出量程下端与上端两个核查点用空心圆表示,并用两条竖直标注线标出两点各自的偏差量 e 低 与 e 高;框内写出分离式 g 等于 e 高减 e 低再除以 x 高减 x 低、b 等于 e 低减 g 乘 x 低。右格另加一个红色小框写「只核一个点时:一个方程两个未知量,分不开」,用一条箭头指向左格中两条不同漂移线在单点处相交的位置。示例所用的 g 与 b 取值为教学假设值,只为把四条线的形态画开而设,不对应任何仪表。本图为归一化教学图,不得据图读取任何具体的漂移量。
图4 零点漂移与增益漂移的形态不同,而单点核查看不出这个不同。要从图上读出三件事:① 零点漂移是全量程上的常数平移,增益漂移是斜率变化;② 在单个核查点处,两条不同的漂移线可以给出同一个偏差 ⇒ 单点核查在数学上分不开它们;③ 取量程内相隔足够远的两点,用右格那两个式子即可解出 g 与 b。图中 g 与 b 为教学假设值,不对应任何仪表,⛔ 不得据图读取任何具体的漂移量。

1.5 后处理滤波的截止频率有下界;被削掉的那一截要变成分量表上的一行

滤波器是整条链上唯一一个设错了看起来反而更好看的环节:曲线变干净了,而峰值被压低、峰值时刻被推后——两者都直接改判结论。所以它的参数不能"调到看着顺眼为止",得有下界。

后处理滤波的截止频率 f_c 有一条由被测过程定的下界,两种输入形态各有一条式子:

  • 知道被测过程的时间常数 τ ⇒ 一阶型过程的 −3 dB 转折频率就是 f_c = 1/(2πτ),取它的数倍,把幅值衰减压到可忽略;
  • 只知道波形上升有多快 ⇒ 单极点系统的 10%~90% 上升时间与带宽满足 f_−3dB · t_r = ln9/(2π) = 0.3497(工程上简记为 0.35),于是 f_c ≥ 0.35/t_r 量级。

两条式子说的是同一件事,只是入口不同。⛔ 低于这条下界,滤掉的就不再是噪声而是信号本身。⚠ 0.3497 与 f_c = 1/(2πτ) 是纯数学,可给准确值;而 τ 与 t_r 本身属平台相关量,⛔ 本课不给数——须由被测过程实测,或由传感器的动态标定给出。

L7-02 数据采集、台架搭建与自动化测试 的边界:那门课讲的是采集侧的模拟抗混叠滤波器,它的 f_c 被两侧夹死(下界保峰值、上界是采样率的一半);本课讲的是数据已经采到手之后的后处理数字滤波——上界那一侧已经不存在(不可能再发生混叠),只剩下界这一侧。少了一侧约束,却多了一件采集侧没有的活,就是下面这条。

本课在滤波这件事上的净新增只有一条:把同一段数据滤波前后的峰值之差量化出来,写成分量表上的一行。它是数据处理引入的分量,不在任何一张仪表精度表上——所以沿着"温度通道一行、流量通道一行、功率通道一行"这条线索列表,它整类不出现,而表看起来是齐的。

做法固定四步:

  1. 取含峰的那一段原始数据;
  2. 用选定的 f_c 与滤波器型式滤一遍;
  3. 记录 |峰值_原 − 峰值_滤|,以及峰值时刻的偏移量;
  4. 把这个差按矩形分布(半宽取该差值)折成标准不确定度进表,即除以 √3 = 1.7321;评定类型 B 类,重复条件下不可压

⚠ 第 4 步里"取矩形分布、半宽取该差值"是本课归纳的偏保守处置约定,⛔ 不是哪份标准规定的做法;采用它的理由是这个差的符号与大小对同一段数据是确定的,我们只知道它的量级、不知道它在区间内怎么分布。⛔ 峰值损失量本身不给数——它由本次数据与本次 f_c 现算,不许沿用任何经验百分数。

⇒ 这一行同时给出一条自检:如果它的贡献 |c_i·u_i| 排进了前三名,说明 f_c 选得太低,回去重滤。也就是说,滤波参数不再是"手感",它有了一个可以被分量表反过来质询的出口。

⇒ 更要紧的是,这四步是一整类分量的处置模板凡是数据处理里做过的选择,都要留下一行分量——时间对齐(1.6)、插值(1.6)、稳态段截取判据、拟合与外推,全部照此办理。这一类分量在第 1 讲产生、到第 3 讲搭分量表时才结账,中间隔着两讲,是最容易掉的一类。

易错点:① 把 f_c 按"看着顺眼"调;② 用同一个 f_c 处理稳态段与瞬态段(稳态段可以滤得狠,瞬态段不行);③ 忘了零相位滤波与单向滤波对时刻的影响不同——判到达时刻的量必须用零相位滤波,否则时刻整体被推后;④ 只记录"滤过"而不记录滤掉了多少;⑤ 把峰值损失当成随机分量(它对同一段数据是确定的,属系统性,加大 n 压不掉);⑥ 用滤波后的曲线去反算"真实峰值"——那需要反卷积,属另一类方法,本课不做。

双联竖排两格图,上下格各自独立横轴。上格横轴为归一化时间 t 除以被测过程的时间常数,范围 0 到 6,无量纲;纵轴为归一化幅值,0 到 1.1。上格画一条含单峰的原始信号,用细实线,峰值归一化为 1.0;另画三条经不同截止频率的一阶低通滤波后的曲线,无量纲截止频率取 0.5、1、3 三档,用粗细区分,每条在峰顶处用竖直标注线标出它的峰值保留量并各带独立文字标签。上格另用一个水平双箭头标出峰值时刻的右移量,标注「时刻被推后」。下格横轴为无量纲截止频率,0.2 到 10,对数轴;纵轴为峰值保留率,0 到 1;画一条随截止频率上升的单调曲线。曲线上用一条水平虚线标出保留率 0.99,并向下引一条竖线到横轴,标出对应的截止频率下界。纵轴右侧另加一条平行的第二纵轴,标「1 减保留率,这一截进分量表,取作半宽」。下格右下角画一个小方框,列出分量表里对应的那一行的五个字段:分量名为滤波峰值损失、评定类型 B、可压性为不可压、分布为矩形、除数为 1.7321。原始信号为解析构造的单峰波形,滤波器统一取一阶低通。本图为归一化教学图,不得据图读取任何具体的峰值损失百分数用于工程判定。
图5 滤掉的那一截不会消失,它换个地方出现在分量表上。要从图上读出四件事:① 截止频率越低,峰值被压得越狠,且峰值时刻被推后;② 保留率随无量纲截止频率单调上升,存在一个使损失可忽略的下界;③ 被削掉的那一截要作为一行分量进分量表,半宽取滤波前后的峰值之差;④ 该行的评定类型是 B 类、重复条件下不可压——加大重复次数压不掉它。矩形分布与半宽取法是本课归纳的偏保守处置约定。本图为归一化教学图,波形为解析构造波形,⛔ 不得据图读取任何具体的峰值损失百分数用于工程判定。

1.6 多轮次时间对齐先定锚点再插值,两项各留一行分量

多轮次数据要放到同一条时间轴上比较时,顺序是硬的:先选锚点,再做插值。⛔ 不能靠插值去凑对齐。插值只负责把两条不同采样率的序列放到同一个时间栅格上,它不含任何关于"两轮的零时刻在哪"的信息;用它去凑,凑出来的是一个看起来对上了的结果。

三种锚点的性质完全不同,残差来源也完全不同(⚠ 这个三分与各自的残差来源是本课归纳的读法):

锚点 残差从哪来 相对优劣
外部同步脉冲 只有采样分辨率量级 最好,但要求硬件支持
可识别的物理事件(开阀冲击、加热起始拐点) 取决于该事件本身的陡峭程度与识别算法 次之,事件越陡越可靠
控制指令时刻 指令到执行之间整条执行链的延迟 最差

第三种最差的理由值得单说:那段执行链延迟本身就是被测对象的一部分。拿它当零点,等于把被测对象的一个动态特性偷偷折进了时间轴,而后面所有基于时间轴的判读都会带着它。

插值这一步则有方向性:线性插值在峰值附近会削峰,样条插值可能过冲。两者的偏差方向相反,所以"随便选一个"不是中性选择——判峰值的量尤其不能在峰附近用线性插值。

⇒ 危险之处在于这两项误差都会伪装成物理现象:两条曲线错开一点,做差之后会出现一个看起来很像真实滞后的偏差,而它其实只是对齐没做好;峰被插值削掉一点,看起来就像是这一轮的工况轻一些。⇒ 处置照 1.5 那个模板办:对齐残差与插值误差各留一行分量,同属"数据处理引入的"那一类。

⛔ 残差量级本课不给数——它取决于锚点类型、采样率与事件陡峭度,须由本次数据现算。跨系统对时的硬件做法归 L7-02 数据采集、台架搭建与自动化测试;路试场景下的跨系统对时与环境窗口不可控这件事,归 L4-04 整车道路试验通则:策划、车载数采与结果有效性判定

易错点:① 用控制指令时刻当锚点却不扣执行链延迟;② 在峰值附近用线性插值;③ 对齐之后不复核——正确的复核是拿另一个独立的物理事件去验,看它是不是也对上了;只用同一个锚点自证,永远是对的。

三条平行的时间轨道,自上而下依次为轮次 A、轮次 B、参考栅格,横向为时间,时间轴只表示先后与相对间隔、不标任何刻度值。三条轨道上各画同一组事件标记:外部同步脉冲用细竖线、可识别的物理事件用三角形并画在一个陡峭上升沿的拐点处、控制指令时刻用方块。轨道之间用三组不同线型的连线表示三种锚点方式的对齐结果,每组连线右端接一个方框写它的残差来源:外部同步脉冲对应残差只有采样分辨率量级;物理事件对应残差取决于事件陡峭度与识别算法;控制指令对应残差里含整条执行链的延迟,框内另加一行「而那个延迟本身就是被测对象的一部分」。图下方另设一条窄带画插值:同一段峰附近,画线性插值结果为折线、峰被削平,画样条插值结果为曲线、峰略有过冲,两者各带独立文字标签并标出与真实峰的差。最右侧竖排一个灰框写「对齐残差与插值误差各留一行分量」,用两条虚线分别连到对齐区与插值区。三种锚点的划分与各自的残差来源为本课归纳的组织方式。本图为时序示意,各段间距与波形陡峭度不代表任何实际时间比例,不得据图读取任何时间或残差。
图6 对齐先于插值,而两者各欠分量表一行。要从图上读出三件事:① 三种锚点的对齐残差来源完全不同,控制指令时刻最差,因为它把整条执行链的延迟混了进来;② 插值在峰值附近有方向性——线性削峰、样条可能过冲,两者偏差方向相反;③ 对齐残差与插值误差都属"数据处理引入的"那一类分量,各留一行。三种锚点的划分与残差来源为本课归纳。本图为时序示意,各段间距与波形陡峭度不代表任何实际时间比例,⛔ 不得据图读取任何时间或残差。

1.7 x̄ 与 s 是描述量不是结论:报它们之前,先说清这 n 个数的条件

清洗做完,手上是一组"可以一起算"的数。这一节要立的是凭什么它们可以一起算

两个式子本身没有争议:

x̄ = (1/n)·Σx_i  s = √[Σ(x_i − x̄)²/(n−1)]

分母取 n−1 而不是 n,理由是 x̄ 本身是从这组数里估出来的,已经用掉了一个自由度 ⇒ ν = n−1。⚠ 这个数不是记号上的讲究,第 3 讲算有效自由度、进而定包含因子 k 时,A 类分量的 ν_i 就取它。

要紧的是这两个量的地位:它们是描述量,不是结论。s 的含义完全取决于取这 n 个数的时候,哪些条件被固定住了

  • 同一次装夹、同一个工况点、同一个操作者、同一台设备,短时间内重复读 n 次 ⇒ s 描述的是重复性散布;
  • 中途重新装拆过、换过工况点、换了人或换了天 ⇒ s 里就混进了别的东西,它描述的是条件的变化而不是测量的散布。

后一种情形里,s 变大不是"这次测得不准",而是"这几个数本来就不该放在一起算"。而 s 又恰恰是后面一切 A 类评定的入口——它错了,第 2 讲的 A 类分量、第 3 讲的合成、第 5 讲的重复性再现性判读会一路错下去,且沿途没有任何一步会报警。

⇒ 可执行动作只有一条,代价极低:任何一处 s 的旁边都要标它的条件(重复性条件/中间精密度条件/再现性条件),⛔ 不许出现无条件标注的 s。这条纪律在第 5 讲会被再用一次,那时三组条件下的 s(s_r/s_中间/s_R)要并列摆出,各自标明它是哪一组条件下取的。

⛔ s 本身属平台相关量,本课不给数。⚠ 这一节里可给准确值的只有两个纯数学事实:分母取 n−1、自由度 ν = n−1;另有下一讲要用的均值标准误差 s_x̄ = s/√n——⚠ 它是本课那根反钉子的落脚点,第 2 讲会正面拆它。

易错点:① 在同一张表里混用不同条件下的 s,却不标条件;② 用总体标准差的公式(分母取 n)算样本标准差,把 s 系统性算小;③ 把"s 小"当成"测得准"——s 只描述精密度,正确度要靠别的证据(第 2 讲的四格靶盘会说清这两件事为什么不能互相代替)。

本讲小结:一个看起来离群的点,先过归因这一关,四类成因里只有"记录与通道故障"允许剔点,其余三类分别是禁止剔、剔整段、整轮作废(1.1);标准化残差存在只由 n 决定的上界 (n−1)/√n,n≤10 时它低于 3 ⇒ 3σ 判据恒不报警,"没剔出异常"因此不构成任何证据,报告须写成四段式(1.2);判据按样本量分三档,n≤4 那一档统计判据缺席,只剩物理合理性、冗余测点、与重复性限 r 比对三条从测量之外引入信息的路线,超限则补测(1.3);零点漂移与增益漂移要靠两点核查分离,修正之后 u(Δ) 仍要作为一行 B 类不可压分量进表(1.4);后处理滤波的 f_c 有下界,被削掉的峰值差要按矩形分布折成一行分量,这也是"数据处理引入的分量"这一整类的处置模板(1.5);时间对齐先定锚点再插值,两项各留一行分量(1.6);x̄ 与 s 是描述量,报它们必须同时报条件,ν = n−1 会在第 3 讲定 k 时再出现(1.7)。⇒ 这一讲把该剔的剔掉、该记的记下,留给第 2 讲的是一组干净的数和一张已经开了头的分量表——接下来要回答的是,表上每一行的数究竟是怎么来的。

后面还有 5 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做

会员专属

后续为会员深水区内容——四库数据与深度拆解。

查看会员方案