TMS BOOK · ACADEMY 讲义

诊断与保护阈值的整定、验证与复验

大纲的完整展开版——讲师授课蓝本 / 学员自学材料

K5-07 诊断与保护阈值的整定、验证与复验

课程代码 K5-07 · 板块 K 控制、软件与标定 / 诊断与故障管理 时长 约 3.5 小时(8 讲) 前置 K5-01 OBD/UDS 诊断与故障码(DTC)设计;K5-02 热管理故障处理与降级策略;K6-01 热管理标定流程与工具(INCA/CANape);体系外前置(需自备):基础概率统计(分布与分位数、重尾识别、检出率与误报率的概念、样本量与显著性)与电子表格/pandas 级的数据透视与拟合操作 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 K5-07 大纲的完整展开版


按任务导航

你手上的事 直接看 还要配
给一条新诊断定阈值,手上只有一台标定车的数据 第 2 讲:哪些段进分布、为什么按车计数 第 3 讲(裕度二选一 + 换成每车每小时的频次)
判「阈值取这个数,故障坏到什么程度才报得出来」 第 4 讲:注入按严重度分档、门槛处至少两点可插值 第 3 讲(先有一版阈值,曲线才画得出来)
配去抖周期数与成熟度计数,或判这条码挂不挂安全目标 第 6 讲:四量联立预算表、检测时间允许计入哪几段 第 5 讲(安全相关先过硬约束再谈代价)
治一条售后频次居前的码 第 8 讲:三量联合读数、四格判读、先分岔再动参数 第 6 讲(不挂安全目标时先动哪个量)
审一份别人交来的阈值整定记录 第 1 讲:六格规格,说不出产出动作的格就是没做 第 7 讲(末格「复验触发条件」写什么)

本课不覆盖:保护类阈值的取值(有物理安全边界可反推的那一类)→ K6-03 电池热管理标定 K3-02 空调温控与压缩机转速/过热度控制(制冷与制热两模式) K6-02 空调与制冷系统标定——★ 本课标题带「保护」二字,而它的取值恰恰不在本课,这是最容易一开头就走错的一步;误差预算的合成规则 → K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值,布置代表性与在线校零 → K1-03 传感器布置、冗余与信号可靠性;使能窗口取值、定位粒度与抑制矩阵 → K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁;迟滞带与滤波的整定次序 → K1-01 热管理传感器信号处理与故障诊断 K3-01 整车热管理控制策略总览与模式管理;DTC 状态机与去抖判据的形式 → K5-01 OBD/UDS 诊断与故障码(DTC)设计;降级策略与故障容错时间的定义拆分 → K5-02 热管理故障处理与降级策略;故障注入的台架实现 → K4-03 MIL/SIL/HIL 验证流程;索赔与返回件的统计口径 → M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计;样本量显著性、参数限幅、灰度放量与回滚门限 → K7-02 软件定义热管理与 OTA 迭代,灰度车的信号覆盖 → K7-04 车队数据回流的车端实现:信号表定义、事件抓帧与带宽/存储预算;判据够不够、残余风险谁签放行 → K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法;标定工具与试验设计本体 → K6-01 热管理标定流程与工具(INCA/CANape)以及任何一个具体的阈值数、裕度倍数、去抖周期数、成熟度计数与误报频次目标值——它们全是平台相关量,由本项目自己的车队数据与所引标准现行版本给出,⛔ 本课一个数都不给(本课给的是每个量的取法:算式、取数去向、反解链,或标明「教学假设」的算例)。

引言:你要标的那件事,在正常数据里一次都不出现

标定一个 PID 增益或一张二维 MAP,动作是清楚的:把工况铺开,扫点、拟合响应面、找最优。这条路走得通,靠的是一个几乎没人明说的前提——你要优化的那个目标量,在正常运行的数据里天天出现,所以你测得到它,也就调得动它。

诊断阈值不是这样。一条冷却液温度合理性判据要抓的那个异常,在一台健康车的正常数据里出现次数是零;把整个工况空间扫遍也扫不到它。⇒ 扫点寻优这条路在这里从根上不成立,不是数据不够多,也不是工具不趁手。

钉子:标定对象是「不该发生的事」⇒ 只能两侧取样,两侧缺一不可

目标事件在正常数据里不出现,就意味着阈值的两个边界只能从两批不同的样本里分别取:

  • 误报侧——用多车多环境的正常工况分布回答「这条线画在哪儿,正常车不会碰到它」(第 2、3 讲);
  • 漏报侧——用按严重度分档的故障注入与真实失效样本回答「这条线画在哪儿,该报的时候报得出来」(第 4 讲)。

阈值落在两者之间;具体偏哪边,由误报与漏报的代价不对称决定(第 5 讲)。只做一侧的整定都不成立:只看正常数据,得到的是一个「不会误报的阈值」,它可能根本报不出故障;只看故障样本,得到的是一个「一定报得出的阈值」,它在量产车队上会报满屏。

★ 这两种失败之所以能一路走到量产,原因是同一个:它们在各自那一侧的指标上都很好看。一份只做了半边的整定报告不会自己露出破绽——破绽只在另一侧,而那一侧根本没被测过。所以本课的交付物不是一个数,是一张把两侧都摆出来的阈值整定记录(六格,第 1 讲立起来);一格说不出是哪个动作产出的,那一格就是没做。

★ 反钉子:「安全相关的诊断,宁可错报、不可漏报 ⇒ 阈值往灵敏侧压、去抖往短里配」

这句话的前半句站得住:挂在安全目标上的诊断确实有一条硬约束——从故障发生到反应完成必须落在故障容错时间间隔 t_FTTI 之内(定义与向下拆分归 K5-02 热管理故障处理与降级策略),这条约束排在代价账之前,⛔ 不许拿代价最优去换它。正因为前半句对,后半句才格外贵:它把一个关于后果的判断,直接接到了四个各有判据的取值动作上,中间那四道判据被一次跳过。读者据此会做四个具体动作,四个都是反的。

动作一:把阈值一直往灵敏侧压。 反在——误报不是零成本,而且它的代价不是线性的。误报频次越过某一点之后,这条码在使用它的人那里失效:报了也没人当回事,有效漏报率跳到 1。而期望代价式 C(x_th) = P_FA·C_FA + P_MD·C_MD 在那一段仍然拿一个很小的漏报概率 P_MD 在算,于是它会继续建议往灵敏侧走。⛔ 这不是精度问题,是模型在那一段不成立。⚠ 那个「某一点」在哪儿是平台相关量,而且本课判定它本身就不是一个该去测的量(它取决于用户群体、这条码的用户可见性与竞品对比,测出来也不稳定)⇒ 正解不是去测它,是改结构绕开它:把单一阈值拆成一组分级阈值,低代价动作(记录、提示、抓帧)用高灵敏度换早发现,高代价动作(降功率、限充、要求进站)用高置信度换低误报,每一档分别定误报预算(第 5 讲)。

动作二:把去抖连续周期数 N 往短里配,再用「单次越界概率的 N 次幂」证明这样也不会误报。 反在——滤波后的残余噪声是自相关的,一次置码判定的误报概率 p_conf 与单次越界概率 p_1 之间恒有 p_conf ≥ p_1^N,等号只在严格独立时成立 ⇒ 幂律估计恒偏乐观,也就是恒偏危险侧。⚠ 偏差的方向是数学必然,幅度取决于滤波时间常数与判定周期之比以及噪声本身的相关结构,是平台相关量、必须实测,⛔ 本课不给。更麻烦的是这条错在台架上几乎不暴露——台架的噪声结构不是车队的噪声结构,按幂律配出来的 N 在台架上一次误报都不会有。⇒ 校核动作是可执行的一步:拿同一批正常样本,直接数「连续 N 个判定周期都越界」发生了多少次,除以判定机会数,与幂律估计并排写进记录(第 3 讲)。

动作三:既然宁可错报,就注一个「坏透了」的样本,报出来就签字。 反在——那样得到的是一个「一定能检出、但要等到很严重」的阈值:检出率随严重度的曲线上只有一个点,无法插值,可检出严重度门槛 s_th 根本没有被测出来,而误报侧一个字都没碰。故障注入在本课的定位与它在验证流程里的定位不同:那里它是验收手段(注进去看诊断报不报),这里它是取样手段(注一族不同严重度的故障,反推「阈值取多少,才能在目标严重度上就检出」)。⚠ 这一处用途差异必须在交付文档里显式写明,否则评审会按验证的验收标准来要求这一批注入数据(第 4 讲)。

动作四:去抖短了误报冒出来,于是抬跨循环成熟度计数 n_conf 去压。 反在——对挂安全目标的诊断,检测时间 t_detect 里只允许算 t_filter + N·T_task 这一段;n_conf·T_cycle 要求「跨几个驾驶或操作循环复现」,那意味着要等用户下一次开车,这个时长不由系统决定,也无法承诺,⛔ 绝不能计入 t_detect。⇒ 安全相关诊断只能在阈值与去抖这两个量之间换,跨循环成熟度这个最便宜的降误报手段对它不可用(第 6 讲)。⚠ 反过来也别读成「成熟度计数对安全相关诊断没用」——它仍然决定这条码什么时候进 confirmed、什么时候进售后视野,只是不进检测时间;把它直接设成最小值会丢掉售后侧的抗偶发能力。

⚠ 反向也要说清,免得被读成另一个极端:本课⛔ 不主张往保守侧偏。工作点该偏哪边,由单次漏报代价与单次误报代价的比值 C_MD/C_FA 的量级按三档读——≫1 往灵敏侧偏、≈1 两侧对称、≪1 往保守侧偏,⛔ 不由「宁可错报」或「宁可漏报」任何一个单调偏好定(第 5 讲)。

今天就能用的一条:拿到任何一条已经在跑的诊断阈值,先问三句——

  1. 定这个数用了几台车? 一台就是单车散度,它系统性小于车队散度——车间装配散差、传感器批次偏置、安装位置差异全部漏在「正常」之外了。
  2. 它的误报预期是多少「每车每小时」? 只答得出「几倍标准差」或某个分位数的,等于还没有验收语言:整车侧与售后侧从来只认频次。
  3. 这个数往严重度轴上退,退到哪一档就报不出来了? 答不上来,说明漏报侧一个点都没测过。

三句里有一句答不上来,这条阈值就只做了半边——而半边的整定,在它自己那一侧的指标上永远好看。

本课的射程

输入是一条判据结构已经定型的诊断:被诊断量是什么、残差怎么构造、使能条件由谁给,这些在本课之前就定了(判据结构与残差构造归 K3-10 热管理在线状态与负荷估计:观测器整定、软测量置信度与退出条件,使能窗口的取值归 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁)。输出是一份可交付、可审计、可再整定的阈值整定记录,以及一条从售后读数回到参数修订的闭环(第 8 讲)。

本课一个阈值数都不给——阈值、裕度倍数、去抖周期数、成熟度计数、目标误报频次、目标检出率,全是平台相关量。本课给的是它们各自的取法:算式、取数去向、反解链,以及标明「教学假设,不对应任何平台」的算例。★ 教学算例里唯一可以给出准确值的一族数是标准正态分布的单侧超越概率——它是数学常数,可由误差函数逐点复算;而给出它的目的恰恰是让你看到,照 kσ 往重尾分布上外推会得到多乐观的一个数(第 3 讲)。

⚠ 另有两条边界先说清。其一,保护类阈值不在本课:那一类有明确的物理安全边界可以反推(电池的三态切换与降功率滞环归 K6-03 电池热管理标定,制冷回路的红线归 K3-02 空调温控与压缩机转速/过热度控制(制冷与制热两模式),空调回路的实例化取值归 K6-02 空调与制冷系统标定),走的是另一条链;本课的对象是只有统计边界、没有物理边界的诊断类阈值。其二,本课到工作点选定为止——这条判据本身够不够(场景覆盖到什么程度算够、残余风险凭什么被接受、谁签放行)归 K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法

全课路线

  • 第 1 讲 分野与归属:待整定量按「目标事件出不出现」×「有没有可反推的物理边界」四格分流;三个「阈值」名词与两个「老化」当堂消歧;阈值下界的三个来源为什么要取大者;本课交付物的六格形态。
  • 第 2 讲 误报侧取样:散差分几层、为什么必须多车多环境;哪些样本段不进分布、每一类被剔的理由;计数单位为什么是车而不是行程。
  • 第 3 讲 误报侧取值与频次换算:先画分布与 QQ 图再决定用 kσ 还是经验分位数;把裕度换成「每车每小时」的误报频次;独立性校核;基线滚动自适应必须设死的两条上限。
  • 第 4 讲 漏报侧:故障注入换个用法当取样手段;注入谱按严重度分档、门槛处至少两点可插值;检出率曲线与可检出严重度门槛;两侧区间为空是一条真结论而不是整定失败。
  • 第 5 讲 工作点:代价不对称时该偏哪边;线性加权在什么条件下失效;把一个阈值拆成一组分级阈值,每档分别定误报预算。
  • 第 6 讲 四量联立:阈值、去抖时间、成熟度计数与故障容错时间并进一张预算表;挂不挂安全目标决定走哪条路;等误报率下三个量怎么互换。
  • 第 7 讲 复验:极端环境与全寿命各要复验哪些项;触发条件写成清单式而⛔ 不是日历式;每一条触发各要重跑哪几步。
  • 第 8 讲 现场再整定:售后频次分布、NTF(无故障返修)率与误换件率的联合读数;四格判读;从读数到参数修订的动作链,以及改后在车队数据里拿什么验收。

第 1 讲 分野判定:手上这个量该走哪条标定链,本课交付的是什么

标定工程师桌上那份待整定量清单,从来不是一类东西:里面既有 PID 增益、前馈系数、二维 MAP,也有一串「某某偏差故障阈值」「某某合理性检查带」「某某去抖周期数」。⚠ 拿到清单之后的第一个动作不是打开数据,是判这个量走哪条链——判错了,后面每一步都只是「把错的方法做得很规范」:你会在一个根本扫不到目标事件的空间里做响应面寻优,或者反过来,拿统计裕度去动一条本来可以从物理边界反推的保护线,把安全裕量当成统计裕度让掉。

本讲只做这一件事,并把本课的交付物形态立起来。次序是:分野的那一句判据(1.1)→ 由它直接推出的取值路线(1.2)→ 把手上那个量放进四格表读归属(1.3)→ 四格之外必须显式写出来的两类(1.4)→ 阈值下界的三个来源(1.5)→ 交付物「阈值整定记录」六格(1.6)→ 把五个互相串线的名词分开(1.7、1.8)→ 本课不覆盖什么、又不给哪些数(1.9)。

本讲立下的记号,全课照此用(各讲第一次用到时会重述单位;统计侧的记号在第 3 讲第一次用到时定义):

记号 含义 单位 纪律
x_th 故障阈值——判据的越界线,本课唯一负责取值的量 同被诊断量 ⚠ 它与迟滞带、使能窗口是三个不同的量,1.7 当堂分开
x_th,det 确定性下界——由传感器本征误差+布置代表性误差+量产散差+全寿命衰减按误差预算合成得到 同被诊断量 合成规则归 K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值,本课只用其结果、⛔ 不重推
x_th,res 分辨率下界——量化步长折算到物理量、以及滤波与采样周期决定的最小可分辨变化 同被诊断量 ★ 本课归纳补出的第三个下界,⛔ 不是本课程体系既有的分类;低分辨率造成的假零斜率去向 K1-01 热管理传感器信号处理与故障诊断
σ_stack 误差预算里独立随机分量的合成值(测量链侧),是 x_th,det 的一个构成分量 同被诊断量 ⚠⚠ 它与第 3 讲要用的「正常工况总体的散布」量纲相同、含义完全不同(一个是测量链的误差带,一个是被诊断量在车队上的真实散布)⇒ ⛔ 不得互相代用、⛔ 不得相加
δ_sensor 传感器本征误差(噪声+精度) 同被诊断量 口径归 K1-03 传感器布置、冗余与信号可靠性K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值,本课只引用、⛔ 不给数
n_age 老化/自愈计数——故障码成熟到自愈的状态机所数的循环数 —(老化循环数) 定义归 K5-01 OBD/UDS 诊断与故障码(DTC)设计
Δ_drift 传感器零点/增益与部件性能的全寿命物理漂移量(周—月级劣化) 同被诊断量 机理归 K1-03 传感器布置、冗余与信号可靠性。⚠⚠ 它与 n_age ⛔ 不是一回事,1.8 当堂分开

1.1 分野的判据只有一句话:目标事件在正常工况数据里出不出现

是什么。把一个待整定量分流到两条完全不同标定链上的判据,只有一句:看它的目标事件在正常工况数据里出不出现。判据量是「目标事件在正常运行数据里的出现频次」,⛔ 不是这个量叫什么名字

  • 性能类标定量(PID 与前馈增益、二维 MAP、滞环)的目标事件天天出现——温度在跟踪、压缩机在调速、风门在动,你要优化的那个响应就在数据里;于是可以把它写成响应面 y=f(x₁,…,x_m),在设计空间里扫点寻优。⚠ 这里的下标 m 只是设计变量的个数,⛔ 与本课第 3 讲那个裕度倍数 k 无关——本课凡写 k 一律指裕度倍数,⛔ 不作任何索引或导热系数用。
  • 诊断/保护判据类标定量的标定对象是「不该发生的事」——目标事件在正常数据里根本不出现,扫遍工况也扫不到它。这条边界是 K6-01 热管理标定流程与工具(INCA/CANape)「典型 TMS 标定量速览」自己声明并让出的那一块:它对本课只作 A2L/XCP 与 INCA/CANape 的工具前置,工具本体与试验设计(DoE)本体不重讲;本课接的正是它让出的那一格。

今天就能做的三步。① 把这个量的「目标事件」写成一句可判的话——⛔ 不是「冷却液温度异常」,而是「冷却液温度实测值与模型估计值之差越过某条线并持续若干个判定周期」;② 拿手上最近一段正常运行数据(台架、路试、车队都算),数这个事件出现了几次;③ 出现频次为零 ⇒ 走本课的两侧取样法,天天出现 ⇒ 走 K6-01 热管理标定流程与工具(INCA/CANape) 的性能标定链。

工程量级。这条判据是二值的(出现/不出现),⛔ 不需要任何数值门限。一个量若在正常数据里一年出现不到几次,实务上就已经按「不出现」处理;具体分界由本项目自己按数据判,⛔ 本课不给。

易错点。把「我在台架上能人为造出这个事件」当成「它在正常工况里出现」。台架上造得出来只说明可以取样,⛔ 不说明可以扫点寻优——扫点寻优要求的是目标量能在设计空间里被连续测出来,而故障事件在正常空间里根本没有取值。⇒ 第一步那句话写不出来的量,说明判据形式还没定,⛔ 还轮不到谈阈值取多少。

1.2 由分野直接推出:本课的路线只能是两侧取样,且两侧缺一不可

是什么。既然目标事件不在正常数据里,阈值就不可能从「哪个值让目标最优」得到,只能从两侧夹出来:

  • 误报侧——正常工况总体的分布,定这条线的下界(第 2 讲取样、第 3 讲取值与频次换算);
  • 漏报侧——故障注入与真实失效样本,定这条线的上界(第 4 讲);
  • 阈值落在两侧之间,具体偏哪边由代价不对称决定(第 5 讲)。

这条路线撑起本课全部工程动作的骨架,七步固定次序:分野判定 → 误报侧取样 → 误报侧取值与频次换算 → 漏报侧取样与检出率曲线 → 工作点选择 → 四量联立 → 复验与现场回流,对应第 1~8 讲。

为什么两侧缺一不可。只做一侧的整定都不成立,而且两种失败在各自那一侧的指标上都很好看——这正是它们能一路走到量产的原因:

  • 只看正常数据,得到的是「不会误报的阈值」——它可能根本报不出故障,而误报侧的报表一片绿;
  • 只看故障样本,得到的是「一定报得出的阈值」——它在量产车队上会报满屏,而漏报侧的验证记录一次不过都没有。

两侧的产出物各自可交付:误报侧交出「阈值下界+预期误报频次」,漏报侧交出「检出率曲线+可检出严重度门槛」。两者都拿到之前,⛔ 不许落笔写阈值。

今天就能用的验收问法。接手一条别人整定好的诊断时,只问一句:你的误报侧产出物叫什么、漏报侧产出物叫什么?答不出这两样东西的名字,就是只做了一侧——甚至一侧都没做,只是照抄了一个值。

易错点。把次序做成「先拍一个阈值,再两侧去验」。那样两侧取样退化成事后背书,而它本来是取值的依据;更麻烦的是一旦两侧算出的可选区间与拍的那个值冲突,人的倾向是回头改判据去迁就已经写进代码的值。

⚠ 另外有一句听起来最稳妥的话,会让人整段跳过误报侧取样:「安全相关的诊断,宁可错报、不可漏报 ⇒ 阈值往灵敏侧压、去抖往短里配」。它的前半句成立、后半句方向恰好相反——为什么反、以及正解是什么,第 5 讲整节拆开。本讲要立的只是它的前提:⛔ 两侧取样一侧都不许省

1.3 归属四格表:把手上那个量放进去,读出它该走哪条链

是什么。把 1.1 的判据(目标事件出不出现)与第二个问题(有没有可反推的物理边界)交叉,得到一张四格表。拿手上那个待整定量往里放,读出归属:

目标事件在正常工况里出现 目标事件在正常工况里不出现
可反推的物理边界 性能类量的保护包络(降功率滞环、运行包络边界)⇒ K3-02 空调温控与压缩机转速/过热度控制(制冷与制热两模式)K6-02 空调与制冷系统标定,⛔ 不在本课 保护类阈值:有明确物理安全边界可反推 ⇒ 电池三态切换与降功率滞环归 K6-03 电池热管理标定,制冷回路红线的判据形式与动作序列归 K3-02 空调温控与压缩机转速/过热度控制(制冷与制热两模式),空调回路实例化取值归 K6-02 空调与制冷系统标定,误差预算合成路径归 K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值,⛔ 不在本课
物理边界 性能类标定量(PID/前馈增益、二维 MAP、滞环)⇒ 可按响应面扫点寻优,归 K6-01 热管理标定流程与工具(INCA/CANape),⛔ 不在本课 本课射程诊断类阈值——判「某信号是否异常」,没有物理边界、只有统计边界

K6-03 电池热管理标定 第 1 节已经把这条分工写在案(保护类归它、诊断类阈值的整定验证与复验归本课),本课与它对称成立

为什么要先分再动手。两类混在一张表里标,会同时犯两个方向的错:拿统计裕度去动一条有物理安全边界的阈值(把安全裕量当统计裕度让掉),或者拿物理反推去定一个根本没有物理边界的诊断阈值(反推不出来,最后还是拍)。这两种错都不会在整定当时报错,它们要到量产或到路试才现形。

工程量级。本课射程内的量只有右下那一格;另外三格全部只给去向——⛔ 不给限值、⛔ 不给等级号、⛔ 不给条款内容。

易错点。本课标题里带「保护」两个字,而这一节恰恰把保护类阈值排除出去——这是读者最可能一开头就走错的一步。⇒ 因此它被写进 1.9 的「本课不覆盖」清单,并在开篇的导航里先说一遍:⛔ 不能等读者读到这里才发现自己找错了门。

图1 待整定量的归属四格表加两条外挂行:横轴为目标事件在正常工况里出不出现(出现/不出现),纵轴为有没有可反推的物理边界(有/无),两轴均为定性二值分档、无刻度。左下格是性能类标定量(PID 与前馈增益、二维 MAP、滞环),格内写可按响应面扫点寻优并标去向课程编号;左上格是性能类量的保护包络,标去向;右上格是保护类阈值,格内写有物理安全边界可反推并标出三个去向课程编号;右下格用实心加粗边框标为本课射程,格内写只有统计边界没有物理边界。方格下方两条外挂行:第一条是混合型,一支箭头指向两个下界都算取大者;第二条是不是阈值却与阈值同表交付的判定参数,去抖时间与成熟度计数两支箭头指向本课第 6 讲与阈值联立,使能窗口一支箭头指向取值去向另一门课本课只作口径约束。四格无一格留空。本图是分类与归属关系示意图,两轴无刻度、格的面积不代表任何比例,不得据图读取任何数值。
图1 待整定量的归属四格表。要读四件事:① 本课射程只有右下那一格(加粗边框那格);② 分流的判据是横轴那一问——目标事件在正常工况里出不出现,⛔ 不是这个量叫什么名字;③ 右上的保护类⛔ 不在本课,三个去向写在格内,这一条正对着「本课标题里带保护二字而内容把它排除」;④ 下方两条外挂行⛔ 不是补充说明,是把「不在四格里」的两类显式摆出来(1.4)。本图是分类与归属关系示意图,两轴无刻度、格的面积⛔ 不代表任何比例,⛔ 不得据图读取任何数值。

1.4 四格之外还有两类,必须显式写出来

四格是按「出不出现 × 有没有物理边界」画的,而有两类量不落在这条线索上。它们必须显式成表,⛔ 不得默认当成不存在:

第一类:混合型——既有可反推的物理上限、又必须留统计裕度的量。合理性检查带是典型:理论上有一个物理可达的上限(两路信号之差不可能超过某个物理量),而实际取值由散度决定。本课判定:两个下界都算、取大者,⛔ 不许只算一侧就落笔。这正是 1.5 那条「下界取大者」在归属这一层的对应。

第二类:不是阈值、却与阈值同表交付的判定参数——去抖时间、成熟度计数、使能窗口。它们与阈值共同决定「判到什么程度算成立」,但取值方法各不相同:

判定参数 形式(怎么定义、怎么接进状态机) 取值(这个数取多少)
去抖时间 K5-01 OBD/UDS 诊断与故障码(DTC)设计 本课第 6 讲与阈值联立
成熟度计数 K5-01 OBD/UDS 诊断与故障码(DTC)设计 本课第 6 讲与阈值联立
使能窗口 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁——本课只把它当口径约束引入,⛔ 不出取值方法

为什么非写不可。不写它们,读者会把「不在四格里」默读成「不存在」——而这是最危险的一种默认:默认值不会被测试覆盖。合理性检查带若被当成纯统计量,物理上限那一侧就永远没人算;使能窗口若被当成「一种阈值」,两门课都会以为对方定了它。

工程量级。混合型在实务里占比不小(凡是既有物理上限又有噪声的合理性检查都属此列),⛔ 但具体占比随本项目的诊断清单而定,本课不给比例。

易错点。把使能窗口当成「一种阈值」拿到本课来取值。K5-01 OBD/UDS 诊断与故障码(DTC)设计 那句「具体取什么数见本课」,字面上把使能条件也包了进来,而使能窗口的属主是 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁——⇒ 拿到一个待整定的「使能条件门限」时,正确动作是转手给 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁,本课只在它定下来之后把它当成「哪些样本算数」的口径约束用。

1.5 阈值下界有三个来源、必须取大者,⛔ 不是两个

是什么。三个下界各回答一个不同的问题,⛔ 不是同一件事的三种算法:

下界 它回答的问题 由什么构成 怎么取
统计下界 正常车会不会碰到这条线? 正常工况总体的散布 本课的增量——第 2 讲取样、第 3 讲取值
确定性下界 x_th,det 这条线是不是落在测量误差带里? 传感器本征误差 δ_sensor +布置代表性误差+量产散差+全寿命衰减 按误差预算合成,分栏合成规则归 K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值(本课只取其结果 σ_stack 及合成后的值),布置代表性与在线校零归 K1-03 传感器布置、冗余与信号可靠性
分辨率下界 x_th,res 这条线在这套信号链上分不分得出来? 量化步长折算到物理量;滤波与采样周期决定的最小可分辨变化率 两者取大者;低分辨率造成的假零斜率这一形态归 K1-01 热管理传感器信号处理与故障诊断

合成规则只有一条:x_th ≥ max{统计下界, x_th,det, x_th,res}三者取大者。★ 第三项是本课归纳补出的,⛔ 不是本课程体系既有的分类。

为什么三个都要算。只算统计不算误差预算,会得到一个「统计上分得开、却落在测量误差带里」的假阈值,量产散差一上来就整批误报;而只算前两项、不算分辨率,会得到一个比量化步长还小的残差阈值——它在纸面上完全成立,在信号链上永远判不稳。三种漏算在数据上表现相同(都是「误报比预期多」),只有把三条都算出来才分得清是哪一条

工程量级。三项都是平台相关量,⛔ 本课一个数都不给;给的是各自的算法与去向(见上表右两列)。

今天就能做的一步。在整定记录里给这三个下界各留一行,任何一行写不出来就是还没算完。⇒ 写不出 x_th,res 那一行的最快补法:查这一路信号的量化步长(模数转换位数与量程,或报文里的分辨率因子),折算到被诊断量的物理单位;再问采样周期与滤波时间常数一起允许分辨多大的变化——两者取大的那个就是这一行。

易错点两处。① 把三者相加——它们是三个下界、不是三个分量,取 max 而不是求和;相加会得到一个远比必要更钝的阈值,把漏报侧的可行区间白白吃掉一大块。② 认为「传感器精度很高,所以分辨率下界可以忽略」——精度与分辨率是两件事,一个高精度但低分辨率的通道照样有分辨率下界(它的读数很准,只是跨不过一个量化台阶)。

1.6 交付物先立起来:一张「阈值整定记录」,六格缺一不可

是什么。本课的唯一可交付物,是一条诊断出一张表——⛔ 不是一个数:

这一格写什么 由哪一讲产出 这一格的验收问法
被诊断量与判据形式 第 1 讲定归属,第 5 讲写定工作点与分级 换一个人照这一格,能不能写出同一条判据?
正常样本来源与工况覆盖 第 2 讲 换一个人拿着这段文字,能不能从原始数据里筛出同一批样本段?
误报侧取值与预期误报频次 第 3 讲 频次的分母是什么?使能占空比写出来了没有?
漏报侧样本与可检出严重度门槛 第 4 讲 门槛是插值读出来的,还是某一个注入点本身?
四量联立预算 第 6 讲 改一个量,另外三个怎么动?
复验触发条件 第 7 讲 触发量是里程、月龄还是事件,有没有写成日历周期?

第 8 讲的现场回流动作也落在这张表上——再整定改的是表里的格,⛔ 不是另起一份记录。

为什么。这张表是外部审计与后续再整定唯一要看的东西。没有它,换一个人来重算必然得出另一个数,而且没人说得清当初为什么是这个数——这与 K5-01 OBD/UDS 诊断与故障码(DTC)设计 头号误区里那个「照抄参考车型」的值在可追溯性上等价:两者都说不出依据,区别只在一个看起来像自己算的。

工程量级。六格里有四格的内容是平台相关量,⛔ 本课不给数——但每一格都必须写清怎么算出来的、数据从哪儿取、拿什么验收,这三样是本课要求的。第 ③ 格还有一条硬口径:验收语言只有一种,就是频次;只报裕度倍数或分位数、不报频次的整定不可验收(换算方法在第 3 讲)。

易错点。把这张表填成「四个数+两句话」。最容易被糊弄过去的是第 ⑤ 格「四量联立预算」——写四个并排的数看起来完全合格,而它要答的是第 6 讲那三问(改一个量、另外三个与误报频次和检出时延各怎么动);答不上来就说明没联立,只是四个数放在一起

图2 阈值整定记录的六格结构与产出动作链:左侧一张竖排六格表框,自上而下依次为被诊断量与判据形式、正常样本来源与工况覆盖、误报侧取值与预期误报频次、漏报侧样本与可检出严重度门槛、四量联立预算、复验触发条件,表框底部一行横贯文字写六格缺一不可;右侧一条自上而下的动作链,七个动作框依次为分野判定、误报侧取样、误报侧取值与频次换算、漏报侧取样与曲线、工作点选择、四量联立、复验与现场回流,每框标注它落在第几讲;左右之间用细线加箭头连出哪一个动作产出哪一格。动作链左侧另有一条加粗的回流箭头,从最下方的现场回流指回误报侧取样,标注为第 8 讲改后重取新样本,不在旧分布上按百分比平移。本图是交付物结构与产出关系示意图,框的大小与位置不代表工作量或时间比例,不得据图读取任何数值。
图2 交付物的六格与它们各自的产出动作。要读三件事:① 本课交付的是一张六格表而不是一个数——每一格都由一个明确的动作产出,说不出产出动作的格就是没做;② 动作链是有次序的,两侧取样都完成之前⛔ 不落笔写阈值,箭头方向就是次序;③ 回流箭头指回的是「误报侧取样」而不是「误报侧取值」——再整定必须在新样本上重取分布。本图是交付物结构与产出关系示意图,框的大小与位置⛔ 不代表工作量或时间比例,⛔ 不得据图读取任何数值。

1.7 三个都叫「阈值」的量,当堂分开

是什么。一条判据链上有三个位置不同的量,中文里都被叫作「阈值」:

它管什么 取值归谁 在本课的角色
故障阈值 x_th 越没越线 本课 本课唯一负责取值的量
迟滞带 越线之后什么时候算退出(退出与再进入之间的带宽) 三项下界取大者与合成流程归 K3-01 整车热管理控制策略总览与模式管理 作为约束进来:从下方约束阈值可用的分辨余量
使能窗口 这一段样本算不算数(这路诊断在该工况跑不跑) K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁 作为约束进来:从样本侧决定「什么算正常」

按判定发生的先后串起来就是:使能窗口决定这一段样本算不算数 → 故障阈值决定越没越线 → 迟滞带决定越线之后什么时候算退出

为什么必须当堂分开。三者共用一个中文词,而取值方法完全不同(本课的统计法只管第一个)。混称的直接后果有两种:把迟滞带宽当成阈值去做分布分析(分布分析回答的是「正常值散在哪儿」,回答不了「退出线该离进入线多远」);或者把使能窗口的边界当成阈值写进判据(于是窗口一变,判据跟着变,而没人知道为什么误报率跳了)。不先分开,第 6 讲那张预算表会算错量纲

易错点。把迟滞带当成「降误报手段」,与去抖、成熟度计数并列进同一张预算表。⛔ 三者治的东西不同:迟滞治的是阈值附近的真实穿越(值真的在线上下来回走)、去抖治的是短时真实越界(值真的越了但很快回来)、滤波治的是测量噪声(值其实没动,是噪声)。整定次序归 K1-01 热管理传感器信号处理与故障诊断K3-01 整车热管理控制策略总览与模式管理;混进一张表里会重复计入同一份裕量——账面上留了三层余量,实际只有一层在起作用。

1.8 两个都叫「老化」的量,也当堂分开

是什么。两个在中文里都叫「老化」的量,量纲、时间基与归属全都不同:

它是什么 单位与时间基 谁产生它 它在本课的哪一讲
n_age 故障码的成熟—自愈状态机所数的循环数(定义归 K5-01 OBD/UDS 诊断与故障码(DTC)设计 老化循环数;时间基从任务周期到驾驶循环级 软件自己计数 第 6 讲的预算表里,随四量联立一起定
Δ_drift 传感器零点/增益与部件性能的物理漂移量(机理归 K1-03 传感器布置、冗余与信号可靠性 与被诊断量同单位;时间基是周—月级 物理劣化产生,软件看不见 第 7 讲的复验清单

为什么。这是本课最常见的一处串线:把两者混用,会把复验清单写成状态机参数表——读者以为「复验老化」就是回去调 n_age 的门限,于是真正会移动正常分布的那个物理漂移一次都没被复验过。而它移动的恰恰是第 2、3 讲那条基线,基线一动,阈值与频次预期全部作废。

工程量级。n_age 的取值在第 6 讲随四量联立一起定;Δ_drift 本课⛔ 不给数、也⛔ 不出机理,只在第 7 讲要求一个动作:把基线重取一次并与出厂基线比

易错点(两个方向都要防)。正向是上面那条「拿状态机参数当复验」;反向同样常见——把 Δ_drift 当成可以靠调 n_age 补偿的东西(「老化了就多要求几个循环」)。那等于用一个抗瞬态的机制去接一个单调劣化的过程:接不住,而且会把劣化证据一起吃掉(要求变严之后码不报了,看起来像修好了)。

图3 三个阈值名词与判定链上四个量的位置:上下两幅对齐的时间轴,中间以折线断裂符号隔开。上幅横轴为时间无刻度、纵轴为被诊断量无刻度,画一条带噪声的示意轨迹,中段有一次持续越界、另有两次短促尖峰;轨迹上叠四样标注——一条水平的故障阈值线标为 x_th 并注明本课唯一负责取值的量取值见第 3 讲,其下一条平行的退出线,两线之间的带标为迟滞带并给合成流程去向,时间轴上两段灰色阴影标为使能窗口外并给取值去向,阴影内那次尖峰画一个叉号并标注窗口外的越界不参与判定,越界段上标出连续 N 个判定周期的刻度格与去抖窗标为 N 乘 T_task。下幅是另一条时间基的轴,画三个离散的驾驶循环块,其中两块内标出本循环复现,标为 n_conf 乘 T_cycle 的跨循环成熟度计数。两幅之间的断裂符号旁写一行横贯文字:两条轴时间基不同、不可相加。图右侧另有一个小方框列出两个老化的分列,n_age 标注为在下幅这条轴上,Δ_drift 标注为不在本图任何一条轴上见第 7 讲。本图两轴均不给刻度,阈值线与迟滞带的位置是示意,不得据图读取任何数值。
图3 三个「阈值」与两个「老化」在同一条判定链上的位置。要读五件事:① 故障阈值、迟滞带、使能窗口是三个位置不同的量,本课只负责第一个;② 使能窗口外的越界⛔ 不参与判定(图上那个叉号),因此也⛔ 不进第 3 讲的分布与频次分母;③ 去抖数的是连续判定周期,量在上幅那条轴上;④ 跨循环成熟度计数在下幅另一条轴上,两条轴之间有断裂符号——量纲不同、⛔ 不可相加;⑤ 右侧小方框里两个「老化」是两个不同的量,n_age 在下幅轴上,而 Δ_drift 一条轴都不在。本图两轴均不给刻度,阈值线与迟滞带的位置是示意,⛔ 不得据图读取任何数值。

1.9 本课不覆盖什么——把「不给哪些数」也一起写清

本课是一门方法课,而且是一门一个数都不给的方法课。⇒ 边界要在开篇一次列清,每样带去向:

不讲的题目(每样带去向):

不在本课射程内的东西 去向
保护类阈值的取值(有物理安全边界可反推的那一类) K6-03 电池热管理标定K3-02 空调温控与压缩机转速/过热度控制(制冷与制热两模式)K6-02 空调与制冷系统标定
误差预算的分栏合成与鲁棒标定路径 K6-06 面向量产散差与老化的鲁棒标定:把公差、传感器误差与衰减折进阈值
使能窗口本身的取值 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁
迟滞带与滤波的整定次序 K1-01 热管理传感器信号处理与故障诊断K3-01 整车热管理控制策略总览与模式管理
故障注入的台架实现(本课只用它取样,⛔ 不讲怎么搭) K4-03 MIL/SIL/HIL 验证流程
故障容错时间间隔及其向下拆分的定义 K5-02 热管理故障处理与降级策略
索赔与返回件数据的统计口径与清洗 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计
参数限幅、灰度放量与回滚门限 K7-02 软件定义热管理与 OTA 迭代(灰度车的信号覆盖与采集配置见 K7-04 车队数据回流的车端实现:信号表定义、事件抓帧与带宽/存储预算
样本聚类结构与显著性口径 K7-02 软件定义热管理与 OTA 迭代

不给的数:任何一个具体的阈值数、去抖周期数、成熟度计数与误报频次目标值。它们全是平台相关量。本课引用到的标准,一律只写标准号与去向,⛔ 一个条款内容、一个限值都不写;版次与年份以现行目录为准,引用前须自行核对。

⚠ 这后半截不能省。只写「不讲哪些题目」而不写「不给哪些数」,带着「我来查一个阈值该取多少」这个任务进来的读者,仍然要通读一遍才敢确认这里没有他要的东西。

「不给数」不是道歉,是本课的立场。数值是平台相关量,给了就是编造;本课交付的是取到那个数的路——算式、取数去向、反解链、教学算例,而这正是读者真正带得走的东西。对照着看:本讲 1.5 没有给任何一个下界的数,但给了三行「这一行怎么算、去哪儿要」;1.6 没有给六格里任何一格的内容,但给了六个「这一格拿什么验收」的问法。⇒ 判断本课有没有对你的量给出交代,标准不是「它给了数没有」,而是「照它说的,我今天能不能动手把那个数算出来」

后面还有 7 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做

会员专属

后续为会员深水区内容——四库数据与深度拆解。

查看会员方案