TMS BOOK · ACADEMY 讲义

售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计

大纲的完整展开版——讲师授课蓝本 / 学员自学材料

M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计

课程代码 M2-05 · 板块 M 项目、质量、成本与合规 / 质量工具与体系 时长 约 3.5~4.0 小时(6 讲) 前置 M2-01 质量工具:PPAP/8D/SPC/MSA;M2-02 热管理常见质量问题与根因分析;I6-04 可靠性目标、分配与寿命数据统计(TMS 可靠性量化入门);L7-03 试验数据分析与不确定度评估 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 M2-05 大纲的完整展开版


引言:先别问「故障率是多少」,先问「你说的这个数,分母是谁」

同一个平台、同一个零件、同一个季度,四拨人能报出四个不同的故障率,而且四拨人都没算错。售后运营按索赔发生的月份除以当月保有量,看的是本月的售后工作量;市场口径按累计索赔台次除以累计销量,看的是「卖出去的车里出了多少事」;质量部按生产批次建在役队列算 12MIS 的 R/1000(MIS 是月在役,指车辆交付之后已经在路上跑了几个月;R/1000 是每千台在役车的维修台次),看的是每一批车跑到同样车龄时的表现;供应商那边只统计被判了自己责任的那一部分。四个数字放在同一页纸上,谁高谁低几乎完全由取法决定——而纸上通常只留下数字本身。麻烦的地方正在这里:这四个数看起来一模一样,都带单位、都能画成曲线、都能排出榜单、都能在会上被引用,而且都可以被复制进邮件、纪要和供应商函件里,一路传到某个人据它做决定为止。

钉子①(本课主钉子):场端故障率不是一个测量值,是一个被三样声明共同构造出来的量——分母的队列口径分子的去重规则删失与成熟度修正。这条钉子在本课的形态不是一句道理,是一套可以当场执行的检查:拿到任何一个场端故障率数字,先问三句——

  • (a) 分母是哪个集合?是「已在役满 m 月的车」,还是被人换成了累计销量、当月保有量或交付台数?
  • (b) 分子按什么单位计数、按什么规则去重?一次进厂开了多条工时行,算 1 还是算 n?同一辆车同一个码二次返修,算新故障还是算同一次故障?
  • (c) 未到期的车与还没入库的索赔怎么处理?做没做右删失与成熟度修正?

三句里凡是答不出的,这个数就只剩一种合法用途:看趋势的形状。⛔ 它不能用来排榜、不能用来判显著、不能当作服务活动或召回评估的输入。把三样声明并成一个结构来讲,是本课为讲清依赖关系而做的归纳,⚠ 不是哪一条标准或哪一本手册里的现成分类;三样各自的做法则分别落在第 1、第 2、第 3 讲。这条钉子真正改变的是交付物的形态:数字本身不是结论,「数字 + 三样声明」才是。三样彼此独立、互不替代——声明了分母不等于交代了去重规则,做了成熟度修正也救不回一个错的分母;因此必须同时声明。第 2 讲会立一组明确标注为教学假设的队列,第 3 讲与其后各讲沿用同一组(⛔ 全课只此一组,⛔ 不另起第二组),把三样对结论的影响各演示一次,数字都可自行复算;⛔ 真实平台的口径取值本课一律不给。

最容易犯的错不是不声明,而是把声明当成报表脚注:它被写在看板的说明页上,而不是随每一个数字一起传递。数字一旦被复制到别处,声明就掉队了,而丢了声明的数字与带着声明的数字长得完全一样——这就是为什么本课要求口径声明与数字同页、同行、同一次传递。

图1 原始索赔明细自左向右穿过三道并排的方框闸:闸①分母口径声明,问「分母是哪个集合」,下挂三个被划掉的错误选项(累计销量、当月保有量、交付台数)与一个勾选项「已在役满 m 月的车」;闸②分子去重规则声明,问「按什么单位计数、怎么去重」,下挂两组对照(一次进厂多条工时行算 1 还是 n、同车同码二次返修算新故障还是同一故障);闸③删失与成熟度声明,问「未到期车与未入库索赔怎么处理」,下挂右删失与成熟度修正两项。三闸之后是一个双层终点框,内层写「一个数」、外层加粗写「数 + 三样声明(这才是交付物)」,终点框向右分两支:绿色实线通往「可排榜/可判显著/可作服务活动与召回评估输入」,灰色虚线通往「只能看趋势的形状」,两支之间画禁止符号。全图无任何数值与刻度。把这三样并成一个结构是本课的归纳。本图为口径构造关系的示意,不得据图取任何数值,三闸的具体取法由本项目确定。
图1 要从图上读出三件事:① 三闸是并列的必要条件,缺任何一样,路径当场掉到灰色虚线那一支,两种用途在图上是两个不同的终点而不是同一个终点的两种说法;② 交付物是外层那个双层框(数 + 三样声明)而不是内层那个数,这一点由内外两层框画出来,不是靠一句话说出来的;③ 三闸下面各挂着最常犯的错误选项,可以拿自己手上的看板逐闸对一遍。三样声明这一结构是本课的归纳。本图为口径构造关系的示意,不得据图取任何数值,三闸的具体取法由本项目确定。

钉子②(副钉子):场端数据能改动设计的分辨率上限,由「能不能追到原因层」定;停在现象层的索赔率只够触发遏制,⛔ 不够改 DFMEA 的 occurrence、不够改 DVP&R 的验证项、不够改工况谱权重。索赔表天然记录的是现象——客户说不制冷、技师换了某个总成、系统里留下了一条工时行。而设计侧最想改的那三个字段,绑的都不是现象:DFMEA 的 occurrence 绑的是失效原因的发生率,DVP&R 的验证项绑的是载荷与失效机理,工况谱权重绑的是使用侧暴露。同一个现象底下往往并着几个不同的原因;把现象层的数直接填到原因层的字段上,等于把几个原因合成一个数,改完之后按 AP 重排出来的优先级,指向的是一个并不存在的原因,补出来的验证项也会补错载荷。

从现象层通到原因层,只有一条路:返回件到件 → 解剖 → 判定。这条路一旦不通,本课后面所有「改设计」的动作就都失去依据。所以到件率不是一个后勤指标,它是本课全部解剖结论的样本代表性上限:它没过事先约定的门槛时,这一轮解剖结论只能写成定性线索,⛔ 不得用于改故障率结论、⛔ 不得用于改 DFMEA 的 O 值。把到件率交给备件物流当 KPI 管、于是它在质量结论里根本不露面,是这条链上最常见的断点;正确的用法是把它当成一条准入判据,写在解剖报告的第一页。⛔ 门槛本身是平台相关量,取多少由本项目按件族与召回风险自行约定,本课不给数。副钉子在第 1 讲埋下(返回件流程第一次定义时就把到件率立成上限)、第 4 讲展开、第 6 讲收口。

接下来是本课最容易被读反的一条,请在开课时就把它记住近端故障率曲线的下行,是这套数据的默认形状,不是质量改善的证据。直觉上的读法是「近三个月的 12MIS R/1000 逐月下降 ⇒ 整改起作用了」,方向恰好反过来。右删失让未到期的车不贡献分子,报告延迟让已经发生的维修还没进库,两者朝同一个方向压低最近几个月的读数,而且月龄越小压得越狠。也就是说,一条什么都没变、质量完全稳定的产品线,它的近端曲线本来就会向下走,然后随着观察窗往后推移,一路抬回原来的位置。

读反之后会做出的那个具体动作是:在月度质量会上拿「近三个月逐月下降」宣布整改有效,据此关闭 8D 的 D5/D7,撤掉产线遏制与加严来料检验。这一个动作同时踩四个坑:它把数据成熟度的伪影当成了因果——那三个月恰恰是报告延迟最重的三个月,等索赔补齐入库,同一批次的曲线会原样抬回去,而遏制已经撤了;它让整改与观察窗对齐得刚刚好——整改动作总是发生在问题暴露之后,也就是曲线的近端,于是「整改之后就下降了」几乎必然出现,那是观察方式的产物,⛔ 不是措施的产物;它绕开了唯一能判真假的那道动作;而且它和一次口径改动长得一模一样——换去重规则、换成熟度完成因子曲线、换队列定义,任何一样都能单独造出一次形状完全相同的「改善」,看板上两者无法区分。

那道唯一能判真假的动作,本课在第 3 讲当场演示:把同一批次的观察值按不同的观察截止日各画一条曲线,看近端有没有持续上抬。持续上抬就说明延迟没有被修正,此时任何「本月改善」的结论都不成立。由此定下本课的一条纪律:凡出现「下降/改善/变好」的判断,必须同时给出三样中的至少两样——同一 MIS 段的对照、成熟度修正后的值、口径未变的声明;三样都拿不出来的,本课一律写成「观察值下降,原因未定」。另有三处方向反转与它同族,⛔ 不与本条合并,各在自己那一讲当场点破:β<1 不是设计不行(它指向早期失效,责任方与 β>1 正好相反,第 3 讲);NTF 率高不是服务站乱换件(把它写进服务站考核,降下来的是观测通道不是故障率,第 4 讲);场端失效分布不是使用工况分布(它是结果侧分布,直接当权重会让验证载荷朝已经暴露的地方越加越重,第 6 讲)。

射程与术语切割。本课站在车辆生命轴上「交付之后」的那一段:从索赔记录整形,到 MIS 队列与指标口径,到删失与成熟度修正,到返回件与 NTF 判定,到三档工程触发判据,最后到六张有收件人的改动单。交付之前那几段只做口径对照、⛔ 不重讲——来料 PPM 与批次分摊归 M2-03 供应商质量与来料控制,产线 DPMO/Cpk 与控制计划归 M2-01 质量工具:PPAP/8D/SPC/MSAM2-07 PFMEA 与控制计划实操:热管理制造过程的失效分析三件套,量产内部根因归 M2-02 热管理常见质量问题与根因分析,总装 EOL 与 0km 判据归 M2-04 整车总装线热管理 EOL 功能检测:项目、判据构造与数据闭环。往外走的四条同样要说清:寿命拟合的方法本体与置信区间归 I6-04 可靠性目标、分配与寿命数据统计(TMS 可靠性量化入门),失效件表征与取样留证链归 L7-07 失效件表征与跨材料族失效分析方法(取样留证—金相/断口—SEM-EDS—FTIR/DSC—离子色谱),法定缺陷认定与召回的备案程序归 M4-01 热管理相关标准(GB/ISO/SAE)体系(本课只出工程触发判据),保修成本的货币化、折现与投资回收归 M3-05 工程收益的货币化与热管理投资回收决策:换算率来源、现金流折现与两种盈亏平衡口径(本课只提供取数口径,⛔ 不做折现、不出换算率)。三包的法定最低责任与商务延保是两层边界,条款内容与施行版本按现行版本确认,本课只用它来判「这条记录进不进保修分子」。

还有一处术语必须在开课时切开:本课的 field 指的是市场在役车——已经交付给用户、在市场上自己跑着的车;它与 L4-01 高温标定试验(吐鲁番等)方法L4-03 高寒(寒区)试验与低温续航I6-02 密封与接头寿命设计与加速试验对标 里的「三高场地/试验场地」不是一回事,那几门课里的「场地」指的是物理试验场所。两者的样本构成、暴露量、观察方式与删失机制完全不同,混用会把试验样本口径当成场端样本,后面所有分母都会跟着错。第 1 讲开篇会把这条切割写成一条可执行的硬判据。

图2 一条横贯全图的车辆生命轴,自左向右依次为来料、产线、总装 EOL/PDI、交付、在役、保修期末,轴上无任何刻度值。轴上方用粗框圈出本课射程「交付之后的场端」,框内列出本课交付的六件事:索赔记录整形、MIS 队列与指标口径、删失与成熟度修正、返回件与 NTF 判定、三档工程触发判据、六张改动单。框外沿轴摆放邻课的责任段并各引一条细箭头指向框边:来料 PPM 与批次分摊 M2-03、产线 DPMO/Cpk 与控制计划 M2-01 与 M2-07、量产内部根因 M2-02、总装 EOL 与 0km 判据 M2-04。框下方另有四条向外的箭头指向本课明确不做的四件事:寿命拟合本体与置信区间 I6-04、失效件表征与取样留证链 L7-07、法定缺陷认定与召回程序 M4-01、货币化与折现 M3-05。轴上另标一个术语切割红点,注明本课的 field 是市场在役车,不是三高试验场地 L4-01、L4-03、I6-02。本图为课程射程的关系示意,阶段轴不代表任何时间或里程比例,不得据图判断某项工作的实际归属,具体分工以本项目职责划分为准。
图2 要从图上读出三件事:① 本课的射程是生命轴上的一段而不是一个话题,读者应当能在轴上指出自己手头的问题落在哪一段;② 进来的箭头(口径对照)与出去的箭头(本课不做)方向相反、分列上下,引用了某一门课不等于本课讲了那件事;③ 术语切割红点标出 field 的两种用法在轴上是两个不同的位置,混用会把试验样本口径当成场端样本。本图为课程射程的关系示意,阶段轴不代表任何时间或里程比例,不得据图判断某项工作的实际归属,具体分工以本项目职责划分为准。

六讲怎么排。顺序是被主钉子那三样声明定下来的,不是按话题拼的:第 1 讲把一张索赔单整理成一条可分析的记录——码怎么映射、脏在哪几类、哪些记录根本不该进分子,为的是让分子可定义第 2 讲建 MIS 队列并把指标族的分母一个个摆开对照,为的是让分母可定义第 3 讲处理右删失、报告延迟与成熟度完成因子,并把索赔表整理成「失效时间 + 删失时间 + 暴露量」三列输入去拟 Weibull、按 β 把整改责任分派出去,为的是让不同交付批次可横比(这一讲最重,请留出时间);第 4 讲做返回件闭环与 NTF 判定,把数据从现象层接到原因层;第 5 讲把结论升级成动作——个案、批次、市场三级分层,以及 TSB/服务活动/召回评估的三档工程触发判据;第 6 讲把结论回流成六张有收件人、有关闭判据的改动单,并在最后一次复敲两根钉子:关闭一张改动单之前,必须先回答「这次到底是质量变了,还是口径变了」。课末的实操会给一份脱敏索赔明细,交付物是一页《场端故障率与回流建议表》——它必须带着队列口径声明、去重规则与成熟度完成因子的来源一起交,否则按本课的判据,它只是一张漂亮的表。

反钉子:近端曲线下行是这套数据的默认形状,不是改善的证据

现在把本课最容易被读反的那一条摆到台面上。

默认的理解链条是这样的:近三个月的 12MIS R/1000 逐月下降 ⇒ 整改起作用了 ⇒ 可以关 8D、撤遏制、把资源挪走。方向恰好反过来:观察值在近端偏低,是这套数据的默认形状,不是改善的证据。右删失让未到期的车不贡献分子,报告延迟让已经做完的维修还没进索赔库,两者都朝同一个方向压低最近几个月的读数,而且月龄越小压得越狠。换句话说,一条什么都没变、质量完全稳定的产品线,它的近端曲线本来就会向下走,然后随着观察窗推移一路上抬回去。

读者会做错的那个具体动作是:在月度质量会上拿「近三个月逐月下降」宣布整改有效,据此关闭 8D 的 D5/D7,并撤掉产线遏制与加严来料检验。这一个动作同时踩四个坑:

  • 它把数据成熟度的伪影当成了因果——那三个月恰恰是报告延迟最重的三个月;等索赔陆续入库补齐,同一批次的曲线会原样抬回去,而遏制已经撤了;
  • 它让整改与观察窗对齐得刚刚好——整改动作一般发生在问题暴露之后,也就是曲线的近端,于是「整改之后就下降了」几乎必然出现。这是观察方式造成的,⛔ 不是措施造成的;
  • 它绕开了唯一能判真假的那道动作——把同一批次的观察值按不同观察截止日各画一条,看近端有没有持续上抬。近端持续上抬 ⇒ 延迟没修正 ⇒ 任何「本月改善」的结论都不成立;
  • 它和一次口径改动长得一模一样——去重规则、成熟度完成因子曲线、队列定义,任一改动都能单独造出一次形状完全相同的「改善」,而看板上两者完全无法区分。

更麻烦的是它的时间尺度:两个季度之后,同一批次的曲线抬回原位,而那时已经没有人会把它和当初那次「改善」联系起来——遏制撤了、资源挪走了、8D 关了,现场看到的只是「这个问题又出现了」。

⇒ 由此立一条贯穿全课的纪律:本课任何一处出现「下降/改善/变好」的判断,都必须同时给出三样中的至少两样——同一 MIS 段的对照、成熟度修正后的值、口径未变的声明;三样都没有的「改善」,本课一律写成「观察值下降,原因未定」。这不是措辞讲究,它决定了会议上下一个动作是撤遏制还是继续观察。

⚠ 本课另有三处同族的方向反转,机制各不相同,分别落在第 3、4、6 讲,各在其讲当场点破——⛔ 本节不与这一条合并,也不提前给它们的结论。

第 1 讲 索赔数据的结构与脏:从一张索赔单到一条可分析的记录

这一讲不算故障率——怎么算是第 2 讲的事。这一讲只做一件事:把一堆维修记录变成一个每一条都知道自己是什么的记录集。「知道自己是什么」有很具体的含义:这条记录对应哪个设计件、这辆车什么时候交付给用户、它进不进保修分子、它是不是本平台的车、它是不是同一次失效被拆开的第二张单。这些问题在第 2 讲之后就没有机会再补了——分母口径、删失修正、Weibull 输入、升级判据、回流依据,全部建在这一层之上。这一讲还要先把两样东西钉死:本课的 field 到底指什么,以及全课的符号怎么写。这两样如果留到用的时候再说,前面每一处都要重新解释一遍,而每重新解释一遍就多一次读反的机会。

1.1 本课的 field 指市场在役车,不是三高试验场地——先切术语,再立符号表

先切一个词。本课全篇的 field 指的是已经交付给用户、正在市场上跑的车。这与 L4-01 高温标定试验(吐鲁番等)方法(高温标定试验)、L4-03 高寒(寒区)试验与低温续航(高寒试验)、I6-02 密封与接头寿命设计与加速试验对标(密封与接头寿命对标)里的「场地」不是一回事——那些「场地」指的是物理试验场所,车是被安排的、按试验大纲跑的、样本是设计出来的。两侧的样本构成、暴露量、观察方式、删失机制没有一样相同。

为什么必须在开篇切:如果读者把两个词当成同义,他会顺手把试验场的样本量代进本课的分母去算故障率。试验车没有月在役队列(它们不是按交付日期陆续进入风险集的),也没有右删失与报告延迟(试验一结束数据就齐了)。用试验样本算出来的那个数,既不是试验结论也不是场端结论——它不对应任何一个可以解释的总体。

工程量级上本课不给两侧的样本量数字,只给一条硬判据:凡是分母里的车不是「交付给用户之后自己在跑」的,就不能进本课的任何一个指标。据此,工程车、试装车、展车、出口车都要剔除——它们在第 1.8 节的脏数据清单里有专门的一类(车辆归属错),不是靠印象删,是靠 VIN 是否在本平台交付名单里判。

易错点是把「field data」笼统译成「现场数据」,于是台架现场、试验场现场、售后现场三种「现场」在同一份报告里混着用,读的人各按各的理解。正确做法很朴素:在报告首页写死本报告的 field 定义,一句话,谁都不用猜。

术语切完,接着立符号表。本课要在开篇给出下面这张表,全六讲遵守。它不是词汇表,是防读反的装置——下面七组里有三组(R、N、C)会在本课同一页上同时出现。

符号 含义 单位 最容易与它混的那一个
R/1000 每千台维修台次,越大越差 次/千台 R(t),方向相反
R(t)=1−F(t) 可靠度,活到 t 还没坏的比例,越大越好 无量纲 R/1000,方向相反
N_m 已在役满 m 月的车辆数 下面两个 N,分母是三个不同集合
N_parts 交付件数(PPM 的分母) N_m 是车、这个是件
N_batch,在役 该批次仍在役的车辆数 N_m 是全量、这个只含一个批次
C_m m 月窗内的维修台次 下面两个 C,三者互不相干
CF(m) 成熟度完成因子 无量纲 与 C_m 只差一个字母
Cpk 过程能力指数(归 M2-01 质量工具:PPAP/8D/SPC/MSA,本课不用) 无量纲 与 C_m、CF(m) 同首字母
I_m 索赔事件数/工时行数 IPTV 是指标名,不是变量
β Weibull 形状参数 无量纲 统计学里的第二类错误率也写 β
η Weibull 特征寿命 月,或万公里(须声明取哪一个基) G1-05 压缩机润滑、可靠性与湿压缩防护 的 η_v 是容积效率
F(t) 累计失效概率 无量纲 与 F̂ 差一顶帽子
F̂(t_目标) F(t) 在目标节点上的外推估计值 无量纲 戴帽的是估计量,必须带区间

由这张表推出三条写法上的硬要求,本课全篇遵守:

  • 全课不单说「R」,一律写 R/1000 或 R(t)。口头汇报里说「R 降了」,听的人分不清是故障率降了(好)还是可靠度降了(坏),而这两句话会导出完全相反的下一步动作。
  • 讲样本量够不够、结论显不显著时,一律用文字「误判风险」表述,本课不写第二个 β。同一页上已经有一个 Weibull 的 β 了。
  • 凡是戴帽的量都是估计值,必须带区间;第 5 讲的暴露量估算尤其如此。

这张表本身不涉及任何数值,它管的是写法。单位一律随符号写死(辆/次/件/月/万公里/无量纲),出现在图上、图注里、脚本里、看板里都用同一套。

顺带交代全课术语的分布,免得读者以为记住名字就够了。本课的名词大半是带分母的量,脱离分母的定义等于没定义,所以本课不设集中的名词表,而是每个带分母的术语首次出现时,同时给出它的分母集合。第 1 讲负责立的是六个:索赔单最小可用字段集、三段码映射、三包与合同保修的两层边界、返回件到件率、NTF 率、误换件率。后面五讲各有各的一批:第 2 讲立指标族与队列口径,第 3 讲立删失与成熟度,第 4 讲立返回件与 NTF 判定条款,第 5 讲立升级判据与三档门槛,第 6 讲立回流改动单。同一个术语在两讲里用两个不同的分母是本课最容易犯的错,而最容易犯的那一对就是 NTF 率与误换件率——它们在 1.7 立定义,第 4 讲复述时必须与这里完全一致。

1.2 只从索赔单取数,分子就只剩「被赔付的那一部分」;缺交付日期或进厂里程,这条记录算不出任何率

先看数据从哪来。场端数据的入口一共十条通道,不是一条。把它们先摊开,再对每一条给一个二值打标:它进不进保修分子

  1. 保修索赔单(赔付过的维修);
  2. 保外/自费维修工单(同一个物理失效,只是过了保修边界,不进保修分子);
  3. 客诉/呼叫中心工单与 TGW(有抱怨、无维修动作);
  4. 服务站技术支援请求与疑难件上报;
  5. 返回件登记与解剖记录;
  6. 车端 DTC、冻结帧快照与远程数据;
  7. 备件消耗数据(备件卖出去了却找不到对应索赔——自费、事故、改装、渠道囤货);
  8. 三包退换记录与法定投诉渠道的缺陷线索
  9. 服务活动/TSB 执行记录(它会把未来的失效提前变成一次预防性更换);
  10. 交付前那一端的 PDI/0km 记录(口径归 M2-04 整车总装线热管理 EOL 功能检测:项目、判据构造与数据闭环,本课只做交接)。

标★的四条是本课归纳补入的。之所以要专门标出来,是因为漏掉它们的后果很具体:只从索赔单取数,分子里就只有「被赔付的那一部分失效」。保修政策一放宽(延保上市、善意维修口径放松),同一个产品的故障率会上升;一收紧,会下降——而产品一点没变。这时候「故障率」就不再是产品的性质,是商务政策的函数

它之所以难被发现,在于漏掉的不是「少了几条记录」,而是整类不出现:没有哪一行会标红,汇总也不异常,报表看起来完整得很。这正是沿单一线索枚举的典型后果——沿「索赔单」这条最熟悉的线索数,数出来的东西自身是自洽的。

打标规则的结构本课写死为两个独立判断,而不是一个:先判是不是失效(排除事故、外力、改装、被盗等非质量原因),再判是不是保内(法定三包+合同延保+善意维修)。两个判断结果各存一列,不合并成一个布尔值。合并了就再也分不开——想只算法定内的、想算全部赔付的、想算全部失效的,这三种口径都得从原始数据重跑一遍。

工程量级上,各通道各占多少记录量是平台相关量,取决于本项目的售后体系覆盖率、渠道结构与各系统的接入程度,须由本项目实测统计,本课不给数。这里要特别说明一点:本课也不给「索赔单大约覆盖了多少比例的真实失效」这一类数——给一个数反而会让读者以为这件事已经被量到了,而这正是本节要点破的东西。

易错点是清洗时只保留「进分子」的记录、把其余的丢掉。丢掉之后:第 3 讲要用的删失信息没有了(那些没坏的车恰恰是删失样本),第 5 讲要用的暴露量没有了,第 6 讲要给服务侧的改动依据也没有了。正确做法只有一句:全部留下、只打标不删行

图3 十条场端数据通道汇入同一道二值打标闸,闸后分「进入保修分子」与「不进分子但留在数据集里」两个出口;图底另有一条灰色对照路径只连保修索赔单一条直达出口,末端标出「分子=被赔付的那一部分」的后果并加禁止符号;标★的四条通道为本课归纳补入。本图为示意,不得据图取值。
图3 从图上读出三件事:沿索赔单一条线枚举会整类漏掉另外九条通道,漏掉的不是少几条记录;打标闸有两个出口,不进分子的记录不删行、另有去处;标★的四条为本课归纳补入。各通道是否接入、如何打标由本项目售后体系确定,不得据图取值,也不得据图判断某条通道一定存在或一定进分子。

再看一条记录里必须有什么。最小可用字段集共九组:VIN 与车型配置、生产日期与交付日期、进厂日期与进厂里程、故障码(客户抱怨码/技师码/DTC)、工时码、更换零件码、工时与金额、服务站与地区、责任判定。硬判据只有一条:

缺「交付日期」或「进厂里程」任一项,这条记录只能做频次统计,进不了队列与里程分析,不能用于算故障率。

为什么是这两项而不是别的:故障率的分母是「已在役满 m 月的车」,而车龄=进厂日期−交付日期;里程维的分档要用进厂里程。这两个量不是「最好有」,它们写在指标的定义里——缺了不是精度下降,是算不出来。其余字段缺了会让分析变粗,缺这两个会让分析不存在。

工程量级上,各字段的缺失率随渠道管理水平、系统必填校验与地区差异变化,是平台相关量,须由本项目按实际数据统计,本课不给数。但本课要求一件事:把降级记录数与总记录数一起报——能进第一档而进不了第二、三档的记录占多少,这个比例本身就是数据治理的体检指标,它直接决定第 2 讲有多少车能进队列,应当按月自测跟踪。

易错点是用生产日期代替交付日期建队列。两者之间隔着渠道库存期,而库存期在爬坡期和平销期差别很大。代替之后车龄系统性偏大,同一批车被算成「已经在役更久却只坏了这么多」,故障率系统性偏低。它属于第 3 讲要讲的观察值偏离成因里「进入延迟」的一种形态,只不过这一种是自己造出来的。

图4 索赔单字段(纵轴)与三档用途(横轴:频次统计/MIS 队列与故障率/里程维分析与里程基拟合)的能力矩阵,格子只用实心、空心、禁止三种符号并给图例;右侧粗边判据框用两条引出线分别指向交付日期与进厂里程两行。本图为示意,不得据图取值。
图4 沿列读:手上的数据缺哪一格,就止步在哪一档用途。交付日期与进厂里程是两条硬门槛,缺任一项这条记录只能停在第一档;而第一档不是废记录,它有合法用途,只是不能拿去算率。图上不给任何字段的缺失率——那是本项目按月自测的数据质量指标;实际字段名与必填校验以本项目索赔系统为准,不得据图取值。

(图上把「生产日期与交付日期」「进厂日期与进厂里程」这类复合项拆开逐行摆,便于逐格核对;正文按九组讲,两者说的是同一件事。)

1.3 三段映射成功的判据只有一条:能不能唯一落到一个可更换件

三段映射链是:工时码 → 维修动作故障码 → 现象/抱怨零件码 → 物料号 → 设计件。但真实数据里同时存在九类码,沿「一次维修产生了哪些码」这条线数只会数到中间那一层:

  1. 客户抱怨码/VOC 码(客户语言);
  2. 技师故障码(技师判断);
  3. DTC(车端码,与第 2 类是两个体系,不可混用);
  4. 工时码(维修动作);
  5. 零件码 → 物料号 → 设计件;
  6. 责任判定码(保内/保外/善意/供应商责任——它决定这条记录进不进分子);
  7. 车型配置码(同一物理件在不同配置下零件码不同,映射必须带配置);
  8. 服务站与地区码(渠道维度,第 2 讲的双榜单与第 5 讲的分层比较都要用);
  9. 供应商批次/炉批追溯码(本课归纳补入)——它是「能不能按批次围堵」的唯一前提,而映射链最常断在这一节。

映射天生不是一对一:一次总成更换会对应多条工时行;同一物理零件在不同车型配置下零件码不同。所以映射的目的不是把码翻译成中文,是把一条维修记录落到一个可更换件上。判据也只有这一条:能不能唯一落到一个可更换件。之所以以「可更换件」为单位,是因为后面几乎所有动作都以它为单位——批次围堵按可更换件围,返回件的应返清单按可更换件开,DFMEA 的原因层追溯也要落到具体的可更换件上。

工程量级上,映射成功率与「映射不到可更换件」的码占比取决于本项目的码体系设计粒度与配置管理质量,是平台相关量,须由本项目实测,本课不给数,也不给「成功率达到多少才算合格」的门槛——那是本项目自己的数据质量目标。本课给的是四种失败形态与各自的处置:

失败形态 说明 处置
落到多个件 映射没带配置维度 映射表带配置码重做
落到总成,而总成下面还有子件 粒度过粗 这本身就是设计侧粒度问题的证据,出口 K5-01 OBD/UDS 诊断与故障码(DTC)设计K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁
落不到任何件 码表缺维护 补码表,并把这一类的量单列
落到已作废件号 图纸版本不同步 映射表随图纸版本受控更新

第二种要特别说明:映射不到可更换件不是数据问题,是设计信号。它说明车端报出来的东西与售后能换的东西粒度对不上,这条线索的去向是诊断设计侧,不是数据治理侧。把它和「脏数据」堆在一起处理,等于把一条设计侧的证据当成录入错误擦掉。

易错点是把映射表做成一次性的电子表格对照,而不是随车型配置与图纸版本一起维护的受控文件。配置一改、件号一升版,映射就静默出错,而且不报错——出来的每一条记录看上去都落到了某个件上,只不过落错了。

图5 上半部九类码按客户侧、技师与车端侧、物料与渠道侧三层堆叠;下半部三段映射链主干汇入判据框「能不能唯一落到一个可更换件?」,两个出口分别通向可进入分层统计与设计侧粒度证据;链上标三处断口符号,技师故障码与 DTC 之间画一条被划掉的等号。本图为示意,不得据图取值。
图5 读三件事:沿「一次维修产生了哪些码」数只覆盖中间一层,客户侧与物料渠道侧会被整层漏掉;三处断口各有独立标签,可拿自己的映射表逐处对照判断断在哪一节;映射失败走的是设计信号出口,不与脏数据出口混在一起。标★的码类为本课归纳补入;各码的命名与层级以本项目售后系统为准,不得据图取值。

1.4 本课这张表是事后归集,K5-01 OBD/UDS 诊断与故障码(DTC)设计 那张是事前指引——两张表字段互引,不互相定义

本课的三段映射表和 K5-01 OBD/UDS 诊断与故障码(DTC)设计 的「DTC → 维修动作」映射表长得很像,但产出方与用途都不同,分工在这里写死:

  • 本课这张表回答的是:一条已经发生的维修记录,对应哪个设计件。它是事后归集,用途是统计。
  • K5-01 OBD/UDS 诊断与故障码(DTC)设计 那张表回答的是:车端报了这个 DTC,技师该做什么动作。它是事前指引,用途是维修。

为什么必须分开:如果本课去重讲 DTC 设计,读者很容易得出一个反向的结论——「既然索赔数据能看出这个码修不到件,那就从索赔侧反过来定义 DTC 的语义」。但 DTC 的语义是由诊断设计定的,本课能做的只是观察它在场端表现出的统计性质(第 4 讲会给出按 DTC 码分层的那张三列表:NTF 率、误换件率、无码抱怨占比)。观察到的统计性质是证据,不是新的定义。

工程量级上,本课不给任何 DTC 的编码规则、位定义或阈值。本课只给两张表之间的字段互引关系:DTC 码是两张表共同的键;本课这张表在此之外另加责任判定码与批次追溯码——这两项在维修指引里用不上,在统计里却是分子归属与批次围堵的前提。

易错点是在索赔分析报告里直接写出「建议把某 DTC 改成某某含义」这一类越界结论。正确做法是只给统计事实与去向:这个码的 NTF 率是多少、误换件率是多少、无码抱怨占多少,然后写清该治误报的回 K5-07 诊断与保护阈值的整定、验证与复验、该治定位粒度的回 K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁,判断留给他们。

1.5 拆机前不读码,冻结帧就永久没了:取证顺序要写进服务通报,而不是靠提醒

客诉工单与 DTC 快照的挂接有三条动作,顺序是固定的:

  1. 先读码存档——拆机会清掉易失信息,这一步做不了第二次;
  2. 按冻结帧记录的工况复现一次(环温、SOC、车速、模式);
  3. 把快照随件一起送走

这条取证纪律出自 M2-02 热管理常见质量问题与根因分析,本课的动作是把它写进服务通报与返回件委托单——写成条款,不是写成提醒。

为什么这一步落在第 1 讲而不是第 4 讲:第 4 讲要按 DTC 码分层统计 NTF 率与误换件率,而分层的前提是每条记录都挂得上码。挂不上的怎么办?必须显式进「未知码」桶,不能被丢掉。丢掉的话,「诊断覆盖不到的那些失效」在报表里就永远不出现——报表看起来是完整的,因为缺的那一类连一行都没有。这正是「未列入的项被默认当成不存在」的典型形态,而它的默认值不会被任何检查覆盖。

工程量级上,未知码桶的占比及其目标值取决于服务通报的执行率与诊断仪的存档流程,是平台相关量,须由本项目实测,本课不给数,也不给目标值——目标值要与本项目的诊断改动节奏一起定。本课给的是它的两种读法

  • 占比高且集中在少数几个现象上 ⇒ 这几个现象缺码,去向是 K5-01 OBD/UDS 诊断与故障码(DTC)设计(补码或改码的覆盖范围);
  • 占比高且分散 ⇒ 取证纪律没落地,去向是服务侧(服务通报、培训、诊断仪存档流程)。

两种读法指向完全不同的部门,而分辨它们只需要看一眼分布形状。

易错点是把无快照工单直接排除出分析集。排掉之后,未知码桶的占比恒为零,看板上永远是一片绿——而这一桶的占比本来就不是数据缺陷指标,是诊断设计的体检指标:它回答的是「诊断有没有覆盖这类失效」,答案要交给诊断设计侧,不是拿来自我批评数据质量。

1.6 三包是法定最低那一层,不是保修的全部——不打标,故障率就是商务政策的函数

保修边界至少有两层,实务上是三层:

  • 法定最低那一层——《家用汽车产品修理、更换、退货责任规定》(市场监管总局规章)规定的是企业不能低于的责任底线;
  • 合同/商务保修与延保——由本项目的商务政策确定;
  • 善意维修与政策性赔付——超期或超范围但企业决定赔付,边界不规则、常常是个案决定。

因此同一次维修可能落在三种状态里:法定内保修外但商务赔付双方争议待判。三种状态如果不加区分地混进分子,那么每一次商务政策调整——延保上市、区域促销、善意口径放松——都会让故障率跳一档,而产品没有任何变化。把打标做在记录级而不是报表级,分子才能按需要重算:只算法定内的、算全部赔付的、算全部失效的,三种口径都能从同一份数据出。

本课不给三包的具体年限、里程与条款内容。本课未独立核对过该规定的现行版本原文,按「未核对过原文的条款只写去向不写内容」的纪律,这里只讲它是哪一层;条款内容与施行版本按现行版本确认、引用前须核,版次与施行日期不得写成一个定值。商务延保那一层本来就是合同量,随车型、区域与销售阶段变化,同样不给数——期限、善意维修的判定边界、政策性赔付的比例,都由本项目按自己的政策文件确定。

这里顺带把本课涉及的四类外部文件的写法统一交代一次,第 4 讲与第 5 讲照此办理:

文件类别 它管什么 本课怎么写
三包规定 保修的法定最低边界 只写它是哪一层,不转述年限、里程与条款
召回条例及其实施办法 缺陷调查、备案、召回实施与报告的法定程序 只写位阶与出口在哪(M4-01 热管理相关标准(GB/ISO/SAE)体系),不转述时限与格式
汽车行业质量管理体系文件 含保修管理与无故障返回件分析的要求 只写去向,条款号与版本按现行版本确认
保修/索赔管理与 NTF 分析的行业参考手册 可作方法参照 名称本身按现行版本确认,本课只作类别指代、不编具体编号,也不转引手册里的任何判定值

四类一律采用同一种写法:写清它管什么、去哪查,不转述条款内容与限值。理由是来源分三级——标准原文优于行业协会/手册,手册优于供应商数据表——而本课未取到任一份原文;转引一个没核过原文的判定值,与自己编一个的后果相同。国内实务中,索赔口径的实际依据常常是各主机厂自己的保修政策文件与索赔手册,本课不引具体编号。

易错点有两个。一是把「按现行版本确认」写成一句免责声明放在文末,而正文里照旧写了具体限值——那句声明挡不住任何人:读者读到的是正文里那个数。正确做法是正文里根本不出现那个值。二是把「保修期」当成一个常数写进分析脚本(比如按固定月数截断队列)。车型不同、区域不同、有没有延保不同,一旦政策变了或换个车型跑同一段脚本,整份队列的截尾点就错了,而脚本不会报错。正确做法是把保修边界做成随记录带的字段,不是脚本里的常量

图6 一条无刻度的服役进程轴上自下而上叠三条边界带——法定最低责任、合同与商务保修及延保、善意维修与政策性赔付(锯齿边),三条带右端均画成开口箭头并各标明由谁给出;轴上三个示例进厂点引向同一道打标闸,闸下列出法定内、保修外但商务赔付、双方争议待判三类结果。本图为示意,不得据图取值。
图6 读三件事:保修边界不是一条线而是叠起来的多层,同一次维修可能同时落在不同带里;每条带的右端都是开口箭头,图上读不出任何年限或里程;打标闸输出三类而不是两类,争议件必须有自己的标签,否则它会被默默算进或算出分子。法定边界以现行规定为准、商务边界以本项目政策为准,不得据图取值,也不得据图判断任何具体保修期限或某次维修的责任归属。

1.7 到件率不是后勤指标,是本课全部解剖结论的样本代表性上限

返回件闭环分四段:应返清单 → 到件登记 → 分级解剖 → 结论回签(⚠ 全课只此一套切法,四段各自的交付物与那道到件率闸在第 4 讲 4.1 展开,⛔ 不另起第二套四段)。第 1 讲只做一件事——把两个率的分母钉死;判定规则本身写成可执行条款,那是第 4 讲的活。

指标 分子 分母
到件率 实际到件数 应返数(按分层抽样定的清单,既不是全返也不是随机返)
有效到件率 证据未被破坏、可判定的到件数 应返数
NTF 率 按判定规则未复现故障的返回件数 到件的返回件数(不是索赔数、不是换件次数)
误换件率 判定为换错件的次数 换件次数(与 NTF 率不是同一个分母)

为什么要在第 1 讲就立:这两个率在后面被反复引用,而它们的分母各不相同;若拖到第 4 讲才第一次出现,读者在第 2 讲整理分母口径时无处安放它们。更要紧的是到件率的地位——它不是流程指标,是准入判据。先立在这里,第 4 讲的两条禁令才有落点:

到件率低于事先约定的门槛时,本轮解剖结论只能作定性线索,不得用来改故障率结论,也不得用来改 DFMEA 的 occurrence。

这条禁令背后是本课的一条基本判断:索赔表天然是现象层的(客户说不制冷、技师换了某个总成),而设计侧最想改的三个字段绑的都不是现象——DFMEA 的 occurrence 绑失效原因的发生率、DVP&R 的验证项绑载荷与失效机理、工况谱权重绑使用侧暴露。从现象层到原因层只有一条通道:返回件到件 → 解剖 → 判定。所以到件率就是本课全部解剖结论的样本代表性上限——通道有多宽,结论就只能有多硬。

如果允许用现象层的索赔率直接去改 occurrence,会发生什么:同一个现象下面往往挂着好几个不同的原因,用现象层的一个数去改,等于把这几个原因合并成了一个数;改完之后按 AP 表重排出来的优先级,指向的是一个不存在的原因。同理,据现象层数据去补 DVP&R 的验证项,补出来的载荷也会补错——现象不告诉你是哪一种载荷把它逼出来的。

工程量级上,到件率门槛本身是平台相关量,本课不给数——它取决于本项目的物流能力、件值,以及这一轮结论要用到哪一层(只是定性排查,还是要改 O 值)。下面这组数是教学假设值,不对应任何平台,不得取用,它只用来说明「样本代表性上限」这件事的量级与算法:

应返 100 件、实际到件 28 件 ⇒ 到件率=28%;其中 12 件被现场清洗过、证据已毁不可用 ⇒ 有效解剖样本 16 件 ⇒ 有效到件率=16%

由此推出本课的一条硬要求:报到件率时必须同时报有效到件率(⚠ 全课统一用这一个名字,⛔ 不另写「有效解剖率」——它的分母是应返数而不是解剖件数,名字里的「到件」正是为了把分母写进名字里;第 4 讲 4.1 复述时与这里同名同分母)。上面这组数里,28% 与 16% 之间那一截(12 件)就是取证纪律没落地的量——它不是物流问题,是 1.5 节那条纪律没有写进服务通报的直接后果。只报 28% 的话,这一截完全看不见,而下游会按 28% 去判「样本够不够」。

易错点有两个。其一是把到件率当成一个后勤 KPI 交给备件物流去管,于是它在质量结论里根本不出现——正确用法是把它当成准入判据,写在解剖报告的第一页,没过门槛就先声明结论只能作定性线索。其二是把到件率与 NTF 率并排放在同一张看板上却不标分母,读者会把两个百分数相加或相减——它们的分母一个是应返数、一个是到件数,相加相减都没有意义。凡是这两个率同框出现,分母必须写在数字旁边

(返回件的运输与保存条款、解剖分级与分流、NTF 判定的可执行条款,全部在第 4 讲展开;取样留证链与表征手段本体见 L7-07 失效件表征与跨材料族失效分析方法(取样留证—金相/断口—SEM-EDS—FTIR/DSC—离子色谱),本课只负责把它写进服务通报与委托单。)

1.8 字段值全对的记录,照样可能不该在这个分子里

清洗只清场端专有的脏,分两组,一共十类。分组的那条线本身就是判据:

第一组【字段值错】四类——问的是「这个字段填得对不对」:

  1. 重复索赔与短期返修;
  2. 一车多单跨服务站;
  3. 零件码错挂(同名不同件、总成码填成子件码);
  4. 日期/里程缺失与录入位数错(里程多一位零最常见,判据=与同车历史工单的里程单调性冲突)。

第二组【字段全对,但这条记录不该在这个分子里】六类,均为本课归纳补入——问的是「这条记录该不该在这个分子里」:

  1. 非质量索赔混入(事故、外力、改装、误操作、被盗、进水);
  2. 商务性赔付混入(善意维修、政策性赔付、销售促成——它们是真花了钱的,但它们不是失效);
  3. 同一物理失效跨保修边界被拆成两单(保内一单、保外一单;去重规则若只在保内表里做,会把它算成两次,也可能算成零次);
  4. 车辆归属错(VIN 不属于本车型/本平台:试装车、工程车、展车、出口车——即 1.1 节那条硬判据的落点);
  5. 时间倒挂(进厂日期早于交付日期、同车里程非单调);
  6. 改单/撤单后的历史版本残留(同一次维修在库里有多个版本,直接汇总会重复计;判据=同一维修单号存在多个版本时只取终版)。

两组的性质完全不同,这才是本节的题眼。第一组的记录会在汇总时表现为异常值——里程多一位零,画个散点图就跳出来了,人容易发现。第二组每个字段都合法、汇总时也不异常,它只是让分子悄悄多出或少掉一块,而且方向不定:非质量索赔和商务性赔付让分子偏多,跨保修边界拆单可能偏多也可能偏少,车辆归属错则视这批车的实际状况而定。只做第一组的话,清洗完的记录集看起来是干净的——所有可见的毛刺都没了。

工程量级上,十类各自的占比与清洗后的剔除率随系统、政策与渠道差别极大,是平台相关量,须由本项目实测,本课不给数。这里特别不给「脏数据一般占多少」这一类数:写了读者就会拿它当验收线,而清洗的验收线只能是判据全过,不是剔除率落在某个区间。本课对每一类给的是一条可执行的判据(如第 4 类的单调性冲突、第 9 类的日期倒挂、第 10 类的终版取值),不是一个比例。

本课的交付要求是:把清洗结果做成一张剔除台账——每一类剔除了多少条、依据的是哪一条判据,随分析结果一起交付。被剔除的记录不删行,走一条支线进台账,带上剔除理由码。

易错点是把清洗写成脚本里一串连续的过滤条件,没有台账。后果是别人复算不出同样的数,而且更麻烦的一点:两次分析结果有差异时,说不清是数据变了还是清洗规则变了——这两种成因的处置完全相反,一个要去追数据,一个要去追规则。

最后埋一件事,留给第 2 讲。第 1 类「重复索赔与短期返修」的剔除,看上去是清洗,其实它已经踩到分子的定义上了:一次进厂的多条工时行合并成一次还是各算一次?同车同码短期内二次返修,算新故障还是同一故障的延续?这两问没有普适正确答案,只有「声明了」和「没声明」的区别;而两种取法能把同一批数据的结论差出一档(具体差多少由本项目的开单习惯与返修比例决定,须用本项目数据两种规则各算一遍才知道,本课不给差值也不给倍数)。所以清洗这一步只负责把这类记录识别出来并打上标,怎么合并留到第 2 讲写死去重规则,并随数据一起交付。

(清洗方法学与不确定度语言引 L7-03 试验数据分析与不确定度评估,数据管线与脚本工程化引 Q3-01 热管理工程师的数据分析与 Python 脚本,本课不重讲。)

图7 一条记录从左侧进入,先后穿过两组底色明显不同的过滤闸:第一组四类字段值错,各类下写一行可执行判据;第二组六类「字段全对但不该在这个分子里」,均带★角标。两组之后是「可进入分子的记录集」出口,被剔除的记录走一条向下支线进入含理由码的剔除台账;图底另有一条灰色对照路径只穿过第一组直达出口并加禁止符号。本图为示意,不得据图取值。
图7 读三件事:两组闸的分线就是判据本身——第一组问字段值对不对,第二组问这条记录该不该在这个分子里;剔除不等于删除,被剔的记录有自己的去处与理由码,否则清洗过程不可复核;灰色对照路径同样能走到出口,所以只做第一组时记录集看起来是干净的。标★的六类为本课归纳补入;各判据的具体阈值与实现由本项目定,不得据图取值。

本讲小结:这一讲把「一堆维修记录」变成了「一个每条都知道自己是什么的记录集」。做了七件事——切死 field 的含义(市场在役车,不是试验场地)并立起全课符号表;把数据入口摊成十条通道并给每条一个二值打标(是不是失效/是不是保内,两列分存);钉住最小可用字段集与那条硬判据(缺交付日期或进厂里程就算不出任何率);把三段码映射的成功判据收敛成一句(能不能唯一落到一个可更换件),并把映射失败识别为设计信号而非脏数据;把拆机前读码存档的取证顺序写进服务通报,让「未知码」桶显式存在;把保修边界拆成叠起来的多层并要求记录级打标,否则故障率会变成商务政策的函数;把到件率、有效到件率、NTF 率、误换件率四个率的分母钉死,并把到件率立成准入判据而不是后勤指标。第 2 讲开始用这个记录集算数——先解决分母。

后面还有 5 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做

会员专属

后续为会员深水区内容——四库数据与深度拆解。

查看会员方案