M2-02 热管理常见质量问题与根因分析
课程代码 M2-02 · 板块 M 项目、质量、成本与合规 / 质量工具与体系 时长 约 4.0 小时(7 讲) 前置 M2-01 质量工具:PPAP/8D/SPC/MSA;体系外前置(需自备):热管理系统基础(制冷/冷却回路,A/C/F 板块);A5-08 从现象到系统:热管理常见故障现象的入门分诊法(建议前置——objective2「从现象快速缩小根因排查范围」默认学员已能把现象路由到子系统,售后/服务/质量转开发的人从 A5-08 进来再学 8D 才接得上) 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 M2-02 大纲的完整展开版
引言:8D 表上 D4 那一格,怎么才算填对了
一份批量投诉的工单到你手上,8D 表打开,D4 那一格要你写一条「根本原因」。难的从来不是把这一格填满——现象摆在那儿,有经验的人当场就能说出三四条听起来都成立的原因;挑一条写进去,D5 的对策写得出来,D6 的验证数据也交得上,8D 按时关闭、指标好看。真正的麻烦要等下一批件上原样复发时才暴露:那一格里填的是一个说得通的故事,而说得通的故事可以同时有好几个,你挑中的未必是真的那一个。⇒ 这门课要教的不是怎么把 D4 填满,是怎么判断它填对了。
本课站的是离线拆车这一段:车已经进厂、件已经拆下来,你要交出的是三样东西——一条能被开关的原因、一条打在这条原因上的对策、一条写得出门槛的结案出路。围绕这三样,全课有两根钉子和一根反钉子;它们在引言里立,在后面每一讲各敲一次。
钉子①:一条结论要当「根本原因」,必须过「双向可复现」这道门
验收分两半。充分性——这条原因能解释已经观察到的全部现象,包括那些不方便的:为什么只有这一批、为什么只在这个工况、为什么隔壁那台一模一样的车没有。必要性——在不改别的条件下把它开关一次:加上它现象再现,去掉它现象消失。
只有充分性的结论,就是上面那个「说得通的故事」;把它写进 D4,D5 的对策就打在空处,而 8D 照样能关闭、指标照样好看,问题会在下一批原样回来。⇒ 本课因此把「根因找到了没有」这件靠感觉的事,换成四句可以当场问出口的话:(a) 它解释得了「为什么只有这一批 / 只在这个工况 / 为什么那台同样的车没有」吗?(b)「加上它、现象再现」这一半我做过吗?(c)「去掉它、现象消失」这一半我做过吗,去掉的时候有没有同时改了别的东西?(d) 这两次开关是我主动做的,还是等它自己发生的?四句里凡是答不出的,这条结论就还是假设——⛔ 不许写进 D4,更不许据它关闭 8D。
⚠ 本课不给「复现几次算够」的数(它取决于问题严重度与统计口径,属平台相关量,须由项目确定),但给一条不依赖次数的判据:开关必须是你主动做的。等它自己再出现一次,那不是必要性验证。8D 与 5Why 本身并不产出根因,它们只是逼你把这道门做出来的脚手架。
钉子②:现象进入根因分析之前,先过三道分流闸
8D 的对象是「一个能归因到件或过程的缺陷」。有三类现象长得很像缺陷,但根本不是它:
① 这是不是设计意图——低 SOC、快充、化霜等场景下策略主动收紧性能,用户感知为「空调突然不给力」「暖风忽然变弱」,件没坏、策略也没错(见 K5-02 热管理故障处理与降级策略)。判为让路的走产品/策略评审,⛔ 不做质量 8D;否则会把设计意图当缺陷拆机,还会污染索赔统计的分母(口径接 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计); ② 这是不是软件、标定或传感器假读——件没坏,是策略误报或信号不可信。先用数据排掉,⛔ 不拆件; ③ 这属不属于本课这一段——还停在「现象→哪个子系统」的分诊阶段(去 A5-08 从现象到系统:热管理常见故障现象的入门分诊法)?属跑着的车上的在线辨识(去 K5-05 在役健康度与渐变衰减辨识:从车端信号到服务决策 / K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁)?属索赔表口径与真实故障率(去 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计)?
⚠ 三道闸是排除不是怀疑:排不掉就明确写「未排除」并把它继续留着,⛔ 不许因为排不掉就跳过去;⛔ 也不是「先怀疑软件」。三道闸的成本量级是「读一次数据」,而闸后的第一个动作是「拆一台车」——顺序颠倒,付出的是工时与整车占用这一整档的代价。
★★ 反钉子:「没检出」不等于「不存在」
这是全课最容易被读反的一条。现场嗅探扫了一遍没报警、部件单测全项合格、读码没有故障码、换总成后问题消失——读者的默认理解是「那就排除了」。而这四句共同的语义只有一句:用这个方法、在这个工况下、这一次没看到。一个阴性结果的排除力,等于该方法对该失效的检出能力;而热管理最贵的四类失效——慢漏、阀内漏、间歇性信号漂移、微裂纹——恰好各自落在常用方法检出能力最低的那一档。
读者读反之后会做的那个具体动作是:把阴性结果当成证据写进 8D 的 D4,用它把某个候选根因划掉;或者据它结案(「未见异常」「未复现」)把车放回去。这一个动作同时踩四个坑:
· 候选表少了一列,而那一列往往就是真因——被划掉的候选不会再被检查,后续每一步分析都在一张缺列的表上做,而表面上它看起来是完整的; · 它把「方法的局限」记成了「件的清白」——责任从检测方法悄悄转移到了件上,于是没有人再回头问一句「这个方法本来查得到它吗」; · 渗透型泄漏这一整类会被结构性地漏掉——软管本体整个壁在渗、根本没有漏点,任何点定位方法对它都不是灵敏度不够,而是用错了类;而「扫一遍没报警」会让人以为已经查过了; · 它让「换总成后问题消失」变成结案理由——换件同时换掉了新件、重新装配、重新拧紧、重新充注,⛔ 它不是一个单因子开关:现象消失既可能是根因被换掉,也可能是被这些扰动暂时压住。
⇒ 正确写法只有一句,但每次都要写全:「用 X 方法、在 Y 工况下未检出,未排除」——写明方法与工况,并把这一列留在候选表里。要真正排除,只有两条路:换一个检出能力更高的方法,或换到这个失效更容易暴露的工况,再拿新的阴性结果去排除。⚠ 反过来也要防:⛔ 不得因为「阴性没有排除力」就把所有候选无限期挂着——那是把一条判据用成了不作为的借口。
⇒ 于是「扫过了没报警,不漏」「单测合格,件没问题」「没有故障码,硬件是好的」「换了总成就好了,根因找到了」这四句话,在本课里只会以被点破的错句出现:第 2 讲讲检漏方法与灵敏度时当场点破一次,第 3 讲讲部件单测合格与阀内漏、第 5 讲讲无故障码时各复敲一次,第 7 讲讲「外观正常但功能已失」时收口。⛔ 它不会只被丢进末尾的误区节了事——读到那里时,读者已经带着「查过了就是没有」的印象读完了整整七讲。
另有五条直觉,会把人带向相反的动作
它们不像反钉子那样贯穿全课,但每一条都对应一个读反后会立刻去做、而且看起来还挺负责任的动作。五条都会在正文里当场点破,⛔ 不只列进误区节:
(a) 「制冷量不足 ⇒ 先补点冷媒」——过充同样表现为制冷量不足且排气压力偏高,与冷凝不良同向;补下去会把系统推得更远。方向要靠过冷度与过热度的组合判(判法去向 C1-03 充注量优化与系统油循环管理),⛔ 不靠「感觉不够冷」。(第 3 讲) (b) 「散热变差 ⇒ TIM 涂厚一点」——厚度增加直接抬高体积热阻,而且泵出量随装配厚度与厚度的循环变化幅度增大,越涂越差。控制量是装配后的实际间隙与压紧力,不是涂布量(去向 H5-03 TIM 可靠性、泵出与老化)。(第 3 讲) (c) 「怕腐蚀 ⇒ 旁边换一个更耐蚀的贵金属件」——把阴极换得更贵,只会让阳极(多半是铝件)腐蚀得更快;面积比才是放大器,大阴极配小阳极最危险(去向 H6-02 阳极氧化、锌层与电偶腐蚀防护)。(第 4 讲) (d) 「支架开裂 ⇒ 把支架加厚加强」——加质量会移动模态频率,可能把共振点搬进激励带里,裂得更快;疲劳的控制量是应力幅与循环数,不是静强度余量(去向 I4-03 模态、共振规避与结构 NVH 设计 / J5-03 振动、模态与随机振动疲劳)。(第 4 讲) (e) 「5Why 问到员工没按 SOP 就到底了」——那是入口不是出口:下一层要问 SOP 本身对不对、有没有防错、为什么不按也能流过去。(第 6 讲)
本课的射程:四段活,别当成一段
「查故障」这三个字底下其实是四段判据、成本与产出物都不同的活:
· 分诊——现象→哪个子系统,最少证据、三问两测,追求快和便宜,产出「去查哪个子系统」(A5-08 从现象到系统:热管理常见故障现象的入门分诊法); · 离线根因——拆解后归类到一条可复现的真因,追求可复现与可验证,产出「一条能被开关的原因 + 一条对策」(本课); · 在线辨识——跑着的车上的渐变衰减与代理量,追求不拆车就能判,产出「一个能在车上算的判据」(K5-05 在役健康度与渐变衰减辨识:从车端信号到服务决策 / K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁 / K5-06 冷却液流量的在线估计与流量/内漏类故障诊断); · 索赔统计——从工单表读出真实故障率,追求口径干净,产出「一个分母干净的故障率」(M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计)。
⚠ 两个方向的串台都很常见:把 8D 用在分诊阶段,会在错的子系统上把工时耗光;把本课的离线结论直接搬成车端判据,也多半行不通——离线拆得到的量,车上往往取不到。
与本课相邻、本课只给去向不重讲的还有:8D 的工具本体(表格、时限、评审)归 M2-01 质量工具:PPAP/8D/SPC/MSA;D3 遏制与 D5 永久对策的分辨、供应商与来料控制归 M2-03 供应商质量与来料控制;变更申报通道与再验证范围判定归 M2-06 量产阶段变更控制:4M 变更申报、再验证范围判定与量产断点切换;物证怎么取、用什么手段判、结论怎么写属表征层,通用链归 L7-07 失效件表征与跨材料族失效分析方法(取样留证—金相/断口—SEM-EDS—FTIR/DSC—离子色谱),压缩机类返回件走专用取证链 G1-08 电动压缩机失效件判读与烧毁后的系统处置;NVH 的试验方法与评价量表归 L6-01 空调系统 NVH 试验与声品质评价;清洁度目标、检测方法与产线管控归 I5-05 流体回路技术清洁度与颗粒污染控制:目标设定、检测方法与产线管控;异味与污染类的机理与处置归 C4-02 车内空气质量(VOC/异味)与净化技术 / C2-12 冷凝水排放、防霉与蒸发器自清洁。⚠ 「本课不讲」⛔ 不等于「不重要」——本课那个案例的真根因,最后就落在变更管理这一维上(对策落点去向 M2-06 量产阶段变更控制:4M 变更申报、再验证范围判定与量产断点切换)。建议先读 M2-01 质量工具:PPAP/8D/SPC/MSA(工具本体)与 A5-08 从现象到系统:热管理常见故障现象的入门分诊法(入门分诊),本课默认你已经能把一个现象路由到子系统。
两条阅读约定
第一条,本课有大量地方不给数,那是判据不是省略。产线检漏工位的判定阈值、现场仪器的可检下限与本底、O 型圈压缩率窗口与拧紧扭矩、充注量允差、目标寿命循环数与振动载荷谱、传感器漂移门槛、PPM/DPMO 的门槛与严重度分档——这些全部取决于件型、平台、工艺能力与顾客特殊要求,本课一律写「取决于什么、须由谁给出」,⛔ 连图上也不给刻度值与门槛竖线的位置。⚠ 与之相对,正文里出现的几组算例数字(不良率与缺陷数的对照例、疲劳指数的灵敏度、热应力的量级)全部是教学假设值,只用来把算法走通,⛔ 不对应任何平台、⛔ 不得被引用为「典型值」。
第二条,本课有几处把通行的分类补全了,补的地方都会标出来。失效模式补到六类+一条横轴、泄漏路径补到七类、「制冷量不足」的候选根因补到九列、结构失效的驱动载荷补到九类、根因维度补到七维、证据类型七类、结案出路六条+一个升级状态——每一处都会写明「沿什么线索数会漏掉谁」,并注明这是本课归纳、⛔ 不是既有分类。⇒ 这样做的理由只有一条:漏掉的那一类不会以「少了一条」的形式暴露,它是整类不出现,而清单看起来是完整的。
全课路线(七讲)
第 1 讲 框架与货币:把两根钉子与反钉子讲透,画出失效模式全集(六类+一条横轴),立起「部件—现象—根因」三层框架,并把严重度这门「货币」说清楚——PPM 与 DPMO 数的不是同一样东西,帕累托该按什么排。 第 2 讲 泄漏类:七类泄漏路径、方法 × 场景两条轴的检漏方法表、漏率的几道口径关卡(氦漏率≠冷媒漏率、保压法测到的常常是温度不是漏)、泄漏点定位的三类误判、慢漏的正确打法,以及检漏标准分四层、跨层引用就是射程错误。 第 3 讲 性能衰减类:「制冷量不足」的候选补到九列并逐条给分离判据、先排传感器假读再进硬件的次序约束、换热效率下降的三支、TIM 泵出、传感器漂移、多通阀内漏的机理与它的指纹。 第 4 讲 结构与耐久:驱动载荷九类、疲劳寿命对应力幅的灵敏度、静强度校核过关不等于疲劳过关、热应力式的两个射程与「全约束是上界」、热冲击与热循环之别、电偶腐蚀的四要素与面积比、塑料件的时间尺度。 第 5 讲 控制与电气:EXV 卡滞三型的对策落点、通信故障的四层分法、两类「零件无故障」的不同入口、「先用数据排除软件再拆硬件」落成五步操作序、节温器卡开与卡闭的两个量、车端取证纪律与冻结帧。 第 6 讲 根因方法论:根因维度补到七维、让路判别前置、5Why 的两条停止判据、鱼骨发散与 5Why 深挖的先后、对比试验与简化 DOE 是用来杀假设的,以及证据七类各自「能证明什么、不能证明什么」。 第 7 讲 闭环与结案:通用症状分诊模板五步、NVH 责任件判定链路、分诊与根因两段之别、「外观正常但功能已失」收口、结案出路六条+一个升级状态、8D 关闭判据落到本课能判的三条,最后把案例的决策链完整走一遍,并用一次动手做把本课的学习目标逐条验到。
第 1 讲 先判对象,再谈根因:根因的验收标准与进入分析之前的三道闸
大多数根因分析做砸的地方,不在"分析"这两个字上。它砸在两头:一头是对象选错了——花了整车工时去拆一台根本没坏的车;另一头是验收标准太软——写进报告的那条"根本原因"其实只是一个说得通的故事,没有人问过它经不经得起开关。这一讲把这两头都钉死:先给根因一个可执行的验收标准(本课要反复敲的第一根钉子),再给一道在动手之前就该过的分流闸(第二根钉子),然后交代本课的射程、要排查的失效模式全集、贯穿全课的三层框架,最后落到两个每天都在被误用的量化指标上。这一讲不讲任何一个具体零件怎么坏——那从第 2 讲开始。
1.1 根因的验收是两半:能解释现象只是入门票,还要能被主动开关
一条结论要当"根本原因",验收分两半,缺一半都不成立。
第一半是充分性:这条原因能解释已经观察到的全部现象,包括那些不方便的部分——为什么只有这一批、为什么只在这个工况下出现、为什么隔壁那台同平台同配置的车没有。第二半是必要性:在不改动别的条件的前提下把这个变量"开关"一次——加上它,现象再现;去掉它,现象消失。
落成可执行的形式,就是拿任何一条打算写进 D4(根因这一步)的结论问四句:
- 它能不能解释"为什么只有这一批 / 只在这个工况 / 为什么那台同样的车没有"?
- 我做过"加上它、现象再现"这一半吗?
- 我做过"去掉它、现象消失"这一半吗?去掉的时候,有没有同时改了别的东西?
- 这两次开关是我主动做的,还是等它自己发生的?
四句里凡是答不出的,这条结论就还只是一个假设——⛔ 不许写进 D4,更⛔ 不许据它关闭问题。
为什么必须要第二半:只有充分性的结论,本质上是"一个说得通的故事"。而说得通的故事可以同时有好几个——同一批制冷量不足的车,"压缩机容积效率衰减""膨胀阀开度漂移""充注量偏低"三种说法各自都能把观察到的现象讲圆。把其中一个写进 D4,D5 的永久对策就会打在空处:报告照样能关闭、指标照样好看,而问题会在下一批原样回来。必要性那一半的作用,就是在几个说得通的故事之间做裁决——只有能被开关的那一个,才是原因,其余的是伴随现象。
工程量级:本课⛔ 不给"复现几次算够"的数——它取决于问题严重度与统计口径,属平台相关量,须由项目按自己的严重度定义与判定规则确定。但本课给一条不依赖次数的判据:开关必须是你主动做的。等它自己再出现一次,那不叫必要性验证,那叫又碰上一次。
易错点一(本课最贵的一条):把"换总成后问题消失"当成必要性的那一半。它只做了"去掉"这一半,而且⛔ 它根本不是一个单因子开关——换件这个动作同时改了四件事:换了一个新件、重新装配了一次、重新拧紧了一次、重新充注了一次。现象消失既可能是根因被换掉了,也可能是被这几个扰动暂时压住了。要用它做必要性验证,唯一的路是把被换下来的那个件装回去、现象再现,而这一步几乎没有人做。
易错点二:把"员工没按 SOP"当成根因写进 D4。用上面四句量一量就清楚了——它解释不了"为什么只有这一批"(那批人天天都在那么干),也没法被主动开关(你没法"给它加上一次不按 SOP")。它是入口不是出口:下一层要问的是 SOP 本身对不对、有没有防错、为什么不按也能让件流过去。5Why 的深度陷阱与两条停止判据在第 6 讲展开,这里只是拿它当一个不合格结论的样本。
1.2 进入根因分析之前先过三道分流闸:闸没过就开工,是在错的对象上花整车工时
一个现象送到你手上,第一个动作不是拆车,是判它该不该进来。三道闸依次过:
闸① 这是不是设计意图。低 SOC、快充、化霜等场景下,热管理策略会主动收紧性能——用户感知是"空调突然不给力""冬天暖风忽然变弱",而件没坏、策略也没错。这一类的入口是查降级理由记录与当时的资源账(见 K5-02 热管理故障处理与降级策略)。判为让路的,走产品/策略评审,⛔ 不做质量问题闭环。
闸② 这是不是软件、标定或传感器假读。件没坏,是策略误报或者信号本身不可信。这一类要先用数据排掉,⛔ 不拆件——把标定问题当硬件问题处理,会把大量硬件排查资源耗在一个从来没坏过的件上。
闸③ 这属不属于本课这一段。问题还停在"现象 → 是哪个子系统"这一层吗(那是分诊,去 A5-08 从现象到系统:热管理常见故障现象的入门分诊法)?是要在跑着的车上不拆车判出来吗(那是在役辨识,去 K5-05 在役健康度与渐变衰减辨识:从车端信号到服务决策 / K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁)?是要从工单表读出真实故障率吗(那是索赔统计口径,去 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计)?
为什么这三道闸必须在前面:根因分析的对象是"一个能归因到件或过程的缺陷",而上面三类都不是它。把设计意图当缺陷去拆机,不但拆掉了好件,还会污染索赔统计的分母——本来不该计入的条目进了分母,此后所有基于它算出来的故障率都偏了(口径接 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计)。
工程量级:三道闸的成本量级是"读一次数据"——调降级记录、看冻结帧、做一次传感器交叉校验;而闸后的第一个动作是"拆一台车"。这两档不在同一个量级上。⛔ 具体工时本课不给(属平台与企业口径),但顺序颠倒付出的是工时与整车占用这一整档的代价,这一点跟企业规模无关。
易错点:把三道闸理解成"先怀疑软件"。⛔ 不是。闸是排除不是怀疑——排得掉就分流出去,排不掉就必须明确写下"未排除"并把这一条继续留着,⛔ 不许因为一时排不掉就跳过去当它不存在。这一点与 1.3 是同一条纪律的两个面。
1.3 "没检出"不等于"不存在":一个阴性结果的排除力,等于该方法对该失效的检出能力
这是本课最容易被读反的一条,也是本课在后面每一讲都会回来敲一次的一条。
现场嗅探扫了一遍没报警、部件单测全项合格、读码没有故障码、换总成后问题消失——这四句话在报告里长得像四种结论,其实它们共同的语义只有一句:用这个方法、在这个工况下、这一次没看到。
为什么它不等于"不存在":从"没看到"推出"不存在",中间需要一个前提——该方法对该失效的检出能力足够高。而热管理里最贵的四类失效——慢漏、阀内漏、间歇性信号漂移、微裂纹——恰好各自落在常用方法检出能力最低的那一档:慢漏在现场方法的下限附近、阀内漏在部件单测的工况覆盖之外、间歇性漂移在单次读码的时间窗之外、微裂纹在目视与常规无损检测的分辨率之外。前提不成立,推理就不成立。
读者会做错的那个具体动作(这一条是硬判据,比上面的道理更要紧):把阴性结果当成证据写进 D4,用它把某个候选根因划掉;或者据它结案("未见异常""未复现")把车放回去。这一个动作同时踩四个坑:
- 候选表少了一列,而那一列往往就是真因——被划掉的候选不会再被检查,后面每一步分析都在一张缺列的表上做,而表面上它是完整的。这是最难自查的一种缺陷:你看到的是一张写满了的表。
- 它把"方法的局限"记成了"件的清白"——责任悄悄从检测方法转移到了件上,于是再没有人回头问一句"这个方法本来查得到它吗"。
- 渗透型泄漏这一整类会被结构性地漏掉——软管本体整个壁都在渗、根本没有一个漏点,任何点定位方法对它都不是"灵敏度不够"而是用错了类;而"扫一遍没报警"会让人以为已经查过了。这一类在第 2 讲讲泄漏路径时会正面展开。
- 它让"换总成后问题消失"变成结案理由——1.1 已经拆过这个动作:它同时改了新件、装配、拧紧、充注四件事,⛔ 不是一个单因子开关。
正确写法只有一句,但必须每次都写全:把阴性结果记成"用 X 方法、在 Y 工况下未检出,未排除"——写明方法、写明工况,并把这一列留在候选表里。
工程量级:本课⛔ 不给各方法检出概率的数——它取决于仪器、本底、工况与操作者,须实测标定。本课给的是上面那条可执行的写法,以及两条真正的排除路径:要把一个候选真正排除掉,只有换一个检出能力更高的方法,或者换到这个失效更容易暴露的工况,再拿新的阴性结果去排除。
易错点(反方向的那一半也要防):⛔ 不得因为"阴性没有排除力"就把所有候选无限期挂着——那会让候选表永远收不敛,等于没有分析。正确处置是上面那两条路:换方法,或者换工况,然后拿新的阴性去做排除。
这一条在后面还会正面再敲三次:第 2 讲讲检漏方法与灵敏度时当场点破,第 3 讲讲阀内漏与部件单测合格时敲一次,第 5 讲讲"无故障码不等于硬件没坏"时敲一次,第 7 讲讲"外观正常但功能已失"时收口。
1.4 本课只占四段里的第二段:分诊、离线根因、在役辨识、索赔统计,产出物各不相同
围绕"车上出了个热管理问题"这件事,实际上有四段互不相同的活。它们经常被笼统地叫成"排查",但判据、成本与产出物都不一样:
| 这一段叫什么 | 追求什么 | 产出物是什么 | 归哪门课 |
|---|---|---|---|
| 分诊(现象 → 哪个子系统) | 快和便宜,最少证据、三问两测 | 去查哪个子系统(以及理由) | A5-08 从现象到系统:热管理常见故障现象的入门分诊法 |
| 离线根因(拆解后归到可复现的真因) | 可复现、可验证 | 一条能被开关的原因 + 一条经验证的对策 | 本课 |
| 在役辨识(跑着的车上判渐变衰减) | 不拆车就能判 | 一个在车上能算的判据 | K5-05 在役健康度与渐变衰减辨识:从车端信号到服务决策 / K5-08 诊断使能窗口与故障抑制矩阵:多故障并发的根因仲裁 / K5-06 冷却液流量的在线估计与流量/内漏类故障诊断 |
| 索赔统计(从工单表读真实故障率) | 口径干净 | 一个分母干净的故障率 | M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计 |
为什么要先把这四段分清:因为它们的产出物不同,拿错产出物就是用错了段。分诊给你的是"去查哪个子系统",它不是原因;把它直接当根因结案("判为制冷剂回路问题,已补冷媒"),就是把一个中间结论当成了终点。反过来,把本课的离线结论直接搬成车端判据也不成立——离线拆得到的量(阀芯上有没有杂质、断口是什么形貌),车上多半根本取不到。
工程量级:四段的单次成本差得很远——读一次数据 / 拆一件 / 上一次试验台 / 跑一批数据,这几档不在同一个量级上。⛔ 具体工时本课不给(属平台相关量)。
易错点:把根因分析的那一整套步骤用在分诊阶段。它的每一步都假定对象已经收敛到一个子系统了——问题描述要写清工况、遏制要圈定范围、根因要做开关复现;在还不知道是哪个子系统的时候启动这些步骤,遏制范围会画得过大,复现试验会做在错的回路上,工时会在错误的子系统上耗光。这一条在第 7 讲的闭环流程里还会再展开一次。
1.5 失效模式不止四类:漏掉的那两类是整类不出现,而第七项是横轴不是并列项
排查之前先要有一张失效模式的全集表。热管理最常被引用的分法是四类:泄漏 / 性能衰减 / 结构耐久 / 控制电气。沿这条线索数下去,会整类漏掉两类:
- (5) NVH/异响类——它既不是漏、也不是性能不够、也不一定有件裂了,四类里没有它的位置。试验方法与评价量表去向 L6-01 空调系统 NVH 试验与声品质评价。
- (6) 气味/污染类——蒸发器霉变异味、冷媒油或冷却液渗进座舱、滤芯二次污染。它多数情况下什么都没漏出去(不是泄漏),制冷量也可能完全正常(不是性能衰减)。本课只把它列进全集并给一条归类判据(多数属使用环境这一维、不是件的缺陷),机理与处置去向 C4-02 车内空气质量(VOC/异味)与净化技术 与 C2-12 冷凝水排放、防霉与蒸发器自清洁,⛔ 本课不展开。
这两类补进来之后是六类。但还有第七项,而它不是第七类。
"外观正常但功能已失"是一条横轴,不是一个并列项。阀内漏、密封面微渗、传感器假读都属于这种面貌——件看上去好好的、单测也过,装到系统里就不合格。它切的是"怎么判"那一层,而不是"什么坏了"那一层:前面六类里每一类都可能以这种面貌出现。⛔ 把它并列进清单,读者会去找一种并不存在的"第七种零件失效",然后在拆解台上永远找不到它。
为什么要这么较真:漏掉的那一类不会以"少了一条"的形式暴露——它是整类不出现,而清单看起来是完整的。你按四类去查,四类都查干净了,报告写"未发现异常",而问题落在第五类上。这就是为什么全集必须先画出来再逐项核对,⛔ 而不是沿着自己最熟的那条线索往下数。
⚠ 上面这个"六类 + 一条横轴"的分法是本课归纳补入的,⛔ 不是哪本标准或哪套现成分类里既有的写法;引用时请照这个来源说清楚。
工程量级:⛔ 本课不给各类在售后工单里的占比——那属平台相关量,口径去向 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计。本课给的是每一类"在拆解上留下什么",这一层从第 2 讲开始逐类展开。
1.6 "部件—现象—根因"少了中间那层,同一个现象就会被绑死在一个部件上
本课的排查框架有三层,从上到下是:部件(哪个件 / 回路 / 子系统)、现象(可观察、可复现描述的那个事实,含工况)、根因(能被开关的那个变量)。
关键在中间那层,它是一个多对多的枢纽:一个现象对应多个候选部件("制冷量不足"至少对应压缩机、冷凝侧与前端进风、蒸发侧风路、多通阀、传感器、控制策略六个方向),而一个部件也能产出多种现象(同一个阀,卡在小开度是制冷不足,内漏是模式串扰,失步是响应异常)。
为什么多数排查是在这里失败的:因为工单上写的往往不是现象,而是已经带着结论的部件名——"压缩机制冷量不足"。从写下这几个字的那一刻起,排查范围就被锁死在压缩机上了:冷凝侧散热不足、蒸发侧风量不足、阀内漏、策略让路全部出局,而它们一个都没有被排除过。这个动作和 1.3 的那个动作是同一类错误的两种面貌——候选表在你还没开始查的时候就已经缺了几列。
工程量级:⛔ 本课不给"候选数至少要几个"的门槛(那是凑数不是判据),但给一条硬口径——现象描述里必须含工况:环境温度、车速、模式、SOC、持续时长。没有工况的现象无法复现,也就进不了 1.1 的必要性验证——这两条是扣在一起的:现象描述这一步没做好,根因验收那一步根本做不成。
易错点:把三层做成三段流水线——先定件、再描述现象、再找原因。顺序反了。正确用法是现象在最前面,部件是它的候选集而不是它的前提。第 3 讲会拿"制冷量不足"这一个现象,把它的候选集完整摊开一次。
1.7 PPM 与 DPMO 数的不是同一样东西:跨供应商横向比较只能用 PPM
排完对象,接下来要决定"先做哪一个"。这一步会用到两个量化指标,而它们几乎每天都在被混着用。
两条定义式:
- PPM =(不良品件数 / 总检验件数)× 10⁶ ——一件上有多个缺陷,仍然只记一件;
- DPMO =(缺陷数 /(样本数 × 机会数))× 10⁶ ——同一件上的多个缺陷逐个记。
手算一次就看清楚了(以下是教学算例,件数与缺陷数不对应任何平台、任何供应商,⛔ 禁止照抄取用):一批 1000 件,其中 5 件判为不良,这 5 件上合计发现 8 个缺陷,每件按 20 个机会计——
- PPM = 5 / 1000 × 10⁶ = 5000
- DPMO = 8 /(1000 × 20)× 10⁶ = 400
两个数相差 12.5 倍,而它们描述的是同一批件。分子不同(件数 vs 缺陷数)、分母也不同(检验件数 vs 样本数×机会数),⛔ 它们之间不存在一个换算系数——差多少取决于"每件平均几个缺陷"与"每件算几个机会"这两个随批次变化的量。
DPMO 的软肋在分母里:机会数是一个约定,不是一个测量值。同一个换热器,按"每个钎焊接头算一个机会"数出来是几百,按"每个总成算一个机会"数出来是一。接着上面同一批数据——把机会数从 20 改成 100:
- DPMO = 8 /(1000 × 100)× 10⁶ = 80
从 400 降到 80,而件一件没变、缺陷一个没少。一个分母里含有可协商量的指标,不能承担横向比较的责任。而 PPM 的分母是检验件数——谁来数都数得一样。
⇒ 结论是一条口径纪律:跨批次、跨供应商的不良率横向比较用 PPM;DPMO 只留给同一产品内部的工序比较与六西格玛换算。
⚠ 说清 PPM 是什么、不是什么:它是归一化的件数频次,⛔ 里面不含后果严重度——两批同为 5000 PPM 的件,一批的不良是异响、另一批是失压抛锚,PPM 一模一样。⇒ PPM 只解决「不同批次、不同供应商的频次能不能放在一起比」这一件事;排队先做哪一个的排序键不是 PPM,是「频次 × 后果严重度」,写在 1.8。⛔ 别把这两步混成一步。
工程量级:⛔ PPM / DPMO 的门槛、升级触发与严重度分档表本课不给——它们由顾客特殊要求与企业口径确定。本课只给一条最低结构要求,写在 1.8。
易错点一:把供应商报的 DPMO 与自家算的 PPM 放进同一张排序表里排名次。上面已经算过了,这张表排出来的顺序没有意义。
易错点二:看到 DPMO 降了就宣布改善——先问它的机会数定义有没有改过。
易错点三:把"六西格玛水平 = 3.4 DPMO"当成一条合格线去要求供应商。3.4 这个数是一个约定值,它含 1.5σ 长期漂移假设;而且换一套机会数定义,它算的就已经不是同一件事了。⛔ 它不是判定限。
1.8 帕累托按"频次 × 后果严重度"排:换一个分组口径,Top1 就换人
有了干净的指标口径,才谈得上排序。排序这一步有两个容易做错的决定:按什么分组,以及按什么排。
分组要按不良模式,不按部件号、不按供应商。把一批投诉按"不良模式"分组计数——同一批 O 型圈材料问题,如果按部件号分组,会被拆散到管路、阀、储液器三个件号里,每一条看上去都不高,三条都排不进前列;按不良模式分组才能把它并回一条,而它一并回来就是 Top1。同一个机理被分组口径拆散,是排序失真最常见的一种。
排序键要用"频次 × 后果严重度",不用纯频次。纯频次排序会把"每年一次的开锅"排到"每月十次的异响"后面——而这两件事的后果根本不在一个层面上。
工程量级:⛔ 本课不给严重度分档表与各档权重——那属平台与企业口径,须按项目自己的严重度定义确定。本课只给一条最低结构要求:严重度至少要能分出"安全/法规 → 抛锚停驶 → 售后返修 → 抱怨"四档。分不出这四档的排序,等于在用纯频次排。
易错点:把"80% 的问题来自 20% 的原因"当成判据用,据此宣布"前两条已经覆盖了八成,其余不看了"。80/20 是一个经验观察,⛔ 不是判据——实际分布必须由本批数据现算出来,可能是前一条就占七成,也可能是前六条才过半。本课的"动手做"第一步做的正是这件事:把数算出来,而不是套一个比例。
本讲小结:这一讲给的全是"动手之前"的东西。根因的验收是两半——充分性只是入门票,必要性要靠你主动拨的那次开关(换总成后问题消失⛔ 不算);现象进来先过三道分流闸——设计意图 / 软件与假读 / 不属于这一段,闸的成本是读一次数据,闸后的第一个动作是拆一台车;阴性结果一律记成"用 X 方法、在 Y 工况下未检出,未排除",⛔ 不许拿它去划掉候选或据它结案;本课只做四段里的离线根因这一段,产出物是"一条能被开关的原因 + 一条经验证的对策";失效模式的全集是六类 + 一条横轴,横轴切的是"怎么判"不是"什么坏了";三层框架的中间那层是多对多枢纽,现象描述必须含工况;PPM 与 DPMO 数的不是同一样东西,横向比较只能用 PPM;排序要按不良模式分组、按"频次 × 后果严重度"排。从第 2 讲起,我们把这套框架落到第一类失效模式——泄漏——上面去。
后面还有 6 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做