I6-04 可靠性目标、分配与寿命数据统计(TMS 可靠性量化入门)
课程代码 I6-04 · 板块 I 结构设计与工程化 / 可靠性与耐久设计 时长 约 4.0 小时(6 讲) 前置 B1-02 需求逐级分解:整车 VTS → 系统 SSTS → 零部件;L7-03 试验数据分析与不确定度评估;体系外前置(需自备):基本概率统计——分布、分位数、置信区间与单侧置信下限的含义;体系外前置(需自备):材料力学与疲劳基础——读到 β>1 指向磨损耗损时要能对上失效物理 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 I6-04 大纲的完整展开版
引言:报告里每一步都照流程走了,结论还是被量产推翻
一份耐久验证报告可以写得挑不出毛病。某电池液冷板的进出水快接接头,投试 6 件,每件跑满按加速因子折算出来的当量寿命,全程零失效,结论栏写着「可靠度 ≥ 99%,判通过」。评审桌上没有人反对:件数按惯例来,时长按折算算,判据照验证计划里那句「跑满规定当量寿命不失效」,三样都对得上。麻烦要到量产之后才露头——同一个接头在保修期内批量渗漏;拿在役数据拟一遍,Weibull 形状参数 β 明显大于 1,是耗损型;回头翻那份报告,里面根本没有 β 这个数。(⚠ 本课全部案例与算例数据均为教学假设值,⛔ 不对应任何平台、任何供应商产品,也不作为任何项目的要求件数或要求时长。)
复盘时最难受的一点是:没有人造假,每一步也都照着流程走了。错在更靠前的一层——那份报告里的每一句话,都缺着「它能不能被判定」所必需的成分,而缺什么、缺了会怎样,恰恰没有哪一步流程负责问。本课要补的就是这一层:一套让寿命目标、寿命试验与寿命结论能互相对话的量化语言。它不解决任何一种失效物理——件为什么会疲劳、密封为什么会老化、金属为什么会腐蚀、副摩擦面为什么会磨穿,各有各的专题课;本课解决的是它前后两端的事:话该怎么说、数该怎么报、一个寿命结论要满足什么才算立得住。
钉子 A ——「可靠性目标」和「可靠性结论」都不是一个数,是一个五元组。本课把它归纳成五要素(⚠ 这是本课归纳的组织方式,不是任何标准既有的划分):度量 + 时间基准 + 可靠度 + 置信度 + 失效判据。五项各堵一个具体的不可判定:没有度量(用 R、λ 还是 B10 说话)就不知道该测什么;没有时间基准(t 是小时、公里还是循环/动作次数)就无法与试验时长对话;没有可靠度就分不到部件;没有置信度 C 就反推不出样本量;没有失效判据,同一批件不同人判出的失效数能差一倍,而失效数是后面所有统计的输入。合法的形式长成这样:「C=__% 下 R@(当量 __ 循环)≥ __,失效判据=外漏率超 CTS 限值」。⇒ 本课的第一条可执行动作:拿到任何一句寿命要求或寿命结论,先数它缺哪几项,缺了就退回去问,⛔ 不要先算。三句听起来都很正常的现场原话,会卡在不同的闸上——「寿命 15 年」第一个卡住的是度量那一闸,「MTBF 10 万小时」卡在置信度那一闸,「跑满当量寿命不失效」同时卡在可靠度与置信度两闸上;卡在哪一闸,决定了该回去问谁。
钉子 B ——一切寿命结论按置信下限报,而下限被三样东西共同压低:样本量、分布形状、模型参数不确定度。只报点估计的结论一律不采信。开头那 6 件零失效真正能声称的,是「以 90% 的置信度声称 R@t ≥ 0.681」(该值=(1−C)^(1/n) 在 C=0.90、n=6 时的取值,是数学恒等量)——⛔ 不是「可靠度 ≥ 99%」,也 ⛔ 不能简写成「可靠度 0.681」,那两种写法都把「没坏」当成了可靠度本身。⇒ 第二条可执行动作:看到任何一个寿命数,先问它是点估计还是下限、置信度是多少,答不出来的数不进决策。(本课全部示例统一取 C=90% 单侧,⚠ 这是教学统一口径,⛔ 不是行业强制值;可靠性声称常用 50%、90%、95% 三档,具体项目的接受口径由客户可靠性体系文件与 CTS 规定,按现行版本确认。)
往下走之前,先把本课最容易被读反的那一条立在这里:「没坏是好消息,坏了是坏消息」。这句话在工程管理上完全正当——谁都不希望件坏;而它一进到寿命数据这一层就整个反过来:没坏的件携带的是「活到 t 还没坏」这条信息,必须进似然;坏了的件是唯一能给出分布形状 β 的信息源。把前者当成「无信息」、把后者当成「失败」,会让人做出两个方向恰好相反的具体动作,而这两个动作同源。
会做错的第一个具体动作:为了保住「零失效」,把试验时长压到刚好不出失效就停试,或者把已经出现的失效判为「非相关失效」剔出数据,然后报「N 件跑满当量寿命零失效,判通过」。为什么这是读反:零失效样本给不出 β——概率纸上一个失效点都没有,分布形状无从估计,于是既拿不到 B10,也无法把结论外推到别的分位或别的时长;它唯一能给的,是可靠度在那一个时间点上的单侧置信下限,而这个下限随件数掉得极快。⇒ 正确动作方向相反:需要 B10 或需要外推时,必须让件坏——延长倍数、升应力或 sudden-death 编排,把试验做到出失效为止。⚠ 射程限定:这一条只在需要分布形状或需要外推时成立;如果验收条目本身就写成「跑满当量寿命不失效」这种成败判定,且不打算声称可靠度以外的任何东西,bogey test 是合法且省时的选择——它错在被拿去反算 B10,不错在存在。
会做错的第二个具体动作:拟合之前先把没坏的那些件(右删失)从数据里删掉,理由是「只用坏了的件算寿命更保守」。为什么这是读反:删掉之后,中位秩的分母会从投试总件数塌缩成失效件数,同一个失效点的累计失效概率被抬高一大截——20 件里的第 3 个失效点,按投试总件数算是 13.2%,只留 5 个失效件之后变成 50.0%(⚠ 这一组编排是教学假设值,且它另带一条前提:失效全部发生在截尾之前,此时调整秩与简单秩才相同)。概率纸上整条线左移,β 与特征寿命 η 双双偏小,B10 被系统性低估。它不是「保守」,它是把一个错误方向的偏差当成了安全裕度——后果是把本来达标的件判为不达标、据此加壁厚加成本,更糟的是据此把整改方向指错。⚠ 与它方向相反的另一种错法同样常见:把删失件当成「合格品」只做一次通过率统计,再把这个试验时长上的比例直接当成目标寿命上的可靠度——那些跑完没坏的件在目标寿命之前还会坏掉一部分,于是结论系统性乐观。⇒ 正确动作只有一条:删失件以「活到 t 还没坏」的形式进入似然,一件都不丢、一件都不改成失效点。
两个动作看起来一个保守、一个激进,根却是同一条:把「没坏」当成没有信息。
本课交出三项判断力,每一项都对应一个当场可验的动作。第一,看见任何一句寿命要求或寿命结论,能当场数出它缺哪几要素、该退回去问谁——由此也能当场否掉「目标只写 MTBF」这类不可判定的写法,并说清 R(t)、F(t)、λ(t)、B10、MTBF 之间哪些可以与分布形式无关地互推、哪些必须先承认一个分布形状才谈得上换算,以及一个已发生的失效落在浴盆曲线哪一段、对应的整改手段为什么不能串用。第二,能把整车级的寿命目标逐级分配到系统、部件与单个接头,给出等分配与加权分配两套结果并留下决策记录;同时知道这套分配只算概率不算后果,也知道接头数、密封点数这类代理指标在什么条件下会整类失效。第三,能把一组带删失的寿命数据拟成 β、η、B10 并按单侧置信下限报出,用 β 把整改责任分派到工艺、外因或设计,再用样本量式与加速折算去设计下一轮验证——而且交出去的是区间,不是单值。
射程要说死,因为本课与相邻课题最容易在这里重叠。本课只做三件事:度量语言、自上而下的目标分配、寿命数据的统计推断(含零失效试验的样本量设计与加速折算的置信传递)。⛔ 本课不讲任何一种失效物理——交变载荷与疲劳归 I6-01 振动、热冲击与压力脉冲耐久设计,密封与接头的热老化归 I6-02 密封与接头寿命设计与加速试验对标,腐蚀归 I6-03 腐蚀防护与环境适应性设计,磨损与动作次数定寿归 I6-05 磨损与动作次数定寿:耗损失效的第四机理、跨部件判据与动作耐久验证,非机械环境载荷谱归 I6-06 热管理件的环境载荷谱与环境适应性验证(气候·化学·防护·辐射四类非机械载荷);台架实施与载荷谱构造归 L1-04 振动、热冲击与耐久台架试验,整车路试的等效里程归 L4-06 整车耐久路试中的热管理验证:强化路谱、等效里程与失效闭环;验证条目的写法与验证计划管理归 M1-03 DVP&R 与验证计划管理,需求逐级分解链归 B1-02 需求逐级分解:整车 VTS → 系统 SSTS → 零部件;系统概率的自下而上一侧(建树、最小割集、失效率取数、共因量化)整段归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,冗余结构与表决归 I7-02 失效安全(Fail-safe)与冗余设计,后果侧的严重度、影响面与可探测度归 I7-01 热管理系统/零部件 DFMEA 实操,安全目标侧的口径归 I7-03 功能安全导向的结构与失效模式设计;测量不确定度归 L7-03 试验数据分析与不确定度评估,仿真响应超限概率归 J7-06 仿真不确定度量化(UQ)与稳健/可靠性设计:从确定性单点到带分布的裕度;在役与索赔数据的作业化整段归 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计,使用剖面的取值本体归 B1-01 整车热平衡与全工况热负荷谱分析 与 B1-03 极端工况定义:高温、高原、低温、快充、拖挂爬坡;脚本与数据管线归 Q3-01 热管理工程师的数据分析与 Python 脚本,标准体系位阶归 M4-01 热管理相关标准(GB/ISO/SAE)体系。⛔ 凡本课不判的判据,一律只给类型与去向,不给限值、不给等级号、不给条款内容——这不是省略,是不在两门课里各写一套,否则同一个件会被查到两张不一样的表。顺带说清与架构侧的接法:串联连乘 R_模块 = ΠRᵢ 与失效率求和 λ_模块 ≈ Σλᵢ 这两条写法,在集成与架构的讨论里(B1-06 架构方案权衡:性能/成本/重量/可靠性多目标决策、B3-05 集成模块的整车架构取舍与边界划分、G8-01 集成热管理模块(TMM/阀岛/超级水壶)架构)已被当成既知语言使用,而两条式子的前提并不相同,必须分开查——本课负责把这两条前提讲成可执行的检查动作。
全课六讲与两根钉子对齐。第 1 讲把度量语言立起来:五要素、三种计量(时间/里程/循环)与使用剖面的换算纪律、R/F/f/λ 四个量的互推、B10 与 MTBF 为什么不可互换、浴盆三段与整改手段的一一对应,并把全课的符号定死。第 2 讲把目标从整车一路分配到单个接头:框图三种结构的分配式、两条硬前提、等分配与加权分配,以及自上而下的分配与自下而上的合成必须闭环对账。第 3 讲是全课的重心——含删失的数据怎么进似然、秩回归与 MLE 两条路线怎么对照着用、概率纸上的折点该怎么处置、β 三段诊断怎么分派责任,以及一切结论为什么必须带单侧置信下限。第 4 讲讲零失效试验:样本量式的来源与三条前提、「跑 N 件零失效」的正确表述、bogey test 的两面,以及用试验时长换件数的三个陷阱。第 5 讲讲加速:加速因子的参数不确定度怎么被指数放大、再加大加速倍数还有没有收益、机理不漂移这条硬边界为什么是前置条件而不是事后检查。第 6 讲把台架与场端两套口径对上账,给出在役数据的统计接口与两个回流出口,也把第 1 讲那条换算率假设的闭环补上。案例把开头那份报告的三层根因各自对回一条判据,动手做则交出一页能被逐格核对的《寿命数据统计与下一轮验证方案表》。
第 1 讲 寿命目标口径与可靠性度量语言:三种计量、五个量、浴盆三段
一份 DV 报告送到评审桌上,结论栏写着:「本件目标寿命 15 年 / 24 万公里,6 件跑满当量寿命零失效,判通过,可靠度 ≥ 99%」。这句话里有三个数、两个动词、一个结论,读起来完整得挑不出毛病——而它其实一个字都不可判定:「15 年」没说是日历年还是运行年,「跑满不失效」没说什么算失效,「99%」既不是从那 6 件里算出来的、也没说是以多大把握声称的。它甚至不是写得不认真——每一栏都填了,每一栏也都对得上上一版模板。
本讲要建立的第一个判断力,就是把这样一句话拆开,并且给出拆的工具。走法是:先立五要素这道闸,把「目标」从一个数改判成一个五元组(1.1);再处理五要素里最容易被当成常识的那一项——时间基准,说清三种计量之间为什么没有直路(1.2);然后把度量语言本身按「它取自分布的哪一部分」排成一条轴,四个量在轴上与分布形式无关地互推(1.3),并用这条轴推出全课第一条禁令:分位不能由矩反推(1.4);接着把浴盆三段改判成三个成因族,说明段判错了为什么手段一定无效(1.5);用一条能当场算的式子,把「冗余只救随机段」从经验之谈变成数(1.6);最后把全课符号钉死(1.7),并交代两条被当成常识随手用的系统级式子各自的前提(1.8)。
1.1 「寿命 15 年」不是目标,是口号——目标必须是五要素齐备的五元组
是什么。一条可靠性目标(以及后面各讲要产出的可靠性结论)都不是一个数,是一个五元组:
- 要素① 度量——用哪个量说话:R、λ、B10 三者之一。⛔ 不是「寿命」这种没有数学定义的词;
- 要素② 时间基准——在哪个 t 上说,且必须注明 t 的单位是小时、公里还是循环/动作次数;
- 要素③ 可靠度——该 t 上要求的 R 值;
- 要素④ 置信度 C——这个 R 是以多大把握声称的;
- 要素⑤ 失效判据——什么算坏:渗漏到多少、功能量漂移到哪条限、还是彻底断裂。
五项齐了才是一条合法写法,形如:
「C = __ % 下 R@(当量 __ 循环)≥ __,失效判据 = __」
⚠ 模板里的数值位刻意留空:R 的目标值、目标 t 与失效判据限值全部是平台相关量,取决于该件在整车上的角色、需求分解结果与产品规范,⛔ 本课一个都不给(需求逐级分解的做法归 B1-02 需求逐级分解:整车 VTS → 系统 SSTS → 零部件,验收条目的写法归 M1-03 DVP&R 与验证计划管理)。⚠ 这套「五要素」是本课归纳的组织方式,⛔ 不是任何标准的既有分类;它的价值在于可以逐项数、数完就知道该回去问谁。
为什么五项一项都不能少。因为它们各自堵住一个具体的不可判定,而且堵的方向互不重叠:
| 缺哪一项 | 立刻卡在哪里 |
|---|---|
| 缺①度量 | 不知道该测什么——「寿命」不对应任何可采集的量 |
| 缺②时间基准 | 无法与试验时长对话——不知道台架跑多久才算「当量」 |
| 缺③可靠度 | 无法往下分配——第 2 讲的分配式没有输入 |
| 缺④置信度 | 无法反推样本量——第 4 讲整讲建在这一项上,没有它就只能拍件数 |
| 缺⑤失效判据 | 同一批件不同人判出的失效数会差一倍,而失效数是后面所有统计的唯一输入 |
⇒ 这就是本课的第一条可执行动作:拿到任何一句寿命要求或寿命结论,先数它缺哪几项,缺了退回去问,⛔ 不要先算。回到本讲开头那句报告:①缺(只有「寿命」两个字,没说用哪个量)、②含糊(15 年是日历还是运行)、④缺(99% 没有配置信度)、⑤缺(「不失效」不是判据),五项里只有③写了一个数——而那个数还不是从那 6 件数据里算出来的(为什么不是,第 4 讲讲)。
⚠ 顺带把一件事说在前面:五要素对「结论」与对「目标」是同一套。写目标时缺一项,是没法验证;写结论时缺一项,是没法采信。后面各讲反复要做的动作只有一个——把结论也写成五元组。
工程量级与本课的统一口径。五要素里除置信度外全是平台相关量,⛔ 本课不给取用值。置信度可以给常用档位:可靠性声称常见取 50%、90%、95% 三档。⚠ 本课全部示例统一取 C = 90% 单侧,这是教学统一口径,⛔ 不是行业强制值,也 ⛔ 不是推荐值——具体项目的接受口径由客户可靠性体系文件与 CTS 规定,按现行版本确认。
易错点(三条,都很高发)。
① 把「置信度」与「可靠度」混成一个数。听到「可靠性 90%」要立刻反问:是分布上那个值(R = 0.9),还是对该值的把握(C = 90%)?两者一个是被声称的量、一个是声称的强度,必须同时出现才有意义。只出现一个的时候,最常见的情况是说话人自己也没分清。
② 失效判据只写「不失效」。这样写会把功能量漂移型退化整类漏掉——件没裂也没漏,但内漏率涨了、扭矩上去了、位置精度掉了,功能其实已经不达标。判据必须把「功能量漂移到限」写成与失效等价的形式(这条在第 5 讲末会以加速试验判据的身份再出现一次;具体判据表归 I6-05 磨损与动作次数定寿:耗损失效的第四机理、跨部件判据与动作耐久验证 与各产品课,本课只管判据的写法)。
③ 时间基准写「15 年」而不写它是日历年还是运行年。老化型退化按日历走,疲劳与磨损按运行走——这一字之差,在换算率上就是下一节要讲的整整一座桥。
1.2 三种计量之间没有直路,只有一座必须报出取值来源的桥
先画全集:寿命计量口径全集。建集合之前先问自检两问——①我是沿着什么线索数出来的?②有没有不在这条线索上、但同样属于这个集合的东西?
沿「单位」这条线索数(小时 / 公里),必然漏掉三类:
- (a)循环与动作次数——阀动作次数、快充次数、开关次数、压力脉冲次数。它们恰恰是热管理件里最常见的耐久计量,而一张按「单位」列的表往往只有 h 和 km 两栏;
- (b)累积通过量——通过的能量、通过的流量、压缩机累计运行小时,用于「按吞吐定寿」的件;
- (c)日历时间与运行时间的区别——★ 这一类最容易漏,因为它根本不在「单位」这条线索上,它在「钟走不走」这条线索上。两者的单位可以完全一样(都是「年」),含义却不同:老化型退化按日历走(车停在停车场里也在老化),疲劳与磨损按运行走。同一个「15 年」,对前者就是 15 年,对后者要先乘一个年均运行小时数。
⇒ 建轴的方式因此不是「按单位」,而是按谁在走这个钟(⚠ 这条轴是本课归纳的组织方式):日历钟 / 运行钟 / 事件计数钟 / 吞吐计数钟。
是什么。任意两种计量之间的换算,都必须显式经过一个使用剖面(年均运行小时 / 年均里程 / 年均循环数)。例如把「15 年」换成「7500 h」,中间隐含的是「年均运行 500 h」这一条假设;把「24 万公里」换成某个当量循环数,中间隐含的是「每公里发生多少次该动作」这条假设。⇒ 换算率是假设,不是事实。
为什么必须把它当成需求项而不是常识。因为换算率一旦被当成事实写死,后面四处结论会被同一条假设平移:目标寿命的部件级取值、台架当量时长、加速折算的目标端、场端对标的分母。而这条假设通常没有署名——它躺在某一版仿真输入表里,没有版本、没有责任人、没有再评估触发条件。⇒ 本课的做法是把它当成一个需求项来管,三条缺一不可:
- 与目标写在同一行——⛔ 不许目标写进 CTS、换算率写在别的文档里;
- 标明取值来源与责任人——哪份剖面文件、哪一版、谁负责;
- 留一条反标定回路——第 6 讲会用在役数据回过头来修正它,这是全课唯一一条有闭环的输入。
工程量级:⛔ 不给数。年均运行小时、年均里程、年均循环数,以及整车寿命目标本身(诸如「15 年 / 24 万公里」这类写法),全是平台相关量,取决于车型定位、区域与用户画像,须由需求侧给出——剖面取值本体归 B1-01 整车热平衡与全工况热负荷谱分析 与 B1-03 极端工况定义:高温、高原、低温、快充、拖挂爬坡,整车路试侧的等效里程归 L4-06 整车耐久路试中的热管理验证:强化路谱、等效里程与失效闭环。本课只做两件事:换算与口径声明。⚠ 正文里凡需走通算例的数值一律标为教学假设值(本节用到的「15 年 → 7500 h、年均运行 500 h」即是),⛔ 不对应任何平台、禁止取用。
易错点(三条)。
① 拿上一代车的换算率直接抄。换算率必须由本项目的使用剖面确定——⛔ 抄上一代是实撞过的错误动作,而使用剖面恰恰是换代时最常变的东西(动力形式变了、区域市场变了、快充习惯变了,年均循环数就是另一个数)。
② 把「15 年 / 24 万公里」当成两个独立目标各自验证。它们由同一条剖面绑定,只能同时成立或同时不成立。分开验的后果是得到两个互相矛盾的部件目标,然后由试验方各自挑一个更宽松的用。
③ 换算率只写进一份仿真输入表、不写进 CTS。于是试验方按自己手里的那份假设又换算了一遍,两边的「当量寿命」压根不是一个数——而这件事在报告汇总之前不会暴露。
1.3 R、F、f、λ 是同一条分布的四种看法——λ 的分母是「还活着的那部分」
先画全集:可靠性度量语言全集。同样先问自检两问。沿教科书那张「可靠性指标表」往下数(MTBF → MTTF → 失效率 → 可靠度 → B10),必然漏掉两整类:
- (a)计数型度量——R/1000、IPTV、PPM、每台年故障次数。它们根本不是寿命分布的参数,而是「分子怎么数、分母取谁」的产物,属场端语言。拿一张寿命度量清单查一遍会把它们整类漏掉,然后做出「IPTV 和 B10 比一比」这种不可比的比较(场端口径怎么接,第 6 讲给接口,作业化整段归 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计);
- (b)维修性与可用度族——MTTR、可用度 A,以及 MTBF 与 MTTF 在可修件与不可修件上的区别。本课对象以不可修件为主,而读者会把修理业的 MTBF 定义原样套过来。
⇒ 本课因此不按名称建轴,而按「它取自分布的哪一部分」建轴(⚠ 这是本课归纳的组织方式,⛔ 不是任何标准的既有分类):
| 类 | 是分布的哪一部分 | 本课涉及的量 |
|---|---|---|
| ① | 分布本身 | R(t)、F(t)、f(t) |
| ② | 分布的导出率 | λ(t)(含 FIT 单位) |
| ③ | 分布的分位 | B10、B50、η |
| ④ | 分布的矩 | MTBF、MTTF |
这条轴一画出来,本课最重要的一条禁令就变成显然的——分位不能由矩反推,除非先承认一个分布形状(1.4 展开)。射程:①②③④四类在本课讲透;计数型度量只在第 6 讲给口径接口;维修性与可用度族只给边界,⛔ 本课不展开。
是什么。第①②类里的四个量是同一条分布的四种看法,它们之间的关系与分布形式无关——不需要先假定 Weibull、也不需要先假定指数:
R(t) = 1 − F(t) f(t) = dF(t)/dt λ(t) = f(t)/R(t) = −d[ln R(t)]/dt R(t) = exp[−∫₀ᵗ λ(τ)dτ]
四句话的读法:R 是「活到 t 的比例」;F 是「已经坏掉的比例」;f 是「单位时间里新坏的比例(对全体)」;λ 是「单位时间里新坏的比例(对还活着的那部分)」。★ 最后那个括号是 f 与 λ 的全部区别,也是浴盆曲线为什么画 λ 而不画 f 的原因——只有 λ 回答工程上真正要问的那个问题:已经用了 t 的这台车,接下来还危不危险。
为什么这组恒等式是本课的底座。因为四种语言必须能互相翻译,四拨人才谈得下去:目标可以写成 R 也可以写成 λ;供应商报的常常是 λ 或 FIT;系统模型用的是 R 的连乘;而试验数据先长成 F 的经验分布(第 3 讲的中位秩就是在估 F)。这四个量之间只有上面这一组桥,⛔ 没有第二条路。
工程量级与算例。λ 的工程单位常用 FIT,其定义是标准单位,可给准确值:1 FIT = 10⁻⁹ 次失效/小时。走一遍量纲——⚠ 下面这组输入是教学假设值,只为建立一次尺度感,⛔ 不对应任何平台、任何供应商产品,禁止取用:
设 λ = 50 FIT = 5×10⁻⁸ /h(常失效率假设),目标 t = 7500 h:
- 累计危险 ∫λdτ = 5×10⁻⁸ × 7500 = 3.75×10⁻⁴;
- R(7500 h) = exp(−3.75×10⁻⁴) = 0.99963;F ≈ 3.75×10⁻⁴。
⛔ 本课不列任何元器件失效率手册值——手册族的取数口径与用法归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,本课不重复列。
易错点(三条)。
① 把 f 当 λ 用。两者在早期段差得最远,因为那一段 λ 的分母(还活着的件)正在快速缩小。用 f 去回答「这台已经跑了两年的车接下来危不危险」,得到的是对全体新件的平均,不是对幸存件的条件风险——两者在早期段可以差出好几倍。
② 跨时间基准比 λ。一个件的 λ 写成「每小时」、另一个写成「每公里」,两个数直接比大小没有意义——必须先过 1.2 那座桥。同理,λ 只有在同一时间基准且同一失效判据下才可比:判据松一档,λ 就掉一截,而这不代表件变好了。
③ 把「λ 是常数」当成 λ 的性质。它是浴盆平底那一段的近似,出了那一段就不成立。这条前提在 1.4、1.8 与第 2 讲要反复用到,⛔ 每次用之前都要重新确认,不能一次通过就当永久成立。
⚠ 符号提醒:本课的 β 一律指 Weibull 形状参数,图 3 里的三个 β 取值是教学假设值;全课符号口径在 1.7 一次钉死。
1.4 分位不能由矩反推:B10 与 MTBF 不可互换,而 MTBF 给的印象与它的数学含义方向相反
是什么(上半:分位与矩的分工)。把 1.3 那条轴用起来——B10 是分布的分位(R = 0.9 处的寿命),MTBF 是分布的矩(均值)。给定两参数 Weibull(β, η):
R(t) = exp[−(t/η)^β] B10 = η·(−ln 0.9)^(1/β) = η·0.10536^(1/β) B50 = η·(ln 2)^(1/β) = η·0.6931^(1/β) 均值 = η·Γ(1 + 1/β)
三者由同一对 (β, η) 决定,但只知道其中一个推不出另外两个——除非 β 已知。这句话就是「不能由矩反推分位」的确切含义。
⚠ 显示口径(全课统一):常数本身统一写 −ln 0.9 = 0.10536(五位);下面这张比值表统一取三位小数显示。⛔ 全课不再出现第三种舍入。
| β | B10/η = 0.10536^(1/β) | 读出来的意思 |
|---|---|---|
| 1 | 0.105 | 指数分布:B10 只有特征寿命 η 的约十分之一 |
| 2 | 0.325 | |
| 3 | 0.472 | |
| 4 | 0.570 | β 越大,B10 越靠近 η |
★ 这张表读出的结论比数本身值钱:β 越大,B10 越靠近 η——分布越集中,件「大家一起坏」,于是「前 10% 坏掉」这个时刻离「大多数坏掉」不远;而 β = 1 时两者差一个数量级。⛔ 表里的 β 是自变量,不是推荐值;各件的实际 β 须由实测数据拟合确定(第 3 讲)。
为什么这条禁令要立在第 1 讲。因为现场最常见的两难就长在这里:供应商只肯给 MTBF,而验收条目要写 B10。此时唯一合法的动作是先问 β——β 拿不到,就说明这个转换做不了,⛔ 不许拍一个系数换算过去。反过来,一旦 β 已知,B10/η 就是一个只依赖 β 的确定比值,查上面那张表即可。
是什么(下半:MTBF 的三条误用)。MTBF = 1/λ 这个式子只在 λ 为常数时成立(指数分布、β ≈ 1)。代进 R(t) = exp(−λt) 得:
R(MTBF) = e⁻¹
⚠ 显示口径:e⁻¹ 的精确值是 0.36788,全课正文一律读作「约 37%」,图上因需标在纵轴刻度旁写作 0.368——三者是同一个数的三种显示形式,⛔ 不再出现第四种。
也就是说,「MTBF = 10 万小时」的件跑到 10 万小时时,已经有约 63% 坏掉了。而它给人的直觉印象恰好相反(「能用 10 万小时」)。三条误用一次讲清:
- 活到 MTBF 的概率只有约 37%——它不是「能用多久」;
- 对 β 明显偏离 1 的件,MTBF 没有工程意义可言——此时 λ 随时间变,「一个 MTBF 数」根本没有定义;
- 任何时候不可与 B10 互换——理由就是上半的分位与矩之分。
⇒ 拿到一个 MTBF 时的两问:先问 β(敢不敢用「λ 为常数」这条假设),再问敢不敢换成 R@目标 t。
工程量级:换成同口径再看。⚠ 下面这组是教学假设值,⛔ 不对应任何平台、任何供应商报价,禁止取用。设 MTBF = 10 万 h、目标寿命 t = 7500 h:
- λ = 1/10⁵ = 10⁻⁵ /h;
- t/MTBF = 0.075;
- R@7500 h = exp(−0.075) = 0.9277 ⇒ 寿命期内约 7% 失效。
⇒ MTBF = 10 万 h 这个数看着「远超」7500 h 的寿命需求,换成同口径之后是寿命期内约 7% 的件会坏——对一个整车热管理件,这个数几乎肯定不可接受。★ 这是本课唯一一个数值上看起来很宽裕、换成同口径后反而不合格的度量,所以要当场打掉。动作:拿到 MTBF 先换成 R@目标 t 再看,⛔ 不与目标寿命直接比大小。
易错点(四条)。
① 把 B10 当成判据用——「10% 的件在这个时间坏了就算合格」。B10 是结论不是判据;判据要写成「B10 ≥ 目标,且其单侧置信下限也达标」(下限那一半是第 3 讲的活)。
② 用 B50 或均值代 B10 做验收——β 小的时候两者差三五倍,而验收关心的恰恰是分布的左尾。
③ 把 MTBF 理解成「平均寿命」并与 B50 混用——只有 β = 1 时两者才接近;对磨损型件(β > 1)报 MTBF 本身就是误用。
④ 把多个件的 MTBF 直接取倒数相加得系统 MTBF,而不先确认各件都在随机段——这条前提 1.8 专讲。另有一条纯技术性的错:η 用循环数拟出来、B10 却报成小时,B10 与 η 必须同单位同基准。
1.5 浴盆三段是三个成因族,不是三个日历区间——段判错了,手段一定无效
是什么。浴盆曲线画的是 λ(t) 而不是 f(t)(理由见 1.3),三段对应三种成因族:
- λ 递减的早期失效段——物理是「一小批件本来就有缺陷,它们先走掉,剩下的越来越好」⇒ 指向工艺 / 装配 / 来料;
- λ 常数的随机段——物理是「失效由与年龄无关的外部事件触发」⇒ 指向外因;
- λ 递增的磨损段——物理是「损伤在累积,每个件都在往同一个终点走」⇒ 指向寿命设计。
★ 判段的输入是 β(怎么从数据里把它拟出来是第 3 讲的活),⛔ 不是「这批车用了几年」。
为什么这是本课第一条判据:三段对应的手段互不可替代。
| 段 | β 判据 | 成因族 | 对应手段 | 失效物理去哪门课 |
|---|---|---|---|---|
| 早期失效 | β < 1 | 工艺 / 装配 / 来料 | 筛选与老化跑合 | 各专题课 |
| 随机 | β ≈ 1 | 外因(使用与环境) | 冗余与降额 | 结构与表决归 I7-02 失效安全(Fail-safe)与冗余设计 |
| 磨损耗损 | β > 1 | 损伤累积 | 寿命设计 | I6-01 振动、热冲击与压力脉冲耐久设计 / I6-02 密封与接头寿命设计与加速试验对标 / I6-03 腐蚀防护与环境适应性设计 / I6-05 磨损与动作次数定寿:耗损失效的第四机理、跨部件判据与动作耐久验证 |
跨段用手段不只是没用,是有害,而且三条后果各不相同:
- 对磨损段加冗余 ⇒ 两路件会一起走进磨损期,寿命增益随 β 迅速消失(1.6 给形式化依据);
- 对早期段加壁厚 ⇒ 缺陷件该漏还是漏,因为它坏在缺陷不在裕度;
- 对随机段做老化筛选 ⇒ 筛不出任何东西,还白烧一批件的寿命。
⇒ 动作:任何整改会开始之前先问「这批失效落在哪一段、依据是什么」,答案必须是一个带置信区间的 β,⛔ 不是一句「感觉是早期问题」。
工程量级:⛔ 不给数,但给判据分界。三段的时间分界是件与平台相关量,须由实测数据拟合确定,本课不给。可给的是判据分界 β = 1:⚠ 这个「1」是指数分布的分界,由分布定义定死,⛔ 不是可调的经验阈值。而「β ≈ 1」的「≈」必须由 β 的置信区间是否包含 1 来判,⛔ 不许拍一个 0.9~1.1 之类的窗口(第 3 讲展开怎么把这个区间算出来,以及区间没夹紧时为什么不得下结论)。
易错点(三条)。
① 把浴盆三段当成「新车期 / 中期 / 老车期」三个日历区间,于是不看数据、直接按时间归因:保修期内的失效一律判早期问题,出保后的一律判磨损。这是把成因族换成了时间窗,而两者只是经常重合,不是同一件事——一个装配扭矩失控的件,可以在出保后才集中暴露。
② 忘了三段可以同时存在。一个总成里不同零件处在不同段,混在一起拟合会得到一个谁也不像的 β——这就是第 3 讲要处理的混合总体,它在概率纸上表现为一个折点。
③ 把「选手段」和「治机理」混为一谈。本课只给判段与选手段这一层;各机理的失效物理本体不在这里——交变载荷疲劳归 I6-01 振动、热冲击与压力脉冲耐久设计、密封老化归 I6-02 密封与接头寿命设计与加速试验对标、腐蚀归 I6-03 腐蚀防护与环境适应性设计、磨损与动作次数定寿归 I6-05 磨损与动作次数定寿:耗损失效的第四机理、跨部件判据与动作耐久验证、非机械环境载荷谱归 I6-06 热管理件的环境载荷谱与环境适应性验证(气候·化学·防护·辐射四类非机械载荷)。
1.6 「冗余只救随机段」可以算出来:两路并联的 B10 增益 = 3.6076^(1/β)
是什么。把 1.5 那句定性结论变成一条能当场算的式子。设两路独立同分布的 Weibull(β, η) 件并联,系统只要有一路活着就算活着:
R_并(t) = 1 − [1 − R(t)]²
求并联系统的 B10,就是解 R_并 = 0.9:
- [1 − R]² = 0.1 ⇒ 1 − R = √0.1 ⇒ 单件此时的 R = 1 − √0.1 = 0.6838;
- 代进 Weibull:(t/η)^β = −ln 0.6838 = 0.3801 ⇒ B10_并 = η·0.3801^(1/β);
- 而单件 B10_单 = η·0.10536^(1/β);
- 两者相除,η 直接约掉:
B10_并 / B10_单 = 0.3801/0.10536 = 3.6076,故增益倍数 = 3.6076^(1/β)
★ 这个增益倍数只依赖 β,与 η 无关——也就是说,它对任何件都成立,不需要先知道那个件能活多久。
| β | 增益倍数 3.6076^(1/β) | 这一行说明什么 |
|---|---|---|
| 1 | 3.61 | 随机段:并联把 B10 抬到 3.61 倍,收益巨大 |
| 2 | 1.90 | |
| 3 | 1.53 | |
| 6 | 1.24 | 强磨损型:多一路只能往后挪一点点 |
β → ∞ 时增益趋于 1。
为什么这条式子值得单独占一节。因为「冗余只救随机失效」这句话作为结论没有杀伤力——它拦不住一个已经决定加冗余的方案。而上面这张表可以:件越是磨损型,冗余买到的寿命越少,物理原因是磨损型件的失效时间高度集中,两路件几乎在同一时刻一起进入磨损期。⚠ 而这还是在两路完全独立这条最有利的假设下算出来的;同批次、同工况、同装配工位的两路件,共因失效比例不低,实际增益比该式更低(共因失效的量化归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,⛔ 本课不给共因因子的任何取值)。
工程量级。3.6076^(1/β) 是数学恒等量,上表可给准确值;⚠ 表中的 3.6076 由上面两个显示值(0.3801 与 0.10536)相除得到,全课统一用这一个显示。⛔ 表里的 β 是自变量不是推荐值,各件的实际 β 须由实测数据拟合确定(第 3 讲)。⚠ 这里的 β 是 Weibull 形状参数,与共因模型里那个同名的因子是两个不同的量,1.7 的符号表已分列。
易错点(三条)。
① 把「可靠度增益」与「寿命增益」混为一谈。前者是「在固定 t 上 R 提高了多少」,它在任何 β 下都很可观;后者是「B10 提高了多少倍」,它随 β 迅速消失。而工程验收要的是后者。图 6 左右两格画的就是这两件事。
② 拿这条式子去论证「所以磨损件不值得做冗余」。⛔ 本课只给寿命增益这一维——冗余同时还承担失效后果控制与 fail-safe 功能,那一维归 I7-02 失效安全(Fail-safe)与冗余设计,本课不判。
③ 忽略并联件的失效判据要与单件同口径。两个 B10 若来自不同的失效判据,相除得出的「增益倍数」不成立——分子分母不是同一件事。
1.7 全课符号在这里钉死:四处同名不同量,正文一律不许裸写
是什么。本课至少有四对同名不同量的符号,而且它们不是理论风险——它们会出现在相隔不到两页的两条公式里(第 3 讲的似然与第 4 讲的时长倍数都想用 L)。在这里一次定死,后面每条式子旁再标一次单位与身份:
| 符号 | 本课含义 | 单位 | 口径与禁令 |
|---|---|---|---|
| β | Weibull 形状参数 | 无量纲 | ⚠ 全课的 β 只有这一个身份 |
| β_CCF | 共因失效因子 | 无量纲 | ⛔ 不得写作裸 β;量化归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,本课不给值 |
| 似然函数(或写 𝓛) | 数据在给定参数下的似然 | — | ⛔ 不许写裸 L;本课统一写全称或花体 𝓛 |
| L | 试验时长倍数 L = t_试验 / t_目标 | 无量纲 | 裸写的 L 在本课只有这一个身份(第 4 讲用) |
| n_件 | 件数(样本量) | 无量纲 | 第 3、4 讲用。⚠ 它在本课有两个口径,每次出现都要写明是哪一个:投试总件数(3.3 中位秩的分母、4.1 样本量式)与失效件数(3.6 的 β 区间乘子表——β 的信息只来自失效点)。两者在含删失的样本里可以差好几倍,⛔ 不许跨节沿用 |
| n_环节 | 可靠性框图上的环节数 | 无量纲 | 第 2 讲用;⚠ 跨讲引用时必须带下标 |
| R | 可靠度 | 无量纲 | 裸写的 R 在本课只表示可靠度。⚠ 与它同形不同量的有三处,各自另列或就地标注:R_g(气体常数,见下行)、R²(拟合优度,见下行)、R/1000 里的 R(维修次数,6.1 就地标注) |
| R² | 回归的拟合优度(决定系数) | 无量纲 | ⚠ 与可靠度 R 不是同一个量,⛔ 不得互算、不得读成「R 的平方」;只在第 3 讲 3.3/3.4 出现,且本课对它的判据是「R² 高与点列有系统性弯曲完全可以并存」 |
| R_g | 通用气体常数 = 8.314 J/(mol·K) | J/(mol·K) | ⛔ 气体常数一律带下标;第 5 讲用 |
| F | 累积失效概率 F = 1 − R | 无量纲 | ⚠ 本课的 F 只有这一个身份 |
| f | 概率密度 dF/dt | 1/时间基准 | ⛔ 与 λ 不可混用(分母不同,见 1.3) |
| λ | 失效率 / 危险函数 | 1/时间基准(FIT = 10⁻⁹/h) | 只在同一时间基准、同一失效判据下可比 |
| η | Weibull 特征寿命 | 与 t 同基准 | ⚠ R(η) = e⁻¹,与 β 无关 |
| B10 / B50 | R = 0.9 / R = 0.5 处的寿命分位 | 与 t 同基准 | ⛔ 必须与 η 同单位同基准 |
| C | 置信度 | 无量纲 | 本课示例统一取 90% 单侧(教学统一口径) |
| t | 时间基准上的自变量 | h / km / 循环 | ⛔ 每次出现都要注明是哪一种(见 1.2) |
为什么符号纪律要占一整节。因为本课的输出是要被别处直接引用的语言:一个 R@t、一个 B10、一个 β 会被抄进 CTS、抄进验收条目、抄进供应商往来。符号一乱,抄过去的数就带着一个错误身份继续走,而且下游不会报错——它只是算出一个看起来很正常的结果。⚠ 最典型的一处:把「试验跑了 3 倍时长」的 L 读成似然,于是第 4 讲那条 L^β 被当成某种「似然的 β 次方」,整条样本量交换的推理全断。
工程量级。符号表本身不含数值。唯一给准确值的是 R_g = 8.314 J/(mol·K)(全课统一这一个舍入)与 1 FIT = 10⁻⁹ 次失效/小时(单位定义)。
易错点(三条)。
① 以为在第 1 讲列一次符号表就算数。读者是跳着读的——⇒ 本课的做法是每个式子旁再标一次单位与身份,这种重复不是冗余。
② 把两种身份都写成同一个字母、靠上下文区分。⛔ 只差下标、或量纲不同却同名的两个量,必须分列并各带定义与单位。最容易失守的位置是「本讲用得顺手了就开始省下标」。
③ 单位混用而不换算。典型形态是活化能用 kJ/mol 而 R_g 用 J/(mol·K),两者直接代进同一个指数里——量纲检查抓不到,结果差一千倍。第 5 讲会把这条单独当一个易错点讲(算例里必须把活化能先换成 J/mol 再除以 8.314)。
1.8 Σλ 与 ΠR 的前提不一样,必须分开查——先拿 β 说话,再决定能不能求和或连乘
是什么。两条式子在系统级讨论里几乎是随手就用的:
λ_模块 ≈ Σλᵢ (见 B3-05 集成模块的整车架构取舍与边界划分) R_模块 = ΠRᵢ (见 G8-01 集成热管理模块(TMM/阀岛/超级水壶)架构)
⚠ 两条都自带「常失效率段近似」这一类前提,而且前提并不一样。本讲要做的,是把这条前提从一句嘱咐讲成一个可检查的动作:先确认在役数据或台架数据落在浴盆的哪一段(拿 β 说话),再决定能不能用求和 / 连乘。
| 式子 | 成立前提 | 缺了会怎样 |
|---|---|---|
| R_模块 = ΠRᵢ | ①各环节失效独立 ②各 Rᵢ 取同一个 t | 不独立 ⇒ 结果偏乐观;不同 t ⇒ 得数没有工程意义 |
| λ_模块 ≈ Σλᵢ | 上面两条,外加③各件都处在常失效率段 | 有件在磨损段 ⇒ 求和无依据,且随时间越走越失真 |
原因很直接:R 连乘只用到概率的乘法(独立 + 同一时间点),不要求 λ 常数;而 λ 相加是从 R_系统 = exp(−Σλᵢ·t) 反推出来的,那个式子本身就假定了每个 λᵢ 不随时间变。⇒ ΠRᵢ 的前提是 Σλᵢ 前提的真子集——两者必须分开查,⛔ 不能查一遍算两遍。
为什么这一条放在第 1 讲末。因为它是本讲三样东西的合流:1.3 的「λ 常数是近似不是性质」、1.5 的「判段要拿 β 说话」、1.2 的「同一时间基准」。合起来就是一个可执行的三步检查:
- 取每个环节最近一轮的寿命数据,拟出 β 与它的置信区间(方法在第 3 讲);
- β 的置信区间不包含 1 的环节,⛔ 不许进 Σλ 模型;
- 各环节的 Rᵢ 逐个核对:是不是在同一个 t、同一套失效判据下算出来的?不是就先统一再乘。
工程量级:⛔ 不给数。各环节的 λ、β 与 R 全是平台相关量,须由实测数据拟合确定;元器件级 λ 与 FIT 的手册取数口径与用法归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,⛔ 本课不列手册值、不给 FIT 取值。
易错点(三条)。
① 看到「Σλ 很方便」就一路用到底。而热管理件里恰恰有大量磨损型件——密封、阀、泵轴承——根本不在随机段。方便的代价是整个模块的失效率预测建在一条不成立的前提上,而它算得出数、也画得出曲线,不会自己报错。
② 把「独立」当成默认成立。同一供应商、同一批次、同一装配工位的件不独立。⛔ 没有写进假设清单的相关性不等于它不存在——独立性要么有依据,要么就要显式扣回(共因量化归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量)。
③ 把连乘结果直接当成「系统预测值」去与目标对账。自上而下的分配与自下而上的合成是两个方向的量,两者的差额才是设计缺口——怎么对账、缺口不为零时该改架构还是改目标,是第 2 讲末的内容。
本讲末的射程声明(全课两次声明中的第一次)。本课只做三件事:度量语言、自上而下的目标分配、寿命数据的统计推断(含零失效试验的样本量设计与加速折算的置信传递)。⛔ 本课不讲任何一种失效物理,也不给任何一条限值:交变载荷疲劳归 I6-01 振动、热冲击与压力脉冲耐久设计,密封与接头热老化归 I6-02 密封与接头寿命设计与加速试验对标,腐蚀归 I6-03 腐蚀防护与环境适应性设计,磨损与动作次数定寿归 I6-05 磨损与动作次数定寿:耗损失效的第四机理、跨部件判据与动作耐久验证,非机械环境载荷谱归 I6-06 热管理件的环境载荷谱与环境适应性验证(气候·化学·防护·辐射四类非机械载荷);台架实施与载荷谱构造归 L1-04 振动、热冲击与耐久台架试验,整车路试等效里程归 L4-06 整车耐久路试中的热管理验证:强化路谱、等效里程与失效闭环;系统概率的自下而上一侧(建树、最小割集、失效率取数、共因量化)整段归 I7-04 故障树分析(FTA)实操:建树、最小割集与顶事件概率定量,冗余结构与表决归 I7-02 失效安全(Fail-safe)与冗余设计,后果侧的严重度与可探测度归 I7-01 热管理系统/零部件 DFMEA 实操,安全目标侧的口径归 I7-03 功能安全导向的结构与失效模式设计;测量不确定度归 L7-03 试验数据分析与不确定度评估,仿真响应超限概率归 J7-06 仿真不确定度量化(UQ)与稳健/可靠性设计:从确定性单点到带分布的裕度;在役与索赔数据的作业化整段归 M2-05 售后保修与在役失效数据分析:从索赔表读出真实故障率并反馈设计,使用剖面取值本体归 B1-01 整车热平衡与全工况热负荷谱分析 与 B1-03 极端工况定义:高温、高原、低温、快充、拖挂爬坡,架构权衡里怎么用可靠性这一维归 B1-06 架构方案权衡:性能/成本/重量/可靠性多目标决策;验证条目写法归 M1-03 DVP&R 与验证计划管理,需求分解链归 B1-02 需求逐级分解:整车 VTS → 系统 SSTS → 零部件,脚本与数据管线归 Q3-01 热管理工程师的数据分析与 Python 脚本,标准体系位阶归 M4-01 热管理相关标准(GB/ISO/SAE)体系。⚠ 第 6 讲末会按同样的口径再声明一次,那一次连回流出口一起点名。
⇒ 本讲到此,语言与口径都立起来了:目标是五元组、计量之间只有一座桥、四个量与分布形式无关地互推、分位不能由矩反推、段要拿 β 判、系统式子各有各的前提。第 2 讲把这套语言往下传——把整车级目标一路分配到单个接头的 R@t,并且五要素一项都不许在传递途中掉下来。
后面还有 5 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做