TMS BOOK · ACADEMY 讲义

结温估计、热保护与主动降额策略

大纲的完整展开版——讲师授课蓝本 / 学员自学材料

E2-05 结温估计、热保护与主动降额策略

课程代码 E2-05 · 板块 E 电驱与电力电子热管理 / 电控/功率半导体散热 时长 约 4.0 小时(7 讲) 前置 E2-03 功率模块封装与热阻网络(Zth/Cauer);K3-05 PID/前馈/增益调度控制 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 E2-05 大纲的完整展开版


引言:结温是一个估计量,而降额门限建在它的误差带上

一段乏味到不像事故的现场。某纯电 SUV 平台的主驱在一条长坡上连续爬了几分钟,模块基板上那颗 NTC 读数一路平稳、离报警线还留着一截;而后台跑着的在线结温估计已经顶上了降额起点。标定工程师在这一刻要当场答三个问题:这个估计值可不可信?现在动,先动哪一只手、动多少?动完了什么时候能收回来?三个问题没有一个能靠「再测一次」解决——结温这个量在车上根本测不到。它不是精度不够、不是采样率不够,是芯片有源区的温度在一个已经灌封、已经压装、已经装车的模块里没有任何一条物理通道通到外面。控制器手上永远只有一个估计量,而这个估计量的下游挂着的是可靠性硬约束与整车动力输出。

这门课要做的,就是把上面那三个问题变成可以在评审会上逐条答出来的判据链。本课的输入是一台已经设计完成的电驱:模块选型定了、冷板与回路已经存在,热阻网络(Cauer / Zth)的口径与建立归 E2-03 功率模块封装、DBC 与热阻网络本课的输出是三样东西:一套在线结温估计(损耗模型驱动网络,加上温敏参数与 NTC 的融合与合理性校验)、一套分级热保护与主动降额(每一档的进入、退出、驻留与恢复速率)、一套失效响应与降级路径(估计不可信时怎么让车继续安全地走)。⇒ 一句话:这是一门在线估计与保护动作的课,⛔ 不是热阻网络建模课、⛔ 不是热测量课、⛔ 不是寿命评估课。

射程外的,本课一律只写「归哪门课管」,⛔ 不给限值、不给等级号、不给条款内容。它们是:热阻网络与 Zth 口径的建立(E2-03 功率模块封装、DBC 与热阻网络)· 温敏参数的台架标定与 JESD51 热阻实测(L7-04 电子/功率器件热测量与表征:TSP 标定、JESD51 热阻实测与结构函数判读)· 估计器结构选型、整定量与软测量置信度(K3-10 热管理在线状态与负荷估计:观测器整定、软测量置信度与退出条件)· ΔTj 与功率循环寿命的定量关系(E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324)· DC-Link 薄膜电容与盒级非半导体热源(E2-06 主驱逆变器盒级热设计:DC-Link 薄膜电容与非半导体热源)· 冷板与流动设计(E2-01 逆变器/IGBT 散热设计与冷板)· 整车冷量与功率仲裁(K3-01 整车热管理控制策略总览与模式管理)· 升压充电工况细节(N1-04 升压充电(兼容低电压等级直流桩)工况下的电驱热管理与冷量仲裁)与桩侧三方握手(D4-03 充电过程温控策略与充电功率协同)· 冷却能力标定的一致性校核方法链(K6-08 电驱与前端散热回路标定(BEV))· 全工况热仿真(J6-01 功率器件结温与热阻网络仿真)· 电机侧温升限值与降额(E1-05 电机温升限值、绝缘等级与降额)· 分布场极值的稀疏测点重构(D1-06 电池热状态在线估计:从稀疏 NTC 到 T_max 与 ΔT_pack)· 无扰切换的通用做法(K3-05 PID/前馈/增益调度控制实战)· 共模盲区的论证(K1-03 传感器布置、冗余与信号可靠性)· 负荷意图识别与预测性热管理(K7-01 预测性热管理(导航/云端/驾驶意图协同))· 冷板/液冷总成的件级台架热性能实测(L1-10 冷板/液冷总成件级热性能台架试验(模拟热源法))。⚠ 这份清单一共 17 门,与 1.7 的分工线清单、7.6 的收口表是同一套,⛔ 三处不许各列各的。⚠ 「本课不做」⛔ 不等于「不重要」——上面每一门要么是本课的硬前置,要么是本课某一路输出的接收方,缺一条这份保护策略就落不了地。⚠ 其中若干门目前还没有讲义,本课只写它归谁管,⛔ 不声称人家已经讲过什么。引用到的四项标准同样只写「管什么」:ISO 26262 管功能安全的开发与失效响应框架,JEDEC JESD51 系列管热阻与瞬态热阻抗的测试基准与参考面口径,AQG 324 管车用功率模块鉴定,IEC 60747 是半导体器件的通用规定;⚠ 版次与年份以现行目录为准、引用前须核,且 AQG 324 是行业协会(ECPE)的鉴定指南,⛔ 不与 ISO/IEC/JEDEC 并列成同一级来源

钉子①:在线结温的交付物是一个五元组,⛔ 不是一个温度数;而降额门限建在误差带的保守边上——所以估计精度直接换算成可用输出。五元组=值 + 参考面口径 + 误差带 δ_est + 置信度档 + 有效期。少任何一项,下游都没法判这个数当下该不该被信:只给值,接收方无从知道它是相对壳温还是相对冷却液入口温度;不给 δ_est,门限就无处可建;不给置信度档与有效期,估计降档或信号超时的时候,降额逻辑会照旧拿一个陈值往下算。门限则按一条分解式定(★ 本课归纳,⛔ 不是大纲或标准既有):

Tj_start = Tj_max − δ_est − ΔT_overshoot − ΔT_life − ΔT_cal

五项分别由器件手册、本课第 2/3 讲攒出来的误差账、执行延迟与热惯性、E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324K6-08 电驱与前端散热回路标定(BEV) 给出。⛔ 本课一项都不给数,交的是「每一项由谁给」这张责任表——因为这条式子的价值不在算出一个数,而在于它能回答标定评审会上那个最常答不出的问题:这条门限为什么是这个数?大纲那句定性话「估准结温=既保器件又不浪费输出能力」在这里被量化:本课教学网络上,δ_est 每宽 1 K,等于先扣掉约 1.9 W 的可用芯片损耗(=1/Rth(j-f),教学假设值,⛔ 不对应任何平台、⛔ 不得取用;折成可用扭矩还要本平台的损耗-输出映射,那是平台相关量,本课不给数)。⇒ 估计精度不是一个学术指标,它是一张预先付出去的账单:算不准多少,就先在门限上让出多少输出。⚠ 而 δ_est ⛔ 不是常数——它随工况变(大负荷、瞬态、输入缺失或降档时展宽),所以门限必须按工况分段,⛔ 不能拿一个「典型精度」把全工况一口价包了。

钉子②:降额是「削损耗」的动作,四只手各有一份额度,排序键是「每削 1 kW 损耗要付出多少可感知的输出」,⛔ 不是一条按级停留的固定序列。(⚠ 「四只手」有它的射程,见 5.4:在本 ECU 内下发、以削损耗为直接目的、额度可按瓦量出来的那四只;⛔ 它不是执行器全集——限扭矩、时间预算式限功率、整车侧与人机各有各的位置,全集是 5.3 那六层。)执行语义只有一句:用完这只手的额度立刻换手冷却侧(泵速、风扇与 AGS、回路切换与电子节温器、请求 Chiller 投入、请求更低的目标冷却液温度)是四只手里唯一一只不付出输出能力的,所以它永远排第一;但它的动作要经过整条回路的输运与热容才会变成冷却液入口温度的下降,独自兜不住瞬态——而调制方式切换、降开关频率 f_sw、限相电流这些在下一个控制周期就生效。⇒ 快手与慢手必须同时在场,⛔ 不是「先试慢手,不行再上快手」。⚠ 这里⛔ 不写两者相差多少倍(冷却侧响应时间常数是平台相关量、本课不给数,一侧不给数就不做倍数比较);可写的只是结构性的相对关系:一个在控制周期尺度上生效,一个在回路输运尺度上生效,两者根本不在同一个时间尺度上。

两根钉子在本课的典型案例(连续爬坡)处合钉:钉子①决定什么时候开始动,钉子②决定先拧哪只手、拧多少、什么时候换手。

下面这句是本课最容易被读反的一条,必须在这里就点破:「瞬态峰值结温才是危险点」被读成「峰值=急加速与爬坡那几秒的峰值」。

读反之后,读者会做的那个具体动作是用三相平均损耗(或整模块总损耗)驱动一个单节点热网络,然后拿它去和台架实测对,发现秒级尺度上对得很好,于是判「峰值抓到了,模型可以用了」。

它为什么反了:「瞬态峰值」是两类,不是一类。第 ① 类是工况级瞬态——急加速、连续爬坡、升压充电,时间尺度从秒到数十秒;第 ② 类是基波周期脉动——单个芯片的损耗在一个输出基波周期(周期=1/f_out)内剧烈起伏,而车用模块从芯片段到基板段的热时间常数正落在这个时间尺度上(本课教学网络的模块段四阶 τ=[0.2, 2, 20, 200] ms,教学假设值)。车用主驱的输出基波频率 f_out 从 0(堵转)一直到千赫兹量级(由极对数 3~6 与最高转速 12000~20000 rpm 这两个行业典型区间现算),f_out 越低,同样的平均损耗产生的结温脉动越大,f_out→0 时趋近直流值——而 f_out→0 恰恰是堵转、坡道起步、低速脱困这些最需要保护的工况。⇒ 关键在于:第 ② 类峰值在「三相平均」这个输入口径里就已经被抹掉了,网络再准也算不回来。它的可怕之处不在于结果错得离谱,而在于输出曲线合法、光滑、秒级尺度上完全正确,只是峰值系统性偏低——往危险侧错。读者据此判「还有余量」,然后放宽门限。

正解:平均口径必须写死成每芯片、每控制周期(热观测器执行周期典型 1~10 ms,由 ECU 任务调度定;开关频率 f_sw 车用典型 4~16 kHz,对应 PWM 周期 62.5~250 μs——两者均为行业典型区间);当控制周期长于基波周期的若干分之一、脉动仍会被采样抹平时,另设一条 ΔTj,fund 修正支路(f_out 与相电流的函数),并显式声明它是修正项、⛔ 不是网络输出。第 1 讲会用教学网络把 ΔTj,pp 随 f_out 的变化当场算出来给你看,第 2 讲在写平均口径那一节还会再复述一次——这条不是可以只放进误区节的东西。

⚠ 另有两条同源的读反,也在这里先点破,各自的完整展开在第 5、第 6 讲:

附带①:「分级链=从轻到重逐级往下走」。分级链(预警→降开关频率→限相电流→限扭矩→跳保护)排的是驾驶员可感知度,⛔ 不是削温效率。四只手各有额度,判据是「额度用完立刻换手」,⛔ 不是「在这一级停留固定时间再往下」。尤其⛔ 不得由「降频排在前面」推出「任何工况下都先降频、且降完再说」——降 f_sw 这只手的额度上限就是开关损耗在总损耗中的占比,而 SiC 器件的开关能量显著低于同等级 Si IGBT(供应商数据表可查、须按所用器件核)⇒ 同一 f_sw 下,SiC 平台这只手的额度更小、更早见底。⚠ 这里只写定性关系,⛔ 不作倍数或数量级比较——开关损耗占比是平台相关量,本课不给数。

附带②:「门限往保守侧设总是安全的」。「保守」在本课没有单一方向:对器件瞬态保守=门限低、迟滞窄;对寿命保守=迟滞宽、动作次数少;对整车能力保守=门限高。低门限加窄迟滞会在门限附近反复进出,把安全动作本身变成 ΔTj 循环;而门限比整车实际冷却能力保守,会出现「能力够却降额」——它与「降额没兜住」两类都是事故,⛔ 不存在「保守一点总没错」这条退路。⇒ 说「保守」必须指明对谁保守

接着是全课的读法约定,先立后用——本课有六组极易代错的量(这六组与「关键公式详解」开头那张符号收口表是同一套,⛔ 两处不许各列各的),⛔ 正文与图上一律不裸写。两个频率f_sw 是逆变器的开关频率(kHz 量级,是降额的一只手),f_out 是电机的输出基波频率(0 到千赫兹量级,是上面第 ② 类峰值的自变量)——两者毫无关系,⛔ 全课禁止出现裸的「频率」。② 两条热阻Rth(j-c) 是结到壳,Rth(j-f) 是结到冷却液(教学网络取 0.288 与 0.526 K/W,教学假设值、与 E2-03 功率模块封装、DBC 与热阻网络 同值同舍入,⛔ 不对应任何平台)——它们各自只能配自己那个参考面的温度,这是第 3 讲的硬约束。③ 四个结温门限Tj_max 是器件手册给的额定工作上限(车规模块常见额定档 150~175 ℃,行业典型区间;⚠ 它不是烧毁温度、不是设计值,设计值由寿命目标反推、归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324;⛔ 区间端点不得当作可承诺值,本平台采用值以所用器件手册为准、本课不给数)、Tj_start 是降额起点、Tj_trip 是跳保护触发点、Tj_reset 是退出点,四者之间隔着迟滞带 ΔT_hys。④ ΔT 一族,⛔ 全课不裸写 ΔTΔTj 在本课只有一个含义——一次「降额投入—温度回落—恢复」所经历的循环幅值(寿命账里那个量,与 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324 同定义);相对参考零点的温升(教学算例里那些数)一律写作 ΔT(j−f),⛔ 不许写成 ΔTj;一个输出基波周期内的结温峰谷差写作 ΔTj,pp,它与 ΔTj ⛔ 不是同一个量、也⛔ 不是同一族里的两个刻度。这一族的完整成员表在「关键公式详解」开头。⚠ 这不是名字像而已——ΔTj 与 ΔT(j−f) 会在第 5、第 6 讲相邻出现,代错一个,「降低门限」这个动作在两本账上的符号正好相反。⑤ k 分两个,⛔ 不裸写 k落在求和号里的 k 是芯片序号不落在求和号里、单独出现的 k 是热-电正反馈的环路增益(第 2 讲 2.3 那一个);在线自校正对损耗总量的标度增益另写作 k_P。⑥ 带帽的是估计量:T̂j 是观测器给出的估计结温、P̂ 是在线损耗模型给出的估计损耗,不带帽的 Tj、P 指真值——车上永远只有带帽的那一个,这正是门限必须建在误差带保守边上的原因。

本课要画六个全集,每一个都先说清「沿什么线索数的」「有没有不在这条线索上、但同属这个集合的」:被保护量全集九类,结温只是其中之一;其中八类各出一个可用输出上限、取最小,第九类 ΔTj 循环幅值是循环量⛔ 不是温度、⛔ 不进这个取最小)· 在线拿到结温的手段全集(五类,按时间尺度 × 空间粒度两轴摆开,⛔ 不按先进程度排)· 降额与保护的执行器全集(⛔ 禁止沿「降频→限流→限扭」这一条电控链枚举,那样会整类漏掉冷却侧、调制方式、时间预算式限功率、整车侧与人机五类)· 失效模式全集(十类,⛔ 禁止只沿「NTC 失效」枚举;十类归成三种可观测特征处置)· 触发降额的工况全集(七类,⛔ 不止行驶工况,且出口量随场景变)· 降额曲线自变量全集(⛔ 不是只有 Tj,但多个被保护量走 min 仲裁、⛔ 不塞进同一个函数)。⚠ 这六个全集里,漏掉的那一类不会以「少了一条」的形式暴露——它是整类不出现,你数出来的那张表看起来完完整整。

全课按七讲排。第 1 讲把地基立起来:Tj_max 这条线同时被瞬态安全与寿命两本账引用而本课只交前一本的动作、NTC 与结温之间差的是空间差/时间差/分配差三件互相独立的事(⛔ 不是只差一个「滞后」)、上面那条反钉子用教学网络当场证一遍、被保护量与拿到结温的手段两个全集、本课与方法课姊妹课的分工线,最后落到交付物五元组与门限分解式上。第 2 讲是观测器的输入端——损耗账:六项损耗全集(沿「导通+开关」两项数会漏掉二极管那两项与高温漏电那一项)、损耗模型的自变量表(大纲的四个之外必须补调制比与功率因数,否则按芯片分配无从算起)、热-电正反馈有界不发散而不是会热失控、平均口径写死、低 f_out 下损耗集中在一两个芯片上、损耗误差线性进结温、在线自校正只能校总量⛔ 不能校分配。第 3 讲网络端——数值与口径账:在线为什么必须用 Cauer(前三条理由归 E2-03 功率模块封装、DBC 与热阻网络,本课补第四条——只有 Cauer 的状态能被重初始化)、参考面同源这条硬约束、参考零点本身也是估计量、离散化的步长判据、降阶要保住慢阶把快阶折成静态热阻、四条触发下的状态重初始化、多芯片 Zth 是矩阵不是曲线。第 4 讲讲 TSEP 与融合:参数全集分静态与动态两支(片上集温二极管不是 TSEP)、为什么必须小感测电流(通态压降的温度系数在大电流下会翻号)、TSEP 只在被采样的那一刻给一个数、在线提取的三重难、老化同时改变真实热阻与标定曲线⛔ 不得用它反推热阻退化、融合结构先试互补滤波、⛔ 不许双向互喂。第 5 讲是钉子②的主场:每一档必须交付进入/退出/最小驻留/恢复速率四件事、档与被保护量是多对多、执行器全集、四只手的额度与换手、降频⛔ 不是免费的(它把热搬到电机侧)、限相电流与限扭矩不是同一件事、降额曲线 g(Tj) 的形状约束、迟滞带的下界怎么来、恢复不是触发的镜像、给冷却系统的请求里除请求类型外还要带哪三个字段。第 6 讲收门限的外部约束:分解式收口、门限必须与整车实际冷却能力同版标定、触发场景全集与各自不同的出口量(升压充电工况下降额表现为充电功率下降而不是扭矩回退)、取最小仲裁自己会抖所以仲裁层要有「当前主导者」、ΔTj 寿命预算、前馈改变的是输入⛔ 不是判据、前馈失效必须原样兜底。第 7 讲回到功能安全与整车协同:合理性校验六条各能抓什么、抓不到什么(⛔ 它不是冗余,六条共用同一路参考零点)、失效十类归三种可观测特征、「安全侧」是往降额与退出方向而⛔ 不等于立刻跳保护(行驶中动力中断本身是整车级危害)、置信度降档与故障码分开报、往整车只交可用输出上限/冷却请求/置信度三样而⛔ 不交仲裁。

最后由收尾各层收口:五条关键公式各自的射程与失效边界(那比式子本身值钱)、连续爬坡案例的五项输入与一条决策链以及四种做错各自的代价、七条误区的落点表、动手做的三项交付物各带一条可被别人复核的验收判据,以及标准与工具的用法边界——其中最要紧的一句是:HIL 上的「结温」是被仿真出来的,它只能验状态机、时序与降级分支这些逻辑,⛔ 验不了观测器的精度;把 HIL 全绿当成「结温估计验过了」,是本课最贵的一种自证通过。

第 1 讲 结温是估出来的:先把「交付什么、保护谁、拿什么手段」三件事定死

这一讲一行观测器代码都不写。后面几讲讲的是怎么把结温估出来、估出来之后怎么用、以及估不出来时怎么办;而这一讲只做一件事:把三个前提定死——这门课要交付的到底是什么(1.8)、要保护的到底是谁(1.5)、车上真正能拿到结温信息的手段一共有哪几类(1.6)。三个前提里任何一个含糊,后面搭出来的观测器都会很自信地算出一个没人敢用的数。中间三节(1.2~1.4)做的是同一件事的另一半:把两个几乎人人都会先犯一遍的错,在动手之前先掐掉——一个是拿 NTC 当结温,一个是把「瞬态峰值」当成一类。

⚠ 全讲开始前先立两条口径,全课统一、⛔ 不中途换。

其一,教学网络。本讲及全课出现的每一个具体的 R、C、τ、功率、温升与温度,都出自一套教学热网络,它与前置课 E2-03 功率模块封装、DBC 与热阻网络 同源同值,为的是让每一步都能被读者自己复算一遍:模块段四阶 Foster R=[0.030, 0.055, 0.100, 0.103] K/W、τ=[0.2, 2, 20, 200] ms(ΣR = Rth(j-c) = 0.288 K/W)及其精确等价的 Cauer;其后串 TIM 0.178 K/W(C = 0.047 J/K)、冷板固体 0.040 K/W(C = 50 J/K)、冷却液侧 0.020 K/W(C = 500 J/K),整链 Rth(j-f) = 0.526 K/W。教学工况取三点:连续 80 W、连续爬坡段 140 W、峰值 200 W;教学冷却液入口温度取 65 ℃。对应的相对冷却液入口温度的稳态温升分别是 42.1 / 73.7 / 105.2 K,结温 107.1 / 138.7 / 170.2 ℃⛔ 以上全部是教学假设值,不对应任何平台、任何器件、任何模块,禁止取用——它们只保证内部自洽与量级合理。全课显示精度也在这里定死:温度与温升 1 位小数、热阻 3 位小数、功率整数、占比 1 位小数;计算一律用未舍入值,⛔ 不得用显示值 0.526 反算(未舍入值是 0.526127,用 0.526 会在 140 W 上算出 73.6 而不是 73.7)。

其二,三个容易撞名的符号先分开。本课有三个都写作「ΔT…」的量,量纲相同、含义完全不同,⛔ 全课不许裸写混用(这一族的完整成员表在「关键公式详解」开头,本表只先立最要紧的三个):

符号 是什么 单位 归哪本账
ΔT(j−f) 结面相对冷却液入口的温升(= P·Rth(j-f) 的稳态值,或其瞬态对应量) K 瞬态安全账
ΔTj,pp 一个输出基波周期内结温脉动的峰峰值(周期稳态下的 Tj,max − Tj,min,与 E2-03 功率模块封装、DBC 与热阻网络 同定义) K 瞬态安全账(峰值那一侧)
ΔTj 一次「降额投入—温度回落—恢复」所经历的循环幅值(与 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324 同定义) K 寿命账

第一个是「结温比冷却液高多少」,第二个是「结温在一个基波周期里摆了多大」,第三个是「一次降额动作让结温摆了多大」。上面那三个 42.1 / 73.7 / 105.2 K 全是 ΔT(j−f),⛔ 不是 ΔTj、也⛔ 不是 ΔTj,pp。⚠ 1.4 里出现的 ΔTj,pp 与 ΔTj ⛔ 不是同一个量、也不是同一族里的两个刻度:前者由 f_out 与损耗波形决定、每个基波周期发生一次,后者由降额动作的投退决定、一次工况事件才发生一次。

1.1 Tj_max 这条线同时被两本账引用:瞬态安全一本、寿命一本——本课只交前一本的动作

是什么。「结温不能超」这句话,工程上其实是两句话叠在一起说的,它们看的是同一条曲线上的两个完全不同的特征:

  • 瞬态安全账看的是 Tj 的绝对峰值——任何一个瞬间都不许越过允许的工作上限。它的自变量是「最高点在哪」。
  • 寿命账看的是 ΔTj 的幅值与次数——结温每摆一次,芯片贴装层与键合界面就积累一点热机械损伤。它的自变量是「摆了多大、摆了多少回」。

两本账在纸面上共用 Tj_max 这一条线,所以极容易被合并成一句「别超温」。但它们的自变量根本不同:一条曲线可以峰值从没碰过线,而摆幅巨大、次数极多;也可以摆幅很小,却有一次尖峰越线。

为什么这件事必须放在全课第一节。因为把两本账混成一条线,会出现两种方向相反的错,而且两种都不会报错:

其一,峰值从没超线,寿命却提前用完。保护逻辑只盯绝对值,每一次都在门限以下把车「救」回来,账面完美;而每救一次就是一个完整的温度循环,损伤在另一本账上悄悄累加。

其二,为了压峰值而频繁降额—恢复,反而多造了循环。门限压得越低、迟滞带做得越窄,单位里程内进出降额的次数就越多——安全动作本身变成了寿命消耗。这条会在第 6 讲兑现成一条可判的约束(门限与迟滞带的设定必须把「单位里程循环数」列为并列约束)。

⇒ 本课的处置是只交前一本账的动作:在线估计、分级保护、主动降额,全部服务于「绝对峰值不越线」。寿命账在本课里只以两种形态出现:一是被计数(降额投入与退出的次数、每次的 ΔTj 必须记录上报,那是任务剖面统计的输入),二是被当成一条并列约束去限制门限与迟滞带怎么设。⛔ 本课不给 ΔTj 与循环寿命的定量关系、不给幂律指数、不给寿命次数——那一整套判据归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324

工程量级。车规功率模块的额定结温上限 Tj_max 常见档是 150~175 ℃(行业典型区间,标「典型」,与 E2-01 逆变器/IGBT 散热设计与冷板E2-03 功率模块封装、DBC 与热阻网络 同口径同值)。⚠ 三条限定必须跟着一起写:① 区间的端点不得当作可承诺值;② 它是额定上限不是设计值——设计用的那个值由寿命目标反推得到,一定低于额定上限,反推方法归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324;③ 本平台的采用值以所用器件手册为准,⛔ 本课不给数

易错点。把 Tj_max 当成烧毁温度。它不是失效阈值,也不是一条「越过就报警」的线——它是器件手册允许的工作上限,越过之后发生的不是立即损坏,而是可靠性假设整体失效:手册上所有基于该上限给出的参数与寿命外推,从那一刻起都不再成立。这个区别决定了保护策略的形状:如果它是一条报警线,正确做法就是「到了就跳」;而它是一条可靠性假设的边界,正确做法就变成「提前多少开始动、动多少」——那正是主动降额存在的全部理由,也是 1.8 那条门限分解式要回答的问题。

1.2 NTC 与结温之间差三件事:空间差、时间差、分配差,⛔ 不是只差一个「滞后」

是什么。功率模块上通常贴着一颗 NTC 热敏电阻,很多人的第一反应是「它就是模块温度,加个补偿就能当结温用」。它与结温之间差的不是一件事,是三件互相独立的事

空间差——NTC 贴在 DBC 上或基板上,不在任何一块芯片的正下方,读的是另一个物理面,而且带着横向偏置。它与最热那块芯片之间隔着好几段热阻。

时间差——在热网络里,NTC 所在的节点位于芯片下游若干阶。功率阶跃之后,热量要先把上游那几阶的热容充满才轮到它,所以它的读数总是「迟到」,而且迟到的时长由那几阶的时间常数决定,⛔ 不是一个固定的延迟。

分配差——一颗 NTC 面对的是整块模块的十几块芯片。基板的横向导热把各芯片的贡献抹成了一个加权平均,于是三相不平衡、单个开关位过载这类最危险的情形,在 NTC 那里几乎看不见

为什么必须拆成三件。因为只把它当成「滞后」,会推出一个看起来很自然、实际只解决三分之一问题的对策:加一个超前补偿(或者干脆加一个固定偏置)。超前补偿治的是第 ② 件;第 ① 件与第 ③ 件它一件都补不掉——空间差要靠一段确定的热阻去补,而分配差根本不是「一个数不准」,是「这个量里已经不含那个信息了」。信息在测量口径里被抹掉之后,任何后处理都造不回来。这条判据在本课会反复出现:被输入口径抹掉的量,网络再准也算不回来(1.4 会在另一个量上再撞一次)。

工程量级。用本讲开头那套教学网络算一次只算第 ① 件的量级:在爬坡段 140 W 上,直接拿壳面温度当结温,稳态就差一整个 P·Rth(j-c) = 140 × 0.288 = 40.3 K(教学假设值,⛔ 不对应任何平台,禁止取用)。40.3 K 是什么概念——它与 1.1 那条常见额定档 150~175 ℃ 的整段跨度是同一个量级。⚠ 这里只作量级对照,⛔ 不是拿区间端点作任何承诺。

这个数的方向必须写死:它是低估。教学算例把 NTC 放在壳节点上,而真实模块里 NTC 通常还要更远离芯片(横向偏置 + 不同的面),所以真实偏差不小于这个值。⇒ 此方向声明只能这样用:真实偏差比 40.3 K 更大;⛔ 不得反过来用它说「偏差最多也就这么大」——那是把一个明确标了下界的量当上界用。

易错点。把「NTC 偏低」理解成一个可以标定掉的常数。它随损耗大小变(第 ① 件与损耗成正比)、随时间变(第 ② 件)、随三相与各芯片之间的分配变(第 ③ 件)——三个自变量,没有一个是常数。⇒ NTC 在本课里的正确位置不是「结温的粗测」,而是一路慢时间尺度的边界量测:走合理性校验与总量自校正,⛔ 不直接进保护判据。它具体怎么接,第 3 讲(参考零点)与第 4 讲(融合结构)各交一半。

图1 上下两栏的结构示意。上栏为功率模块俯视:三相六个开关位,每个开关位画出 IGBT 芯片与反并联二极管两块、共十二块芯片,基板边缘另画一颗 NTC,十二块芯片各引一条细线汇聚到这一颗 NTC 上,形成十二对一的汇聚箭头束。下栏为纵向剖面,自上而下逐段标名共十段:结、芯片贴装、DBC 上铜、陶瓷、DBC 下铜、基板贴装、基板、TIM、冷板、冷却液;剖面上用三条不同颜色的引线各带独立名称标出三个参考面,分别是结面、壳面即基板底面、冷却液入口面。三件差各挂一条独立文字标注:空间差指向被涂成热红的那几段热阻,即 NTC 与最热芯片之间隔着的热阻段;时间差指向这几段上画出的热容符号;分配差指向俯视图里那束十二对一的汇聚箭头。本图为结构示意,几何比例不代表真实尺寸、不含任何数值,不得据图取值。
图1 该读出的判断是:NTC 与结温之间不是一个可以用固定偏置补掉的差,而是三件互相独立的差同时存在。三件差在图上各有独立标签与各自的图形落点——涂色的热阻段(空间差)、热容符号(时间差)、十二对一的汇聚箭头(分配差);三个参考面各有独立引线与名称;十段叠层逐段有名。据此可判:任何「NTC 读数 + 一个常数」的写法只补了三件里的第一件,而第二件与第三件恰恰在瞬态与三相不平衡工况下才是主项——也就是最需要它准的那些工况。本图为结构示意,几何比例不代表真实尺寸、不含任何数值,⛔ 不得据图取值。

1.3 「NTC 读数 + 一个固定偏置」这个改良版不是偏保守——它两个方向都会错

是什么。知道 1.2 那 40.3 K 之后,几乎所有人的下一步都一样:那就把它加回去。于是车上出现两种用法:

  • 用法甲:直接拿 NTC 读数当结温;
  • 用法乙:NTC 读数 + P·Rth(j-c),把第 ① 件差补回去。

用法乙在稳态下是对的——它补的正是那一整个 40.3 K。问题全部发生在瞬态。

为什么。用法乙把一个稳态关系(P 乘以稳态热阻)套在了一个瞬态过程上。而真实的那一段温差是由 Zth 的瞬态值决定的,它在阶跃之后要花时间才长到稳态值。于是:

  • 升载瞬间:功率一步跳上去,用法乙立刻把整个稳态温差加了上去,而真实的那段温差还没长起来 ⇒ 它高报结温,方向上偏保守;
  • 卸载之后:功率一步落下来,用法乙立刻把这份温差撤走,而芯片上那份热还没散掉、真实结温还高高地挂在上面 ⇒ 它低报结温,方向上偏危险

工程量级。用同一套教学网络跑一段 20 W →(3 s)→ 140 W →(9 s)→ 20 W 的方波,两侧的极值分别是:升载瞬间用法乙最大偏保守 +27.8 K,卸载瞬间最大偏危险 −27.7 K;同一张图上用法甲的稳态固定偏差是那 40.3 K(均为教学假设值,⛔ 不对应任何平台,禁止取用)。两侧几乎一样大。

⇒ 由此得到本节要钉死的一条:⛔ 不得声称「NTC 加偏置偏保守」。这句话在稳态与升载段是对的,在卸载段是反的,而声明了方向性的量⛔ 不得反向使用。工程上真正要命的恰恰是卸载那一侧——长坡到顶、急加速结束、快充结束这类「刚刚过去」的时刻,估计值提前回落,而真实结温还在高位,此时若刚好叠上第二次加载,保护会晚一拍。

易错点。拿「平均起来差不多抵消」来给用法乙背书。两个方向的误差不会互相抵消——它们发生在不同时刻,而保护逻辑看的是每一时刻的值,不是时间平均。⇒ 正确动作只有一条:把那段温差按瞬态算,也就是用损耗驱动一条完整的热网络,而不是拿一个稳态热阻去乘。那正是第 2 讲与第 3 讲要做的事。⚠ 同 1.2 的方向声明:本例把 NTC 放在壳节点,在方向上低估了真实偏差,此声明⛔ 不得反向使用。

图2 单张时序曲线图,横轴为时间 0 到 15 秒,主纵轴为相对冷却液入口温度的温升,单位 K。图上四条曲线各带独立标签:真实结温、壳节点温度即 NTC 位置的教学代表、用法甲即直接拿 NTC 读数当结温、用法乙即 NTC 读数加上损耗乘以结到壳的稳态热阻。次纵轴上叠画功率剖面方波,20 W 保持 3 秒后阶跃到 140 W、保持 9 秒后落回 20 W。在 3 秒与 9 秒两处各画一条竖直误差标注并直接标出数值,分别是用法乙的最大偏保守量正 27.8 K 与最大偏危险量负 27.7 K;稳态段另标出用法甲的固定偏差 40.3 K。网络参数为教学假设值,不对应任何平台,图上所有温度均为教学算例值,不得取用于任何工程判断。
图2 该读出的判断是:「NTC + 一个固定偏置」这个改良版不是偏保守,它在两个方向上都会错,而卸载之后那一侧是往危险侧错。要读的四个量图上各有独立标签——用法甲的稳态偏差(40.3 K)、用法乙在升载瞬间的偏保守峰值(+27.8 K)、用法乙在卸载瞬间的偏危险峰值(−27.7 K)、以及真实结温自己的峰值位置。据此可判:⛔ 不得声称「NTC 加偏置偏保守」。⚠ 本图把 NTC 放在壳节点,这在方向上低估了真实偏差,该方向声明⛔ 不得反向使用。网络参数为教学假设值,⛔ 不对应任何平台,图上所有温度均为教学算例值,⛔ 不得取用于任何工程判断,⛔ 也不代表任何平台的实际偏差量级。

1.4 「瞬态峰值」是两类:沿急加速与爬坡这条线索数,会整类漏掉基波周期脉动

是什么。「瞬态峰值结温才是危险点」这句话本身没错,错在它几乎总被读成一类峰值——急加速、连续爬坡那几秒的峰值。先问自己两句:我是沿什么线索数出来的?有没有不在这条线索上、但同属这个集合的?沿的线索是「整车层面能感觉到的负荷事件」。补齐之后是两类:

  • 第 ① 类·工况级瞬态:秒到数十秒。急加速、连续爬坡、低压桩升压充电。它的时间尺度由整车事件决定。
  • 第 ② 类·基波周期脉动:周期 = 1/f_out。单块芯片的损耗在一个输出基波周期内剧烈起伏——某个开关位的电流从零涨到峰值再回零,它的损耗跟着走一遍。输出频率越低,这个周期越长;堵转、坡道起步、低速脱困时 f_out→0,周期可长到无穷。

为什么第 ② 类不能被当成「高频纹波」忽略。因为决定脉动幅值的是热网络在这个时间尺度上的取值,而车用模块芯片段到基板段的热时间常数正好落在这里。本课教学网络:模块段 τ = [0.2, 2, 20, 200] ms,其后 TIM 8.4 ms、冷板固体 2 s、冷却液侧 10 s;整条链耦合之后的特征时间常数实算跨 0.2 ms 到 11.3 s(教学假设值,与 E2-03 功率模块封装、DBC 与热阻网络 同值,⛔ 禁止取用)。而车用主驱的 f_out 从 0(堵转)一直到千赫兹量级(按极对数 3~6 与最高转速 12000~20000 rpm 现算,均为行业典型区间,⛔ 端点不得当作可承诺值),对应的基波周期从无穷长到亚毫秒——这条区间与模块段那几个时间常数完全重叠。⇒ 在 f_out 低的那一段,芯片温度来得及跟着损耗涨落走一遍,脉动就出来了;f_out 越低,跟得越彻底,f_out→0 时干脆趋近直流值。

图3 一条横向对数时间轴,跨 0.1 毫秒到 1000 秒,刻度只标八个数量级:0.1 ms、1 ms、10 ms、0.1 s、1 s、10 s、100 s、1000 s。轴上自下而上叠四条带,每条带各带独立名称与量级范围标签:第一条为教学网络各段的热时间常数带,分芯片与贴装段、基板与冷板段两段,标出七个特征时间常数所在区间;第二条为观测器执行周期带 1 到 10 毫秒并标典型;第三条为第二类瞬态即输出基波周期带,由输出基波频率从堵转到千赫兹量级换算,左端画成开口箭头指向无穷大周期并标堵转时输出基波频率趋于零;第四条为第一类瞬态即工况级事件带,含急加速、连续爬坡、升压充电,跨秒到数十秒。开关周期另标一格以免与基波周期混淆。两类瞬态用主蓝与热红两色区分并配图例,带的右侧各写一句判语,第一类写三相平均口径能看见,第二类写三相平均口径里已经被抹掉。本图为量级对照示意,带的宽度与位置只表示数量级、不表示任何平台的实际取值,不得据图取值。
图3 该读出的判断是:「瞬态峰值」是两类而不是一类,且第 ② 类与模块段热时间常数落在同一个数量级上——这正是它既抹不掉、也算不回来的原因。要读的量图上各有独立标签:四条带各自的名称与量级范围、开关周期那一格(⛔ 不要与基波周期混为一谈)、两类瞬态的颜色图例、以及带右侧那两句「能看见 / 已经被抹掉」的判语。据此可判:手上那套观测器的输入口径,有没有已经把第 ② 类丢掉。⚠ 横轴是时间(周期或时间常数),⛔ 不是频率。本图为量级对照示意,带的宽度与位置只表示数量级、⛔ 不表示任何平台的实际取值,⛔ 不得据图取值。

现在把它算给你看。用同一套教学网络求周期稳态解,损耗波形假设写死为单芯片、半波整流形状、周期均值 140 W(对应峰值 140π ≈ 439.8 W)——⚠ 这条波形假设是结论成立的前提,换一个波形形状,下面每一个数都要重算。结果(均为教学假设值,⛔ 不对应任何平台或器件,禁止取用):

f_out 结温峰谷差 ΔTj,pp
100 Hz 30.8 K
10 Hz 65.2 K
1 Hz 104.0 K
→ 0(堵转极限) 231.4 K(= 439.8 W × 0.526127)

而三个频点上的周期均值恒为 73.7 K(= 140 W × 0.526127)——与 f_out 完全无关,一条水平线

⇒ 这张表就是本课反钉子的证据。一个只吃「平均损耗」的模型,它的输出就是那条 73.7 K 的水平线;而真实的峰谷差从 30.8 K 一路涨到 104.0 K、极限处 231.4 K。差额不是网络算错了,是它在输入端就已经不存在了

易错点(本课反钉子,读者最常做的那个具体动作)。用三相平均损耗、或者整模块总损耗,去驱动一个单节点热网络,然后拿它与台架实测的秒级曲线对一对,发现对得很好,于是判「峰值抓到了」。这条链上每一步都是对的,结论是错的:秒级尺度上它确实对(第 ① 类它看得见),而第 ② 类在「三相平均」这个口径里就已经被抹平了。输出曲线合法、光滑、在它被检验的那个尺度上完全正确,而峰值系统性偏低——往危险侧错。读者据此判「还有余量」,然后去放宽降额门限。

正确动作。平均口径必须写死成「每芯片、每控制周期」,⛔ 不是三相平均、⛔ 不是整模块总量(第 2 讲展开,那里会把这条口径的三个自由度逐个钉死);② 当控制周期长于基波周期的若干分之一、脉动仍会被采样抹平时,另设一条 ΔTj,fund 修正支路(f_out 与相电流的函数),并声明它是修正项、⛔ 不是网络输出——两者的置信度与失效模式完全不同,混在一个量里报出去,下游无从判断它信的是哪一个。

图4 左右双联曲线图。左联横轴为输出基波频率,对数刻度 0.2 到 1000 Hz,纵轴为温升 K,画三条各带独立标签的线:真实结温周期稳态的峰值线、谷值线,以及恒为一条水平线的平均值线;峰值线与谷值线之间的竖直距离即为结温峰谷差,在输出基波频率等于 1、10、100 Hz 三处各画一根带数值标签的双箭头。水平的平均值线上另标一句:三相平均口径的输出与输出基波频率无关,恒为同一个数。右联取输出基波频率 10 Hz 上的一个基波周期,画损耗波形与对应的结温波形,损耗波形为半波整流形状、周期均值 140 W,图上标出峰值、均值与峰谷差三个量各自的独立标签。损耗波形假设为单芯片、半波整流形状、周期均值 140 W,对应峰值约 439.8 W;网络参数与损耗波形均为教学假设值,不对应任何平台或器件,图上数值只用于说明趋势,不得取用。
图4 该读出的判断是:同样的平均损耗,输出基波频率越低脉动越大,趋于零时趋近直流值;而平均口径的输出是一条与它无关的水平线——⇒ 峰值差额是被输入口径抹掉的,网络再准也算不回来,且抹掉的方向是把峰值系统性低估(往危险侧)。要读的量图上各有独立标签:1 / 10 / 100 Hz 三处的峰谷差数值、峰值线、谷值线、恒定的平均值线,以及右联那一个周期里的损耗峰值、均值与结温峰谷差。⚠ 损耗波形假设写死为单芯片、半波整流形状、周期均值 140 W(峰值约 439.8 W),换一个波形形状每一个数都要重算。网络参数与损耗波形均为教学假设值,⛔ 不对应任何平台或器件,图上数值只用于说明趋势,⛔ 不得取用,⛔ 也不代表任何平台的实际脉动幅值。

1.5 被保护量全集:结温不是唯一那一个,各出一个上限、取最小

是什么。这门课叫「结温估计与热保护」,于是很容易默认被保护量只有结温一个。同样先问那两句:沿什么线索数的?沿的是「结温 Tj」这一条。补齐之后,这个集合里除结温之外还有八项——连结温在内一共九类(⚠ 全课一律按这个数说,⛔ 不许有的地方说八类、有的地方说九类):

# 被保护量 本课怎么处理
(a) DC-Link 薄膜电容芯温 讲判据与仲裁口径;热账本体归 E2-06 主驱逆变器盒级热设计:DC-Link 薄膜电容与非半导体热源
(b) ΔTj 循环幅值 讲判据,但⛔ 不进取最小仲裁(见下);定量关系归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324
(c) 芯片之间与三相之间的不平衡 讲判据与仲裁口径
(d) 二极管结温 讲判据与仲裁口径
(e) 栅极驱动板与 PCB 元件温度 只作声明
(f) 母排与连接器温度(接触电阻) 只作声明
(g) 电机侧限值 只写去向与接口,归 E1-05 电机温升限值、绝缘等级与降额
(h) 冷却液本身的温度上限 只写去向与接口,仲裁归 K3-01 整车热管理控制策略总览与模式管理

⚠ 这个全集是本课按「先画全集再逐项核对」归纳的,⛔ 不是某标准或课程大纲里既有的分类,引用时请说明出处。

为什么不能把它们合并成一个判据。九类各由各自的判据链决定——电容的芯温由纹波电流与它自己的等效串联电阻决定,母排温度由接触电阻决定,电机侧限值由绝缘等级决定。这些链之间不存在任何可以互相推导的关系。⇒ 正确形态只有一个:每一项各自出一个「本步允许的可用输出上限」,取最小值下发(⚠ 进这个取最小的是九类里的八类——(b) ΔTj 循环幅值是循环量、⛔ 不进,理由见下)。之所以能取 min,是因为它们出的都是同一个量纲的同一个量——不是温度,是输出上限。⛔ 不得把温度与输出上限放在同一条比较链上。

(b) 为什么是个例外。ΔTj 循环幅值确实属于被保护量,但它不是一个温度,是一个循环量:它没有「当前值超没超」这回事,只有「累计摆了多少次、每次多大」。⇒ 它进不了这个 min,它走的是 1.1 那本寿命账——被计数、被上报,并作为一条并列约束去限制门限与迟滞带(第 6 讲)。

工程量级。⛔ 九类的门限一个都不给数——它们全部是平台相关量,取决于所用器件与元件、整车冷却能力标定与寿命目标,须由本项目标定确定。

易错点。① 把多个被保护量塞进同一个降额函数,写成 g(Tj, T_cap, T_motor, …)。这是把两条互不相干的判据链硬接成一条,标定时会发现改任何一维都会动到别的维,而且说不清为什么。② ⛔ 由「结温没超」推出「电容没超」——两者的热源、热路径与时间常数都不同,尤其在低 f_out 大电流工况下电容的纹波电流可能正处在最恶劣点,而结温还很从容。③ 为每一个被保护量各建一套完整的分级链——两套链同时动作时输出不可预测(第 5 讲会把正确形态给出来:一套档位机 + 多路上限取最小)。

图5 一张判据链结构图。左列纵向排开八项被保护量,各带独立文字标签:IGBT 结温、二极管结温、芯片间与三相间不平衡、DC-Link 薄膜电容芯温、栅极驱动板与 PCB 元件温度、母排与连接器温度、电机侧限值、冷却液温度上限。每一项后面各接一个写着「各出一个上限」的方框,八个方框汇进中间一个取最小的仲裁菱形,菱形右侧出一条箭头指向出口量「本步的可用输出上限」。八项按射程分三组着色并配图例:本课讲判据与仲裁口径的四项、本课只作声明的两项、本课只写去向与接口的两项,后两项各带一条去向箭头分别指向 E1-05 与 K3-01,电容热账另带一条指向 E2-06、寿命账带一条指向 E2-07。图外单画一条注:ΔTj 循环幅值不是一个温度而是一个循环量,走寿命账,不进这个取最小。图上标明该全集为本课归纳。本图为结构与判据示意,不含任何限值、门限或数值,不得据图取值。
图5 该读出的判断是:结温不是唯一的被保护量;各项各出一个「可用输出上限」,由取最小仲裁给出这一步真正下发的值;而 ΔTj 循环幅值虽然同属被保护量,却因为不是温度而不能进这个取最小。要读的量图上各有独立标签:八项名称、八个「各出一个上限」方框、取最小菱形、出口量名称、三种射程的颜色图例与四条去向箭头,以及图外那条 ΔTj 例外注。⚠ 之所以能取最小,是因为进入比较的都是同一个量纲的同一个量(可用输出上限),⛔ 不得把温度与输出上限混在同一条比较链上。⚠ 数一遍:全集共九类,图上画的是进入取最小的那八类,第九类 ΔTj 循环幅值在图外单独作注(它是循环量、不是温度,⛔ 不进这个取最小)——⛔ 不要把图上的八项当成全集。本图为结构与判据示意,⛔ 不含任何限值、门限或数值,⛔ 不得据图取值。

1.6 在线拿到结温的手段全集:五类,按「时间尺度 × 空间粒度」两轴摆开,⛔ 不按先进程度排

是什么。关于「车上怎么知道结温」,流传最广的说法是「两条路:热模型观测器,或者 TSEP」。沿「模型 ↔ TSEP」这条线索数,会漏掉三类。补齐之后是五类:

  1. 热模型观测器——用估计的损耗驱动热网络。连续、快、无噪声,但有漂移(模型参数不准、器件老化)。
  2. TSEP(温敏参数法)——用器件自身的某个电学参数反解结温。离散、稀疏、带噪,但在它被采样的那一刻直接对应结温、⛔ 不与热模型同源,所以不会跟着模型一起漂。⚠ 这⛔ 不等于「它不会漂」——它自己那条标定曲线会随老化漂,而且漂了多少与真实热阻变化不可辨识(4.5、4.7 第 ③ 条);⇒ 选型时⛔ 不得把它当成一路永远不跑偏的锚。
  3. 片上集温二极管——集成在芯片上的测温结构。⛔ 它不是 TSEP:它是直接测量,不需要反解一条标定曲线,也不受工况耦合。
  4. 模块内 NTC——1.2 讲过的那一颗,测的是另一个面。连续、慢、⛔ 不与热模型同源,但空间差与分配差大。⚠ 同样⛔ 不等于「它不会漂」——NTC 自身的慢漂是第 7 讲失效全集里的第 ① 类,而且是最难检出的那一种(它没有跳变);⇒ 把它当慢基准用时必须连着第 7 讲那条「慢漂或残差持续同号 ⇒ 残差限幅、冻结自校正、降一档」的处置一起投。
  5. 冷却液侧能量守恒反算——由进出口温差与流量反算整模块散出去的总热量。它只给整模块一个数,对芯片之间的分配一无所知。

另有一类不在车上:红外热像与光纤测温,属台架手段,去向 L7-04 电子/功率器件热测量与表征:TSP 标定、JESD51 热阻实测与结构函数判读

⚠ 这个五分法、以及下面「按两轴摆开」这条口径,都是本课归纳的,⛔ 不是某标准或课程大纲里既有的分类,引用时请说明出处。

为什么要按两轴摆,⛔ 不按先进程度排。「先进程度」是一条一维排序,它会诱导出一个错误动作:挑一个最先进的,别的就不做了。而这五类真正的差别落在两个正交的维度上——更新的时间尺度(连续 / 离散 / 慢)与空间粒度(单芯片 / 每开关位 / 每相 / 整模块一个数)。摆开之后一眼就能看到结论:没有任何一类单独落在「结温保护要的位置」上(既要单芯片粒度,又要接近控制周期的更新率)。⇒ 量产方案必然是几类的组合,而不是选一个。这也解释了为什么第 4 讲整讲要讲「融合」,而不是「选型」。

更要紧的是:不先摆清粒度,融合本身就会做错。第 5 类给的是整模块一个数,若拿它去校单芯片的峰值,等于用一个已经被平均掉的量去纠正一个平均掉的信息——这与 1.2 的分配差、1.4 的口径抹平是同一个错的第三次出现。

工程量级。五类手段的更新率、粒度与精度全部取决于所用器件、驱动硬件与调制策略,⛔ 本课不给数

易错点。把片上集温二极管也叫 TSEP。两者在这个全集里是并列项而不是同一项:TSEP 要反解标定曲线、读数受电流与母线电压等工况量耦合;片上二极管不需要、也不受。⇒ 两者的失效模式完全不同,⛔ 不能共用同一套合理性校验——给 TSEP 设计的「工况耦合超范围就作废」这条校验,套到片上二极管上会在完全健康时把它废掉。② 把台架手段的结论直接当成车上可得的能力——红外与光纤在车上没有,台架测量方法本体归 L7-04 电子/功率器件热测量与表征:TSP 标定、JESD51 热阻实测与结构函数判读,本课只写去向。

图6 一张二维定位示意图。横轴为更新的时间尺度,对数刻度,自左向右从控制周期级到分钟级,只标数量级;纵轴为空间粒度,自下而上依次是整模块一个数、每相、每开关位、每芯片。图上放五个带名称的方块,每个方块内写两行小字,分别是它给的是什么量与它的主要局限:热模型观测器、TSEP、片上集温二极管、模块内 NTC、冷却液侧能量守恒反算。图外另放一个灰色虚线方块,标红外与光纤、台架手段、车上没有,并带去向标签 L7-04。图的右上角画一个热红空心目标框,标结温保护要的位置,五个方块与它的距离即为各自的差距。片上集温二极管一侧明写它不是 TSEP,不需反解标定曲线、不受工况耦合。图上标明该全集与两轴口径为本课归纳。本图为定性定位示意,方块位置只表示相对关系、不表示任何可读的数值或性能指标,不得据图取值。
图6 该读出的判断是:五类手段不是按先进程度排队,而是各自落在时间尺度与空间粒度这两轴的不同位置上;没有任何一类单独落进右上角那个目标框——所以量产方案必然是几类的组合,而不是选一个。要读的量图上各有独立标签:两轴的名称与量纲、五个方块的名称与各自两行说明、目标框、以及台架手段那个虚线方块与它的去向。⚠ 纵轴「空间粒度」指的是这一类手段能分辨到多小的空间单元,⛔ 不是它的精度;横轴指更新间隔,⛔ 不是延迟。本图为定性定位示意,方块位置只表示相对关系、⛔ 不表示任何可读的数值或性能指标,⛔ 不得据图取值。

1.7 分工线:本课是通用估计方法落在「结温」这一个量上的完整实例,⛔ 不重讲方法本体

是什么。在线估计这件事在本课程体系里由三门课分担,各自的被估量形态不同:

为什么要划这条线,而不是各讲各的。因为三者虽然「方法同构」,被估量的性质却不同,判据体系不能互抄:本课的被估量是单点值D1-06 电池热状态在线估计:从稀疏 NTC 到 T_max 与 ΔT_pack 的是分布场的极值——后者多一层「测点没覆盖到的地方会不会更热」的问题,本课没有;本课的损耗模型在整个寿命期内相对稳定(器件参数漂移是慢过程),而 D1-06 电池热状态在线估计:从稀疏 NTC 到 T_max 与 ΔT_pack 的产热源随电池健康状态漂移。⇒ 两边的自校正节奏与置信度判据必然不同。观测器与降阶模型的通用构造在本课讲一遍D1-06 电池热状态在线估计:从稀疏 NTC 到 T_max 与 ΔT_pack 引用不重讲;而估计器的结构选型与置信度分档在 K3-10 热管理在线状态与负荷估计:观测器整定、软测量置信度与退出条件,本课引用不重推。

本课不做的那几样,一并写在这里(这条边界是本课自己划定的,⛔ 不是课程大纲里既有的条款):热阻网络与 Zth 口径的建立归 E2-03 功率模块封装、DBC 与热阻网络;TSEP 的台架标定方法归 L7-04 电子/功率器件热测量与表征:TSP 标定、JESD51 热阻实测与结构函数判读;估计器结构选型与整定量归 K3-10 热管理在线状态与负荷估计:观测器整定、软测量置信度与退出条件;寿命与任务剖面归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324;电容与盒级热源归 E2-06 主驱逆变器盒级热设计:DC-Link 薄膜电容与非半导体热源;冷板与流动设计归 E2-01 逆变器/IGBT 散热设计与冷板;整车冷量仲裁归 K3-01 整车热管理控制策略总览与模式管理;升压充电的工况细节与三方握手归 N1-04 升压充电(兼容低电压等级直流桩)工况下的电驱热管理与冷量仲裁D4-03 充电过程温控策略与充电功率协同;冷却能力标定的校核方法链归 K6-08 电驱与前端散热回路标定(BEV);全工况仿真归 J6-01 功率器件结温与热阻网络仿真;电机侧限值归 E1-05 电机温升限值、绝缘等级与降额;无扰切换的通用做法归 K3-05 PID/前馈/增益调度控制实战;分布场极值的稀疏测点重构、以及误差链「先分偏置与随机、再按性质合成」的口径归 D1-06 电池热状态在线估计:从稀疏 NTC 到 T_max 与 ΔT_pack;传感器冗余的架构判据与共模盲区论证归 K1-03 传感器布置、冗余与信号可靠性;负荷意图识别与预测性热管理归 K7-01 预测性热管理(导航/云端/驾驶意图协同);冷板/液冷总成的件级台架热性能实测(模拟热源法)归 L1-10 冷板/液冷总成件级热性能台架试验(模拟热源法)。⚠ 这份清单一共 17 门,与引言的射程外清单、7.6 的收口表是同一套,⛔ 三处不许各列各的。

易错点。① 把「本课没讲」当成「本课漏了」——边界要双向写清,上面每一条都注明了归谁,这就是它在体系里的位置。② ⚠ 措辞纪律:上面全部只写「归哪门课管」,⛔ 不写「某课已经讲透了某事」。这两种写法的差别不是客气不客气——去向课是否已经有可读的内容,本课无从担保,声称人家讲过了,读者点过去落空之后会连带不信本课的其它引用。

1.8 交付物是一个五元组,⛔ 不是一个温度数——而门限建在误差带的保守边上

是什么。这一节是全课第一根钉子的落点。在线结温估计的交付物不是一个数,是一个五元组

内容 为什么少不了
① 值 估计结温本身
参考面口径 这个值是「结到什么面」的,配的是哪一条 Zth 参考面不同源时误差是系统性的(第 3 讲展开)
误差带 δ_est 这个值可能偏多少 门限就建在它的保守边上(见下)
置信度档 此刻这个值该被信到什么程度 降档说的是「暂时别太信」,⛔ 不是「车坏了」(第 7 讲展开)
有效期 这个值到什么时候作废 下游⛔ 不许消费一个没有时效标记的裸值

为什么误差带必须是交付物的一部分,而不是一个内部指标。因为降额门限只能建在误差带的保守边上。写成分解式就是:

Tj_start = Tj_max − δ_est − ΔT_overshoot − ΔT_life − ΔT_cal

五项各由谁给:Tj_max 由器件手册给;δ_est 由第 2 讲与第 3 讲的误差账给;ΔT_overshoot(从下令到结温真正停止上升这段时间里还会涨多少)由执行延迟与热惯性算;ΔT_life(留给寿命的那一份)归 E2-07 功率模块热可靠性与寿命评估:功率循环、任务剖面与 AQG 324ΔT_cal(标定不确定度那一份)归 K6-08 电驱与前端散热回路标定(BEV)

这条分解式是本课归纳的,⛔ 不是课程大纲或任何标准里既有的条款,引用时请说明出处。它存在的意义只有一个:让「这条门限为什么是这个数」这个问题有一个可以逐项回答的结构——那正是标定评审上最常答不出来的问题。⛔ 五项全部是平台相关量,本课一项都不给数,本课交的是「每一项由谁给」的责任表。

工程量级:估计精度可以换算成可用输出。分解式里 δ_est 是唯一能靠工程努力买回来的一项(Tj_max 是器件给的,另外三项各有各的属主)。它值多少钱,在教学网络上可以直接算:门限每被 δ_est 顶低 1 K,能允许的稳态芯片损耗就少 1/Rth(j-f) = 1/0.526127 ≈ 1.90 W

⚠ 这个兑换率有三条射程必须跟着写:① 分子是可用芯片损耗,⛔ 不是可用扭矩——折成扭矩需要本平台的损耗-输出映射,属平台相关量,⛔ 本课不给;② 它只在稳态、单芯片、且另外几项门限分量不变时成立,瞬态下要用 Zth(t) 而不是 Rth;③ 兑换率是 1/Rth(j-f),所以冷却链越好(Rth 越小),同样 1 K 的误差带越贵——这条反直觉但很要紧:花钱把冷却做好之后,估计精度这件事的性价比是上升的,不是下降的。

易错点。把 δ_est 当成一个常数。它随工况变——大负荷时损耗模型的绝对误差更大,瞬态时时间对齐误差更大,某一路输入缺失或超范围时它要当场展宽。⇒ 门限必须按工况分段,用一个「最坏情况 δ_est」去覆盖全工况,等于在绝大部分时间里白扣输出。② 把可以靠建模消掉的单向偏置记进误差带——那不是不确定度,那是一个已知的、可以直接补掉的偏差,记进去等于花钱买了一份本来不用买的保险(第 2 讲会给出一个具体的例子)。③ 只交①,把②~⑤ 留在实现者脑子里——下游拿到一个裸温度数,唯一能做的就是当它绝对准,于是所有降额门限都被迫按最坏情况设。

这根钉子在全课怎么走。它在这一讲(交付物的定义与门限分解式),在第 2 讲与第 3 讲(δ_est 的每一项到底从哪来、各有多大量级),在第 6 讲(五项各自由谁给,以及为什么每一项都往安全侧取会合成出「能力够却降额」这种事故)。

图7 单张曲线图。横轴为结到冷却液的稳态热阻 Rth(j-f),单位 K/W,范围 0.3 到 1.0,图上写明该范围只是画图区间、不是任何平台的取值范围;纵轴为兑换率,定义为误差带每宽 1 K 要先扣掉的可用芯片损耗,单位 W/K。图上画一条倒数形式的双曲线,曲线上用一个实心点标出本课教学网络所在的那一点并带数值标签,横坐标 0.526 K/W、纵坐标 1.90 W/K。图内另画一段带箭头的水平参考,说明沿曲线往左即冷却链更好时兑换率上升。右侧留一个文字块,写三行射程声明:这条兑换率的分子是可用芯片损耗、不是可用扭矩;折成扭矩需要本平台的损耗到输出的映射,属平台相关量、本课不给;门限五项里只有误差带这一项能靠估计精度买回来。图上不给结温上限与任何门限。教学点来自教学假设网络、不对应任何平台;本图不含结温上限、门限或可用扭矩的任何数值,不得据图反推平台能力。
图7 该读出的判断是:估计精度不是一个软指标,它有一个可算的兑换率 1/Rth(j-f);而且冷却链越好(热阻越小),同样 1 K 的误差带越贵。要读的量图上各有独立标签:两轴名称与量纲、教学网络那一点的坐标数值(0.526 K/W → 1.90 W/K)、曲线的单调方向箭头、以及右侧那三行射程声明。据此可判:把 δ_est 收窄 1 K 的工作值不值得做,取决于本平台的 Rth(j-f),⛔ 不取决于一句「越准越好」。⚠ 兑换率的成立条件是稳态、单芯片、其余四项门限分量都不变,瞬态下⛔ 不成立。教学点来自教学假设网络、⛔ 不对应任何平台;本图不含结温上限、门限或可用扭矩的任何数值,⛔ 不得据图反推平台能力。

后面还有 6 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做

会员专属

后续为会员深水区内容——四库数据与深度拆解。

查看会员方案