K7-03 · 控制、软件与标定 / 智能与软件定义
待认领listed
→
众筹中recruiting
→
已开课open · Course 售卖
一课题可并存多讲师版本
课程大纲
学完能做什么
- 能判断一个热管理控制场景是否值得上数据驱动方法,而不是无脑都上
- 能搭出数据驱动闭环的最小管道:采集→特征→训练→验证→部署
- 能给学习结果设计安全限幅/护栏机制
- 能在有监督学习、自适应控制、强化学习中为具体场景选对方法
- 能用影子模式或 AB 对比评估自学习控制相对基线标定的真实收益
内容大纲
- 从标定到自学习的范式转变
- 传统标定的局限:工况覆盖有限、个体差异大、部件老化后标定会漂移
- 数据驱动方法能补什么:车队规模的数据覆盖、持续适应老化与个体差异
- 自学习不是替代基线标定,是在基线之上做增量优化,基线永远是兜底
- 什么场景值得上:数据量够、有明确可量化收益、失效代价可控
- 数据管道与特征工程
- 本节的上游边界:干净时序样本从哪来——采什么信号、多高频率、按什么热管理事件触发抓帧、上行带宽与云端存储扛不扛得住,全部属上游课 K7-04;本节只从『数据已到云端』起讲,负责特征与学习
- 特征选择:哪些信号真正影响能效/舒适,不是信号越多越好
- 标注/评估基准:拿什么当'好'的标签(能耗、COP、舒适指标、噪声)
- 数据质量与噪声处理:传感器漂移、异常值、缺失值怎么处理
- 一个可直接落代码的特征族:驾驶风格相关特征——踏板开度及其变化率、纵向加速度、能量回收强度的滚动窗口统计量(均值、分位数、超阈时长占比),正是本课网约车案例里『同款车不同司机能耗差异』要用到的那一层;没有它,案例与方法闭不上环
- 学习方法选型
- 有监督学习:拟合能效/负荷模型,适合有明确标签、关系相对稳定的场景
- 自适应控制:在线微调增益/设定点,适合缓变的个体化/老化补偿。注意与状态估计划清界限——参数在线辨识/老化补偿改的是模型参数,状态估计重构的是不可测状态(观测器整定、软测量置信度与退出条件见 K3-10),两件事别混;本课只讲档位选型与使能/冻结/回退条件
- 强化学习:策略优化,适合多目标权衡但训练代价和不确定性都高——反过来说,秒级的驾驶风格/使用模式分类这类任务用规则或统计特征通常就够,不必上强化学习(准确率与覆盖率的权衡口径见 N6-01)
- 离线训练+车端在线推理 vs 车端在线学习:算力、实时性、可验证性的权衡
- 运行期安全护栏:限幅、退回基线与自适应-诊断互锁
- 学习输出必须限幅在安全包络内、不能直接作用于执行器;且该包络是 K3-01 限值层按当前工况实时算出的允许值,不是一张出厂固化的静态上下限表,其计算链路上不得混入任何学习件的输出
- 边缘工况(极端温度、传感器失效)下学习策略要能退化为基线控制
- 学习结果一旦外推出训练分布,就等于进入未知的不安全场景:必须用 OOD/分布漂移的**在线**判据(输入特征落在训练分布外、置信度低于阈值、残差超限)实时触发退回基线,而不能只靠事后的模型退化监控——等事后监控发现时,错动作已经作用过成千上万次
- 自适应与诊断必须联合设计,而且是双向的:正向——自适应会把缓慢的真实劣化当成个体差异吸收掉(脏堵被风扇转速补偿掩盖、慢漏被过热度目标补偿掩盖),本该成熟的 DTC 因此永远报不出来,所以凡有自适应补偿的通道,都要把**补偿量本身**列为受监视量并对其设趋势阈值,补偿量单调走高即是劣化证据(趋势型健康度见 K5-05);反向——诊断已置位或降级已生效的工况必须写进自适应的禁止使能条件,否则会在故障态上学出一组错参数并固化下来
- 驾驶风格/使用模式的分类误判属于『输入语义判错』而非『信号失效』——传感器都好、诊断也不报,输出限幅照样放行,所以护栏还要给误判设能耗代价上限与退回统一标定的触发条件(例如个体化策略相对基线的滚动能耗劣化超过设定阈值即回退)
- 上车论证:可解释性、影子模式、A/B 与变更评审证据
- 黑箱模型的可解释性要求:标定工程师要能看懂、能手动干预
- 影子模式:学习策略先'旁听'不接管,对比其输出与实际执行的差异
- A/B 对比评估真实收益:车队分组、统计显著性、避免选择性偏差
- 学习模型的变更同样要过功能安全/标定评审,不因为是'AI'就绕过流程——评审具体审四样、也就是要备的证据:运行设计域(ODD)界定、训练/验证数据集的充分性与覆盖论证、性能指标的验收准则、运行期监控作为安全措施的有效性;论证方法与接口见 K2-05
- 部署形态与长期运维:个体化取舍、漂移再训练与学习值持久化
- 个体化模型 vs 车队统一模型的取舍:维护成本 vs 精细化收益
- 模型退化监控:车辆/环境分布漂移后要有再训练或回退触发机制;再训练所用数据集必须带版本标识、且能追回 K7-04 定义的信号语义版本——DBC 改版会造成历史数据口径断层,否则看到的『漂移』可能只是采集口径变了
- 学出来的参数怎么在车上活下去:增益微调、设定点偏置、老化补偿都是必须跨点火周期保存的量——不存,则每次上电从基线重学、收益永远学不满且用户能感知策略反复;存,则要定写入频次(这类量缓变,不能每个控制循环写,受 NVM 擦写寿命预算约束,只在收敛后或下电序列写,或做分层缓存节流)、上电有效性校验失败与售后换件后的复位路径(一律退回基线标定,正是『基线永远是兜底』在存储侧的落地形式),以及 OTA 升级/版本回滚后学习值**保留、迁移还是清零**的判定——模型结构或特征定义变了必须清零重学,仅参数微调可迁移。本课只给判定准则与对存储层的需求,载体设计与掉电一致性见 K4-06,刷写事务本身见 K7-02
关键公式
K_(n+1) = K_n + η·∇J(K_n)
在线自适应控制的梯度式增益更新。**方向约定:此处 J 取收益型(见下一条,越大越好),故取 +;本体系其余各处(K3-06、K3-07、N6-02)的 J 均为代价型、求 argmin,套到那类 J 上必须改成 K_(n+1) = K_n − η·∇J(K_n),照抄正号即梯度上升、会直接发散。** η 为学习率,过大易震荡、过小收敛慢。另一前提:以 COP/舒适偏差这类量测指标为目标时,∇J 对增益 K 并无解析梯度,须靠 dither 扰动、有限差分或策略梯度估出(属极值搜索/策略梯度类),与模型参考自适应(用误差对参数的解析灵敏度、经典梯度型自适应律取负号)不是一回事;工程上还须配参数投影或死区,防止激励不足时参数漂移。
J = w₁·ΔCOP − w₂·舒适偏差 − w₃·安全违规惩罚
多目标**奖励(收益)函数——越大越好**,与 K3-06/K3-07/N6-02 的代价型 J(越小越好、求 argmin)方向相反;同一符号 J 在体系内有两种用法,引用前先确认方向。权重设计直接决定学出来的策略偏向什么,安全违规项权重要足够高。
u_final = clip(u_learned, u_safe_min, u_safe_max)
学习模型的输出动作必须裁剪进安全基线包络——这是**必要条件而非充分条件**:输入幅值限幅并不蕴含状态约束满足,热管理是强积分对象,一串每步都合法的动作照样能把电芯温度、过热度或压缩机排气温度积分出边界。完整安全层=幅值限幅 + Δu 变化率限幅(见 K3-05)+ 基于状态预测的独立监督/仲裁通道(将越界即夺权、切回基线并平滑过渡;监控器-执行器架构见 K5-02,功能安全侧见 K2-03)+ 学习使能/退出条件清单(传感器有效性、工况在训练分布内、故障字无关键位)。另注:u_safe_min/u_safe_max 不是出厂固化的静态常数,而是 K3-01 限值层按当前工况实时算出的允许值(随排气温度、母线电压、绝缘状态、NPSH 裕度等逐周期变化),且该允许值的计算链路上不得出现任何学习件的输出,否则等于让模型自己给自己放宽包络。
ΔCOP = COP_learned − COP_baseline
评估自学习是否真的比人工标定更好的核心指标,要在同工况分布下比才有意义
关键概念
数据驱动控制自适应控制强化学习有监督学习特征工程安全护栏 safety layer影子模式A/B 对比模型退化在线学习/离线训练可解释性
推荐工具与标准
Python(pandas/scikit-learn/PyTorch) MATLAB/Simulink(自适应控制原型) 车队数据回流平台 离线仿真回放平台 本站冷媒工况计算器(基线 COP 对比)
ISO 26262:2018(第 2 版,2018-12 发布;ISO 标准发布即生效、无实施日分档。中国对应件=GB/T 34590.1~.12-2022,修改采用 MOD、推荐性,2022-12-30 发布 / 2023-07-01 实施)——**本课只在 E/E 失效链路上引它**:按用法落部分号,安全监督/仲裁通道与限幅执行件的系统层设计走 -4、软件走 -6、学习件的变更与配置管理走 -8。两条射程线必须写死:① 26262 只管安全相关 E/E 系统「失效行为」引发的危害,电芯过温、热失控、冷媒泄漏这类热危害本身不在其射程(除非由 E/E 失效直接引起)——热危害判据另有对口件,动力电池侧见 GB 38031-2025(2025-03-28 发布,分档实施:新申请型式批准车型 2026-07-01 起执行、在产及延续车型 2027-07-01 起执行,过渡期内与 2020 版并行);② 26262:2018 正文不覆盖机器学习(ML 要求要到在编的第 3 版才进正文,当前一律按 2018 版引用、不得提前引第 3 版),故学习件自身的安全论证不能只挂 26262,须靠本条之后的 ISO/PAS 8800 与 SOTIF/ISO 21448(论证方法与接口见 K2-05) ISO/PAS 8800(道路车辆 AI 安全)——本课落点在「安全护栏与可解释性」节:其 AI 生命周期要求(ODD 界定、数据集充分性与覆盖论证、性能验收准则、运行期监控作为安全措施)正是学习件变更评审要交的证据,论证方法见 K2-05 ISO 24089(软件更新工程,学习模型经 OTA 下发时适用)
工程案例
某网约车车队数据显示,同款车型在不同司机驾驶风格与地域气候下空调能耗差异明显;工程团队用车队回传数据训练一个在线自适应的蒸发温度设定策略,在安全限幅内按个体使用模式微调,先用影子模式跑一段时间确认不影响舒适性与安全,再对比统一标定表评估整体能耗改善。
动手做
交付物 · 选择一个热管理控制场景(如压缩机转速调节或电池预处理时机):①设计数据驱动闭环的最小管道(采集哪些信号→特征→算法→安全护栏怎么设);②给出学习结果的安全限幅规则;③设计一个影子模式验证方案,说明看什么指标能判断'可以正式上线'。
常见误区
- 把学习模型的输出直接作用于执行器,没做安全限幅,边缘工况下学出一个不合理甚至危险的动作
- 用实验室/固定工况数据训练,上车后遇到训练集没覆盖的极端场景(严寒、极端拥堵),模型外推失效
- 只看训练集/离线拟合误差判断模型好坏,没做真实车队的 AB 对比或影子模式验证
- 学习模型黑箱化,标定工程师无法解释也无法手动干预,出问题时定位困难,也过不了变更评审
- 长期不监控模型漂移:车辆老化、传感器漂移后输入分布变了,学出来的策略逐渐失准却没人发现
- 把安全包络做成一张出厂固化的上下限表:工况把真实允许值压到表值以下时(排气温度已顶到限值、母线电压跌落、NPSH 裕度不足),护栏形同虚设,限幅照过、状态照样越界
相关课题