TMS BOOK · ACADEMY 讲义

AI 大模型在热管理开发中的应用

大纲的完整展开版——讲师授课蓝本 / 学员自学材料

N6-03 AI 大模型在热管理开发中的应用

课程代码 N6-03 · 板块 N 前沿与新技术 / N6 智能预测与数字孪生 时长 约 4.5 小时(7 讲 + 1 次 RAG 接入方案设计实操) 适合对象 高级仿真 / 系统工程师与技术负责人;正在评估或主导大模型工具引入的骨干(选修,专家向) 前置 体系外前置(需自备):了解热管理研发基本流程(需求/DFMEA/标定/仿真);体系外前置(需自备):对大模型/生成式 AI 基本概念有初步了解 本讲义定位 讲师授课蓝本 / 学员自学讲义,是 N6-03 大纲的完整展开版


引言:它答得又快又像样,而那个标准编号是它编的

一位工程师问某类阀件历史上出过哪些失效模式,几秒钟就拿到一段条理清楚、术语准确、还带着标准编号的回答。通篇没有一句语法不通,没有一处措辞含糊——而那个编号不存在。这类错误难对付的地方不在于它错,在于它错得完全合乎格式:错误的外形与正确答案一模一样,靠「读起来对不对」这条日常启发式根本筛不出来。再往前走一步就更棘手:当这套系统接上企业自己的文档做检索增强生成(RAG),答案下面挂出了真实可点开的来源、页码与文档名,可信度看上去又抬高了一大截——而它召回的那一段,工况点与提问的并不是同一个。带着真实出处的错答案,比裸编造更难被发现,因为读者的怀疑已经被那条链接消解掉了。这门课要做的就是把「大模型能不能用」这个问不出结果的问题,换成一串答得出来的问题:这条输出去哪儿、谁在哪一步核它、核什么、出了错谁负责

学完这门课,你应当能做五件事:① 分清大模型(LLM)、数值代理模型(归 J7-05 机器学习/AI 代理模型在热管理中的应用)与物理求解器三者的能力边界,并按一条判据把一件研发任务分派出去;② 设计一个把企业热管理知识接进检索增强生成的方案,说得出它由哪些环节组成、每一环归谁负责、哪几环最容易被整环跳过;③ 列出研发链路上大模型可以辅助的具体环节,并给出每个环节对应的人工复核把关点;④ 识别幻觉与数据泄露两类风险的具体发生场景,把治理规则写成动作级而不是态度级;⑤ 判断某个场景够不够成熟到可以脱离人工复核。⚠ 第五件事上本课给的是判据不是结论——课题大纲的能力目标里写着「通常答案是否」,而那个「通常」要由你把七条判据逐条问过之后自己得出来;直接把结论交给你,换一个场景你就不知道该怎么判了。

这门课的位置要先说清,否则它会膨胀成一门「AI 万能课」。它讲的是企业级的系统怎么建、怎么管,⛔ 不是工程师个人日常怎么用(那归 Q3-03 AI 辅助热管理工程工作实务,本课是它的系统侧展开,两边口径一致、⛔ 不另立一套说法);它讲的是语言与知识这一侧,⛔ 不是数值预测(那归 J7-05 机器学习/AI 代理模型在热管理中的应用)。全课七讲的动作依次是:第 1 讲立分派判据,把「这件事该交给谁」问清楚,并把语言与知识密集型任务的全集摊开;第 2 讲拆开 RAG 的内部结构——它不是三步而是十四环,并把检索的几何、上下文预算与「有据可查」这条判据一次立住;第 3 讲讲知识库本身,从入库门槛、切分、权限随片段走一直到生命周期闭环,末尾给出 RAG、领域微调、提示与上下文工程的三档选型;第 4 讲把研发链路上的落地场景逐个走一遍,并给出按输出去向分的四档人工复核门槛;第 5 讲收前沿——多模态读图、agent 编排、与车云及数字孪生结合的知识层,以及「能不能脱离人工复核」的七条判据;第 6 讲与第 7 讲各守一条红线,前者是幻觉与可验证性(失效模式全集、三层过滤、可追溯链、动作级治理规则),后者是数据安全与组织治理(接入形态全集、准入矩阵、提示注入、责任落点)。其后的典型案例把七讲的次序合成一条从提问到「这个数能不能写进报告」的完整判据链,动手做则用一个真实场景把接入方案、复核检查点与一条防幻觉规则各落一次。

第一根钉子(全课下文一律简称「钉子一」):大模型在研发链路里的产出一律是「初稿与线索」,不是「结论与依据」。它的可操作形式只有一问——这条输出会不会进入工程决策链。会,就必须同时挂上三样东西:一个指名到人的复核点、一条能追回原始文档的追溯路径、一份出错时的责任归属;只给人看的草稿,复核可以降为抽样,但⛔ 不为零。为什么必须是这三样而不是「提高模型能力」:大模型的错误不是随机噪声,而是格式完全正确、语气高度自信的错误,它不会自己报警,也没有类似网格收敛那样的自检手段可用;能拦住它的从来不是模型本身,而是流程上那个带责任人的框。⇒ 这三样的落地形态都是可数的:复核点=流程图上一个写着名字的框,追溯路径=一条从结论走到源文件版本号的链,责任归属=一份签署记录。三样里少任何一样,这个场景就还没落地——它不是「还需要打磨」,是还没开始。全课每一个场景(需求与 DFMEA 草拟、标定与试验数据摘要、MBD 相关代码、专利与情报整理、云图判读、agent 编排)最后都要落回这三样。

第二根钉子(简称「钉子二」):接了 RAG 不等于解决了幻觉,它只是把核验对象从「结论」换成了「出处」。而核验出处又要拆成三问:这个出处存不存在/它是不是现行版本、且属于本平台/它是不是真的支持这句话。三问各拦一类错——第一问拦编造的出处,第二问拦过时与张冠李戴,第三问拦「引了真文档、结论却是模型自己加上去的」。★ 三问里最难的是第三问:它必须由懂这门技术的人读原文来判,⛔ 不是由检索指标、相似度分数或「引用率」来判,也⛔ 不能外包给另一个模型(两个模型的错误是相关的,那只是把同类错误再叠一层)。本课后面全部的治理设计——片段级引用、版本与生效日期字段、评测集、复核档位——都围着这三问转。

先把本课最容易被读反的那句话摆到台面上:把「grounded(有据可查)」当成正确性的充分条件。它只是可核验性的必要条件——RAG 把「无从核起」降成了「可以核」,而核这件事一点没少。会读反是有原因的:那条判据(输出内容不超出检索片段可支撑的范围)是相对于检索片段说的,它只回答「模型有没有越出片段乱说」,⛔ 完全不回答「片段本身对不对、是不是现行版本、是不是这个平台的」;而界面上那条真实可点的来源链接,恰好会把读者本来该有的怀疑消解掉。

会做错的第一个具体动作:拿 groundedness 或引用率当验收指标,凡是带了知识库引用的输出就放行。顺着这个动作往下,知识库的版本治理与失效下架就被省掉了——反正每条输出都「有引用」。它最典型的兑现形态是:工程师问某型电子水泵在某工况下的扬程,系统召回一段措辞高度相似、但工况点不同的表格片段,模型自信地报了一个数并附上真实文档来源,这条输出在 groundedness 上满分、数值全错;而这个数会被直接代进算式,算式不会报错

会做错的第二个具体动作(方向正好相反):因为要求 grounded,就把模型说「检索不到/我不知道」当成故障去调参——降相似度阈值、加检索条数、换更大的模型,直到它总能给出一个带引用的答案。这条路系统性地把「没有依据」改造成了「有一个弱依据」,而后者恰恰是最危险的失效形态:前者会让人停下来去查,后者会让人放心地用下去。⇒ 正解是把它当成三层过滤的第一层——第一层的完整问法是「有没有引用、引用能不能打开、输出有没有越出被引片段可支撑的范围」,这一整问就是 grounded;后面还有「引用的那份文档存在、现行且属本平台」与「引用的那段原文真的支持这句话」两层,三层全过才叫可采信;而「检索不到」是知识库缺口的告警信号,正确动作是开一张知识库补建工单,⛔ 不是调参数把它消掉。这条反钉子在第 2 讲末尾先立判据与它的边界,在第 6 讲单设一节做三层过滤并配图,两处呼应,常见误区节收口。

再把边界划清——不在开篇写死,这门课必然与相邻几门重叠,或者整段落空。本课定六件事:① 大模型与代理模型、物理求解器的分派判据,以及「看起来能做、实际不该独立信任」的两维判据;② 检索增强生成的完整环节、各环属主与典型失效;③ 企业知识接入侧的要求与知识库的生命周期闭环;④ 研发链路上的落地场景与按输出去向分档的人工复核门槛;⑤ 幻觉的治理:三层过滤、可追溯链与动作级规则;⑥ 数据安全边界与组织制度闭环。本课不定的,逐项写明归谁:数值预测本身与代理模型的可信域 → J7-05 机器学习/AI 代理模型在热管理中的应用,降阶与快速求解 → J7-02 模型降阶(ROM)与控制导向建模;不确定度这一项分两侧、⛔ 不是两个互斥归属——分类与合成方法本身J7-06 仿真不确定度量化(UQ)与稳健/可靠性设计:从确定性单点到带分布的裕度试验与标定数据上的不确定度评估(在一批实测数据上把它算出来、并用它判偏差显不显著) → L7-03 试验数据分析与不确定度评估;工程师个人怎么用与个人核验习惯 → Q3-03 AI 辅助热管理工程工作实务;文本型经验条目怎么沉淀 → Q3-02 工程知识管理与经验沉淀方法,数值型基准库的入库口径与退役 → Q3-04 热管理数值型基准库治理:口径标注、跨源置信排序、退役与入库门槛(⚠ 本课沿用它们两门的入库门槛,只补接入侧四条,且这四条分属两层入库层三条——生效与废止日、密级与可见范围、源文档 id 与版本及来源(3.2 给);检索层一条——元数据不全的数值条目⛔ 不进检索结果(2.6 给)。⚠ 全课下文出现的「只加三条」一律指入库层那三条,「只加一条」一律指检索层这一条,⛔ 两处的「只」各自成立、⛔ 不是同一个计数。⛔ 除这四条外不另立一套入库标准,那正是本课自己在批评的事);车云数据生态与数字孪生的统计、判据与时延 → N6-01 预测性热管理的车云数据生态与产业路径 / N6-02 整车热管理数字孪生与在线优化(本课只讲它们之上的自然语言查询层);DFMEA 方法本身 → I7-01 热管理系统/零部件 DFMEA 实操;MBD 建模与代码生成的既有验证台阶 → K4-02 基于模型开发(MBD):Simulink 建模与代码生成;专利 claims 解读与 FTO → M5-01 热管理专利布局与规避设计,情报与对标方法 → M5-02 技术路线情报与竞品对标,对外协议与 IP 权属条款 → M5-05 合作开发与供应关系中的 IP 权属:技术协议 IP 条款、职务发明与商业秘密保护。★ 还有一档整个在本课射程之外:输出进入上车的功能或安全相关判断时,其性能局限识别、危害分析与人工复核门槛须按 AI 安全框架论证,落法归 K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法——本课只给去向,⛔ 不给判据、不给门槛值。⛔ 对不定的部分,本课一律只给类型与去向,⛔ 不写别课的结论,也⛔ 不声称某门课已经讲过什么。

⚠ 由此有三种读法会落空。一是来找可以直接抄走的数:上下文窗口有多大、切分粒度取多少、检索多少条、相似度阈值定在哪、幻觉率合格线是多少——这些全部是平台相关量,取决于所用模型及其版本、嵌入模型、语料与场景,换一个就不可移植,本课一概不给数、也不给推荐区间,只给它们受到的约束以及该怎么用自建评测集把它们测出来;⛔ 尤其不得引用任何公开评测的幻觉率百分比当作本企业的验收基线(评测集分布、判分口径与模型版本三者都不同,数不可比)。个别图上出现的比例是明确标注的教学假设值,只为把结构画出来,⛔ 不对应任何模型、产品或平台,⛔ 不得取用。二是把它当标准条文课读:本课涉及的 ISO/IEC 22989(人工智能概念与术语)与 ISO/PAS 8800(道路车辆 AI 安全),本讲义只写编号、名称与去向,⛔ 不写条款内容、不写限值,版次与年份以现行目录为准、引用前须核;另外,企业数据安全与 IP 保护目前尚无统一强制性国标,行业规范仍在形成中,而「AI 管理体系」与「AI 风险管理」一类的通用标准是存在的——⚠ 本讲义未取到它们的原文,故只写「这一类标准存在,编号与版次须自行核现行目录」,⛔ 不写编号解读。三是来找产品选型与工具评测:向量库、嵌入模型、开发框架与部署平台的选型对比不在本课射程,本课给的是判断这些选型对不对的判据形式,⛔ 不给产品名与评测数值。

最后交代两件贯穿全课的约定。其一是符号(后面几讲共用,⛔ 不在别处另起一套):N_ctx、N_query、N_retrieved、N_history、N_sys、N_out、L_max 一律是 token 计数(无量纲);agent 的串联步数写作 n_step(步),⛔ 不写成 N——它与上面那组量纲与含义都不同;检索条数写作 k_ret(条),单片段平均长度写作 c_chunk(token),分配给检索片段的预算写作 B_ret(token),agent 单步成功率写作 p_step(无量纲),agent 整链一次通过的概率写作 P_chain(无量纲)。★ 其中 N_sys、N_out、B_ret 与 P_chain 四个是本课在大纲所给公式基础上的补充,⛔ 不是大纲既有。其二是自建判据的声明:本课多处给出的成套判据——三分派判据、可检出性与代价两维、十四环流水线与四个责任区、检索失败的两问定位链、时效缺口三层、知识库七环闭环、接入侧四条补充(入库层三条 + 检索层一条)、四档复核门槛(外加射程外一档)、成熟度七判据、失效模式全集、三层过滤、可追溯链的字段集、接入形态全集、提示注入的三处阻断点、治理闭环——都是本课归纳的,⛔ 一律不是大纲既有、也⛔ 不是某标准的既有条款;正文每次用到都会再标一次。这门课能交给你的不是一套现成的数或一套现成的工具,是一串问得出口、答得出来、且答完就知道下一步该做什么的问题

第 1 讲 交不交给大模型,由产出形态定;交了能不能独立信任,由另外两维定

这一讲不讲检索怎么搭、知识库怎么建、哪一段流程该配什么复核表——那些是第 2 讲往后的事。这一讲只做动手之前的七件事:把「这件事该交给谁」压成一次就能判完的三问把大模型在数值上的那条硬边界钉死——它复述数、⛔ 不产生数;把「看起来能做、实际不该独立信任」从直觉换成两维判据把研发链路上语言与知识密集型任务的落点摆全,尤其是沿研发主线数必然整类漏掉的那几类;把大模型与代理模型的配合写成接口,⛔ 不是「谁更准」把本课与五门相邻课的边界一次划清;最后落回全课第一根钉子——每个场景最后都要挂上的三样东西

看起来像开场白,其实后面六讲吃的都是这一讲钉下来的口径。三问判不清,读者会拿这门课的方法去管一个本该走求解器的问题,而那类问题不会以「答错了」的形式暴露,它会以「答得很流畅、数字也很像」的形式通过;两维判据不立,复核强度就会按「这活难不难」来定,而最容易出事的恰恰是「简单、量大、错了没人复算」那一格;落点摆不全,做出来的方案会只覆盖设计与仿真那一段,而文本量最大、结构最差的那几类连被提到都没有;边界不划清,这门课会退化成一门「AI 万能课」,并且与相邻课给出互相矛盾的口径。所以顺序是:先分派,再定信任,然后才谈落点与边界,最后收到那三样东西上

1.1 三分工判据:看产出是什么,⛔ 不看问题是用什么语言问的

是什么。一件研发任务落到手上,三问顺序判,一次就能分完(★ 这三问是本课归纳的判据,⛔ 不是某项标准或某份既有规程里的既有分类):

  • 问① 这件事的产出,是不是一个要被代进算式的数?是 → 归数值预测这一支:物理求解器,或者数据驱动的代理模型(代理模型归 J7-05 机器学习/AI 代理模型在热管理中的应用,降阶与控制导向建模归 J7-02 模型降阶(ROM)与控制导向建模)。
  • 问② 有没有可用的控制方程与求解器,且边界条件拿得到?有 → 归物理仿真
  • 问③ 产出是不是语言、知识、结构化整理或代码?是 → 归大模型,也就是本课的射程。三问都不落 → 本课不覆盖。

⚠ 判据落在「产出形态」上,⛔ 不落在「提问方式」上。这一条要单独强调,因为它是这三问最常被绕过的地方:用自然语言问出来的问题,产出仍然可能是一个数。「这个工况下换热系数大概多少」是一句自然语言,但它要的是一个会被代进算式的数 ⇒ 它归问①那一支,⛔ 不因为「我是用聊天框问的」就变成大模型的活。

为什么必须先分派再谈别的。因为三者的误差机理完全不同,因而自检手段不可互借

这一支 误差从哪来 自检靠什么 会不会自己报警
物理求解器 离散与建模假设 网格与步长收敛验证 收敛不达标,人能看出来
代理模型 训练集覆盖不足 外推检测 出了可信域会报警(J7-05 机器学习/AI 代理模型在热管理中的应用 的可信域声明)
大模型 语言概率分布 ⛔ 没有对应的收敛判据 ⛔ 不会自己报警

第三行那两个 ⛔ 就是本课存在的全部理由:另外两支各自带着一套「不对劲会被发现」的机制,而大模型这一支没有——所以它必须外挂一套人做的东西。本课后面每一讲讲的都是这套外挂:检索让它能被核(第 2、3 讲)、复核门槛决定谁来核(第 4、5 讲)、三层过滤与追溯链决定核什么、凭什么核(第 6 讲)、准入与制度决定谁签字(第 7 讲)。

图1 一件研发任务该交给谁的三问决策链。入口框写着一件研发任务,下方注明用自然语言问的也算数,看产出不看提问方式。问 1 为产出是不是一个要被代进算式的数,是分支引到去向 A 数值预测,框内写物理求解器或代理模型,并带去向标签 J7-02 与 J7-05;否分支进入问 2。问 2 为有没有可用的控制方程与求解器且边界条件拿得到,是分支引到去向 B 物理仿真,否分支进入问 3。问 3 为产出是不是语言、知识、结构化整理或代码,是分支引到去向 C 大模型并标注本课射程,否分支引到本课不覆盖。图下方一张三行对照表,每行一个去向,列出误差机理与自检手段:物理求解器为离散与建模假设、网格与步长收敛验证、收敛不达标时人能看出来;代理模型为训练集覆盖不足、外推检测并报警、出了可信域它会报警;大模型为语言概率分布、无收敛判据、不会自己报警因而必须外挂人工复核。三个去向之间画禁止符号并各写互套后果:三者不在同一个可比口径上不能按谁更准排序、把大模型当求解器会得到一个没有口径的数、把代理模型当知识引擎则它只做输入到输出的映射并不理解问题。图上以青绿虚框标明该三问判据为本课归纳,不是既有标准或既有规程的判据。图上不含任何数值或性能指标。本图为定性决策示意,框的大小与位置不表示任何量的大小,不代表任何平台的实际值,⛔ 不得据图读取任何数值。
图1 该从图上读出的判断有四条:① 分派看产出形态,⛔ 不看问题是用什么语言问的——用聊天框问出来的数值问题,仍然归数值预测那一支;② 三者的误差机理各不相同,自检手段因此不可互借,⛔ 不能拿收敛性验证去背书一段文字,也不能拿「读起来很合理」去替代收敛判据;③ 三者不在同一个可比口径上,⛔ 不能按「谁更准」排序——图上三处禁止符号画的就是这件事;④ 大模型那一行的两个 ⛔(无收敛判据、不会自己报警)是本课全部内容的出发点:缺的这套报警只能由人和流程补上。该三问判据为本课归纳。本图为定性决策示意,框的大小与位置不表示任何量的大小,不代表任何平台的实际值,⛔ 不得据图读取任何数值。

工程量级。这三问一次就能分完,不需要打分、不需要权重——它是分类不是评估。真到界面上分不清的时候,只看一件事:产出是不是数。是数就不是大模型的活,哪怕问题本身是用自然语言描述的、哪怕对方给出的答案读起来非常像那么回事。

三个易错点。① 看到「它也能回答换热问题」就以为可以取代仿真——它能回答的是关于换热的知识与措辞,⛔ 不是这一次的换热结果;② 把三者按「谁更准」排序——三者不在同一个可比口径上,一个有收敛判据、一个有可信域、一个两样都没有,⛔ 不可比大小;③ 把大模型给出的公式当结论直接用——公式的形式很可能是对的,而它的适用边界(几何范围、流态范围、工质范围)恰恰是最容易被省略的那一部分,⛔ 必须回到公式的原始出处核适用条件。

1.2 大模型不做数值求解:它复述数、⛔ 不产生数

是什么。输出里出现的一个数,来源只有三种:从这次送进去的上下文片段里抄的从训练语料里记住的为了让这句话读起来成立而生成的。⚠ 关键在于:这三种在输出里长得一模一样——同样的句式、同样的语气、同样的有效数字位数,没有任何格式上的差别把它们分开。读者无法从输出本身判断自己拿到的是哪一种。

为什么。它的生成机制是按概率续写符号,其中不含求解器,也不含单位与量纲检查。所以「把一个以米为单位的长度和一个以毫米为单位的长度相加」这类问题它可能答对,⛔ 但那不是因为它算了,而是因为这种算式在语料里出现过足够多次。⚠ 即便系统给它接了计算工具,也仍然要看日志才知道工具到底调没调、参数传对没传对、单位有没有在传参那一层被换算——工具接上了不等于它每次都会用,而它不用工具时的回答与用了工具时的回答,在版面上同样看不出差别。

工程量级。最典型的高危问法是这一类:「某工况下的换热系数是多少」「这个阀的压损大概多少」「这个电机在这个转速下的损耗是多少」。⚠ 这类问题会稳定地得到一个看起来非常合理的数——量级像、单位对、有效数字位数还挺讲究——而这个数既没有工况口径(哪个流量、哪个进口温度、哪个几何),也没有来源。本课全课⛔ 不给任何这类数值,理由不是「不方便给」,是它们本来就随平台、随工况定义而变,给一个单点值本身就是错的

三个易错点。① 把「它给了三位有效数字」当成它算过——有效数字位数是措辞习惯,⛔ 不是精度声明;② 让它直接给结果而不要求给公式与代入过程——有过程才有得核,只给一个数等于把唯一可核的东西删掉了(个人使用层面怎么养成这个习惯,归 Q3-03 AI 辅助热管理工程工作实务);③ 数值型问题不加任何元数据约束就丢给语义检索——「措辞最像」与「工况点对得上」是两件事,第 2 讲会把这件事拆开讲。

⚠ 这里先埋一句、⛔ 不在本讲展开:把出处补上(也就是接检索)之后,这个数会带着一条真实的、可以点开的来源链接出现。那时候它仍然可能是错的,而且更难被发现——这一条要到第 2 讲末尾才立得起来,第 6 讲再展开成可操作的三层过滤。本讲只把话放在这儿:看到出处不等于看到了正确性。

1.3 该不该独立信任,由「错误可检出性 × 错误代价与可逆性」两维决定,⛔ 不由任务难不难决定

是什么。把一个候选任务放到两维平面上(★ 这两维判据同样是本课归纳的):

  • 横轴:错误的可检出性——这件事错了,会不会在下游立刻暴露?会立刻暴露的(比如代码编译不过、数对不上、评审当场问住),是「易查」那一侧。
  • 纵轴:错误的代价与不可逆性——错了改回来要花多少代价?只是把文档再改一遍,还是已经刷进车里、已经发给客户、已经据此下了单?

四格各有各的处置:代价高且难查 → 原则上不用,或降到只做候选提示代价高但易查 → 可用,须逐条核并留痕代价低但难查 → ★ 最容易被放过的一格,须抽核并做错误注入代价低且易查 → 可放手做初稿

为什么两维不能只取一维。只看代价,会漏掉「代价低但难查」那一格——而那一格的量最大,也是唯一一个警惕心天然最低的格子。只看可检出性,会把「易查但一旦漏了就不可逆」的任务放行,而可逆性与可检出性是两件独立的事:文档改错可以再改,标定值刷进车里再改,代价完全不是一个量级——⚠ 这里给的是方向性判断,两侧的具体代价都是平台相关量,本课⛔ 不给数。

为什么直觉一定会判错。直觉按「这活难不难」判:难的活多核,简单的活少核。而大模型恰恰在简单又难查那一格最危险。一个具体到可以立刻对照的例子:让它把一份报告的术语统一一遍——任务简单到不值得开会讨论,它做得又快又整齐,而它在改术语的同时悄悄把一处工况标注也改了(原文写的是某个定速工况,被顺手改成了与上文措辞一致的另一个工况名,⚠ 两个工况名读起来很像,而它们对应的边界条件完全不同)。这处改动格式完全正确、读起来毫无破绽、批量提交、⛔ 没有人会为了一次术语统一去逐条重读全文。

图2 该不该独立信任大模型输出的两维判据。二维平面,横轴为错误可检出性从低到高,纵轴为错误代价与不可逆性从低到高,两轴均无刻度、无数值。四象限各有标题与一句处置:左上为代价高且难查,处置是原则上不用或降到只做候选提示;右上为代价高但易查,处置是可用但须逐条核并留痕;左下为代价低但难查,标星注明是最容易被放过的一格,处置是须抽核并做错误注入,并注明量最大而警惕心最低;右下为代价低且易查,处置是可放手做初稿。平面上落七个任务示例点并各带文字标签:会议纪要与行动项、文献与专利初筛、批量统一术语、DFMEA 候选失效模式、试验异常摘要、MBD 代码生成、标定参数取值。右侧一条竖直色带把四档人工复核门槛与象限对应起来:档 0 为只给人看的草稿与线索;档 1 为进入工程文档但不直接决定设计、责任人逐句过;档 2 为进入工程判断、逐条回原始数据核并加第二人复核;档 3 为进入代码、参数、标定值或控制逻辑,并注明没有 AI 生成免评审通道。色带之外另用虚线框画档 4,写着输出进入上车功能或安全相关判断、超出本课射程、去向 K2-05、本课不给判据。图上注明四档门槛与两维判据均为本课归纳,七个任务点为教学性定位,不来自任何调查或评测数据。本图为定性示意,任务点的坐标只表达相对位置、不表示任何可测量的量,不代表任何平台的实际值,⛔ 不得据图读取任何数值,也不得据此为自己的任务打分。
图2 该从图上读出的判断有三条:① 该不该独立信任,由可检出性 × 代价与可逆性两维决定,⛔ 不由「这个任务难不难」决定——图上七个任务点的位置与它们的难度没有关系;② 左下角那一格是最危险的一格(简单、量大、错了没人复算),它的共同特征是产出为大批量、格式统一、人不会逐条重读的文本或表格 ⇒ 处置不是「多看两眼」,是抽核 + 主动做错误注入,靠人为埋进去的错能不能被查出来,反过来验证这条复核链是不是真的在工作;③ 象限与右侧复核档位一一对应,定档时先在图上找到自己的位置:越往上、越往左,档位越高。⚠ 右侧四档的完整定义(谁复核、核什么、凭什么核、留什么痕)在第 4 讲给全,本图只做位置对应、⛔ 不另立一套;虚线框里的档 4 是射程外那一档,本课只给去向 [K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法](/academy/topic/K2-05/),⛔ 不给它的判据与门槛值。两维判据与四档划分均为本课归纳。本图为定性示意,任务点的坐标只表达相对位置、不表示任何可测量的量,不代表任何平台的实际值,⛔ 不得据图读取任何数值,也不得据此为自己的任务打分。

工程量级。最危险那一格有一组可以直接拿来自查的共同特征:产出是大批量的、格式统一的、人不会逐条重读的文本或表格。三条同时成立,就落在左下格,不管这个任务听起来多轻。⚠ 相应的处置也不是「多留意一点」这种没有落点的说法,而是两个具体动作:按写死在流程里的比例抽核,以及做错误注入——人为在输入里埋进已知的错,看这条复核链能不能把它捞出来。捞不出来,说明这条链此刻只是形式上存在。

三个易错点。① 按任务难度定复核强度——方向恰好反了;② 把「模型答得很流畅」当成可检出性高——流畅度与可检出性无关,它甚至是负相关的:越流畅越不容易被质疑;③ 忽略可逆性这一维只看可检出性——同样是「一处数写错了」,写在方案对比表里和写进标定值里,改回来的代价完全不同。

1.4 语言与知识密集型任务有六类,沿研发主线数会整类漏掉后三类

是什么。研发链路上适合大模型介入的语言与知识密集型任务,完整地数是六类(★ 这个六分是本课归纳的):

  • (a)输入侧——法规与标准跟踪、专利与文献检索、竞品与技术路线情报、供应商资料比对;
  • (b)设计与分析侧——需求与 DFMEA 草拟、方案对比表、评审问题清单、仿真前后处理说明、脚本与代码;
  • (c)验证侧——试验大纲草拟、试验数据异常摘要、标定报告解读、失效现象与历史案例匹配;
  • (d)售后与服务侧——★ 现场抱怨文本归类、工单与故障码文本聚类、服务手册与培训材料生成;
  • (e)组织与协作侧——★ 会议纪要与行动项、跨语言技术文档、新人问答、老工程师经验的结构化沉淀;
  • (f)工具链自身——把上述任务串起来的 agent 编排、给仿真与标定工具写接口脚本。

为什么要先摆全集再往下讲。因为沿「需求 → DFMEA → 仿真 → 标定 → 试验 → 报告」这条最熟悉的研发主线往下数,只会数到前三类。漏掉的不是几条,是三整类——而整类漏掉不会以「少了一条」的形式暴露:数出来的清单看上去是完整的、每一条也都对,只是那三类整体不在上面。⚠ 尤其是(d)与(e):它们恰恰是文本量最大、结构最差、最缺人手的两类,也是最不需要精确数值因而风险最低的两类。一个只覆盖设计与仿真那一段的方案,等于把最容易见效的那一半直接放弃了。

工程量级。六类的复核档位差别很大,⛔ 不能一刀切:组织协作侧多数落在档 0~1(草稿与线索、或进入文档但不决定设计);设计分析侧与验证侧多数落在档 2(进入工程判断,要逐条回原始数据核并加第二人);工具链自身一旦产出的是代码,就直接进档 3,走完整代码评审与既有验证台阶,⛔ 不因为「这是 AI 写的所以先试试」而豁免任何一级。四档的完整定义在第 4 讲,六类在研发链路上的落点分布图见第 4 讲的图 12

三个易错点。① 只在「设计仿真」这一段找应用场景——那是漏掉三整类的直接原因;② 把售后文本当成没有工程价值的语料——现场抱怨与工单文本是唯一一份来自真实用户、真实工况、真实失效的连续记录,它结构差不等于它信息少;③ 把「经验沉淀」理解成「让模型自动总结一下」——沉淀方法本身归 Q3-02 工程知识管理与经验沉淀方法,本课只讲怎么把已经沉淀好的东西接进检索与生成系统,⛔ 两者不是一件事。

1.5 与代理模型配合:接口是「谁负责哪一段」,⛔ 不是「谁更准」

是什么。大模型与代理模型可以在同一条工具链里配合,典型形态是这样:大模型负责把一句自然语言需求翻译成一次代理模型调用的输入,并把返回结果解释成人能读的话;代理模型负责数值预测本身。两者之间是函数调用关系——参数与量纲由代码层校验,⛔ 不由大模型自由裁量。

为什么这条边界必须写成接口。因为边界写成函数签名,错误就落在可测试的地方:单位不对,校验层当场拒绝;超出区间,返回约定说得清清楚楚;要复现,把入参记下来重跑一次就是了。而边界写成「让大模型自己判断该不该调、该传什么」,错误就落在无法复现的地方——同样一句话问两次可能走两条不同的路径,出了问题连「上次它到底传了什么」都答不上来。⚠ 这一条与「谁更准」完全无关:准不准是各自领域内的问题,而接口解决的是「出了错能不能查出来」的问题,两条判据⛔ 不可互相推导。

工程量级。这条接口上必须显式声明的至少三项,一项都不能留在口头上:

  1. 输入量的单位与有效区间——写进签名,由代码层校验,⛔ 不靠调用方自觉;
  2. 代理模型的可信域——承接 J7-05 机器学习/AI 代理模型在热管理中的应用 给出的可信域声明,⚠ 它必须落进接口,⛔ 不能留在写这个模型的工程师心里;
  3. 超出可信域时的返回约定——是报错,还是给一个带警示标记的外推值?两种都可以,但必须二选一写死,⛔ 不能是「看情况」。

三个易错点。① 让大模型「顺便估一个」,去补代理模型不覆盖的那些工况——那正好把一个有可信域、会报警的东西,换成了一个没有可信域、不会报警的东西,方向完全反了;② 把可信域声明留在人的脑子里而不落进接口——那样它只在写的人自己调用时有效,换个人调用就失效了;③ 两侧的不确定度各报各的,最后没有人把它们合起来看——不确定度怎么分类、怎么合成,归 J7-06 仿真不确定度量化(UQ)与稳健/可靠性设计:从确定性单点到带分布的裕度;而在一批试验与标定数据上怎么把它评估出来、怎么用它判偏差显不显著,归 L7-03 试验数据分析与不确定度评估(⚠ 两者是方法与用法的分工,⛔ 不是两个互斥归属,全课这两处指向一律按这条分工读)。

1.6 本课与五门相邻课的边界:个人用法、数值代理、车云与孪生、上车论证、知识资产本体各归各家

是什么。本课讲的是企业级系统怎么建、怎么管。与它最容易混的五门课,边界各是一句话:

相邻课 它管什么 本课管什么 分开的那句判据
Q3-03 AI 辅助热管理工程工作实务 工程师个人日常怎么用 企业级系统怎么建与怎么管 给谁用:个人还是组织
J7-05 机器学习/AI 代理模型在热管理中的应用 数值代理模型(小模型做数值预测) 语言与知识引擎 产出是不是数
N6-01 预测性热管理的车云数据生态与产业路径 / N6-02 整车热管理数字孪生与在线优化 车云数据生态与数字孪生本体 建在它们之上的自然语言查询层 跑在车上还是云上、管的是数据本体还是查询层
K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法 输出进入上车工程决策链时的 AI 安全论证 输出进入研发决策链时的复核与治理 输出进不进上车的功能或安全判断
Q3-02 工程知识管理与经验沉淀方法 / Q3-04 热管理数值型基准库治理:口径标注、跨源置信排序、退役与入库门槛 文本型与数值型知识资产本身该怎么建 怎么把已建好的资产接进检索生成系统 管的是资产本体还是接入方式

为什么必须先划再讲。不划这五条,本课会往两个方向同时垮:一是退化成一门「AI 万能课」——什么都沾一点,什么都不给判据;二是与相邻课给出互相矛盾的口径——比如这边说「知识条目要按某某六列登记」,那边也说一套,两套并存,几个月后必然漂移。⚠ 而「两套口径并存必然漂移」正是本课自己在批评的那件事,本课自己⛔ 不能犯。

工程量级。这五条边界都是一问就能判的是非题,⛔ 不需要权衡:给谁用(个人/企业)· 产出是不是数 · 跑在车上还是云上 · 输出进不进上车决策链 · 管的是资产本体还是接入方式。答完这五问,一件事归哪门课就定了。

本课对这五门课的处理一律是「写去向」。说清一件事归哪门课管,⛔ 不代替那门课给判据、⛔ 不给它的限值与门槛。尤其是 K2-05 预期功能安全(SOTIF/ISO 21448)与 AI 件安全论证在热管理的落法:输出一旦进入上车的功能或安全相关判断,就是图 2 里那个画在带外的档 4——超出本课射程,本课只给去向,⛔ 一个判据、一个门槛值都不给。

三个易错点。① 把 Q3-03 AI 辅助热管理工程工作实务 的个人核验习惯直接当成企业治理制度——个人版缺了准入、审计、责任归属三层,而这三层恰恰是「制度」与「习惯」的全部差别;② 把本课的复核门槛拿去管上车件——本课的四档是按研发决策链的输出去向划的,⛔ 不覆盖上车场景,拿过去用是跨射程引用;③ 在接入侧另立一套知识入库标准——入库门槛沿用 Q3-02 工程知识管理与经验沉淀方法Q3-04 热管理数值型基准库治理:口径标注、跨源置信排序、退役与入库门槛,本课只在入库层加三条补充(3.2 给),另在检索层加一条硬规则(2.6 给),⛔ 不重开一套。

1.7 每一个场景最后都要落回三样东西:复核点、追溯路径、责任归属

是什么。这是全课第一根钉子的落地形态。判据句只有一问:这条输出会不会进入工程决策链?

  • 会 → 必须同时具备三样:一个指名到人的复核点、一条能追回原始文档的追溯路径、一份出错时的责任归属。三样是「同时」,⛔ 不是三选二。
  • 只给人看的草稿 → 复核可以抽样,但⛔ 不为零。「只是草稿」不是把复核降到零的理由,只是把它从逐条降到抽样的理由。

为什么拦得住这类错误的不是模型能力,是流程。因为大模型的错误不是随机噪声。随机噪声会以「读起来不对劲」的形式暴露自己,而它的错误是格式完全正确、语气高度自信的——一个不存在的标准编号会带着完全正确的编号格式出现,一个错的参数会带着讲究的有效数字出现。这类错误没有任何形态上的特征可供识别 ⇒ 唯一拦得住它的,是「谁在什么节点、凭什么依据、核过了什么」这条记录。⛔ 换一个更强的模型不解决这个问题:更强的模型只是让错误出现得更少、更隐蔽,而更隐蔽恰恰更危险

工程量级:三样东西的落地形态是可数的,因此可以当场检查。

  1. 复核点=流程图上一个带责任人姓名的框。⚠ 写成「团队复核」等于没有复核——没有指名到人的复核,出事时每个人都可以合理地认为是别人在核;
  2. 追溯路径=一条从这句结论一直追到源文件与它的版本号的链。链上每一环的必备字段第 6 讲给全;
  3. 责任归属=一份签署记录:谁、什么时候、核了哪几条、依据是什么。

三样里少任何一样,这个场景就还没落地——⛔ 这不是「还需要打磨」,是没落地。本课后面六讲的每一个场景(DFMEA 草拟、标定报告摘要、MBD 代码、情报整理、云图判读、agent 编排)到最后都要回到这三样上,落不回去就不往下走。

三个易错点。① 把「输出质量很好」当成可以省掉复核的理由——质量好只改变错误的频率,⛔ 不改变错误的形态,而拦不住它的正是形态;② 把复核写成「团队复核」「相关方确认」这类没有主语的说法——没有主语就没有责任归属,三样里直接少一样;③ 只给人看的草稿就把复核降到零——正确做法是把抽查比例写死在流程里,⛔ 不是靠各人自觉,⛔ 也不能是零。

这一讲的收口,同时是下一讲的入口。1.1 到 1.3 回答了「交不交、交了能不能独立信任」,1.4 到 1.6 回答了「在哪儿用、跟谁配、什么不归我管」,1.7 给出了每个场景最后都要挂上的三样东西。⚠ 但这三样里最难的那一样此刻还是悬空的:追溯路径要追到哪里去?通用模型不知道你的车型、你的标准、你的历史失效案例,它连一个可追的地方都没有。第 2 讲从这里接着讲——怎么把企业自己的文档接进来,让「无从核起」变成「可以核」。⚠ 而「可以核」与「已经核过」是两件事,这一条会贯穿本课剩下的全部内容。

后面还有 6 讲正文 · 关键公式 · 案例拆解 · 常见误区 · 动手做

会员专属

后续为会员深水区内容——四库数据与深度拆解。

查看会员方案