📚

智能硬件学习

2026年09月16日

📚 智能硬件PM学习日报 | 2026-09-16(周三)


取材说明:任务里的 `curl` 直连 Google 在本机仍被网络策略拦截(两条命令均返回 0 字节、exit 0 无内容,已实测),改用备用检索通道取材,来源真实可查(见文末)。本主题在历史日报中从未作为主主题讲过(此前已覆盖 IPD / NPDP / 竞品分析 / PRD / DFM×2 / BOM成本 / GTM / 测试验证 / 用户调研 / 路线图 / 跨部门与供应链 / 专利布局 / 迭代策略 / 质量管理体系 / 敏捷硬件 / 平台化与CBB / 认证与合规 / 成本工程DTC),符合轮换要求——而"可靠性"恰好是机巢、载荷、无人机这三条线上最容易被嘴上说说、实际没人记账的一块。报告已同步归档:`/home/ubuntu/reports/pm-learning-2026-09-16.md`,并已上传语雀 → https://www.yuque.com/pm-bonner/hermes-learning/pm-report-20260916-dfr




🎯 今日主题(约15分钟):可靠性工程 DFR —— 客户不会因为参数表买第二台,只会因为第一台没坏



一、概念解释:可靠性不是"质量好",是"质量在时间轴上的积分"


昨天讲的 FMEA 是定性的(哪些失效模式、严重度多高、怎么防);今天讲的可靠性是定量的(多久坏一次、坏了多久能修好、修好要多少钱)。它们是一件事的两面:FMEA 找"可能怎么坏",可靠性算"多长时间坏一次、值不值得这么设计"。


先把这套语言背下来,会议上有它你才说得出话:


指标含义适用对象公式
MTBF(平均故障间隔时间)两次故障之间的平均运行时长可修复系统(机巢、无人机、云台)总运行时间 ÷ 故障次数
MTTF(平均失效时间)失效前的平均时长不可修复件(电池包、LED、密封件)总运行时间 ÷ 投放数量
MTTR(平均修复时间)故障到恢复正常的平均时长维修能力总停机时间 ÷ 维修次数
可用性 A需要时能用的时间占比客户真正关心的那个数A = MTBF ÷ (MTBF + MTTR)

可用性公式有个必须记住的对称性:MTBF=400h、MTTR=4h → A=99.0%;把 MTTR 压到 2h → 99.5%;或者把 MTBF 翻到 800h → 同样是 99.5%。两条路成本差一个数量级——改设计提 MTBF 要几个月,多备一个模块/写一页现场更换 SOP 提 MTTR 可能只要一周。警用客户嘴上说"我要可靠",实际痛点是"停飞多久",那往往该往 MTTR 下手。


另一个必须打破的误读:MTBF 不是"寿命",也不是"这机器能用多少年"。指数分布下,一台设备活到 MTBF 那一刻的概率只有约 37%。Flex 举过一个很扎心的例子:1000 台设备,每台 MTBF=100 万小时,听上去像 114 年不坏;实际上第一年起每年大约有 9 台会坏。如果你拿 MTBF 去承诺"保证不坏",就是给自己埋雷。正确的用法是:用 MTBF 反推备件库存、售后人力和质保成本。


浴盆曲线(Bathtub Curve)——三段,三段对应三种完全不同的动作:



PM 的活儿:别让三段混在一张汇报里。客户投诉"三个月就坏"是①,投诉"用了两年开始批量坏"是③,两者根因和预算来源完全不同。


二、核心要点(7 条,按对你的实际杀伤力排序)


  1. 可靠性指标必须写进需求基线,而且必须是"指标 + 试验方法 + 判据 + 责任方 + 节点"五件套。

只写"高可靠"等于没写。"机巢舱盖机构动作寿命 ≥ 2 万次(GB/T 2423 类环境条件下,动作后密封性不失效)"才是可执行的需求。判据缺失的指标,在评审会上一定会被研发用"已经做得很好了"糊过去。


  1. 先做可靠性分配,再谈指标——串联系统是乘法的地狱。

系统可靠度 = 各串联单元可靠度相乘。0.999 的子系统串 50 个:0.999⁵⁰ ≈ 0.951;串 200 个 ≈ 0.819。所以"每个部件都要做到 99.9%"既不现实也没必要。正确姿势是:给每个子系统定不同的可靠度目标(贵的、关键的给高指标),靠冗余(双余度、并联)+ 降额设计把整机拉起来。


但冗余有个致命边界:冗余只能救随机失效,救不了共因失效(Common Cause Failure)。同一个批次、同一块板、同一个软件版本,会一起坏。所以双余度设计必须做独立性审查:供电是否共用一路?固件是否同一个版本?散热是否同一条风道?


  1. DFR 四件套:降额 / 热设计 / 冗余 / 简化。

  1. 试验金字塔:把 HALT / HASS / 环境试验 / 可靠性鉴定摆到正确的位置上。

  1. 加速寿命试验:算得出,才敢承诺。

阿伦尼乌斯(Arrhenius)模型是温度加速的通用工具:AF = exp[Ea/k × (1/T_使用 − 1/T_试验)](k 为玻尔兹曼常数 8.617×10⁻⁵ eV/K,温度必须换算成开尔文)。Ea(激活能)经验取值:通用 IC/半导体/贴片阻容 0.5~0.7 eV(常用 0.6 eV)、铝电解电容 0.7~1.2、LED/光耦 0.8~1.0、高分子塑料橡胶热老化 0.8~1.5、焊点与金属界面扩散 1.0~1.5。

一个真实算例(讯科标准):产品要求 10 年寿命,Ea=0.68,用 105℃ 加速(对比 25℃)→ AF≈262 → 只需 10×365×24 ÷ 262 ≈ 333.7 小时(约 14 天),5 个样品可同时进行。

前提红线:加速应力不能引入新的失效机理。一旦超过材料本身的极限,测出来的 AF 就是假的——这是加速试验最常被自欺的地方,跟昨天 FMEA 里"改频度分来压 RPN"是同一类作弊。


  1. 现场的售后数据才是真正的可靠性数据。

实验室只能证明"设计上限",客户手上才有"实际使用剖面"。建一张故障归零台账:序列号 → 使用场景 → 累计运行时间/循环次数 → 故障现象 → 根因 → 处置 → 是否重复发生。这张表三个月后就能算出实测 MTBF/MTTR,比任何仿真都值钱——而且它是你向老板要可靠性预算的唯一硬证据。没有这张表,"可靠性改进"永远排在"新功能"后面。


  1. B2G 场景:可靠性是可以直接换钱的。

警用/政企招标的技术分与资格项里,MTBF/MTTR 指标、IP 等级、第三方环境试验报告(CNAS/CMA 资质机构)、盐雾与高低温试验、防雷等级、设计寿命都是硬通货。PM 的动作:立项时就把"哪些可靠性报告要提前送检、送检周期多长"写进计划——环境与可靠性试验排期往往比认证还长,且试验失败要整改重测(另外付费、重新排队)。


三、实际案例(结合无人机 / 机巢 / 警用场景)


官网规格本身就在回答可靠性问题:DJI Dock 工作温度 −35 ~ 50℃、IP55、防雷 40 kA(8/20 μs 波形),符合 EN/IEC 61643-11 Type 2 防护等级要求;DJI Dock 2 为 −25 ~ 45℃、IP55、防雷 20 kA,配套 Matrice 3D/3TD 整机 IP54、−20 ~ 45℃。

更值得学的是它对沿海场景的正面回答:官方明确把"防盐雾"单独立项——"部署在沿海地区的机场,盐雾、潮湿、凝露等容易引起设备受腐蚀、受潮,导致设备老化严重,缩短产品使用寿命"。也就是说:IP55 解决了"进水",但没解决"腐蚀";两件事必须分开说明、分开验证。 这条对你做水上/沿海警种(水上、环食药)的机巢是直接可抄的论证结构。此外其公开的实验室试验项目里包含防水防尘、交变盐雾、极端温度飞行等(Matrice 400 宣传物料口径)。

👉 拿它做对标时的正确用法:不要抄参数值,抄它的"参数→试验→场景"三段式举证逻辑。客户问"你的机巢能不能在江边用",回答里必须有"盐雾试验(中性/交变)+ 时长 + 报告编号",而不是"我们的密封做得很好"。


注意最后一项——"线路弯折"是很多人会漏掉的。系留无人机(TK 系留)的系留线缆、机巢内部动线、载荷快拆线束,都是反复弯折的疲劳件,属于浴盆曲线第③段(耗损)的典型。这张清单最实用的地方是:它可以直接改写成你项目 DVT 阶段的试验项清单。


1 000 台机巢,宣称 MTBF = 100 万小时(约 114 年),听起来是"永不坏"。按指数分布,第一年约 9 台会出故障。如果你在投标文件里写"MTBF 100 万小时 = 基本免维护",交付第一年就会收到 9 张故障单 + 9 次舆情。

👉 正确写法:MTBF 指标 + 备件包配置(按 X% 年故障率备多少块电源/图传/电机)+ MTTR 承诺(现场模块级更换 ≤ X 小时)+ 质保条款。可靠性承诺必须和服务方案一起出现,否则就是纯风险。


四、落到成至语境:三条产品线的可靠性抓手


产品线可靠性瓶颈(真凶)该做的试验/设计动作
机巢① 舱盖/推杆/充换电机构寿命(动作件是浴盆③段的重灾区)② 内温升(森林高温+阳光直射,温控系统自身也有寿命)③ 盐雾/凝露(水上、沿海)④ 防雷机构动作循环试验(定几万次并给出失效判据);温度+湿度+振动三综合;中性/交变盐雾;防雷按 EN/IEC 61643-11 等级验证;温控模块降额设计
载荷(MT照明/MP喊话/TH抛投/GL激光/CZ悬浮灯/DH100水炮/TK系留)① LED 光衰与结温 ② 密封件与压力件老化(水炮)③ 线缆弯折疲劳(系留/快拆线束)④ 挂载机构的插拔寿命光衰测试(温度加速,Ea 取 0.8~1.0);密封件按循环次数定寿命;线缆弯折寿命试验;挂载接口插拔寿命(这类"接口寿命"是平台化架构下最容易被漏掉的可靠性项)
无人机(含整机集成)① 电池循环寿命与贮存衰减(最贵的耗损件)② 振动对云台/IMU/线束 ③ GPS 搜星(城市峡谷、森林)④ 跌落(强制项)⑤ 电机/桨电池循环与存储试验(并据此定电池质保与备件策略);振动(工作+运输);搜星测试;跌落 ≤ GB 42590-2023 要求(满电 30%±2%、10 m 垂直跌落不起火不爆炸)

一句话取舍:可靠性的钱要花在"动作件、发热件、耗损件、密封件"这四类上,其余地方做降额和简化就够。 把预算平摊到每个零件上,是最常见的浪费。


五、给 1.5 年经验 PM 的落地清单


  1. 给在研项目补一张"可靠性需求表"(半天能做完):列 5~8 项关键指标,每项填"指标值 / 试验方法 / 判据 / 责任方 / 验证节点"。没有这张表,DVT 结束你无法判定能不能放行。
  2. 把 HALT 排到 DVT 之前:HALT 是"花一周找极限",越早做越便宜;HASS 排到量产导入(PVT),把早期失效烧在厂里而不是客户手上。
  3. 建"故障归零台账"并每月算一次实测 MTBF / MTTR:这是你从"会说流程"升级到"手里有数据"的分水岭。
  4. 把 MTTR 当设计指标反推结构:模块化快换 + 现场可更换单元(LRU)划分 + 随箱备件包。警用客户最在意的不是"不坏",是"停飞多久"。
  5. 可靠性条款要写进供应商协议:关键件(电池、电机、图传模块、密封件)要求来料可靠性数据 + 变更通知(PCN)。供应商偷偷换料,是让成熟产品的可靠性一夜倾覆的最常见原因。


💡 知识速览(每条 1-2 分钟)



  1. 10℃ 法则 + 降额设计:结温每降 10℃,失效率大致减半;器件按额定值的 50%~70% 使用。这两条是所有可靠性手段里投入产出比最高的,而且不需要等待试验结论就能执行——改散热、加余量,改图就能做。
  2. IP 等级的读法:IP55 = 第一位 5(防尘,"不能完全防止粉尘进入但不影响正常工作")+ 第二位 5(防喷水);IP67 = 防尘完全 + 短时浸水;IP68 = 持续浸水。"IP55 的机巢被台风积水泡了"是设计场景没定义清楚,不是密封件没做好——需求里必须写"使用环境剖面",否则 IP 等级是拍脑袋。
  3. 共因失效:冗余的隐形杀手。双余度设计只有在"两路真正独立"时才算冗余(独立供电、独立信号路径、独立固件、独立散热)。凡是共用一路电池、共用一块 PCB、共用一版固件的"冗余",都只是让你感觉安全的冗员。
  4. 环境试验顺序有讲究:先"工作状态"振动冲击 → 再"非工作状态"振动冲击 → 高低温 → 湿度/温度 → 温度/海拔 → 损坏极限 → 最后包装振动与包装跌落。顺序错了,前面试验的损伤会污染后面试验的结论——这是试验大纲评审时最该问的一句。
  5. FMEA 与可靠性各管一半:FMEA 回答"哪种失效模式最该防"(定性、RPN/AP 分级),可靠性回答"多久坏一次、坏了怎么快速恢复"(定量、MTBF/可用性)。项目管理上它们的落点不同:FMEA 挂在 TR 评审,可靠性指标挂在需求基线与验收试验。


📌 今日金句



"可靠性不是'不会坏',而是'坏得可预期、可承受、可恢复'——客户不会因为参数表买第二台,只会因为第一台没坏。"



—— 给你的动作建议:本周挑一款在售产品,把它的售后故障记录按"早期/偶发/耗损"三段分类。落在耗损段的故障(密封件、电池、动作机构),今年就能做成预防性维护与备件方案;落在早期段的,说明出货筛选还不够,那是 HASS 的缺口。这两件事都不需要重新设计产品,却能立刻改变客户对你产品的口碑。



📎 今日取材来源



明日预告建议:产品组合与产品线管理(Portfolio Management:五警种方案该按"项目"还是按"产品线"组织,资源怎么分配、什么时候该砍产品),或"需求管理全链路(需求收集 → 分层 → 需求基线 → 变更控制 RTM)"——两个主题此前均未讲过。


To stop or manage this job, send me a new message (e.g. "stop reminder 智能硬件产品经理学习").