Skip to content

工业 AI 系统

本页是工业 AI 分类的总结页:工业 AI 从来不是”训练一个模型然后部署上线”这么简单——它是一个从感知到反馈的完整闭环系统,涉及传感器采集、边缘推理、通信协议、控制执行、持续优化等多个环节的紧密协作。前面的章节分别从垂直维度展开:工业视觉工程解决”怎么看”,工业通信协议解决”怎么传”,3D 视觉与机器人解决”怎么动”。本页把它们拼起来,回答一个核心问题:如何把这些技术组装成一个可靠、安全、可持续运行的工业 AI 系统?

如果你只读过前面某一页就跳过来,完全没问题——本页会从系统视角重新梳理各模块的角色,并与 MLOps 实践、异常检测、时间序列分析等横向技术建立连接。

工业 AI 系统的本质是一个闭环(Closed-loop)控制系统:

感知 → 理解 → 决策 → 控制 → 反馈 → (回到感知)

这五个环节缺一不可,任何一环断裂都会导致整个系统失效。直觉上,可以把工业 AI 系统类比成一个”有眼睛、有大脑、有手脚、还会自我改进”的自动化工人:

  • 感知(Perception) = 眼睛耳朵:通过摄像头、传感器、PLC(Programmable Logic Controller,可编程逻辑控制器)采集产线状态——对应工业视觉和工业通信。
  • 理解(Understanding) = 大脑的第一步:用 AI 模型对采集到的数据做推理——缺陷检测、异常识别、位姿估计(Pose Estimation)。
  • 决策(Decision) = 大脑的第二步:基于推理结果,结合规则引擎或优化算法做判断——这个零件合格吗?设备需要停机吗?机械臂应该走哪条路径?
  • 控制(Control) = 手脚:把决策转化为执行动作——驱动机械臂抓取、控制传送带启停、触发报警器。
  • 反馈(Feedback) = 自我改进:把运行结果(人工复核标注、停机事件、良品率统计)回流,触发模型再训练和系统调优——这正是 MLOps 在工业场景的落地。

与互联网 AI 的关键区别:互联网 AI 是”开环”的——推荐系统推错了内容,用户最多划走,损失可以忽略。工业 AI 是”闭环”的——质检漏检一个缺陷零件,可能导致下游装配故障甚至产品召回;控制指令发错,可能导致机械臂撞毁设备或伤及工人。因此,工业 AI 系统对实时性、可靠性、安全性的要求远高于互联网场景。

感知层是系统的”感官”,负责把物理世界的状态数字化。工业场景的感知源极其丰富:

感知源采集内容典型设备关联章节
工业相机产品表面图像、场景图像面阵相机、线扫相机、3D 相机工业视觉工程
振动传感器设备振动频率与幅度加速度计(IEPE / MEMS)异常检测
温度传感器设备/环境温度热电偶、红外热像仪时间序列分析
PLC / DCS设备运行状态(速度/压力/电流)西门子 S7、罗克韦尔 CompactLogix工业通信协议
力矩传感器机械臂末端受力六维力传感器3D 视觉与机器人

感知层的核心挑战是”同步性”:多传感器数据必须在时间上对齐(时间戳同步),否则融合推理会产生错误。例如,一个零件的图像和它的重量数据必须对应同一时刻,否则质检判断就会出错。工业上通常用 PTP(IEEE 1588 精密时间协议)实现微秒级同步。

理解层把原始数据变成”有意义的信息”。这是 AI 模型发挥作用的地方:

"""
质检理解层示例:图像 + 传感器数据 → 缺陷判断
"""
import numpy as np
def understand(image: np.ndarray, sensor_data: dict) -> dict:
"""
输入:相机图像 + PLC 传感器数据
输出:结构化的理解结果
"""
# 1. 视觉缺陷检测(CNN 模型推理)
defect_result = defect_detection_model(image)
# defect_result = {"has_defect": True, "defect_type": "scratch", "confidence": 0.95}
# 2. 尺寸测量(亚像素边缘提取)
measurements = measure_dimensions(image)
# measurements = {"width_mm": 10.02, "tolerance": "pass"}
# 3. 传感器数据异常检测(时序模型)
vibration_score = anomaly_model.predict(sensor_data["vibration"])
return {
"defect": defect_result,
"dimensions": measurements,
"vibration_anomaly": vibration_score,
"timestamp": sensor_data["timestamp"],
}

理解层的输出不是”最终决策”,而是结构化的中间结果——有无缺陷、置信度多少、尺寸偏差多少。这些结果交给决策层做综合判断。

决策层把”理解结果”转化为”行动指令”。工业系统的决策通常不是纯 AI 的,而是 AI + 规则引擎 的混合模式:

"""
质检决策层:AI 推理结果 + 业务规则 → 最终判定 + 执行指令
"""
def decide(understanding: dict) -> dict:
defect = understanding["defect"]
dims = understanding["dimensions"]
vibration = understanding["vibration_anomaly"]
# 规则 1:AI 置信度低于阈值 → 转人工复核(不直接判废)
if defect["confidence"] < 0.85:
return {"action": "manual_review", "reason": "low_confidence", "priority": "normal"}
# 规则 2:明确缺陷 → 剔除
if defect["has_defect"]:
return {"action": "reject", "reason": f"defect:{defect['defect_type']}", "priority": "high"}
# 规则 3:尺寸超差 → 剔除
if dims["tolerance"] == "fail":
return {"action": "reject", "reason": "dimension_out_of_tolerance", "priority": "high"}
# 规则 4:设备振动异常 → 预警但不立即停机(预测性维护)
if vibration > 0.8:
return {"action": "alert_maintenance", "reason": "vibration_anomaly", "priority": "medium"}
# 默认:合格
return {"action": "pass", "reason": "all_checks_passed", "priority": "none"}

为什么不是纯 AI 决策? 因为工业场景对可解释性和可审计性有硬性要求——出了事故,必须能追溯”为什么这个不合格零件被放行了”。纯神经网络是黑箱,难以满足 ISO 9001 质量管理体系的可追溯要求。规则引擎虽然”笨”,但每一步决策都可审计、可解释。这是工业 AI 与互联网 AI 的又一个核心差异。

决策层输出”指令”,控制层把指令变成物理动作。控制层通过工业通信协议(PROFINET、EtherCAT、Modbus 等,详见工业通信协议)与执行机构通信:

"""
控制层:把决策指令发送到执行机构
注意:实际工业中这段逻辑通常跑在 PLC 或工控机上,而非 Python。
这里用伪 Python 展示逻辑流程。
"""
class ActionController:
def __init__(self, plc_connection):
self.plc = plc_connection # PLC 通信句柄
def execute(self, decision: dict):
action = decision["action"]
if action == "reject":
# 触发气缸剔除机构
self.plc.write("rejector_trigger", True)
self.plc.write("alarm_light", "red")
elif action == "pass":
# 正常放行,绿灯
self.plc.write("rejector_trigger", False)
self.plc.write("alarm_light", "green")
elif action == "manual_review":
# 分流到人工复检通道
self.plc.write("diverter_to_manual", True)
self.plc.write("alarm_light", "yellow")
elif action == "alert_maintenance":
# 发送维护工单(不触发物理动作,只通知)
send_maintenance_alert(decision["reason"])
# 记录执行日志(供反馈层使用)
log_execution(decision)

实时性要求:控制指令的延迟必须确定且可控。典型要求:视觉质检系统从拍照到剔除机构动作,整个链路要在 50-200ms 内完成(取决于传送带速度)。这就是为什么理解层推理必须在边缘端完成——把图像传到云端再返回结果,延迟通常是几百毫秒到数秒,产线根本等不起。

反馈层是闭环的”闭合点”。没有反馈,系统只是一个”开环检测器”,永远停留在初始模型水平,无法适应产品变更、环境漂移。

反馈层做的事:

  • 数据采集:每次检测的图像、推理结果、最终判定、人工复核结果都自动入库。
  • 模型监控:跟踪关键指标(检出率、误报率、人工复核比例)。指标恶化时触发告警。
  • 主动学习(Active Learning):优先筛选”模型不确定”的样本(置信度在阈值附近的)送人工标注,最大化标注效率。
  • 模型再训练:积累足够新数据后,触发自动再训练流水线,新模型通过验证后灰度上线。
  • 闭环度量:量化”模型改进 → 良品率提升 / 人工复检减少”的 ROI,证明 AI 系统的持续价值。

这个反馈闭环正是 MLOps 在工业场景的落地形态——只不过工业 MLOps 比互联网 MLOps 多了”边缘端部署”和”功能安全验证”两个额外约束。

工业 AI 系统几乎都采用 边缘-云协同(Edge-Cloud Collaborative) 架构:边缘端做实时推理,云端做大模型训练和全局分析。两者各司其职。

维度边缘端(Edge)云端(Cloud)
核心任务实时推理 + 设备控制模型训练 + 数据分析 + 模型管理
延迟要求毫秒级(< 50ms)秒级到小时级
硬件NVIDIA Jetson Orin、工业 IPC、NPU 加速卡GPU 集群(A100 / H100)
模型精度INT8 量化,轻量模型(MobileNet、YOLO-nano)FP32/FP16,大模型(ResNet、Vision Transformer)
网络依赖断网可独立运行需要稳定网络
数据实时流数据,只保留近期缓存全量历史数据,数据湖存储

把云端训练的模型部署到算力有限的边缘端,需要做模型压缩(Model Compression)。核心手段:

"""
模型量化示例:FP32 → INT8
用 PyTorch 的量化工具把一个分类模型压缩到 INT8 精度。
"""
import torch
import torch.ao.quantization as quant
# 1. 加载训练好的 FP32 模型
model = MyDefectClassifier() # 自定义缺陷分类模型
model.load_state_dict(torch.load("defect_model_fp32.pth"))
model.eval()
# 2. 准备校准数据(代表性的输入样本,几百张即可)
calibration_data = load_calibration_images("./calibration_samples/")
# 3. 设置量化配置(后训练量化 PTQ)
model.qconfig = quant.get_default_qconfig('fbgemm') # x86 CPU 后端
prepared_model = quant.prepare(model)
# 4. 用校准数据跑前向传播,统计各层激活值的范围
with torch.no_grad():
for batch in calibration_data:
prepared_model(batch)
# 5. 转换为 INT8 量化模型
quantized_model = quant.convert(prepared_model)
# 6. 对比模型大小和推理速度
fp32_size = sum(p.nelement() * p.element_size() for p in model.parameters())
int8_size = sum(p.nelement() * p.element_size() for p in quantized_model.parameters())
print(f"FP32 模型大小: {fp32_size / 1024 / 1024:.1f} MB")
print(f"INT8 模型大小: {int8_size / 1024 / 1024:.1f} MB")
print(f"压缩比: {fp32_size / int8_size:.1f}x")
# 典型输出:
# FP32 模型大小: 25.6 MB
# INT8 模型大小: 6.4 MB
# 压缩比: 4.0x

量化精度损失:INT8 量化通常导致精度下降 0.5%-2%。对于缺陷检测这类对 Recall(召回率)敏感的任务,即使 1% 的精度下降也可能导致漏检率显著上升。因此工业上常用量化感知训练(QAT, Quantization-Aware Training)——在训练阶段就模拟量化误差,让模型提前适应,部署后精度损失通常可控制在 0.5% 以内。

工业环境中,AI 系统的失误可能造成设备损毁、生产中断甚至人员伤亡。因此工业 AI 的安全设计不是”锦上添花”,而是”准入门槛”。

故障安全原则:系统出错时,必须进入安全状态,而非危险状态。具体到工业 AI:

  • 模型推理超时 → 默认判定为”需要人工复检”(不自动放行)。
  • 相机断线 → 产线自动减速或停机(不能在”看不见”的情况下继续生产)。
  • 边缘设备宕机 → 切换到备用设备,或降级为纯人工模式。
"""
故障安全设计示例
"""
def safe_inference(image, timeout_ms=100):
try:
result = model.predict(image, timeout=timeout_ms)
if result is None:
# 模型返回空 → 安全降级
return {"action": "manual_review", "reason": "inference_returned_none"}
return result
except TimeoutError:
# 推理超时 → 默认转人工,不自动放行
log_critical("Inference timeout, falling back to manual review")
return {"action": "manual_review", "reason": "inference_timeout"}
except Exception as e:
# 任何未预期错误 → 停机并报警
log_critical(f"Unexpected error: {e}")
return {"action": "stop_line", "reason": f"system_error: {e}"}

当 AI 模型不可用(服务器宕机、模型版本出错、输入超分布)时,系统应能降级到规则系统继续运行,而非完全瘫痪:

设计原则:AI 是”锦上添花”,规则系统是”安全底线”。先确保规则系统能独立运行(哪怕效率低),再让 AI 在其之上提升精度和效率。这样 AI 模型出问题时,产线不会停摆。

人机协作安全(Human-Robot Collaboration)

Section titled “人机协作安全(Human-Robot Collaboration)”

协作机器人(Cobot,Collaborative Robot)设计为能与人在同一空间工作,而非关在安全围栏里。ISO 10218 和 ISO/TS 15066 定义了四种协作模式:

协作模式安全机制典型场景
安全监控停止(Safety-rated Stop)人进入工作区时机器人停止上下料协作
手引导(Hand Guiding)人手动引导机器人运动轨迹示教编程
速度与位置监控(Speed & Separation)实时监控人机距离,动态调速组装线
功率与力限制(Power & Force Limiting)机器人输出力矩被物理限制,碰撞不会伤人精密装配

力限制(Force Limiting) 是最根本的安全措施:即使控制系统完全失灵,机器人的关节力矩也被机械层面限制在人体可承受范围内(通常 < 150N)。UR(优傲)、KUKA LBR、Franka Emika 等协作机器人均采用此设计。AI 视觉在此提供增强安全——提前检测人体位置,主动避让,减少碰撞触发频率。

工业 AI 系统涉及的功能安全标准主要有两套:

  • ISO 13849(机械安全):定义 Performance Level(PL),从 PL-a 到 PL-e,PL-e 最高(用于”失效可能导致死亡”的场景)。
  • IEC 61508(电气/电子/可编程电子安全):定义 Safety Integrity Level(SIL),从 SIL 1 到 SIL 4,SIL 4 最高。
等级失效概率(每小时)风险等级典型应用
SIL 1 / PL-c10−610^{-6} ~ 10−510^{-5}低风险一般机械防护
SIL 2 / PL-d10−710^{-7} ~ 10−610^{-6}中风险压力机、输送线急停
SIL 3 / PL-e10−810^{-8} ~ 10−710^{-7}高风险人机协作、机器人系统

AI 模型本身无法获得 SIL 认证。当前的功能安全标准是基于”确定性系统”设计的,要求系统的行为完全可预测、可验证。神经网络本质上是概率性的,无法满足严格的 SIL 要求。因此工业实践中的做法是:AI 做辅助判断,最终的安全关断由经过 SIL 认证的硬件安全回路(如安全继电器、安全 PLC)执行——AI 不会直接控制安全关键动作。

AI 模型的输出不是非黑即白的”合格/不合格”,而是带置信度的概率值。合理的阈值设置是平衡自动化率和安全性的关键:

决策={自动判定(合格 / 不合格)if confidence≥τhigh转人工复核if τlow<confidence<τhigh转人工复核 + 模型告警if confidence≤τlow\text{决策} = \begin{cases} \text{自动判定(合格 / 不合格)} & \text{if confidence} \geq \tau_{\text{high}} \\ \text{转人工复核} & \text{if } \tau_{\text{low}} < \text{confidence} < \tau_{\text{high}} \\ \text{转人工复核 + 模型告警} & \text{if confidence} \leq \tau_{\text{low}} \end{cases}

其中 τhigh\tau_{\text{high}} 和 τlow\tau_{\text{low}} 的设定取决于业务对漏检(False Negative)和误报(False Positive)的容忍度。在航空航天等高可靠性场景,τhigh\tau_{\text{high}} 可能设到 0.99 以上,大部分产品转人工;在消费电子等大批量场景,τhigh\tau_{\text{high}} 可能设在 0.85,实现 90%+ 的自动化率。

案例 1:AOI 自动光学检测(Automated Optical Inspection)

Section titled “案例 1:AOI 自动光学检测(Automated Optical Inspection)”

AOI 是工业 AI 最成熟的落地场景。典型应用包括 PCB(Printed Circuit Board,印制电路板)焊点检测、显示面板缺陷检测、精密零件表面缺陷检测。

系统流程:

AOI 的核心挑战不是”检测”,而是”误报”:工厂宁可漏检(后续工序可能拦截),也不愿误报——因为每一个误报都意味着一个良品被错误剔除,直接造成产能损失。工业上用”过杀率(Overkill Rate)“衡量误报严重程度,通常要求控制在 5% 以下。降低过杀率的关键是提高模型对边界样本的判别能力,这正是异常检测中 PatchCore 等方法的用武之地。

案例 2:预测性维护(Predictive Maintenance)

Section titled “案例 2:预测性维护(Predictive Maintenance)”

预测性维护通过持续监测设备状态(振动、温度、电流、声纹),在故障发生之前预警,把”事后维修”或”定期保养”升级为”按需维修”。

技术栈:

  • 数据采集:高频振动传感器(采样率 10-25 kHz)、温度传感器、电流互感器。
  • 特征工程:频域特征(FFT 频谱、功率谱密度)、时域特征(RMS、峰值因子、峭度)。
  • 模型:异常检测模型(Isolation Forest、Autoencoder)发现异常趋势 → 分类模型(随机森林、1D-CNN)诊断故障类型(轴承磨损 / 不对中 / 不平衡)→ 预测模型(LSTM)估算剩余使用寿命(RUL, Remaining Useful Life)。
"""
预测性维护示例:轴承振动异常检测 + 故障分类
"""
import numpy as np
from scipy.fft import fft
from sklearn.ensemble import IsolationForest, RandomForestClassifier
def extract_vibration_features(signal: np.ndarray, fs: int = 25000) -> dict:
"""从振动信号中提取时域 + 频域特征"""
# 时域特征
rms = np.sqrt(np.mean(signal ** 2))
peak = np.max(np.abs(signal))
crest_factor = peak / rms # 峰值因子,对早期故障敏感
kurtosis = np.mean((signal - signal.mean()) ** 4) / (signal.std() ** 4)
# 频域特征(FFT)
spectrum = np.abs(fft(signal))[:len(signal) // 2]
freqs = np.fft.fftfreq(len(signal), 1 / fs)[:len(signal) // 2]
# 特征频段的能量(轴承外圈故障频率 BPFO ≈ 107 Hz,示例值)
bpfo_band = (freqs > 100) & (freqs < 115)
bpfo_energy = np.sum(spectrum[bpfo_band] ** 2)
return {
"rms": rms,
"crest_factor": crest_factor,
"kurtosis": kurtosis,
"bpfo_energy": bpfo_energy,
}
# Step 1: 异常检测——用正常运行数据训练,发现异常趋势
normal_features = [extract_vibration_features(s) for s in normal_signals]
detector = IsolationForest(contamination=0.05, random_state=42)
detector.fit(np.array([list(f.values()) for f in normal_features]))
# Step 2: 故障分类——一旦检测到异常,诊断故障类型
fault_features = np.array([...]) # 历史故障样本
fault_labels = np.array([...]) # "bearing_wear", "misalignment", "imbalance"
classifier = RandomForestClassifier(n_estimators=100, random_state=42)
classifier.fit(fault_features, fault_labels)
# Step 3: 实时推理
new_features = extract_vibration_features(live_signal)
feature_vector = np.array(list(new_features.values())).reshape(1, -1)
is_anomaly = detector.predict(feature_vector)[0] == -1
if is_anomaly:
fault_type = classifier.predict(feature_vector)[0]
print(f"⚠️ 检测到异常!疑似故障类型: {fault_type}")
# 触发维护工单...

预测性维护的深层原理——振动信号的频域特征如何映射到特定故障类型,异常检测算法如何发现早期劣化趋势——详见异常检测和时间序列分析。

AGV(Automated Guided Vehicle,自动导引车) 和 AMR(Autonomous Mobile Robot,自主移动机器人) 是智能物流的核心:

特性AGVAMR
导航方式固定路径(磁条 / 二维码 / 反射板)自主规划(SLAM)
避障能力弱(需停等障碍物移开)强(实时绕行)
路径灵活性低(固定路线)高(动态规划)
部署成本高(需铺设磁条/路标)低(建图即可)
典型场景产线物料配送、固定工位搬运仓储拣选、跨区域搬运

SLAM(Simultaneous Localization and Mapping,同步定位与建图) 是 AMR 的核心技术:机器人在未知环境中一边移动一边构建地图,同时在地图上定位自己。视觉 SLAM(如 ORB-SLAM3)用相机,激光 SLAM(如 Cartographer)用激光雷达。3D 视觉和 SLAM 的深入原理见3D 视觉与机器人。

AI 视觉在工厂安全监控中的应用:

  • PPE(Personal Protective Equipment,个人防护装备)检测:自动检测工人是否佩戴安全帽、护目镜、工服、安全鞋。未佩戴者触发声光提醒。
  • 危险区域入侵检测:定义电子围栏(电子安全区域),人员越线进入危险区域(如冲压机工作区、高温区)时立即报警。
  • 行为安全检测:识别不安全行为——在禁烟区吸烟、攀爬护栏、操作姿势违规等。
  • 人员跌倒检测:基于人体关键点检测(Pose Estimation),判断是否发生跌倒事故并触发急救响应。
"""
PPE 检测推理示例(基于 YOLO 目标检测)
"""
# 模型类别:person, helmet, helmet_red, helmet_blue, helmet_white,
# no_helmet, safety_vest, no_safety_vest, glasses, no_glasses
def check_ppe(detections: list) -> dict:
"""
输入:YOLO 检测结果列表
输出:每个人员的 PPE 合规状态
"""
persons = [d for d in detections if d["class"] == "person"]
results = []
for i, person in enumerate(persons):
# 找到与当前 person 重叠度(IoU)最大的 helmet / vest 检测
helmet = find_best_overlap(person, detections, ["helmet_red", "helmet_blue", "helmet_white"])
vest = find_best_overlap(person, detections, ["safety_vest"])
violations = []
if helmet is None:
violations.append("NO_HELMET")
if vest is None:
violations.append("NO_SAFETY_VEST")
results.append({
"person_id": i,
"bbox": person["bbox"],
"compliant": len(violations) == 0,
"violations": violations,
})
return {"persons": results, "total_violations": sum(len(r["violations"]) for r in results)}

目标检测模型的原理与训练方法详见CNN 主线和目标检测与 YOLO。

把 AI 从”实验室 Demo”变成”7×24 稳定运行的产线系统”,需要跨越以下工程挑战:

挑战描述应对策略
数据稀缺缺陷样本极少(良品率 99%+),长尾分布异常检测范式(只用正常样本训练);数据增强;合成缺陷生成
产线变更换产品/换型号,模型需快速适配少样本学习(Few-shot Learning);零样本模型(如 WinCLIP)
环境漂移光照、温度、设备老化导致数据分布变化持续学习(Continual Learning);数据漂移监控
实时性推理延迟必须确定性可控边缘部署;INT8 量化;模型蒸馏(Knowledge Distillation)
可解释性出了事故必须追溯原因AI + 规则引擎混合决策;可解释 AI(XAI);完整执行日志
安全认证安全关键场景需通过功能安全认证AI 辅助 + SIL 认证硬件安全回路执行
IT/OT 融合AI(IT 世界)与 PLC(OT 世界)协议不兼容OPC UA 统一架构;协议网关;边缘中间件

2024-2025 年,大视觉模型(Large Vision Models)开始渗透工业视觉领域:

  • 视觉基础模型(Vision Foundation Models):如 SAM(Segment Anything Model)及其工业变体,能对任意物体做零样本分割。工业场景中,SAM 可以快速标注新产品缺陷数据,将标注成本降低 80%+。
  • 多模态大模型做缺陷理解:GPT-4V / Gemini 等多模态模型可以直接”看图说话”——输入缺陷图片,输出缺陷类型描述和严重程度评估。2025 年的研究表明,多模态大模型在零样本缺陷分类上已接近专用模型的 85-90% 精度。
  • 工业大模型微调:用 LoRA(Low-Rank Adaptation)等参数高效微调技术,在通用大模型基础上用少量工业数据微调,快速适配到特定产线。

具身智能是 2024-2025 年最热的工业 AI 方向之一:把大模型的”理解能力”与机器人的”执行能力”结合,让机器人能听懂自然语言指令并自主完成复杂操作任务:

  • Google RT-2 / RT-X:把视觉-语言-动作(Vision-Language-Action, VLA)统一到一个 Transformer 模型中,机器人能理解”把红色零件放到左边”这样的指令。
  • NVIDIA GR00T:为人形机器人设计的基础模型,目标是让机器人通过观察人类演示学习操作技能。
  • 工业落地展望:短期内(2025-2026)具身智能主要在实验室和高端场景(如精密电子装配)试点,大规模工业部署仍需解决实时性、可靠性、成本三大瓶颈。

数字孪生——物理设备的虚拟镜像——与 AI 深度融合:

  • 虚拟调试:在数字孪生中先测试 AI 控制策略,验证通过后再部署到物理设备,降低试错成本。
  • 预测性维护增强:数字孪生结合物理仿真模型(Physics-informed AI),比纯数据驱动模型更准确地预测设备剩余寿命。
  • 合成数据生成:在数字孪生环境中渲染各种缺陷、故障场景的合成数据,解决真实缺陷样本稀缺的问题。NVIDIA Omniverse 等平台已支持物理级光线追踪渲染,生成的合成图像足以训练可靠的检测模型。

5G 的高带宽、低延迟(URLLC 超可靠低延迟通信,理论 < 1ms)为工业 AI 提供了新的连接基础:

  • 无线边缘推理:AGV/AMR 不再受限于有线连接,5G 回传视频流到边缘服务器做实时推理。
  • 柔性产线:5G 让设备”剪掉网线”,产线布局可以快速重构,配合 AI 实现小批量多品种的柔性制造。
  • TSN(Time-Sensitive Networking):时间敏感网络为工业通信提供确定性延迟保障,是 5G + 工业互联网的关键使能技术(详见工业通信协议)。

在功耗和成本极度受限的场景(电池供电的无线传感器节点),TinyML 把模型压缩到 KB 级别:

  • MCU 级推理:在 ARM Cortex-M 系列 MCU(几十 KB RAM)上跑轻量模型(如 MicroNet、MCUNet),实现声纹异常检测、微振动监测。
  • 端侧学习(On-device Learning):2024-2025 年的研究(如 MIT 的 TinyTrain)让边缘设备能在本地做增量学习,无需回传数据到云端——这对数据隐私敏感的工业场景尤其有价值。
术语英文解释
闭环系统Closed-loop System输出结果反馈到输入端,形成自我调节的控制回路
PLCProgrammable Logic Controller可编程逻辑控制器,工业自动化的核心控制器
边缘计算Edge Computing在数据产生源(产线侧)就近做计算,减少云端往返延迟
边缘-云协同Edge-Cloud Collaborative边缘端做实时推理、云端做训练和分析的协同架构
模型量化Model Quantization把模型从 FP32 压缩到 INT8/INT4,减少存储和加速推理
量化感知训练QAT (Quantization-Aware Training)训练阶段模拟量化误差,部署后精度损失更小
故障安全Fail-safe系统出错时自动进入安全状态,而非危险状态
优雅降级Graceful DegradationAI 不可用时降级到规则系统继续运行
协作机器人Cobot (Collaborative Robot)设计为与人共同工作的机器人,有力限制等安全措施
功能安全Functional Safety系统在故障时仍能执行安全功能的 ability,以 SIL/PL 衡量
安全完整性等级SIL (Safety Integrity Level)IEC 61508 定义的安全等级,SIL 1-4,越高越安全
性能等级PL (Performance Level)ISO 13849 定义的机械安全等级,PL-a 到 PL-e
AOIAutomated Optical Inspection自动光学检测,用相机和 AI 自动检测产品外观缺陷
预测性维护Predictive Maintenance基于传感器数据预测设备故障,提前安排维护
AGVAutomated Guided Vehicle自动导引车,沿固定路径搬运物料
AMRAutonomous Mobile Robot自主移动机器人,用 SLAM 自主导航避障
SLAMSimultaneous Localization and Mapping同步定位与建图,机器人在未知环境中边建图边定位
数字孪生Digital Twin物理设备/系统的虚拟镜像,用于仿真、监控和预测
具身智能Embodied AIAI 大模型与物理机器人结合,能感知环境并执行物理动作
过杀率Overkill Rate良品被误判为不良品的比例,衡量质检误报严重度
PPEPersonal Protective Equipment个人防护装备(安全帽、工服、护目镜等)
TSNTime-Sensitive Networking时间敏感网络,为工业通信提供确定性延迟保障
  • 感知层深入:工业视觉工程涵盖相机选型、光源设计、图像预处理等感知层核心知识;3D 视觉与机器人展开 3D 重建、点云处理、SLAM 定位与机械臂运动规划。
  • 通信层深入:工业通信协议系统梳理 PROFINET、EtherCAT、Modbus、OPC UA 等工业协议的原理与选型。
  • AI 算法基础:视觉检测的底层算法见CNN 主线和目标检测与 YOLO;预测性维护的核心算法见异常检测和时间序列分析。
  • 工程化实践:模型训练、部署、监控的完整流水线见MLOps 实践;Python 工程能力见Python 工程进阶;AI 后端服务架构见AI 后端开发。
  • 大模型生态:大模型在工业场景的落地趋势可参考语言模型演进和多模态模型。
  • 功能安全标准:ISO 13849(机械安全控制系统)、IEC 61508(电气/电子安全系统)、ISO 10218 / ISO/TS 15066(工业机器人安全)是三大核心标准族。ISO/TS 15066 详细定义了协作机器人的四种协作模式和力限制阈值,是人机协作安全的必读文档。
  • 工业 AI 综述:IEEE Transactions on Industrial Informatics 和 Journal of Manufacturing Systems 是工业 AI 领域的两本核心期刊,关注系统级集成和落地案例。Lee 等人提出的 “5C 架构”(Connection-Conversion-Cyber-Cognition-Configuration)是工业 4.0 中 Cyber-Physical System 的经典参考框架。