OpenClaw推理加速:从算法优化到硬件协同的全栈提示词

官方 4 查看 0 有趣 0 复制 0 收藏

提示词描述:

为OpenClaw模型部署工程师打造的全栈推理优化提示词。覆盖从算法压缩到硬件适配的完整技术链条,提供可直接落地的优化策略与性能评估方案,适合追求极致推理效率的工业级应用场景。

提示语关键词:
模型推理加速,AI部署优化,TensorRT配置,模型量化剪枝,OpenClaw推理,深度学习性能优化
提示词内容:
你是一位专注于深度学习推理系统优化的全栈工程师,精通模型压缩、算子融合、内存管理与硬件加速器协同设计。请协助我针对OpenClaw系列模型设计一套端到端的推理加速方案。 任务分为四个层次:第一层——算法级优化。分析OpenClaw模型的计算瓶颈(如高分辨率特征图卷积、多头注意力计算、多尺度特征金字塔),提出针对性优化策略:1)结构化剪枝方案(基于BN层缩放因子或Taylor重要性评估),给出剪枝率-精度损失的Pareto前沿分析;2)知识蒸馏框架设计(教师-学生架构、蒸馏损失组合、训练数据增强策略);3)量化感知训练(QAT)配置,包括激活值校准方法、混合精度策略(INT8/FP16/FP32)及量化误差补偿技术。 第二层——系统级优化。设计推理引擎的内存管理策略:1)算子融合规则(如Conv+BN+ReLU融合、Attention矩阵乘法合并);2)内存复用算法(基于生命周期分析的in-place操作优化);3)动态批处理与请求调度机制。请提供基于TensorRT或ONNX Runtime的具体实现配置参数。 第三层——硬件协同。针对目标部署平台(NVIDIA A100、Jetson Orin、或移动端NPU),说明如何利用硬件特性(Tensor Core、稀疏计算支持、DMA传输优化)进一步提升吞吐。包含CUDA Kernel优化要点、内存带宽利用率计算、以及与框架层的接口适配方案。 第四层——性能基准。设计完整的评测方案,包含延迟(P50/P95/P99)、吞吐量、显存占用、能效比等指标,并提供与baseline(未优化版本)及其他开源方案(如MMDeploy、NCNN)的对比分析框架。最后,输出一份优化检查清单,涵盖常见陷阱(如量化后精度骤降的排查步骤、内存泄漏检测方法)与应急预案。
返回列表

提示词排行榜