工程岗

边缘AI工程师

端侧AI模型部署、模型压缩量化、嵌入式推理与物联网智能

参考薪资 20-40K
200知识点
69学时
27720积分
24工具
开始学习
CHAPTER 01

岗位说明

端侧AI模型部署、模型压缩量化、嵌入式推理与物联网智能

本课程路径为【边缘AI工程师】量身设计,聚焦工程系统与基础设施方向。 岗位描述:端侧AI模型部署、模型压缩量化、嵌入式推理与物联网智能。 学习路径分3个阶段递进:AI核心理论(58个知识点,涵盖深度学习) → 工程系统(128个知识点,涵盖AI工程化、AI硬件与算力、AI编译器与系统软件) → 实践应用(14个知识点,涵盖物联网与边缘智能)。 参考薪资:20-40K。需要掌握24个工具。 建议按顺序学习,基础阶段(了解级)快速建立概念框架,核心阶段(理解级)深入掌握关键技术,实践阶段(熟练级)达到工程应用能力。

岗位分类
工程岗
参考薪资
20-40K(月·一线城市参考)
学习规模
200 个知识点 · 约 69 学时 · 24 个工具
已上线课程
201 节可直接学习
CHAPTER 02

现状与前景

端侧AI是最大规模的AI部署场景。从手机到汽车,从智能家居到工业传感器,数以亿计的设备需要本地运行AI模型。学习边缘AI意味着掌握模型压缩、量化和嵌入式部署,这些技能在IoT和移动端无处不在。

CHAPTER 03

招聘数据

薪资区间

20-40K

数据来源于主流招聘平台 AI 岗位统计,一线城市 3-5 年经验参考。

岗位竞争力和成长

完成全部 200 节课程并通过面试题测试,可获得 27720 成长积分,覆盖该岗位 24 个核心工具与全部技能要求。

CHAPTER 04

能力雷达图

深度学习硬件算力AI工程化AI编译器物联网边缘
深度学习 100
硬件算力 91
AI工程化 68
AI编译器 47
物联网边缘 30
CHAPTER 05

工具树(24)

本地推理 · 11
ONNX RuntimeMLXllama.cppOllamaLM StudioGPT4AllKoboldCpptext-generation-webuiSGLangLMDeployExLlamaV2
训练框架 · 1
基础设施 · 4
CHAPTER 06

项目树

端侧人脸识别

嵌入式设备上的离线人脸检测与识别系统,支持低功耗实时推理

智能摄像头AI

边缘摄像头端的视频分析AI,支持行为识别与异常检测

IoT设备推理

资源受限IoT设备上的轻量级模型部署与推理优化

移动端AI应用

手机端的AI推理SDK开发,支持拍照识别与实时滤镜

边缘网关AI

边缘计算网关的AI模型管理与推理调度平台

日常工作任务

  • 每日模型压缩与量化实验
  • 每日端侧部署调试与推理验证
  • 每日推理性能优化与延迟调优
  • 每周模型精度验证与对比分析
  • 按项目新硬件平台适配与验证
  • 按项目功耗优化与资源占用调优
  • 按季度边缘AI前沿技术调研
  • 按季度内部部署工具开发与维护

核心交付物

量化模型部署方案性能测试报告适配文档优化工具

协作对象

嵌入式工程师算法工程师硬件工程师产品经理测试工程师
CHAPTER 07

学习目录(可直达课程)

第1篇系统
系统1 节
  1. 了解 欢迎来到AIQZ.CC 6分钟
第2篇深度学习篇
神经网络基础7 节
  1. 浅读 感知机:神经网络的最小单元 22分钟 · 80分
  2. 浅读 激活函数选择指南:场景驱动的决策 15分钟 · 80分
  3. 浅读 伪标签方法:半监督学习的利器 17分钟 · 80分
  4. 浅读 梯度计算:深度学习的引擎核心 21分钟 · 80分
  5. 浅读 PyTorch自动求导背后到底发生了什么 17分钟 · 80分
  6. 浅读 ReLU死亡神经元问题与解决方案 18分钟 · 80分
  7. 浅读 对比损失:度量学习的核心 29分钟 · 80分
卷积神经网络CNN5 节
  1. 浅读 Dilated Conv技术 16分钟 · 80分
  2. 浅读 从LeNet到AlexNet的CNN发展史 17分钟 · 80分
  3. 浅读 DETR:端到端目标检测Transformer 21分钟 · 80分
  4. 浅读 FPN:特征金字塔网络 1分钟 · 80分
  5. 浅读 SegFormer语义分割的Transformer革新 17分钟 · 80分
循环神经网络RNN6 节
  1. 浅读 深度RNN:多层堆叠的序列建模利器 16分钟 · 80分
  2. 浅读 GRU简化门控:轻量级循环网络 18分钟 · 80分
  3. 浅读 双向LSTM:前后文双向建模利器 18分钟 · 80分
  4. 浅读 Bahdanau注意力:开创性的对齐机制 16分钟 · 80分
  5. 浅读 Attention必备:位置编码原理 18分钟 · 80分
  6. 理解 注意力可视化:直观理解模型在看什么 21分钟 · 120分
Transformer架构9 节
  1. 理解 注意力复杂度分析:O(n2)瓶颈与突破路径 24分钟 · 120分
  2. 理解 CatBoost:有序提升与类别特征 19分钟 · 120分
  3. 理解 参数初始化Xavier与Kaiming推导 20分钟 · 120分
  4. 理解 Transformer Decoder:生成过程的完整拆解 22分钟 · 120分
  5. 理解 位置编码消融实验:Naive方案的得与失 25分钟 · 120分
  6. 理解 ELECTRA:高效预训练方法 18分钟 · 120分
  7. 理解 MoE混合专家模型架构入门 22分钟 · 120分
  8. 理解 RetNet retention机制替代注意力 1分钟 · 120分
  9. 理解 Layer Normalization层归一化 22分钟 · 120分
图神经网络GNN5 节
  1. 理解 消息传递框架:GNN的统一计算范式 19分钟 · 120分
  2. 理解 图拉普拉斯特征映射:谱方法的经典之作 24分钟 · 120分
  3. 理解 图Transformer:注意力机制遇上图结构 14分钟 · 120分
  4. 理解 子图表示学习:挖掘图的局部结构密码 22分钟 · 120分
  5. 理解 半监督节点分类:少标签也能学好 24分钟 · 120分
正则化与优化4 节
  1. 理解 Dropout原理解析:为什么随机丢弃有效 22分钟 · 120分
  2. 理解 WeightNorm权重归一化:比BN更轻量 18分钟 · 120分
  3. 理解 LAMB大批量优化:突破训练batch size限制 20分钟 · 120分
  4. 理解 Label Smoothing标签平滑训练技巧 21分钟 · 120分
生成模型6 节
  1. 理解 ELBO:变分下界基础 20分钟 · 120分
  2. 理解 CVAE深度解析:条件生成的数学之美 21分钟 · 120分
  3. 理解 GAN对抗训练:博弈中的生成艺术 17分钟 · 120分
  4. 理解 Glow标准化流:可逆生成模型 22分钟 · 120分
  5. 理解 连续标准化流:用ODE定义可逆变换 15分钟 · 120分
  6. 理解 分数匹配详解:从噪声估计到扩散模型训练 19分钟 · 120分
JAX框架6 节
  1. 理解 JAX纯函数设计:函数式编程的基石 17分钟 · 120分
  2. 理解 JAX框架中XLA编译 20分钟 · 120分
  3. 理解 JAX性能基准测试:量化加速效果 20分钟 · 120分
  4. 理解 多GPU数据并行:JAX实战全流程 15分钟 · 120分
  5. 理解 Optax深度学习优化器库使用指南 15分钟 · 120分
  6. 理解 Flax携手HuggingFace:模型生态打通 20分钟 · 120分
对比学习与自监督学习2 节
  1. 理解 Barlow Twins:冗余消减自监督 25分钟 · 120分
  2. 理解 CLIP深入:多模态对比学习原理 24分钟 · 120分
元学习与小样本学习3 节
  1. 理解 MAML:学会学习的小样本学习通用框架 20分钟 · 120分
  2. 理解 半监督学习与少样本学习结合方法 23分钟 · 120分
  3. 理解 元学习赋能自动驾驶:小样本场景下的快速适应 23分钟 · 120分
AI编译与算子优化4 节
  1. 理解 MLC-LLM编译优化:TVM驱动的端侧推理 24分钟 · 120分
  2. 理解 BLOCK_SIZE与num_warps:Triton调优 22分钟 · 120分
  3. 理解 Triton持久化Kernel设计原理 17分钟 · 120分
  4. 理解 AutoTune调优记录:持久化与迁移 18分钟 · 120分
第3篇数学与统计基础篇
数字信号处理基础1 节
  1. 浅读 卷积:信号处理的万能操作 17分钟 · 80分
第4篇计算机基础篇
软件工程方法论2 节
  1. 理解 CQRS模式读写分离架构设计 22分钟 · 120分
  2. 理解 代码审查最佳实践与流程 22分钟 · 120分
编译原理基础1 节
  1. 精通 编译器死代码消除优化原理 26分钟 · 180分
第5篇AI工程化篇
软件工程实践3 节
  1. 理解 测了多少才算够:代码覆盖率 20分钟 · 120分
  2. 理解 测试驱动开发TDD实战 21分钟 · 120分
  3. 理解 技术文档规范与标准制定 22分钟 · 120分
DevOps与容器化6 节
  1. 理解 Dockerfile最佳实践:镜像优化 15分钟 · 120分
  2. 理解 容器资源限制与管理实战 26分钟 · 120分
  3. 理解 K8s GPU调度插件:容器算力编排 22分钟 · 120分
  4. 理解 ArgoCD持续部署:GitOps实践 21分钟 · 120分
  5. 理解 K3s轻量Kubernetes:边缘与IoT部署实战 19分钟 · 120分
  6. 理解 DevOps实践中的SLO与SLI监控告警体系 19分钟 · 120分
MLOps工程6 节
  1. 理解 MLflow Model Registry:模型版本与生命周期管理 10分钟 · 120分
  2. 理解 超参数追踪:让每次实验都可复现 21分钟 · 120分
  3. 理解 MLflow vs W&B:实验追踪工具选型指南 21分钟 · 120分
  4. 理解 模型A/B部署的工程化实现方案 28分钟 · 120分
  5. 理解 流量分桶:A/B测试的流量分配基础 21分钟 · 120分
  6. 理解 实验指标定义:衡量实验成败的标尺 21分钟 · 120分
AI系统架构5 节
  1. 理解 gRPC与REST:服务通信协议深度对比 21分钟 · 120分
  2. 理解 CQRS模式:事件驱动架构实践 23分钟 · 120分
  3. 理解 多级缓存:构建高性能数据访问体系 22分钟 · 120分
  4. 理解 缓存压缩:用CPU换内存的优化艺术 21分钟 · 120分
  5. 理解 消息确认与重试:确保消息不丢失 18分钟 · 120分
模型监控与漂移检测2 节
  1. 理解 漂移窗口选择:平衡灵敏度与稳定性 24分钟 · 120分
  2. 理解 告警阈值设计:精准把握告警边界 15分钟 · 120分
AI系统可观测性3 节
  1. 理解 GPU利用率优化:显存管理实战 18分钟 · 120分
  2. 理解 日志聚合Elasticsearch与Loki实战 14分钟 · 120分
  3. 理解 Runbook自动化运维与SLO告警体系 19分钟 · 120分
API设计与AI服务2 节
  1. 理解 API文档:OpenAPI/Swagger规范 24分钟 · 120分
  2. 理解 认证与授权:API安全的第一道门 15分钟 · 120分
AI测试与质量保证4 节
  1. 理解 模型行为测试:不变性验证 20分钟 · 120分
  2. 理解 数据标注质量评估与Kappa一致性计算 19分钟 · 120分
  3. 理解 数据质量门控与准入测试实战 20分钟 · 120分
  4. 理解 混沌工程与故障注入测试实战 20分钟 · 120分
可观测性与监控4 节
  1. 理解 Prompt版本管理与AB实验效果追踪 25分钟 · 120分
  2. 理解 标签漂移Label Drift与KS检验 21分钟 · 120分
  3. 理解 漂移溯源:逐特征贡献度SHAP归因 24分钟 · 120分
  4. 理解 A/B测试显著性检验:t检验与贝叶斯方法 21分钟 · 120分
AgentOps与LLM运维4 节
  1. 理解 Agent回归测试:质量保障方法 22分钟 · 120分
  2. 理解 Helicone LLM API网关与可观测性 17分钟 · 120分
  3. 理解 ClearML:实验追踪与MLOps 12分钟 · 120分
  4. 理解 用RAGAS框架系统评估RAG系统质量 17分钟 · 120分
第6篇数据科学与数据工程篇
特征工程与特征平台1 节
  1. 理解 特征版本管理与生命周期 29分钟 · 120分
第7篇AI硬件与算力篇
AI芯片架构11 节
  1. 理解 GPU流多处理器SM架构 23分钟 · 120分
  2. 理解 GPU Warp调度:32线程怎么协同执行 19分钟 · 120分
  3. 理解 MXU矩阵单元:TPU脉动阵列的工作原理 18分钟 · 120分
  4. 理解 谷歌TPU v4到v6三代架构对比 19分钟 · 120分
  5. 理解 NPU编译技术:把模型搬到专用芯片上 18分钟 · 120分
  6. 理解 NPU都用在哪里?六大典型应用场景 29分钟 · 120分
  7. 理解 LPU芯片的编程模型与开发入门 24分钟 · 120分
  8. 理解 寒武纪MLU370/590架构与性能 20分钟 · 120分
  9. 理解 AMD Instinct GPU:AI加速计算架构 22分钟 · 120分
  10. 理解 SambaNova SN40L架构解析:可重构数据流AI芯片 23分钟 · 120分
  11. 理解 存内计算架构原理与挑战 19分钟 · 120分
GPU编程与CUDA7 节
  1. 理解 CUDA __syncthreads屏障同步 21分钟 · 120分
  2. 理解 FP16/BF16/FP8:低精度训练 14分钟 · 120分
  3. 理解 cuDNN卷积加速:GPU深度学习底层优化 18分钟 · 120分
  4. 理解 cuBLAS矩阵内存布局与性能优化 17分钟 · 120分
  5. 理解 GPU占用率优化:CUDA性能调优实战 22分钟 · 120分
  6. 理解 ROCm MIOpen深度学习算子库怎么用 18分钟 · 120分
  7. 理解 OpenCL跨平台GPU计算标准入门指南 20分钟 · 120分
边缘AI计算6 节
  1. 理解 模型剪枝率选择策略与精度权衡方法 20分钟 · 120分
  2. 理解 NCNN与MNN端侧推理框架横评 15分钟 · 120分
  3. 理解 TFLite Micro在微控制器上跑AI模型 17分钟 · 120分
  4. 精通 iOS Core ML端侧AI模型部署实战指南 29分钟 · 180分
  5. 精通 移动端隐私推理方案 28分钟 · 180分
  6. 精通 Edge TPU:边缘推理限制与优化 20分钟 · 180分
算力集群与调度5 节
  1. 精通 InfiniBand高速网络互联技术 20分钟 · 180分
  2. 精通 存储与网络分离架构 20分钟 · 180分
  3. 精通 GPU集群抢占式调度 26分钟 · 180分
  4. 精通 DCN网络拥塞控制 25分钟 · 180分
  5. 精通 并行文件系统Lustre/GPFS实战 25分钟 · 180分
能效与绿色AI5 节
  1. 精通 推理功耗优化方法 26分钟 · 180分
  2. 精通 训练碳排估算方法 25分钟 · 180分
  3. 精通 混合精度训练原理与实战 22分钟 · 180分
  4. 精通 训练中断恢复机制 22分钟 · 180分
  5. 精通 能效对比分析方法 24分钟 · 180分
国产AI芯片生态3 节
  1. 精通 华为MindSpore全场景AI框架 20分钟 · 180分
  2. 精通 燧原TopsRider软件开发工具链 29分钟 · 180分
  3. 精通 国产AI芯片生态建设:社区发展与生态构建策略 25分钟 · 180分
硬件仿真与验证2 节
  1. 精通 等价性检查LEC:硬件验证核心技术 25分钟 · 180分
  2. 精通 约束随机激励生成:UVM验证方法学实践 22分钟 · 180分
先进封装与Chiplet2 节
  1. 精通 UCIe标准:Chiplet互联统一协议 22分钟 · 180分
  2. 精通 CXL互连协议:高速缓存一致性 22分钟 · 180分
AI芯片性能基准与评测3 节
  1. 精通 Stable Diffusion推理性能基准测试 23分钟 · 180分
  2. 精通 HBM3 vs HBM3e:AI芯片内存带宽全面对比 17分钟 · 180分
  3. 精通 数据中心PUE能效指标:评测方法与优化策略 17分钟 · 180分
AI芯片散热与冷却系统2 节
  1. 精通 直接芯片液冷D2C技术:高效散热技术实践方案 26分钟 · 180分
  2. 精通 数据中心PUE散热评估:散热系统效率评测与优化 22分钟 · 180分
AI芯片供应链与制造工艺4 节
  1. 精通 台积电3nm与2nm工艺:先进制程技术 20分钟 · 180分
  2. 精通 英特尔18A与20A工艺:先进制程竞争分析 25分钟 · 180分
  3. 精通 硅中介层技术:2.5D封装关键工艺 30分钟 · 180分
  4. 精通 地缘政治与AI产业:供应链安全与发展趋势 20分钟 · 180分
第8篇AI应用领域篇
计算机视觉CV1 节
  1. 理解 知识蒸馏模型压缩入门 23分钟 · 120分
第9篇AI编译器与系统软件篇
AI编译器基础6 节
  1. 精通 图序列化与反序列化:计算图存储与恢复机制 23分钟 · 180分
  2. 精通 SambaNova可重构数据流架构与计算图映射 29分钟 · 180分
  3. 精通 算子融合规则定义:融合策略设计与实践 1分钟 · 180分
  4. 精通 AI编译器内存池技术:减少分配开销的利器 20分钟 · 180分
  5. 精通 自动微分中的前向模式原理与实现 26分钟 · 180分
  6. 精通 高阶导数计算方法:自动微分进阶技术 24分钟 · 180分
TVM编译框架5 节
  1. 精通 TVM图优化技术:RELAY IR优化方法 22分钟 · 180分
  2. 精通 TVM代价模型:自动调优背后的预测器 23分钟 · 180分
  3. 精通 进化搜索Evolution Search:Ansor自动调优算法 22分钟 · 180分
  4. 精通 MicroTVM微模型部署:边缘设备推理优化技术 19分钟 · 180分
  5. 精通 TVM调优数据库:自动调优数据持久化管理 18分钟 · 180分
MLIR多级中间表示5 节
  1. 精通 MLIR标准方言:内置操作与类型系统 20分钟 · 180分
  2. 精通 MLIR Pass流水线管理 19分钟 · 180分
  3. 精通 MLIR Pass调试与性能分析方法 19分钟 · 180分
  4. 精通 StableHLO与MHLO编译中间表示对比 19分钟 · 180分
  5. 精通 Torch-MLIR如何把PyTorch图编译为MLIR 19分钟 · 180分
XLA与PyTorch编译5 节
  1. 精通 XLA如何生成高效代码:编译流程 26分钟 · 180分
  2. 精通 PyTorch XLA编译流程与调试技巧 23分钟 · 180分
  3. 精通 TorchDynamo图重建技术:动态图重建的工作原理 22分钟 · 180分
  4. 精通 torch.compile调试模式:编译过程诊断技术 24分钟 · 180分
  5. 精通 XLA图优化:代数简化让计算图更高效 26分钟 · 180分
AI Runtime系统6 节
  1. 精通 ONNX Runtime图优化:推理引擎优化技术 24分钟 · 180分
  2. 精通 ONNX Runtime Training:不只是推理引擎 18分钟 · 180分
  3. 精通 TensorRT引擎构建:推理引擎的生成流程 23分钟 · 180分
  4. 精通 TensorRT层融合Layer Fusion:推理优化与加速技术 22分钟 · 180分
  5. 精通 DirectML:跨平台AI执行 28分钟 · 180分
  6. 精通 异构计算设备亲和性:调度优化技术方案 20分钟 · 180分
模型格式与序列化7 节
  1. 精通 ONNX Opset算子集:模型兼容性的关键 23分钟 · 180分
  2. 精通 ONNX Runtime执行机制:图优化与EP加速 11分钟 · 180分
  3. 精通 GGUF量化格式Q4与Q8:大模型量化存储方案 18分钟 · 180分
  4. 精通 Safetensors大文件处理:模型存储优化技术 24分钟 · 180分
  5. 精通 一文搞懂PyTorch模型导出为ONNX格式 17分钟 · 180分
  6. 精通 模型格式转换工具对比:格式转换方案选型分析 22分钟 · 180分
  7. 精通 量化感知微调QAT:量化后精度恢复方法 20分钟 · 180分
第10篇物联网与边缘智能
物联网架构与协议4 节
  1. 理解 OPC UA工业协议:从车间到云的数据通道 24分钟 · 120分
  2. 理解 深入理解设备影子与状态同步 21分钟 · 120分
  3. 理解 ThingsBoard实战:搭建你的开源物联网平台 25分钟 · 120分
  4. 理解 多传感器融合(卡尔曼滤波)完全指南 20分钟 · 120分
边缘AI推理4 节
  1. 精通 NCNN、MNN、TNN三大端侧推理框架对比 26分钟 · 180分
  2. 精通 NVIDIA Jetson平台:边缘AI开发的全家桶 24分钟 · 180分
  3. 精通 ESP32+TinyML:边缘AI微控制器 23分钟 · 180分
  4. 精通 深入理解边缘缓存与预加载 22分钟 · 180分
数字孪生与工业IoT4 节
  1. 精通 数字孪生中的3D建模与可视化技术实践 23分钟 · 180分
  2. 精通 深入理解城市级数字孪生 18分钟 · 180分
  3. 精通 OPC UA:工业互联的统一通信标准 22分钟 · 180分
  4. 精通 深入理解智慧交通IoT 19分钟 · 180分
IoT安全与AI+IoT前沿2 节
  1. 精通 IoT设备安全:威胁分析与攻击面防护 23分钟 · 180分
  2. 精通 星链+物联网:天地一体化AI应用 20分钟 · 180分
AIQZ.CC · 边缘AI工程师岗位说明书 · 返回星图选择岗位 · 2026