工程岗

AI测试工程师

AI系统测试、模型评估、质量保证与自动化测试

参考薪资 15-28K
220知识点
87学时
26960积分
27工具
开始学习
CHAPTER 01

岗位说明

AI系统测试、模型评估、质量保证与自动化测试

本课程路径为【AI测试工程师】量身设计,聚焦工程系统与基础设施方向。 岗位描述:AI系统测试、模型评估、质量保证与自动化测试。 学习路径分3个阶段递进:大模型应用(78个知识点,涵盖AI应用开发) → 数据可信(58个知识点,涵盖AI安全伦理与合规) → 工程系统(84个知识点,涵盖AI工程化、AI评测与基准测试)。 参考薪资:15-28K。需要掌握27个工具。 建议按顺序学习,基础阶段(了解级)快速建立概念框架,核心阶段(理解级)深入掌握关键技术,实践阶段(熟练级)达到工程应用能力。

岗位分类
工程岗
参考薪资
15-28K(月·一线城市参考)
学习规模
220 个知识点 · 约 87 学时 · 27 个工具
已上线课程
268 节可直接学习
CHAPTER 02

现状与前景

AI系统测试是全新的挑战。传统测试关注功能正确性,AI测试还需评估模型性能、数据偏移和对抗鲁棒性。随着AI法规落地,AI系统的质量和安全审计将成为强制要求,这个方向的职业前景非常稳定。

CHAPTER 03

招聘数据

薪资区间

15-28K

数据来源于主流招聘平台 AI 岗位统计,一线城市 3-5 年经验参考。

岗位竞争力和成长

完成全部 220 节课程并通过面试题测试,可获得 26960 成长积分,覆盖该岗位 27 个核心工具与全部技能要求。

CHAPTER 04

能力雷达图

AI开发安全合规AI工程化AI评测
AI开发 100
安全合规 72
AI工程化 62
AI评测 32
CHAPTER 05

工具树(27)

评估工具 · 6
DeepEvalRAGASTruLensOpenAI EvalsLM Eval HarnessBigCode Eval
AI安全 · 4
可观测性 · 9
AI代码审查 · 4
QodoCodeRabbitSnyk CodePR-Agent
AI提示词管理 · 1
Promptfoo
Agent框架 · 1
GitHub Copilot Agent Mode
其他 · 2
gpt_4_1_minio3_mini
CHAPTER 06

项目树

模型评测平台

统一的AI模型评测与基准测试平台,支持多维度自动化评测

自动化测试框架

面向AI应用的端到端自动化测试框架,覆盖接口与UI测试

AI安全测试

对抗样本、Prompt注入与越狱攻击的自动化安全测试方案

性能压测系统

AI推理服务的高并发压力测试与性能瓶颈分析工具

质量监控看板

线上AI服务质量的实时监控与告警可视化看板

日常工作任务

  • 每日测试用例编写与维护
  • 每日自动化测试执行与结果分析
  • 每日模型效果评测与基准对比
  • 每日缺陷跟踪与回归验证
  • 每周测试报告编写与质量分析
  • 按项目测试框架开发与工具建设
  • 按项目性能压测与瓶颈分析
  • 按季度质量复盘与流程改进

核心交付物

测试用例集自动化测试脚本评测报告缺陷报告质量看板

协作对象

算法工程师后端工程师产品经理运维工程师开发工程师
CHAPTER 07

学习目录(可直达课程)

第1篇系统
系统1 节
  1. 了解 欢迎来到AIQZ.CC 6分钟
第2篇AI应用开发篇
Prompt工程14 节
  1. 浅读 零样本提示技术原理与应用实践 19分钟 · 80分
  2. 浅读 角色扮演Prompt设计方法 20分钟 · 80分
  3. 浅读 微软Phi系列小模型如何以小博大 20分钟 · 80分
  4. 浅读 词向量评估内在与外在 21分钟 · 80分
  5. 浅读 Context Engineering:上下文工程方法 20分钟 · 80分
  6. 浅读 文心一言大模型 20分钟 · 80分
  7. 浅读 星野AI社交产品 18分钟 · 80分
  8. 浅读 GLM-5:智谱旗舰模型实战指南 16分钟 · 80分
  9. 浅读 Mistral Le Chat对话平台体验 18分钟 · 80分
  10. 浅读 自一致性投票策略让大模型推理更可靠 17分钟 · 80分
  11. 浅读 Prompt变量插值:模板动态化技巧 23分钟 · 80分
  12. 浅读 Prompt提示词库构建与复用策略 18分钟 · 80分
  13. 浅读 大模型Prompt注入防御实战指南 20分钟 · 80分
  14. 浅读 Prompt输入过滤清洗方案 17分钟 · 80分
RAG检索增强生成10 节
  1. 浅读 RAG系统Markdown解析技巧 16分钟 · 80分
  2. 浅读 Chunk大小与重叠:RAG文档处理调优 18分钟 · 80分
  3. 浅读 向量与关键词混合检索 18分钟 · 80分
  4. 浅读 多向量索引技术 17分钟 · 80分
  5. 浅读 BM25与TF-IDF稀疏检索 18分钟 · 80分
  6. 浅读 AutoRAG:自动化RAG框架 21分钟 · 80分
  7. 浅读 Cross-Encoder重排:检索精度提升 19分钟 · 80分
  8. 浅读 重排模型选型:Cross-Encoder对比 21分钟 · 80分
  9. 浅读 CRAG纠错:RAG检索质量保障 15分钟 · 80分
  10. 浅读 GraphRAG检索增强:图谱向量融合 19分钟 · 80分
AI Agent22 节
  1. 浅读 Plan-and-Execute:Agent规划执行架构 23分钟 · 80分
  2. 浅读 短期长期向量三类记忆:Agent记忆全景 20分钟 · 80分
  3. 浅读 Agent Human-in-the-Loop:人机协作架构 19分钟 · 80分
  4. 浅读 MCP生态盘点:3000+开源Server能做什么 17分钟 · 80分
  5. 浅读 Rasa开源对话系统架构与开发实战 16分钟 · 80分
  6. 浅读 Fathom AI:会议记录助手 16分钟 · 80分
  7. 浅读 DeepL AI:智能翻译服务 18分钟 · 80分
  8. 理解 网易七鱼AI客服:智能客服的工业级方案 23分钟 · 120分
  9. 理解 Gmail AI助手:邮件Agent架构 18分钟 · 120分
  10. 理解 Agent Memory:三层记忆系统设计 26分钟 · 120分
  11. 理解 工具调用错误处理:Agent的兜底哲学 22分钟 · 120分
  12. 理解 工具权限控制:给Agent上把安全锁 18分钟 · 120分
  13. 理解 Claude Computer Use:桌面GUI自动化 20分钟 · 120分
  14. 理解 Dia:AI原生浏览器 26分钟 · 120分
  15. 理解 多Agent系统共识机制:让AI智能体达成一致 20分钟 · 120分
  16. 理解 多Agent通信协议:协作的通用语言 31分钟 · 120分
  17. 理解 LangChain大模型应用开发框架入门 11分钟 · 120分
  18. 理解 AutoGen多Agent:协作框架使用 23分钟 · 120分
  19. 理解 Google ADK:Agent开发套件实战 17分钟 · 120分
  20. 理解 通义Qwen-Agent框架快速搭建智能体应用 15分钟 · 120分
  21. 理解 MCP Client:Agent侧的协议客户端开发 22分钟 · 120分
  22. 理解 MCP vs Function Calling:工具调用该选谁 23分钟 · 120分
LLM应用工程16 节
  1. 理解 缓存层:LLM应用的省钱利器 22分钟 · 120分
  2. 理解 Sentinel限流熔断:LLM服务的守护神 20分钟 · 120分
  3. 理解 大模型统一网关的架构设计实践 25分钟 · 120分
  4. 理解 Dify开源:LLM应用架构 14分钟 · 120分
  5. 理解 Zapier AI自动化集成方案与架构 19分钟 · 120分
  6. 理解 Notion AI写作助手:产品架构与实现 15分钟 · 120分
  7. 理解 Gamma AI演示文稿:智能PPT生成 18分钟 · 120分
  8. 理解 WPS AI解析:金山办公怎么把大模型塞文档 18分钟 · 120分
  9. 理解 Taskade AI驱动的任务管理工具 20分钟 · 120分
  10. 理解 QuillBot如何用AI做智能改写与润色 14分钟 · 120分
  11. 理解 GPTZero:识别AI生成文本的利器 18分钟 · 120分
  12. 理解 LLM流式输出的前端渲染技术与优化 18分钟 · 120分
  13. 理解 流式中断处理:用户喊停的优雅退出 21分钟 · 120分
  14. 理解 成本估算与预算:LLM花钱要有计划 21分钟 · 120分
  15. 理解 日志分析:LLM运维的福尔摩斯 22分钟 · 120分
  16. 理解 灰度与A/B测试:LLM上线的科学决策 22分钟 · 120分
AI工程化范式演进5 节
  1. 理解 系统提示与角色约束:给LLM立规矩 18分钟 · 120分
  2. 理解 Context Compaction:上下文压缩 21分钟 · 120分
  3. 理解 AI系统编排与调度:Harness工程实战 25分钟 · 120分
  4. 理解 自动循环系统:LLM自己跑起来的引擎 18分钟 · 120分
  5. 理解 生产级Loop系统:能扛流量的循环架构 1分钟 · 120分
AI编程辅助与Vibe Coding7 节
  1. 理解 Aider:AI结对编程工具 15分钟 · 120分
  2. 理解 CodeGeeX:国产AI编程助手 15分钟 · 120分
  3. 理解 PearAI开源AI代码编辑器体验 17分钟 · 120分
  4. 理解 Sentry AI自动分析代码错误根因 21分钟 · 120分
  5. 理解 Replit Agent实现全自动AI编程开发 14分钟 · 120分
  6. 理解 A1111 WebUI:Stable Diffusion界面 9分钟 · 120分
  7. 理解 Sweep AI自动生成代码提交PR 15分钟 · 120分
AI深度研究与知识发现4 节
  1. 理解 Gemini Deep Research:AI深度研究 14分钟 · 120分
  2. 理解 Elicit AI:文献检索与研究 13分钟 · 120分
  3. 理解 AI同行评审:用AI辅助学术论文审稿 19分钟 · 120分
  4. 理解 知识图谱融合对齐实战 24分钟 · 120分
第3篇AI安全伦理与合规篇
对抗攻防10 节
  1. 浅读 C&W攻击:对抗样本生成方法 19分钟 · 80分
  2. 浅读 通用对抗扰动UAP攻击原理 17分钟 · 80分
  3. 浅读 MemGPT分层记忆架构与Letta实践 19分钟 · 80分
  4. 浅读 Meta Prompt Guard提示词安全防护 15分钟 · 80分
  5. 浅读 Free与FAST AT:高效对抗训练 13分钟 · 80分
  6. 浅读 对抗训练鲁棒过拟合 19分钟 · 80分
  7. 浅读 CROWN-IBP:认证鲁棒性防御 19分钟 · 80分
  8. 浅读 认证半径计算方法 19分钟 · 80分
  9. 浅读 对抗Patch贴片设计 24分钟 · 80分
  10. 精通 对抗鲁棒性评估方法 24分钟 · 180分
模型安全7 节
  1. 浅读 查询预算防护机制 21分钟 · 80分
  2. 浅读 API保护策略:防止模型提取攻击 18分钟 · 80分
  3. 浅读 数据审计方法 22分钟 · 80分
  4. 浅读 投毒鲁棒训练方法 24分钟 · 80分
  5. 浅读 BadNet后门攻击:原理与防御方案 19分钟 · 80分
  6. 浅读 模型指纹技术 20分钟 · 80分
  7. 浅读 水印攻防博弈分析 20分钟 · 80分
隐私保护技术5 节
  1. 浅读 隐私预算eps/delta 17分钟 · 80分
  2. 浅读 联邦学习拜占庭容错机制 20分钟 · 80分
  3. 理解 成员推断攻击MIA的原理与防御策略 19分钟 · 120分
  4. 理解 成员推断防御策略全览 23分钟 · 120分
  5. 理解 MIA评估指标AUC与TPR 22分钟 · 120分
AI红队测试6 节
  1. 理解 AI安全影响评估方法 25分钟 · 120分
  2. 理解 AI红队成熟度评估模型 22分钟 · 120分
  3. 理解 LLM直接注入攻击实战 21分钟 · 120分
  4. 理解 LLM越狱技术全览 20分钟 · 120分
  5. 理解 角色扮演越狱技术 22分钟 · 120分
  6. 理解 AI红队覆盖率评估方法 25分钟 · 120分
AI法规与合规7 节
  1. 理解 EU AI Act禁止类AI应用 26分钟 · 120分
  2. 理解 EU AI Act合规义务时间表 21分钟 · 120分
  3. 理解 算法备案制度解读 23分钟 · 120分
  4. 理解 AI安全评估标准解读 21分钟 · 120分
  5. 理解 NIST AI RMF中Map映射机制 28分钟 · 120分
  6. 理解 算法备案流程实操指南 21分钟 · 120分
  7. 理解 算法影响评估AIA 22分钟 · 120分
AI伦理与社会影响6 节
  1. 理解 AI去偏见方法全览:算法公平性实战 23分钟 · 120分
  2. 理解 算法公平性评估指标:怎么量化公不公平 21分钟 · 120分
  3. 理解 企业AI治理框架:合规与风险管控 20分钟 · 120分
  4. 理解 AI加剧的数字鸿沟 23分钟 · 120分
  5. 理解 AI对劳动市场影响:哪些岗位会消失或新生 18分钟 · 120分
  6. 理解 全球AI治理中美欧模式对比 22分钟 · 120分
提示词安全与越狱攻防5 节
  1. 理解 直接Prompt注入指令覆盖 21分钟 · 120分
  2. 理解 Prompt注入:MCP工具凭证窃取攻防 14分钟 · 120分
  3. 理解 SmoothLLM投票防御对抗扰动攻击 14分钟 · 120分
  4. 理解 RLHF对齐如何抵御越狱攻击 21分钟 · 120分
  5. 理解 连续自动化红队CRT实战 22分钟 · 120分
AI内容安全与审核4 节
  1. 理解 BERT与LLM文本分类审核实践 25分钟 · 120分
  2. 理解 涉黄涉暴涉政图像检测实战 28分钟 · 120分
  3. 理解 审核置信度与人工复审闭环 18分钟 · 120分
  4. 理解 延迟敏感场景的审核架构 19分钟 · 120分
AI治理与法规合规4 节
  1. 理解 AI风险分级:不可接受至最低四级 22分钟 · 120分
  2. 理解 AI伦理四大原则:公平透明与隐私保护 19分钟 · 120分
  3. 理解 AI伦理培训怎么做:提升团队素养指南 22分钟 · 120分
  4. 理解 AI红队测试主动发现模型安全漏洞 23分钟 · 120分
AI可解释性与机制解释5 节
  1. 理解 Grad-CAM:注意力热力图可视化 22分钟 · 120分
  2. 理解 机制解释性:定义与核心目标 23分钟 · 120分
  3. 理解 神经网络特征可视化技术 24分钟 · 120分
  4. 理解 表征工程工程化操控模型内部表征 22分钟 · 120分
  5. 理解 AI对齐评估与安全审计 20分钟 · 120分
第4篇计算机基础篇
软件工程方法论1 节
  1. 理解 CQRS模式读写分离架构设计 22分钟 · 120分
第5篇AI工程化篇
软件工程实践5 节
  1. 理解 团队代码规范怎么定:从混乱到统一 22分钟 · 120分
  2. 理解 重构方法论与实战手法大全 24分钟 · 120分
  3. 理解 性能测试核心方法与实践 21分钟 · 120分
  4. 理解 技术文档写作核心指南 18分钟 · 120分
  5. 理解 Jira与Confluence团队协作工具实战指南 20分钟 · 120分
DevOps与容器化7 节
  1. 理解 Docker多阶段构建实战优化 17分钟 · 120分
  2. 理解 容器资源限制与管理实战 26分钟 · 120分
  3. 理解 K8s Ingress与NetworkPolicy策略 20分钟 · 120分
  4. 理解 ArgoCD:GitOps持续部署 9分钟 · 120分
  5. 理解 CircleCI:持续集成平台 20分钟 · 120分
  6. 理解 Chef/Puppet:配置管理工具 23分钟 · 120分
  7. 理解 SLO/SLI/SLA三要素在DevOps中的落地实践 20分钟 · 120分
MLOps工程8 节
  1. 理解 模型卡Model Card编写指南 23分钟 · 120分
  2. 理解 实验元数据:机器学习实验的数字档案 19分钟 · 120分
  3. 理解 指标记录与对比的一体化实践 20分钟 · 120分
  4. 理解 模型AB部署:用分流验证模型价值 22分钟 · 120分
  5. 理解 推理延迟优化:让AI响应快如闪电 21分钟 · 120分
  6. 理解 数据快照管理的工程化实践 20分钟 · 120分
  7. 理解 贝叶斯A/B:用概率思维优化实验 19分钟 · 120分
  8. 理解 实验指标定义:衡量实验成败的标尺 21分钟 · 120分
AI系统架构5 节
  1. 理解 消息队列Kafka:高吞吐事件流引擎 17分钟 · 120分
  2. 理解 消息可靠投递:不丢消息的工程保证 20分钟 · 120分
  3. 理解 多级缓存设计:从架构到落地的完整方案 17分钟 · 120分
  4. 理解 延迟队列:精准控制任务执行时机 21分钟 · 120分
  5. 理解 幂等性保证:让重复操作安全无害 18分钟 · 120分
模型监控与漂移检测2 节
  1. 理解 自动化漂移告警:让系统自己发现问题 23分钟 · 120分
  2. 理解 模型退役策略:优雅告别旧模型 18分钟 · 120分
AI系统可观测性3 节
  1. 理解 推理延迟P50/P95/P99:读懂性能分布 19分钟 · 120分
  2. 理解 Jaeger分布式追踪:微服务链路监控实践 18分钟 · 120分
  3. 理解 一文搞懂SLI、SLO、SLA的定义与关系 24分钟 · 120分
API设计与AI服务3 节
  1. 理解 RESTful API设计规范与最佳实践 15分钟 · 120分
  2. 理解 Server-Sent Events流式推送规范 17分钟 · 120分
  3. 理解 认证与授权:API安全的第一道门 15分钟 · 120分
AI测试与质量保证5 节
  1. 理解 模型压力测试与并发推理评估 1分钟 · 120分
  2. 理解 测试自动化框架与用例管理体系 26分钟 · 120分
  3. 理解 时间序列数据时序泄漏检测实战 26分钟 · 120分
  4. 理解 影子测试并行验证模型效果的方法 20分钟 · 120分
  5. 理解 测试左移与开发阶段质量门禁实战 21分钟 · 120分
可观测性与监控4 节
  1. 理解 用户反馈Thumbs Up/Down收集与关联 21分钟 · 120分
  2. 理解 标签漂移Label Drift与KS检验 21分钟 · 120分
  3. 精通 漂移告警阈值设定与误报抑制实战 20分钟 · 180分
  4. 精通 推荐系统NDCG/CTR/转化率监控 26分钟 · 180分
AgentOps与LLM运维5 节
  1. 精通 AgentOps vs MLOps vs LLMOps:运维对比 25分钟 · 180分
  2. 精通 Agent回滚策略:版本管理方案 25分钟 · 180分
  3. 精通 W&B Prompts:LLM应用可观测性调试工具 14分钟 · 180分
  4. 精通 PostHog:开源产品分析与LLM可观测性 12分钟 · 180分
  5. 精通 用RAGAS框架系统评估RAG系统质量 18分钟 · 180分
第6篇编程语言与开发工具篇
服务端语言(Go/Java)47 节
  1. 理解 微服务熔断降级:给系统装上保险丝 21分钟 · 120分
  2. 了解 Go语言goroutine与channel并发编程 17分钟 · 5分
  3. 了解 Go select语句:优雅处理多路channel 10分钟 · 5分
  4. 了解 Go context:并发任务的统一控制台 14分钟 · 5分
  5. 了解 Go并发模式:把goroutine用出花样 18分钟 · 5分
  6. 了解 Go性能调优:让并发程序又快又稳 22分钟 · 5分
  7. 了解 深入Go GMP调度器模型原理 15分钟 · 5分
  8. 了解 Go channel:有缓冲和无缓冲差在哪 16分钟 · 5分
  9. 了解 Go select多路复用:同时盯住多个channel 16分钟 · 5分
  10. 了解 Go context取消与超时:别让goroutine乱跑 14分钟 · 5分
  11. 了解 Go sync包:Mutex与WaitGroup 17分钟 · 5分
  12. 了解 Worker Pool与Fan-in/Fan-out模式 14分钟 · 5分
  13. 了解 Go pprof性能分析工具实战 16分钟 · 5分
  14. 了解 JVM虚拟机原理:内存模型与执行引擎 15分钟 · 5分
  15. 了解 Spring Boot微服务快速开发框架入门 14分钟 · 5分
  16. 了解 Java并发包JUC:并发编程的工具箱 16分钟 · 5分
  17. 了解 JVM GC调优:让垃圾回收更高效 14分钟 · 5分
  18. 了解 Java JIT编译:运行时让代码越跑越快 17分钟 · 5分
  19. 了解 JVM内存模型:堆栈方法区各管什么 16分钟 · 5分
  20. 了解 Spring Boot自动配置原理深度剖析 15分钟 · 5分
  21. 了解 Java并发编程:JUC核心AQS锁与线程池 14分钟 · 5分
  22. 了解 Java GC三剑客:G1/ZGC/Shenandoah 16分钟 · 5分
  23. 了解 Java JIT分层编译:C1和C2怎么配合 16分钟 · 5分
  24. 了解 Java类加载机制:双亲委派到底怎么用 18分钟 · 5分
  25. 了解 JVM调优实战:关键参数与GC优化配置 15分钟 · 5分
  26. 了解 gRPC微服务开发与治理实践指南 16分钟 · 5分
  27. 了解 API Gateway:微服务网关架构 18分钟 · 5分
  28. 了解 微服务服务发现:让服务能找到彼此 19分钟 · 5分
  29. 了解 微服务链路追踪:看清请求的完整路径 14分钟 · 5分
  30. 了解 gRPC服务定义与Protobuf协议 14分钟 · 5分
  31. 了解 API网关Kong/APISIX:微服务的统一入口 20分钟 · 5分
  32. 了解 服务发现Consul/Nacos:注册中心怎么选 20分钟 · 5分
  33. 了解 Go/Java微服务追踪:Jaeger与Zipkin对比 19分钟 · 5分
  34. 了解 熔断降级Hystrix/Sentinel:两款利器对比 13分钟 · 5分
  35. 了解 微服务配置中心:统一管理千变万化的配置 13分钟 · 5分
  36. 了解 服务网格Istio:把治理能力从代码里剥离 20分钟 · 5分
  37. 了解 Go/Java内存分析实战:定位性能瓶颈 13分钟 · 5分
  38. 了解 连接池基础:别让建连接拖垮性能 18分钟 · 5分
  39. 了解 异步IO基础:用更少线程扛更多并发 18分钟 · 5分
  40. 了解 批处理优化:把零散操作攒成一批 15分钟 · 5分
  41. 了解 pprof与async-profiler性能分析指南 14分钟 · 5分
  42. 了解 Go/Java内存泄漏排查指南:从定位到修复 19分钟 · 5分
  43. 了解 连接池调优进阶:参数怎么配才合理 16分钟 · 5分
  44. 了解 异步IO模型epoll/kqueue:高性能并发的底座 18分钟 · 5分
  45. 了解 批处理与流水线:让任务像流水线一样跑 18分钟 · 5分
  46. 了解 GC调优实战:从诊断到优化全流程 13分钟 · 5分
  47. 了解 火焰图分析:一眼看穿CPU时间花在哪 14分钟 · 5分
Python编程基础1 节
  1. 了解 性能profiling:揪出慢代码 16分钟 · 5分
第7篇AI评测与基准测试篇
LLM评测体系10 节
  1. 精通 MMLU学科覆盖范围:LLM评测体系设计方法 24分钟 · 180分
  2. 精通 MMLU-Redux:修复MMLU的数据质量问题 25分钟 · 180分
  3. 精通 Open LLM Leaderboard:开源大模型竞技场 26分钟 · 180分
  4. 精通 自定义算子Codegen:TVM/Triton/CUDA编程技术 7分钟 · 180分
  5. 精通 HumanEval+增强测试用例设计 22分钟 · 180分
  6. 精通 GSM8K答案抽取:推理结果评估技术 24分钟 · 180分
  7. 精通 GSM8K数学推理错误分析:模型推理缺陷诊断方法 20分钟 · 180分
  8. 精通 GPQA Diamond子集:最难推理题 30分钟 · 180分
  9. 精通 Arena Elo盲测流程:LLM竞技场评测体系 23分钟 · 180分
  10. 精通 Arena Hard:自动评测大模型 22分钟 · 180分
多模态模型评测4 节
  1. 精通 MMBench:多模态大模型的综合能力考场 23分钟 · 180分
  2. 精通 ImageNet图像分类:视觉模型评测基准 23分钟 · 180分
  3. 精通 DocVQA文档理解:多模态推理评测技术 18分钟 · 180分
  4. 精通 多模态幻觉评测:模型幻觉检测技术 24分钟 · 180分
模型能力维度评估6 节
  1. 精通 数学推理GSM8K与MATH:推理能力评测基准对比 19分钟 · 180分
  2. 精通 AI代码修复能力评测:从Bug到自动修复 24分钟 · 180分
  3. 精通 LiveCodeBench大模型代码能力评测 19分钟 · 180分
  4. 精通 奥数级推理评测:高难度数学推理评估 20分钟 · 180分
  5. 精通 数学推理自洽性:推理一致性评估方法 24分钟 · 180分
  6. 精通 故事生成评估:创意能力评测方法 23分钟 · 180分
RAG与Agent评测5 节
  1. 精通 RAG评估的三大核心要素 29分钟 · 180分
  2. 精通 如何科学设计RAG系统的对比实验 26分钟 · 180分
  3. 精通 SWE-bench Verified:高可信代码修复评测基准 20分钟 · 180分
  4. 精通 WebArena浏览器操作能力评测 24分钟 · 180分
  5. 精通 多工具编排能力评测方法 20分钟 · 180分
评测方法论5 节
  1. 精通 数据标注流程全解:从需求到交付 25分钟 · 180分
  2. 精通 AI评测设计最佳实践指南 28分钟 · 180分
  3. 精通 LLM评测中的偏差与校准:让AI裁判更靠谱 31分钟 · 180分
  4. 精通 评测数据泄露检测方法 23分钟 · 180分
  5. 精通 数据污染影响量化方法 19分钟 · 180分
AI安全测试3 节
  1. 精通 边界输入测试方法 20分钟 · 180分
  2. 精通 覆盖引导测试方法 23分钟 · 180分
  3. 精通 AI安全漏洞严重度评分体系 24分钟 · 180分
第8篇AI应用领域篇
视频理解与分析1 节
  1. 精通 长视频理解:让AI看懂一小时的视频 23分钟 · 180分
AIQZ.CC · AI测试工程师岗位说明书 · 返回星图选择岗位 · 2026