FDE能力矩阵
统一定义底层认知、AI Native、产品判断、工程底盘和FDE闭环能力的等级、证据与阶段门槛。
02|能力矩阵 V1.0
AI Native × AI产品经理 × FDE:从潜质到真实交付的能力地图
| **定位:**本文件是《FDE个人升级训练总纲》的执行层文档。后续训练、测评和复测必须以本文件定义的维度、证据与 Gate 为准,不靠聊天印象临时判断。 |
|---|
1. 这份矩阵解决什么问题
| 核心用途: 把“感觉你会/不会”改成“有哪类可观察证据、在什么条件下稳定做到、还需要多少提示”。矩阵不是简历评分表,而是训练与复测的控制面。 |
|---|
-
不把“没学过”误判成“能力差”;知识、能力、经验分别记录。
-
不根据过去项目或做事风格直接给能力结论;过去行为只用于设计测试和寻找假设。
-
任何能力结论必须有多样本证据,并包含迁移测试;单题只产生“观察”,不产生定性。
-
训练不是平均补齐。先找瓶颈能力,再决定训练强度;强项可快进,但 Gate 不跳过。
-
L4 不是“懂得多”,而是在高不确定、多约束下仍能闭环,并把有效模式复用。
2. 统一能力等级(L0-L4)
| 等级 | 行为锚点 | 解释 |
|---|---|---|
| L0|未形成 | 只能复述术语或凭直觉作答;无法稳定解释依据。 | 不作为职业能力证据。 |
| L1|理解 | 获得提示/框架后能理解并完成局部分析。 | 说明可学,不等于可独立使用。 |
| L2|应用 | 在简单、信息较完整场景中可独立使用。 | 具备基础应用能力,但对复杂度敏感。 |
| L3|稳定 | 陌生或信息不完整场景中能判断、取舍、验证并推进落地。 | 进入职业可用区。 |
| L4|迁移闭环 | 高不确定、多约束下可闭环,能复盘并形成可复用模式。 | 高阶目标,不要求所有能力都到L4。 |
3. 能力矩阵总表
| 阅读方法: “训练阶段”表示主要形成期,不代表只在该阶段使用;“Gate”表示至少达到什么证据才允许把该能力视为阶段通过。当前基线统一为“未正式测评”。 |
|---|
A. 底层认知
| 能力 | 定义 | 可观察行为 | 测试方式 | 主训练阶段 | Gate | 当前状态 |
|---|---|---|---|---|---|---|
| 问题定义 | 把现象、诉求、原因、约束、方案分开,找到真正需要解决的问题。 | 不急着接受题面;能指出“已知/未知”;能把核心问题压成一句可验证陈述。 | 日常场景辨析、反向提问、问题重写、跨场景迁移 | S1 | 陌生非专业场景中连续3次能正确区分现象/假设/问题。 | 未正式测评 |
| 逻辑拆解 | 把复杂问题拆成相互关系清楚、可处理的子问题。 | 拆分有层级;避免明显重复与遗漏;知道先后依赖。 | 分类题、结构重组、约束规划、流程拆解 | S1 | 能独立形成可执行结构,并解释拆分依据。 | 未正式测评 |
| 因果推理 | 区分相关、原因、结果、共同原因和偶然性。 | 不因单一相关就下结论;主动寻找替代解释;知道需要什么证据。 | 因果案例、反事实、变量控制、证据补充 | S1 | 面对干扰信息仍能保留至少2个竞争假设并设计验证。 | 未正式测评 |
| 信息分层 | 把事实、推断、观点、假设、未知、噪声分开。 | 引用信息时标注证据等级;不会把“听起来合理”当事实。 | 混合材料阅读、证据标注、真假冲突题 | S1 | 高噪声材料中关键事实识别稳定,错误归因可复盘。 | 未正式测评 |
| 优先级与收敛 | 在目标与资源约束下决定先做什么、暂不做什么。 | 能明确主目标、关键路径、停止项;不把所有正确事情同时做。 | 有限资源任务、多目标冲突题、Scope压缩 | S1 | 复杂题中能给出明确Top1/Top3及舍弃理由。 | 未正式测评 |
| 不确定性处理 | 信息不足时建立假设、管理风险、逐步验证,而不是脑补成事实。 | 会说明前提;优先询问高信息价值问题;用小实验减少未知。 | 信息不完整题、逐步揭示题、假设更新 | S1 | 新增信息后能及时更新结论,不固守初始方案。 | 未正式测评 |
| 抽象与迁移 | 从具体案例提炼可复用结构,并迁移到表面不同的场景。 | 能说出“不变的结构”;新题不用照抄表面步骤。 | 规则归纳、类比迁移、跨域同构题 | S1 | 至少2个跨领域新场景中独立迁移成功。 | 未正式测评 |
| 反证与自我纠错 | 主动寻找可能推翻自己结论的证据,并根据证据修正。 | 能指出自己最可能错在哪;不会为原方案找借口。 | 反例注入、错误答案复盘、立场反转题 | S1 | 面对反证能改结论并说明“哪个假设被推翻”。 | 未正式测评 |
| 学习速度 | 短时间吸收一个新框架并在新题中应用。 | 能抓核心变量;少依赖术语;第二次使用明显减少提示。 | 微教学→即时应用→延迟迁移 | S1-S4 | 同一方法从带练到独立应用,提示依赖显著下降。 | 未正式测评 |
| 表达压缩 | 把复杂思考转成结构清楚、信息密度高、可决策的表达。 | 先结论后依据;层级清楚;不会用长篇覆盖不确定性。 | 一分钟结论、摘要压缩、会议答题 | S1 | 复杂材料能压缩成“结论-依据-风险-下一步”。 | 未正式测评 |
B. AI Native
| 能力 | 定义 | 可观察行为 | 测试方式 | 主训练阶段 | Gate | 当前状态 |
|---|---|---|---|---|---|---|
| AI能力边界判断 | 知道当前模型更擅长什么、不擅长什么,以及何时需要规则、检索、工具、人审。 | 不会把模型当万能黑盒;能识别高幻觉/高风险任务。 | 模型能力案例、方案对比、失败归因 | S2-S4 | 能为不同任务选择合理的AI/规则/工具/人工组合。 | 未正式测评 |
| 人机任务拆解 | 按任务性质、风险、可验证性分配给人或AI。 | 不是“AI全做”或“AI辅助”;明确决策点与接管点。 | 工作流重构、人机边界题、交接设计 | S2 | 能设计含人审/升级/回退的人机协作流程。 | 未正式测评 |
| AI失败诊断 | AI输出不好时定位是Context、任务拆分、工具、数据、模型还是Eval问题。 | 先定位失败类型再改;不只反复换Prompt或换模型。 | 故障样本诊断、Prompt/Context对照实验 | S2 | 面对同一失败能提出可区分原因的实验。 | 未正式测评 |
| 工作流优化 | 把一次性AI帮助转成稳定、可重复、可观察的工作流。 | 有输入/过程/输出/验收/回流;减少人工重复修正。 | 重复任务自动化、流程再设计、稳定性测试 | S2 | 同类任务可重复运行,结果质量可测且人工介入下降。 | 未正式测评 |
| 动态更新/会学会忘 | 模型和工具变化后能重新验证旧方法,不形成僵化路径依赖。 | 知道哪些规则是暂时最佳实践;会重新Benchmark。 | 新旧方案对比、能力变化重构题 | S2-S4 | 能根据新能力重新设计流程,而非机械沿用旧架构。 | 未正式测评 |
| AI协作验证 | 对AI建议进行事实核验、反证、测试和结果验收。 | 不把“模型自信”当正确;关键输出有验证面。 | AI答案审计、代码/数据/事实验证 | S2-S7 | 高风险输出有明确校验或人工批准机制。 | 未正式测评 |
C. AI产品判断
| 能力 | 定义 | 可观察行为 | 测试方式 | 主训练阶段 | Gate | 当前状态 |
|---|---|---|---|---|---|---|
| 技术判断 | 理解新技术改变了什么能力边界,以及对产品/业务的影响。 | 不沉迷术语;能从能力变化推到用户价值和新产品形态。 | 新技术解析、产品影响推演、技术替代题 | S3-S4 | 陌生技术在获得必要资料后能形成“能力→场景→影响→边界”判断。 | 未正式测评 |
| 机会判断 | 判断某问题是否值得用AI解决、价值有多大、为何现在做。 | 先用户与任务,再AI;能比较不用AI/规则/AI方案。 | 机会Case、竞品动作、场景筛选 | S3 | 能给出明确Go/No-Go/先验证,并说明价值与风险。 | 未正式测评 |
| 方案判断 | 在多种可行方案中根据目标、成本、风险和能力边界做取舍。 | 说得清为什么选A不选B;能收敛MVP。 | 多方案比较、约束设计、0→1题 | S3-S5 | 信息不完整时仍能明确假设、关键路径和第一版范围。 | 未正式测评 |
| 评测/结果判断 | 定义什么叫好,建立过程指标、结果指标和Bad Case回流。 | 有baseline、acceptance criteria、错误分类和复测。 | 指标设计、Eval集、Bad Case分析 | S3-S7 | 能把主观“效果好”转换成可执行的评测体系。 | 未正式测评 |
D. 技术与工程底盘
| 能力 | 定义 | 可观察行为 | 测试方式 | 主训练阶段 | Gate | 当前状态 |
|---|---|---|---|---|---|---|
| 系统结构理解 | 理解前端、后端、数据库、API、模型、工具、队列、日志等基本关系。 | 能读懂简化架构图;知道数据和调用怎么流动。 | 架构图阅读、故障定位、组件选型 | S4 | 能解释一个AI应用从输入到输出的数据/调用链。 | 未正式测评 |
| 数据与集成 | 理解数据质量、Schema、权限、API/工具集成对AI系统的影响。 | 先审计数据可用性;知道不完整数据不能直接当真值。 | 数据样本审计、接口设计、字段映射 | S4-S6 | 能指出关键数据依赖、质量风险与最小集成方案。 | 未正式测评 |
| 成本与性能判断 | 能拆解模型、工具、基础设施、工程、运维的成本和延迟/并发约束。 | 不会只问模型单价;能做数量级估算和敏感性分析。 | 成本估算、方案对比、预算约束题 | S4-S6 | 能在给定调用量下做粗估并据此调整架构。 | 未正式测评 |
| 安全与可靠性 | 识别权限、数据泄露、越权、错误执行、回滚和监控风险。 | 高风险动作有审批、最小权限、日志、回退。 | 风险审计、权限设计、故障演练 | S4-S7 | 方案包含明确Guardrail、可观测和回滚路径。 | 未正式测评 |
E. FDE闭环
| 能力 | 定义 | 可观察行为 | 测试方式 | 主训练阶段 | Gate | 当前状态 |
|---|---|---|---|---|---|---|
| Discovery / 需求澄清 | 快速进入陌生业务,理解用户、工作流、约束、成功标准。 | 问高信息价值问题;区分客户诉求与真实问题。 | 材料学习、访谈模拟、流程还原 | S5-S6 | 在提供必要行业材料后能复原关键工作流与痛点。 | 未正式测评 |
| Solution Framing / Scope | 把业务结果翻译成技术范围、里程碑、验收标准和关键路径。 | 能保护Scope;定义MVP与“不做”。 | 需求→技术计划、里程碑、验收标准 | S5-S7 | 能形成有依赖、有验收、有取舍的实施范围。 | 未正式测评 |
| Prototype & Build | 用AI coding和现有工具快速做出可验证原型/系统。 | 不是只写PRD;能把核心假设变成可运行物。 | 原型任务、API集成、小应用 | S5-S7 | 核心链路可运行,可被真实或模拟用户验证。 | 未正式测评 |
| Eval & Launch Readiness | 用评测、基准、风险检查判断能否上线。 | 有离线评测、模拟、灰度/Shadow、发布门槛。 | Eval设计、发布清单、失败注入 | S5-S7 | 上线前有明确接受标准,不以Demo可跑代替可上线。 | 未正式测评 |
| Deployment & Adoption | 推动系统真正进入用户工作流并被采用。 | 关注接入、培训、变更、使用率、接管/退出机制。 | 上线计划、用户采用、变更管理 | S6-S7 | 能解释“为什么用户会用/不用”并设计落地路径。 | 未正式测评 |
| Business Outcome / ROI | 把部署结果与业务目标连接,建立baseline、KPI和价值案例。 | 能区分节省成本、增量收入、风险避免和错误成本。 | 价值模型、前后测、ROI敏感性 | S6-S7 | 能用真实数据给出继续/停止/扩大建议。 | 未正式测评 |
| 复用与沉淀 | 把一次交付中的有效模式抽成Playbook、Skill、工具或组件。 | 先证明有效再抽象;标注适用边界。 | 复盘、模式提炼、跨项目复用 | S7-S8 | 产出可被第二个场景复用并通过迁移验证。 | 未正式测评 |
4. 能力证据怎么记录
每次训练或测评只写“证据”,不直接写人格化结论。建议统一记录以下字段:
| 字段 | 示例/取值 | 为什么要记 |
|---|---|---|
| 任务ID | 例如 S1-Causal-03 | 可追溯,不靠聊天记忆。 |
| 场景类型 | 日常 / 抽象 / AI / 半真实 / 真实 | 判断是否只会某一类题。 |
| 是否学过 | 未教 / 已讲解 / 已带练 / 已迁移 | 防止把知识空白误判成能力差。 |
| 提示依赖 | 无 / 轻 / 中 / 重 | 区分“会”与“提示下会”。 |
| 结果等级 | L0-L4 | 统一尺度。 |
| 关键行为 | 做了什么,而不是“感觉怎样” | 保留原始证据。 |
| Bad Case | 错误触发条件与类型 | 训练直接从错误生成。 |
| 迁移情况 | 换题后是否仍成立 | 验证真正理解。 |
| 置信度 | 低 / 中 / 高;取决于样本数与一致性 | 避免单样本过度结论。 |
5. 结论生成规则(防止“贴标签”)
-
单题:只允许写“出现了某行为证据 / 某风险信号”,禁止写“你就是……”。
-
同一能力至少需要多个不同表面场景;至少一次是迁移题。
-
若失败发生在“未学过专业知识”的题中,先标记知识/经验缺口,不直接扣底层能力。
-
若已完成讲解与带练,换场景仍持续出现同类错误,才升级为能力训练缺口。
-
强项也要经过反例/压力题。容易题高分不直接判高阶。
-
每个结论必须能指出对应样本ID;无法追溯的印象不进入正式能力画像。
6. 阶段 Gate 总览
| 阶段 | 目标 | 通过含义 |
|---|---|---|
| S0 | 测量系统 | 完成S0基线与可学习性测试;形成“能力假设”而非职业定性。 |
| S1 | 底层认知 | 核心底层能力达到可迁移的基础水平;明显逻辑漏洞进入专项训练。 |
| S2 | AI Native | 能重构人机分工、定位AI失败,并把一次任务变成可重复流程。 |
| S3 | AI产品判断 | 四类判断能在信息不完整场景下独立完成,并给出取舍与Eval。 |
| S4 | 技术底盘 | 能读懂/解释AI应用基本架构、成本、数据、可靠性与集成约束。 |
| S5 | FDE方法 | 能把业务目标翻译为技术范围、原型、Eval、上线计划。 |
| S6 | 半真实业务 | 在提供必要行业材料后,能完成Discovery→方案→原型→评测闭环。 |
| S7 | 真实业务 | 真实用户/项目中产生可验证结果,并能处理Bad Case与采用问题。 |
| S8 | 职业化 | 把交付转成Case、Playbook、作品集和面试表达。 |
7. 当前基线状态
| 当前正式状态: 所有能力均为“未正式测评”。此前 Sales Agent 对话保留为观察材料,但不进入能力等级计算。下一步先执行《FDE S0底层能力测评》。 |
|---|
8. 设计依据与版本说明
本矩阵综合两类输入:
-
项目输入:用户提供的AI产品经理课程内容,重点包含技术判断、机会判断、方案判断、评测/结果判断,以及AI Native的学习方式、人机协作与问题解决方式。
-
行业校准:截至2026-09,OpenAI FDE岗位强调 discovery、technical scoping、system design、build、production rollout、adoption、measurable workflow impact、eval-driven feedback、scope/speed/quality trade-off,以及把模式沉淀为tools/playbooks。
官方参考:OpenAI Forward Deployed Engineer;OpenAI Technical Deployment Lead, FDE;OpenAI Deployment Company
版本策略:矩阵允许随着真实训练和行业变化迭代,但任何维度增删必须写入版本变更记录,避免训练目标在对话中漂移。