FDE S0底层能力测评
在专业训练开始前测量认知底盘、学习速度和迁移能力,避免把知识空白误判为能力缺口。
03|S0 底层能力测评设计 V1.0
先测“认知底盘与可学习性”,不测陌生业务熟练度
| **定位:**本文件是《FDE个人升级训练总纲》的执行层文档。后续训练、测评和复测必须以本文件定义的维度、证据与 Gate 为准,不靠聊天印象临时判断。 |
|---|
1. S0 的边界:测什么,不测什么
| S0只回答一个问题: 在尚未接受AI产品经理/FDE专业训练之前,当前的逻辑、判断、学习与迁移底盘是什么样;哪些能力可直接进入训练,哪些需要先补基础。S0不用于判断“能不能当FDE”。 |
|---|
测什么
-
问题定义
-
逻辑拆解
-
因果推理
-
信息分层
-
优先级与收敛
-
不确定性处理
-
抽象迁移
-
反证与自我纠错
-
学习速度
-
表达压缩
明确不测
-
销售、CRM、财务、法律、电商等行业经验
-
API、部署、模型成本、数据库等尚未培训的专业知识
-
是否能独立完成真实FDE项目
-
背诵AI术语或面试框架的熟练度
-
过去项目数量、学历、职位名称、自我评价
2. 测评原则
| 原则 | 执行方式 | 防止的误判 |
|---|---|---|
| 非专业化 | 题目应能凭题面信息完成,避免行业经验成为隐性答案。 | 把“没干过这行”误判成逻辑差。 |
| 渐进揭示 | 先给有限信息,再逐步补充,观察如何提问、更新与修正。 | 只测静态答题,不测更新能力。 |
| 多表面同结构 | 同一能力至少用不同题型/不同表面场景测,降低套路刷分。 | 背框架刷分。 |
| 过程证据优先 | 记录关注顺序、假设、舍弃、修正过程,不只看最终答案。 | 答案碰巧对但过程不稳定。 |
| 教学与测评分开 | 正式基线题不提示;可学习性测试会先教学,再看迁移。 | 把老师提示当个人能力。 |
| 不惩罚未知 | 明确说“不知道”不是扣分点;关键是是否能界定未知并设计获取信息的方法。 | 鼓励脑补和装懂。 |
| 反例压力 | 高分必须经过反证、冲突目标或新信息注入。 | 容易题造成虚高。 |
| 延迟复测 | 用平行题再次测,避免短期记住套路造成假提升。 | 短期记忆冒充能力形成。 |
3. S0 测评结构:四轮,不直接上真实业务
| 轮次 | 形式 | 主要测量 | 约束 |
|---|---|---|---|
| S0-A|原始基线 | 不教学,使用生活化/抽象题。 | 观察自然思考方式与当前基线。 | 不评分专业知识。 |
| S0-B|可学习性 | 给一个非常小的思考方法,示范一次,再立即换题。 | 测理解速度、提示依赖和即时迁移。 | 不能把教学后的表现当原始能力。 |
| S0-C|压力与反证 | 增加冲突目标、噪声、新证据、时间/资源约束。 | 测收敛、自我纠错和不确定性处理。 | 重点看结论更新,而非坚持原答案。 |
| S0-D|平行复测 | 换表面、保留底层结构,不再提示。 | 测稳定性和真实迁移。 | 只有复测仍成立,才提高结论置信度。 |
4. 十项底层能力的测试蓝图
| 能力 | 题型 | 观察点 | 典型失误 |
|---|---|---|---|
| 问题定义 | 现象/原因/方案混合题;同一句话重写为可验证问题。 | 能否拒绝题面预设;能否区分症状与真正问题。 | 直接开始给方案;把数据/工具问题当业务问题。 |
| 逻辑拆解 | 分类重组、流程拆解、任务树。 | 层级、依赖、重复、遗漏。 | 列表很多但没有结构;拆得过细或过宽。 |
| 因果推理 | 相关性案例、反事实、变量变化。 | 是否保留替代解释;是否知道需要什么证据。 | 看到同步变化就断言因果。 |
| 信息分层 | 混合事实/意见/推断材料。 | 事实与推断能否分开;证据权重是否合理。 | 用语气强弱代替证据强弱。 |
| 优先级与收敛 | 有限资源、多目标、只能选少数动作。 | 是否明确主目标与不做项;能否守住关键路径。 | “都重要”;Scope持续扩张。 |
| 不确定性处理 | 信息缺口题、最多N个问题、逐步揭示。 | 问题的信息价值;假设透明;新增信息后的更新速度。 | 脑补未知;问低价值细节。 |
| 抽象迁移 | 先学一个规律,再换完全不同的表面场景。 | 是否抓到底层结构;是否摆脱原案例词汇。 | 机械套模板;换场景即失效。 |
| 反证纠错 | 主动找反例;故意注入推翻证据。 | 能否指出自己最可能错的位置并改结论。 | 为原判断辩护;只做局部修补。 |
| 学习速度 | 微教学→即时应用→再次迁移。 | 第二次提示是否下降;是否能自己总结规则。 | 只会复述老师原话。 |
| 表达压缩 | 复杂材料压成短结论;口头结构化回答。 | 结论先行、证据充分、风险明确、无重复。 | 用长篇掩盖没有判断。 |
5. 题库设计:避免“想到哪问到哪”
| 题库不是一套固定答案: 每项能力至少准备“基线题、迁移题、压力题”三种题型;正式复测使用平行题,不重复原题。题目可以持续更新,但能力维度与评分规则不随意变化。 |
|---|
| 题池 | 内容原则 | 主要覆盖 |
|---|---|---|
| P1 日常因果池 | 门禁、排队、配送、学习习惯、设备故障等非专业场景。 | 因果/问题定义/证据 |
| P2 抽象规则池 | 分类、排序、隐藏规则、逻辑约束。 | 拆解/抽象/迁移 |
| P3 信息噪声池 | 多段信息中混有观点、传闻、数字和冲突证据。 | 信息分层/不确定性 |
| P4 资源约束池 | 目标多、资源有限、必须舍弃。 | 优先级/收敛/取舍 |
| P5 新证据池 | 回答后加入反例或关键新信息。 | 纠错/更新/抗路径依赖 |
| P6 微学习池 | 现场教一个陌生但简单的方法或规则,再跨场景使用。 | 学习速度/迁移 |
| P7 表达池 | 长材料→一句话/三点结论/决策摘要。 | 表达压缩/结构化 |
6. S0 评分 Rubric
| 等级 | 行为锚点 |
|---|---|
| 0|失控/无依据 | 接受题面、脑补关键事实、无法解释判断;新增证据也不更新。 |
| 1|有局部意识 | 能看出部分问题,但依赖提示;结构不稳,容易被表面信息带走。 |
| 2|基础可用 | 简单题可独立分析;能说明假设和依据,但复杂度提高后容易漏项或发散。 |
| 3|稳定 | 在噪声/不完整信息下仍能抓关键变量、收敛、验证并根据新证据更新。 |
| 4|迁移/自驱 | 能抽象规律、主动反证、跨场景迁移,并把自己的判断过程压缩成可复用方法。 |
7. 除了等级,还要记录四个“可靠性维度”
| 维度 | 记录方式 | 意义 |
|---|---|---|
| 提示依赖 | 无提示 / 轻提示 / 中提示 / 重提示 | 防止把“教完会做”当成独立能力。 |
| 一致性 | 同能力多题表现是否稳定 | 防止一次发挥好/差影响结论。 |
| 迁移性 | 换表面场景是否仍能使用 | 区分背框架与真正理解。 |
| 更新性 | 新增证据后是否修正结论 | 识别路径依赖与自我纠错能力。 |
8. 结论输出模板
S0结束后,不输出“你适合/不适合FDE”这种结论。正式输出应包含:
-
底层能力雷达:10项能力的当前水平区间,而非单点绝对分。
-
证据置信度:每项能力样本数、一致性、迁移表现。
-
学习速度画像:哪些能力一教就会、哪些需要多轮训练。
-
主要认知风险:例如易脑补、易发散、因果跳跃、表达覆盖判断等(只有证据充分才写)。
-
训练优先级:先补阻塞后续学习的底层瓶颈,不平均训练。
-
S1入口建议:哪些模块正常进入、哪些需要加强版训练。
9. S0 → S1 的 Gate
| Gate不是“全部高分”: S0的目标不是筛掉人,而是建立可靠起点。只要能够区分知识空白与认知短板,并形成可执行的S1训练优先级,就可进入S1;明显底层漏洞会在S1重点训练。 |
|---|
-
允许进入S1:已有足够样本建立基线;测试没有被专业知识严重污染;可学习性和迁移性已至少观察一次。
-
需要补测:同一能力结果冲突很大、题型过于单一、或回答明显受既往专业知识影响。
-
禁止提前进入真实业务验收:S0/S1阶段不得用陌生行业Case直接判断职业能力。
10. 测评执行纪律(对助手的约束)
-
每次只测预先声明的1-2个主能力,其他表现作为次级观察,避免一题什么都测。
-
出题前标记:题目目标、污染风险、预期可观察行为;不把答案框架提前泄露。
-
用户提出“我没学过”时,先判断这是否属于专业知识缺口;若是,停止用该题做底层能力评分。
-
反馈先引用具体行为,再解释能力含义;禁止只给“你逻辑很好/不好”这类空标签。
-
训练后复测必须换题,不允许用记住原答案证明提升。
-
任何新增训练模块必须能映射回《FDE能力矩阵》,否则先不加入主线。
11. 下一步
| 正式执行顺序: 先依据本文件建立 S0-A 第一组基线题卡;完成后将证据写入《FDE能力矩阵》和后续《03_训练日志》。在S0完成前,不进入AI产品经理真实业务Case。 |
|---|
12. 设计依据
S0的测量设计来自本项目的核心约束:先测底层认知与可学习性,再训练AI Native和专业方法;避免把陌生业务经验缺口当作能力缺口。职业后段能力的边界由当前FDE岗位要求校准,但S0本身不直接测试这些后段交付能力。
职业后段参考:OpenAI Forward Deployed Engineer;OpenAI Technical Deployment Lead, FDE