AI NAV / TALENT · 1.0
AI时代人才能力图谱与实战学习资源库
面试3000+人后的观察与实践 · 开放资源 · 持续更新
我是谯洪敏,DTalk 联合创始人,曾任得物 / 滴滴技术总监。我把面试与技术实践中的观察整理成这份资源库,和求职者、面试官、HR 与教师一起练习:发现问题、定义问题、和 AI 一起找到解决问题的方法。
正文为中文原创;切换语言仅翻译界面与操作提示。
先看判断,再看产出
三种核心能力
发现问题、定义问题、和 AI 一起找到解决问题的方法。以下为编辑整理的练习建议。
AI商:判断与验证
判断什么时候值得使用 AI,并用业务规则、反例和原始材料核验结果。
- 低段位
- 把流畅回答当成正确答案,照单全收。
- 高段位
- 先判断真实问题和风险,再用业务规则、反例与原文验证关键结论。
- 观察
- 记录谁在什么情境下遇到困难,以及当前如何绕过去。
- 自测
- 去掉 AI 这个词,还能说明这个问题为何值得解决吗?
- 练习
- 观察一次真实流程,列出三处阻碍,只选一处访谈核实。
- 交付
- 一段用户原话、一条行为证据、一项待验证假设。
- 验收
- 能区分用户事实、自己的解释和产品想法。
提问力:定义目标和约束
让 AI 和同伴知道什么算完成。
- 低段位
- 只给含糊目标,让 AI 猜背景和完成标准。
- 高段位
- 提供必要上下文、约束和可验收结果;按任务补充信息,不依赖固定长模板。
- 输入
- 描述现状、目标、数据来源和不能改变的行为。
- 自测
- 另一个人能按你的规则判断结果对错吗?
- 练习
- 把“优化体验”改成一个可观察任务,写正常路径和失败路径。
- 交付
- 一页任务说明:输入、输出、验收条件、权限和停止条件。
- 验收
- 遇到缺失数据先标明,不擅自补成确定事实。
整合力:把AI接入完整工作流
把单点产出接入可执行、可验收、可恢复的真实流程。
- 低段位
- 得到一个回答或文件就结束,没有检查后续能否使用。
- 高段位
- 串联输入、权限、执行、验收与恢复,明确人工判断和停止条件。
- 协作
- 给出必要上下文和反例,要求暴露关键假设。
- 自测
- AI 提交后,你能预测换一个条件的结果吗?
- 练习
- 先写预期,再运行验证;出现差异就查一个具体假设。
- 交付
- 结果、实际验证记录、未解决项与下一步。
- 验收
- 一次成功充分验证可以很好;对话轮数和工具数量不加分。
把说法交给证据
五个常见误区
这些是有条件的反例,不能反过来变成新的绝对结论。
提示词写得长,就更专业?
上下文的相关性比长度更值得检查。
- 误区
- 把复杂模板、角色设定或长 spec 当成效果保证。
- 合理使用
- 角色设定可帮助语气或视角,是否有用取决于任务。
- 对照练习
- 同一任务分别用简短规则与角色模板,保持输入和验收一致。
- 看什么
- 事实准确、遗漏、可执行性和验证成本。
- 边界
- 这是可自行运行的编辑实验建议,没有声称普遍性能提升。
测试通过,就是需求正确?
测试也要对照原来的业务行为。
- 事实
- 微软 .NET 案例中,代理连既有测试一起修改,审查拦截了问题。
- 反例用法
- 问候选人测试现在验证的行为是否仍符合目标。
- 练习
- 保留一个不能改变的业务反例,再检查变更。
- 边界
- 具体 PR 不是总体失败率,也不是已上线事故。
- 判断
- 修改测试可以合理,但必须解释预期为何改变。
感觉快,就一定提升交付效率?
要把等待、审查和返工计入。
- 事实
- METR 早期2025实验中,耗时增加19%,参与者却估计快20%。
- 更新
- 2026更新出现提速迹象,但选择偏差使当前幅度难以可靠估计。
- 练习
- 同质量任务记录从接到需求到验收的总时间。
- 边界
- 不能把旧工具、16名开发者的结果外推到今天所有任务。
- 判断
- 允许说尚无可靠对照,不用体感冒充因果结论。
交了作品,就已经掌握知识?
完成度和独立理解需要分开观察。
- 事实
- Anthropic 的52人实验发现即时知识测验约50%对67%。
- 练习
- 完成作品后解释关键步骤,再换一个条件预测结果。
- 观察
- 是否能识别错误并说明专业依据。
- 边界
- 特定陌生库的即时测验不等于长期能力退化。
- 取舍
- 允许 AI 参与,保留独立理解的证据。
全权交给代理,就不用管恢复?
执行能力需要配合权限与恢复路径。
- 事实
- Replit 确认代理删了数据库数据,最终完整恢复。
- 练习
- 在隔离演练环境中先验证备份恢复,再做变更。
- 观察
- 能否说清工具能访问什么,以及谁决定上线。
- 边界
- 单次事故不能推算事故率;没有永久数据丢失。
- 交付
- 留下执行记录、恢复入口和恢复后核验方法。
用过程证据识别能力
面试与现场演练
30分钟短任务和60分钟岗位任务可按职责选用;组织者须预先提供执行环境。
30分钟:订阅续期为何越续越早?用户月底开通会员,连续续费后到期日期越来越早。先澄清规则,再修一条关键路径。
- 任务题面
- 检查现有续期接口,确认“一个月”和“到期日”的业务含义。可以查看代码、查文档、问 AI,需解释关键判断。
- 统一规则
- 日期使用 UTC 日历日期。首次开通日的日号是原始锚点;目标月无该日取月底,后续月份仍回到原锚点。
- 验收示例
- 2026-01-31 开通,累计一个月为 2026-02-28,累计两个月为 2026-03-31。不能从截短后的2月28日继续推到3月28日。
- 记录范围
- 只修复具备可靠首次开通日的记录。缺失首次开通日时不得猜测或批量覆盖旧订单承诺;报告缺失,查可靠历史,再制定迁移核验。
- 时间分配
- 4分钟澄清与说明;12分钟与 AI 协作修复;8分钟运行验证与追加条件;6分钟复盘。
- 提交证据
- 先说明预期,再实际运行一条正常路径和一个关键边界。可用自动化测试、脚本或 API 请求,保留输入、输出和结果。
- 准备与边界
- 面试组织者提供可运行代码、测试数据及执行环境,并提前验证。此下载是任务说明,不是可执行服务器包;本题规则不代表所有订阅系统。
五维观察:每项0–2分记录具体行为及证据,不按表达流畅度、对话轮数或模型数量打分。
- 使用方式
- 0–2 为编辑设计的教学观察量表,不是经过心理测量验证的招聘工具。0=缺少证据;1=部分展示但有遗漏;2=有清楚解释及可复核证据。
- 问题定义
- 0未确认规则;1能说部分规则;2明确歧义、数据来源、目标与范围。
- 协作判断
- 0照搬 AI;1发现问题但调整缺少依据;2引入有效信息、检验假设并选择下一步。
- 关键路径理解
- 0无法说明输入到输出;1说明主路径但不能预测变化;2结合代码或日志解释并预测新条件。
- 验证
- 0只有 AI 声称通过;1运行但缺少预期或边界;2先预测再实测,指出覆盖和遗漏。
- 交付边界
- 0编造缺失信息或擅自扩大范围;1发现未解决项但无处理路径;2清楚交代风险、停止条件与后续验证。
- 综合判断
- 五项记录分别讨论,不能只凭总分或一次短任务决定录用;结合岗位基础、项目经验与合理的无障碍安排。
- 隐私边界
- 只观察本次已授权的演练,不要求提交私人聊天记录,不按私人聊天历史评分。
产品:60分钟把模糊诉求变成可验证 Demo题目:“希望用户更愿意回来使用。”
- 准备
- 组织者提供匿名用户访谈、当前流程和一组行为数据。
- 0–10分钟
- 澄清用户、问题、成功标准与数据限制。
- 10–30分钟
- 借助 AI 做最小可体验流程,说明取舍。
- 30–45分钟
- 让观察者完成任务,记录行为与失败点。
- 45–55分钟
- 追加限制:资源减半或用户群改变,调整方案。
- 55–60分钟
- 交付 Demo、关键假设和下一轮验证计划;口头喜欢不等于真实需求。
研发:60分钟修复并交接关键路径题目:在准备好的项目中复现一条真实逻辑错误。
- 准备
- 提供可运行仓库、匿名数据、现有验收规则及隔离环境。
- 0–10分钟
- 复现并解释预期与实际差异。
- 10–30分钟
- 用 AI 定位和修复,审查修改范围。
- 30–45分钟
- 运行正常、边界与回归验证,展示日志。
- 45–55分钟
- 追加权限或缺失数据条件,说明应改哪里。
- 55–60分钟
- 说明未覆盖平台、恢复方法和可接手的后续工作。
运营:60分钟核查 AI 活动方案题目:AI 声称一场活动让成交提升,判断是否值得继续。
- 准备
- 提供匿名活动数据、渠道成本、优惠规则和 AI 草案。
- 0–10分钟
- 确认目标、时间窗、分母和对照条件。
- 10–30分钟
- 核查事实与指标,整理最小活动方案。
- 30–45分钟
- 计算完整成本,区分内容效果与补贴等混杂。
- 45–55分钟
- 追加预算或渠道限制,修改方案。
- 55–60分钟
- 交付结论、证据和暂不能归因的部分。
七个追问:让判断依据显出来按岗位选一到两题深入,避免半小时变成知识抢答。
- 1 · 发现
- 你如何知道这是用户的真问题?哪条证据会让你放弃它?
- 2 · 定义
- 目标、不能改变的规则和当前不确定项分别是什么?
- 3 · 质疑
- 讲一次没接受 AI 结论的经历,你查了什么证据?
- 4 · 停止
- 多次尝试仍无进展,继续、换方法还是暂停,依据是什么?
- 5 · 迁移
- 换一个用户、权限或异常状态,你预计结果怎样?请验证。
- 6 · 计量
- 你说提效,基线是什么?等待、检查、返工和成本算了吗?
- 7 · 更新
- 哪次经历改变了你的 AI 使用方法?如何确认新办法更适合?
事实、口径、边界一起读
公开证据
六张证据卡连接到原始来源。实验、调查与个案不能互相替代。
需求有误,审查仍然必要
微软 .NET 审查拦截了有问题的代理修改。
- 统计期与样本
- 2026-03-23工程复盘;对象为2025-10-11的单个 PR #120638。
- 定义与事实
- 代理执行有问题的需求,并修改既有测试;维护者确认原行为有意保留,关闭修改。
- 边界
- 不是已上线事故,不提供代理总体失败率;不能推断代理故意作弊。
- 应用
- 让候选人对照业务意图解释测试变化。
执行权限必须有恢复路径
代理删了数据,平台最终完成恢复。
- 统计期与样本
- 2025年7月单次公开事故;平台于2025-07-29说明改进。
- 定义与事实
- Replit确认Agent删除应用数据库数据;当时开发与生产库尚未默认隔离,最终完整恢复,无永久丢失。
- 边界
- 不提供总体事故率、经审计损失金额或记录规模。
- 应用
- 在隔离环境核验权限和恢复;不要用代理自己的解释代替调查。
做完与学会,需要两份证据
AI组即时测验约50%,手写组约67%。
52人
- 统计期与样本
- 2026-01-29发布;52名有Python经验的参与者,每组26人,学习陌生Trio库;具体采样日期未在此材料确认。
- 定义与事实
- 随机实验后的即时知识测验;两组相差约17个百分点。AI组约快两分钟,速度差异未达统计显著。
- 边界
- 不是长期能力下降17%,不外推所有工程师;不同使用方式的探索分析不是额外随机因果证据。
- 应用
- AI完成后独立解释关键规则,预测并核验一个反例。
生成之后,审查负担仍要计入
工程师开放反馈描述了核查与集成工作。
1,110条回答
- 统计期与样本
- 2025年第三季度Google工程师的1,110条开放回答;2026-03-10发布。
- 定义与事实
- 主题分析讨论输出检查、提示调整与审查负担,以及工作在环节间转移。
- 边界
- 定性研究,1,110不是降效人数,不能计算负面现象发生率;不引用旧年份吞吐数字冒充2026结果。
- 应用
- 评价可审查、可测试、可接手的交付,追踪团队总投入。
收益与技术债问题可以同时出现
53%提到看似正确但不可靠,40%提到多余代码。
53% / 40%
- 统计期与样本
- 2026报告;2025年10月调查1,149人,技术债多选题n=1,136;方法第4页,相关结果第34–36页。
- 定义与事实
- 比例表示选择某种体验的人数占比;报告同时有93%至少报告一项正面作用。
- 边界
- 不是代码缺陷率;多选项不能相加,也不能用正负比例相减得到净技术债。厂商自报调查不是中国开发者总体普查。
- 应用
- 同时记录收益、返工和维护成本,核对每个比例的分母。
感觉提效,要接受实际计时
早期2025实验耗时增加19%,事后自估快20%。
246项任务
- 统计期与样本
- 2025-07-10发布;16名熟悉自身大型开源项目的开发者,246项真实任务,主要为早期2025工具。
- 定义与事实
- 任务随机允许或禁止AI,比较实际完成耗时与主观估计。
- 边界
- 特定样本、工具与任务,不能代表2026普遍效果。2026-02-24更新有提速迹象,但参与和任务选择偏差使当前幅度难以可靠估计。
- 应用
- 测同质量下需求到验收的总投入,把等待、检查和返工算进去。
信号不是个人收入承诺
招聘市场的三个信号
分别看职位需求、广告薪资和技能溢价;以下不是统一口径排名。
AI岗位需求向产品与应用延伸
AI产品经理职位数同比+87.7%,人工智能工程师+19.3%。
+87.7% / +19.3%
- 统计期与样本
- 2026上半年与2025同期;智联招聘平台职位。
- 定义与事实
- 平台相关招聘职位数同比变化,来自新华财经转引。
- 边界
- 未取得完整方法附件;不是全国就业人数,也不代表所有职业走势。
- 应用
- 结合本地真实职位描述检查业务理解、应用落地与专业基础要求。
要求AI技能的招聘广告,薪资均值不同
要求会用AI的岗位29.6万元,未要求的21.8万元。
29.6万 / 21.8万
- 统计期与样本
- 猎聘《2025年中国AI人才奇点报告》,2026年1月发布;报道未提供可在此核实的完整样本量与采样窗口。
- 定义与事实
- 招聘广告按是否要求AI技能分组,比较平均招聘年薪。
- 边界
- 不是同一个人学AI前后的收入变化;未限定同一非AI岗位,岗位、资历、地区可能不同。
- 应用
- 按目标岗位看作品和经验要求,不能承诺学工具就加薪7.8万元。
全球广告中的AI技能薪资信号
PwC报告AI技能招聘广告平均薪资溢价约62%。
约62%
- 统计期与样本
- 2026报告使用2025数据;研究整体覆盖27个国家和地区、逾10亿条招聘广告。
- 定义与事实
- 行业内比较后汇总的AI技能相关招聘薪资差异;整体广告规模不是每一子分析的样本数。
- 边界
- 没有消除学历、经验、地区等全部混杂;不等于学习工具的因果收益或个人加薪保证。
- 应用
- 把技能与岗位价值一起评估,不直接与中国平台数字排列高低。
每次只验证一件事
五个可以马上做的练习
工具用于形成可检查的结果;以下是编辑整理的工作方法,不声称实测通用收益。
AI E2E测试把AI操作与业务断言接成端到端测试。
- 场景
- 测试站的注册、搜索或表单提交。
- 方案
- 先写预期,用Playwright执行稳定步骤,按需用Midscene操作界面;保存轨迹与断言。
- 适合谁
- 开发、测试工程师与学生。
- 难度
- 入门到中等。
- 工具
- Playwright + Midscene。
- 常见坑
- 点通不等于业务正确;只用测试账号,保留失败证据并复跑。
真机Case分析定位设备、步骤和业务状态中的失败。
- 场景
- 手机登录、权限弹窗或页面切换问题。
- 方案
- 固定机型、系统与应用版本,用Appium执行步骤,结合日志、截图和人工复现分析Case。
- 适合谁
- 移动开发与测试工程师。
- 难度
- 中等,需要设备和驱动配置。
- 工具
- Appium、设备日志与截图。
- 常见坑
- 一个机型不代表所有平台;区分环境波动与缺陷,记录恢复步骤,换条件自测。
AI视觉对比让AI解释差异,用基准判断界面变化。
- 场景
- 页面改版后的排版、文案与控件偏移。
- 方案
- 固定视口、字体与截图时机,用pixelmatch输出差异;让AI提出原因,再核验业务影响。
- 适合谁
- 前端、设计师与测试工程师。
- 难度
- 入门到中等。
- 工具
- pixelmatch + Playwright截图。
- 常见坑
- 动态时间、字体和动画会制造噪声;截图相似不能证明功能正确,保留基准、阈值与人工裁决。
Computer Use / CLI自动化建立有权限边界与恢复路径的自动化。
- 场景
- 测试账户中的网页信息整理,或本地文件批量检查。
- 方案
- 浏览器任务用Browser Use,CLI调用团队已有脚本;先dry-run,再小批执行,验收并记录回滚方法。
- 适合谁
- 开发与运营自动化实践者。
- 难度
- 中等到进阶,取决于操作影响。
- 工具
- Browser Use(浏览器执行)与团队已有CLI脚本。
- 常见坑
- 浏览器执行和CLI都不等于桌面控制;不随意开放生产权限。记录生成、等待、核查、返工与交接时间,与人工基线比较。
RAG知识库让回答返回原文证据,也能说明无法回答。
- 场景
- 已获授权的课程材料或团队文档问答。
- 方案
- 在Dify配置文档、切分与检索;用答案已知、缺资料和冲突问题核对引用与拒答。
- 适合谁
- 教师、学生、产品和知识管理人员。
- 难度
- 中等,先验证小样本。
- 工具
- Dify与已授权文档集。
- 常见坑
- 引用存在不代表支持结论;核查原文、权限和过期资料。Dify源代码可用,但采用自身许可;商用和服务场景须核查许可条件。
允许AI参与,也保留独立理解
把能力培养带回课堂
通识、专业融合、持续产出和独立解释共同组成学习过程。
一轮作业:做、解释、反馈、变式作品是起点,迁移能力要另行观察。
- 给背景
- 给出学科问题、资料、目标和允许使用AI的范围。
- 完成一版
- 学生借助AI形成作品,注明关键辅助环节和来源。
- 独立解释
- 解释专业依据、关键取舍和仍不理解的地方。
- 接受反馈
- 核验事实与方法,修订一处关键问题。
- 改变条件
- 换一个约束或例子,先预测再验证。
- 观察成长
- 比较前后解释与迁移表现;愿意的学生可继续发展为项目或创业实践。
复旦:分层课程与专业融合108门AI-BEST课程,1.3万余修读人次。
- 统计期与样本
- 截至2025年的校方课程实践,2026-01-13总结。
- 定义与事实
- 已开课实践的课程数与累计修读人次。
- 边界
- 人次不是独立人数,课程规模不等于学习效果。
- 应用
- 设计通识入门、专业任务与持续作品路径,再单独评价学习成果。
教学脚手架会改变使用结果提示式帮助与直接给答案,应区分设计。
- 统计期与样本
- PNAS 2025论文;土耳其一所高中近千名数学学生,随机实验;此处不补写未确认的采样日期。
- 定义与事实
- 普通GPT组有AI练习成绩相对提高48%;撤去AI后的测验相对对照降低17%;提示式Tutor大体缓解负效应。
- 边界
- 是相对变化,不是百分点;特定高中数学环境,不能直接推算中国高校。
- 应用
- 先给提示和追问,保留无AI解释或变式环节。
再看Anthropic:完成与掌握分别验收不要把漂亮作品当成全部学习证据。
- 统计期与样本
- 2026-01-29发布,52名有Python经验参与者学习陌生Trio库;具体采样日期未确认。
- 定义与事实
- 即时测验AI组约50%,手写组约67%;任务速度差异不显著。
- 边界
- 不是所有AI教学都损害学习,更不能据此判断长期能力。
- 应用
- 让学生说明关键路径、预测错误并检查自己的预测。
人和AI一起做,人要说明依据
协作中的五项责任
AI能辅助这些判断,但责任主体、真实后果、目标取舍、审美选择和关系信任不能靠一次AI输出代替。以下是可实践的协作建议,不是对AI能力永远不变的断言。
担责
明确谁作出决定、谁跟进结果,不把失误推给AI。
- 行动
- 执行前约定负责人和验收标准;关键结论查证,出错后主动说明并推动修复。
- 交付
- 负责人、决策依据、验证记录,以及出现问题后的修复承诺。
- 停止条件
- 无人承担后果、权限不清或无法验收时,先明确责任再执行。
利害
看清谁受益、谁承担成本,以及真实后果落在谁身上。
- 行动
- 列出受影响的人、收益和风险,区分可恢复试验与不可逆操作,并让受影响者参与核对。
- 交付
- 受益与成本清单、风险承担者、试验范围和恢复方法。
- 停止条件
- 后果超出授权、涉及敏感数据或损害未被评估时,暂停并找相关人确认。
意图
说清真正想达到什么,以及愿意为此放弃什么。
- 行动
- 把模糊诉求转成目标、约束和优先级;让AI提出不同方案,再说明自己的取舍。
- 交付
- 一份目标与非目标说明、验收条件,以及方案取舍的理由。
- 停止条件
- 目标互相冲突或结果偏离初衷时,先重谈目标,不靠继续生成掩盖分歧。
品味
结合受众与情境作出审美选择,并能解释为什么。
- 行动
- 找正反例,写下可读性、节奏和表达标准;比较AI方案,亲自删改并观察真实使用反馈。
- 交付
- 选用与拒绝的例子、修改前后对照,以及与受众需求相连的理由。
- 停止条件
- 只凭个人喜欢或模型评分争论不休时,回到受众、场景和可观察反馈。
信任
通过持续兑现承诺、说明限制和尊重边界建立合作关系。
- 行动
- 说明AI参与方式,核验对外承诺;尊重保密要求,遇到错误及时披露并持续跟进。
- 交付
- 可核验的承诺与进展、已知限制、对方反馈和后续处理记录。
- 停止条件
- 对方未授权分享资料、承诺无法兑现或信任受损时,暂停自动执行并由人沟通修复。
从一个任务开始
工具与原始资料
资源用于学习和实践;可用性、价格与许可可能变化,采用前请检查原站。
Hugging Face 官方 NLP 课程
学习 Transformers 与自然语言处理;官方课程仓库包含中文章节,适合配合小项目练习。
- 开始方式
- 先选一个可复现任务,保存输入、输出和验证记录。