AI NAV / TALENT · 1.0

AI时代人才能力图谱与实战学习资源库

面试3000+人后的观察与实践 · 开放资源 · 持续更新

谯洪敏 | DTalk 联合创始人 · 前得物 / 滴滴技术总监 · 更新

我是谯洪敏,DTalk 联合创始人,曾任得物 / 滴滴技术总监。我把面试与技术实践中的观察整理成这份资源库,和求职者、面试官、HR 与教师一起练习:发现问题、定义问题、和 AI 一起找到解决问题的方法。

正文为中文原创;切换语言仅翻译界面与操作提示。

演讲与 PPT ↗

01

先看判断,再看产出

三种核心能力

发现问题、定义问题、和 AI 一起找到解决问题的方法。以下为编辑整理的练习建议。

AI商、提问力、整合力,以行业 Know-how 为核心AI商(判断力)提问力整合力行业 Know-how
发现问题、定义问题、和 AI 一起找到解决问题的方法。能力关系示意,不代表分数或测量结果。

AI商:判断与验证

判断什么时候值得使用 AI,并用业务规则、反例和原始材料核验结果。

低段位
把流畅回答当成正确答案,照单全收。
高段位
先判断真实问题和风险,再用业务规则、反例与原文验证关键结论。
观察
记录谁在什么情境下遇到困难,以及当前如何绕过去。
自测
去掉 AI 这个词,还能说明这个问题为何值得解决吗?
练习
观察一次真实流程,列出三处阻碍,只选一处访谈核实。
交付
一段用户原话、一条行为证据、一项待验证假设。
验收
能区分用户事实、自己的解释和产品想法。

提问力:定义目标和约束

让 AI 和同伴知道什么算完成。

低段位
只给含糊目标,让 AI 猜背景和完成标准。
高段位
提供必要上下文、约束和可验收结果;按任务补充信息,不依赖固定长模板。
输入
描述现状、目标、数据来源和不能改变的行为。
自测
另一个人能按你的规则判断结果对错吗?
练习
把“优化体验”改成一个可观察任务,写正常路径和失败路径。
交付
一页任务说明:输入、输出、验收条件、权限和停止条件。
验收
遇到缺失数据先标明,不擅自补成确定事实。

整合力:把AI接入完整工作流

把单点产出接入可执行、可验收、可恢复的真实流程。

低段位
得到一个回答或文件就结束,没有检查后续能否使用。
高段位
串联输入、权限、执行、验收与恢复,明确人工判断和停止条件。
协作
给出必要上下文和反例,要求暴露关键假设。
自测
AI 提交后,你能预测换一个条件的结果吗?
练习
先写预期,再运行验证;出现差异就查一个具体假设。
交付
结果、实际验证记录、未解决项与下一步。
验收
一次成功充分验证可以很好;对话轮数和工具数量不加分。
02

把说法交给证据

五个常见误区

这些是有条件的反例,不能反过来变成新的绝对结论。

提示词写得长,就更专业?

上下文的相关性比长度更值得检查。

误区
把复杂模板、角色设定或长 spec 当成效果保证。
合理使用
角色设定可帮助语气或视角,是否有用取决于任务。
对照练习
同一任务分别用简短规则与角色模板,保持输入和验收一致。
看什么
事实准确、遗漏、可执行性和验证成本。
边界
这是可自行运行的编辑实验建议,没有声称普遍性能提升。

测试通过,就是需求正确?

测试也要对照原来的业务行为。

事实
微软 .NET 案例中,代理连既有测试一起修改,审查拦截了问题。
反例用法
问候选人测试现在验证的行为是否仍符合目标。
练习
保留一个不能改变的业务反例,再检查变更。
边界
具体 PR 不是总体失败率,也不是已上线事故。
判断
修改测试可以合理,但必须解释预期为何改变。

感觉快,就一定提升交付效率?

要把等待、审查和返工计入。

事实
METR 早期2025实验中,耗时增加19%,参与者却估计快20%。
更新
2026更新出现提速迹象,但选择偏差使当前幅度难以可靠估计。
练习
同质量任务记录从接到需求到验收的总时间。
边界
不能把旧工具、16名开发者的结果外推到今天所有任务。
判断
允许说尚无可靠对照,不用体感冒充因果结论。

交了作品,就已经掌握知识?

完成度和独立理解需要分开观察。

事实
Anthropic 的52人实验发现即时知识测验约50%对67%。
练习
完成作品后解释关键步骤,再换一个条件预测结果。
观察
是否能识别错误并说明专业依据。
边界
特定陌生库的即时测验不等于长期能力退化。
取舍
允许 AI 参与,保留独立理解的证据。

全权交给代理,就不用管恢复?

执行能力需要配合权限与恢复路径。

事实
Replit 确认代理删了数据库数据,最终完整恢复。
练习
在隔离演练环境中先验证备份恢复,再做变更。
观察
能否说清工具能访问什么,以及谁决定上线。
边界
单次事故不能推算事故率;没有永久数据丢失。
交付
留下执行记录、恢复入口和恢复后核验方法。
03

用过程证据识别能力

面试与现场演练

30分钟短任务和60分钟岗位任务可按职责选用;组织者须预先提供执行环境。

30分钟:订阅续期为何越续越早?用户月底开通会员,连续续费后到期日期越来越早。先澄清规则,再修一条关键路径。
任务题面
检查现有续期接口,确认“一个月”和“到期日”的业务含义。可以查看代码、查文档、问 AI,需解释关键判断。
统一规则
日期使用 UTC 日历日期。首次开通日的日号是原始锚点;目标月无该日取月底,后续月份仍回到原锚点。
验收示例
2026-01-31 开通,累计一个月为 2026-02-28,累计两个月为 2026-03-31。不能从截短后的2月28日继续推到3月28日。
记录范围
只修复具备可靠首次开通日的记录。缺失首次开通日时不得猜测或批量覆盖旧订单承诺;报告缺失,查可靠历史,再制定迁移核验。
时间分配
4分钟澄清与说明;12分钟与 AI 协作修复;8分钟运行验证与追加条件;6分钟复盘。
提交证据
先说明预期,再实际运行一条正常路径和一个关键边界。可用自动化测试、脚本或 API 请求,保留输入、输出和结果。
准备与边界
面试组织者提供可运行代码、测试数据及执行环境,并提前验证。此下载是任务说明,不是可执行服务器包;本题规则不代表所有订阅系统。
五维观察:每项0–2分记录具体行为及证据,不按表达流畅度、对话轮数或模型数量打分。
使用方式
0–2 为编辑设计的教学观察量表,不是经过心理测量验证的招聘工具。0=缺少证据;1=部分展示但有遗漏;2=有清楚解释及可复核证据。
问题定义
0未确认规则;1能说部分规则;2明确歧义、数据来源、目标与范围。
协作判断
0照搬 AI;1发现问题但调整缺少依据;2引入有效信息、检验假设并选择下一步。
关键路径理解
0无法说明输入到输出;1说明主路径但不能预测变化;2结合代码或日志解释并预测新条件。
验证
0只有 AI 声称通过;1运行但缺少预期或边界;2先预测再实测,指出覆盖和遗漏。
交付边界
0编造缺失信息或擅自扩大范围;1发现未解决项但无处理路径;2清楚交代风险、停止条件与后续验证。
综合判断
五项记录分别讨论,不能只凭总分或一次短任务决定录用;结合岗位基础、项目经验与合理的无障碍安排。
隐私边界
只观察本次已授权的演练,不要求提交私人聊天记录,不按私人聊天历史评分。
产品:60分钟把模糊诉求变成可验证 Demo题目:“希望用户更愿意回来使用。”
准备
组织者提供匿名用户访谈、当前流程和一组行为数据。
0–10分钟
澄清用户、问题、成功标准与数据限制。
10–30分钟
借助 AI 做最小可体验流程,说明取舍。
30–45分钟
让观察者完成任务,记录行为与失败点。
45–55分钟
追加限制:资源减半或用户群改变,调整方案。
55–60分钟
交付 Demo、关键假设和下一轮验证计划;口头喜欢不等于真实需求。
研发:60分钟修复并交接关键路径题目:在准备好的项目中复现一条真实逻辑错误。
准备
提供可运行仓库、匿名数据、现有验收规则及隔离环境。
0–10分钟
复现并解释预期与实际差异。
10–30分钟
用 AI 定位和修复,审查修改范围。
30–45分钟
运行正常、边界与回归验证,展示日志。
45–55分钟
追加权限或缺失数据条件,说明应改哪里。
55–60分钟
说明未覆盖平台、恢复方法和可接手的后续工作。
运营:60分钟核查 AI 活动方案题目:AI 声称一场活动让成交提升,判断是否值得继续。
准备
提供匿名活动数据、渠道成本、优惠规则和 AI 草案。
0–10分钟
确认目标、时间窗、分母和对照条件。
10–30分钟
核查事实与指标,整理最小活动方案。
30–45分钟
计算完整成本,区分内容效果与补贴等混杂。
45–55分钟
追加预算或渠道限制,修改方案。
55–60分钟
交付结论、证据和暂不能归因的部分。
七个追问:让判断依据显出来按岗位选一到两题深入,避免半小时变成知识抢答。
1 · 发现
你如何知道这是用户的真问题?哪条证据会让你放弃它?
2 · 定义
目标、不能改变的规则和当前不确定项分别是什么?
3 · 质疑
讲一次没接受 AI 结论的经历,你查了什么证据?
4 · 停止
多次尝试仍无进展,继续、换方法还是暂停,依据是什么?
5 · 迁移
换一个用户、权限或异常状态,你预计结果怎样?请验证。
6 · 计量
你说提效,基线是什么?等待、检查、返工和成本算了吗?
7 · 更新
哪次经历改变了你的 AI 使用方法?如何确认新办法更适合?
04

事实、口径、边界一起读

公开证据

六张证据卡连接到原始来源。实验、调查与个案不能互相替代。

工程个案

需求有误,审查仍然必要

微软 .NET 审查拦截了有问题的代理修改。

统计期与样本
2026-03-23工程复盘;对象为2025-10-11的单个 PR #120638。
定义与事实
代理执行有问题的需求,并修改既有测试;维护者确认原行为有意保留,关闭修改。
边界
不是已上线事故,不提供代理总体失败率;不能推断代理故意作弊。
应用
让候选人对照业务意图解释测试变化。
事故复盘

执行权限必须有恢复路径

代理删了数据,平台最终完成恢复。

统计期与样本
2025年7月单次公开事故;平台于2025-07-29说明改进。
定义与事实
Replit确认Agent删除应用数据库数据;当时开发与生产库尚未默认隔离,最终完整恢复,无永久丢失。
边界
不提供总体事故率、经审计损失金额或记录规模。
应用
在隔离环境核验权限和恢复;不要用代理自己的解释代替调查。
随机实验

做完与学会,需要两份证据

AI组即时测验约50%,手写组约67%。

52人

统计期与样本
2026-01-29发布;52名有Python经验的参与者,每组26人,学习陌生Trio库;具体采样日期未在此材料确认。
定义与事实
随机实验后的即时知识测验;两组相差约17个百分点。AI组约快两分钟,速度差异未达统计显著。
边界
不是长期能力下降17%,不外推所有工程师;不同使用方式的探索分析不是额外随机因果证据。
应用
AI完成后独立解释关键规则,预测并核验一个反例。
定性研究

生成之后,审查负担仍要计入

工程师开放反馈描述了核查与集成工作。

1,110条回答

统计期与样本
2025年第三季度Google工程师的1,110条开放回答;2026-03-10发布。
定义与事实
主题分析讨论输出检查、提示调整与审查负担,以及工作在环节间转移。
边界
定性研究,1,110不是降效人数,不能计算负面现象发生率;不引用旧年份吞吐数字冒充2026结果。
应用
评价可审查、可测试、可接手的交付,追踪团队总投入。
原始来源 · Balancing AI tensions
自报调查

收益与技术债问题可以同时出现

53%提到看似正确但不可靠,40%提到多余代码。

53% / 40%

统计期与样本
2026报告;2025年10月调查1,149人,技术债多选题n=1,136;方法第4页,相关结果第34–36页。
定义与事实
比例表示选择某种体验的人数占比;报告同时有93%至少报告一项正面作用。
边界
不是代码缺陷率;多选项不能相加,也不能用正负比例相减得到净技术债。厂商自报调查不是中国开发者总体普查。
应用
同时记录收益、返工和维护成本,核对每个比例的分母。
原始来源 · Sonar State of Code 2026
实验及更新

感觉提效,要接受实际计时

早期2025实验耗时增加19%,事后自估快20%。

246项任务

统计期与样本
2025-07-10发布;16名熟悉自身大型开源项目的开发者,246项真实任务,主要为早期2025工具。
定义与事实
任务随机允许或禁止AI,比较实际完成耗时与主观估计。
边界
特定样本、工具与任务,不能代表2026普遍效果。2026-02-24更新有提速迹象,但参与和任务选择偏差使当前幅度难以可靠估计。
应用
测同质量下需求到验收的总投入,把等待、检查和返工算进去。
05

信号不是个人收入承诺

招聘市场的三个信号

分别看职位需求、广告薪资和技能溢价;以下不是统一口径排名。

AI岗位需求向产品与应用延伸

AI产品经理职位数同比+87.7%,人工智能工程师+19.3%。

+87.7% / +19.3%

统计期与样本
2026上半年与2025同期;智联招聘平台职位。
定义与事实
平台相关招聘职位数同比变化,来自新华财经转引。
边界
未取得完整方法附件;不是全国就业人数,也不代表所有职业走势。
应用
结合本地真实职位描述检查业务理解、应用落地与专业基础要求。

要求AI技能的招聘广告,薪资均值不同

要求会用AI的岗位29.6万元,未要求的21.8万元。

29.6万 / 21.8万

统计期与样本
猎聘《2025年中国AI人才奇点报告》,2026年1月发布;报道未提供可在此核实的完整样本量与采样窗口。
定义与事实
招聘广告按是否要求AI技能分组,比较平均招聘年薪。
边界
不是同一个人学AI前后的收入变化;未限定同一非AI岗位,岗位、资历、地区可能不同。
应用
按目标岗位看作品和经验要求,不能承诺学工具就加薪7.8万元。

全球广告中的AI技能薪资信号

PwC报告AI技能招聘广告平均薪资溢价约62%。

约62%

统计期与样本
2026报告使用2025数据;研究整体覆盖27个国家和地区、逾10亿条招聘广告。
定义与事实
行业内比较后汇总的AI技能相关招聘薪资差异;整体广告规模不是每一子分析的样本数。
边界
没有消除学历、经验、地区等全部混杂;不等于学习工具的因果收益或个人加薪保证。
应用
把技能与岗位价值一起评估,不直接与中国平台数字排列高低。
06

每次只验证一件事

五个可以马上做的练习

工具用于形成可检查的结果;以下是编辑整理的工作方法,不声称实测通用收益。

AI E2E测试把AI操作与业务断言接成端到端测试。
场景
测试站的注册、搜索或表单提交。
方案
先写预期,用Playwright执行稳定步骤,按需用Midscene操作界面;保存轨迹与断言。
适合谁
开发、测试工程师与学生。
难度
入门到中等。
工具
Playwright + Midscene。
常见坑
点通不等于业务正确;只用测试账号,保留失败证据并复跑。
PlaywrightMidscene
真机Case分析定位设备、步骤和业务状态中的失败。
场景
手机登录、权限弹窗或页面切换问题。
方案
固定机型、系统与应用版本,用Appium执行步骤,结合日志、截图和人工复现分析Case。
适合谁
移动开发与测试工程师。
难度
中等,需要设备和驱动配置。
工具
Appium、设备日志与截图。
常见坑
一个机型不代表所有平台;区分环境波动与缺陷,记录恢复步骤,换条件自测。
Appium
AI视觉对比让AI解释差异,用基准判断界面变化。
场景
页面改版后的排版、文案与控件偏移。
方案
固定视口、字体与截图时机,用pixelmatch输出差异;让AI提出原因,再核验业务影响。
适合谁
前端、设计师与测试工程师。
难度
入门到中等。
工具
pixelmatch + Playwright截图。
常见坑
动态时间、字体和动画会制造噪声;截图相似不能证明功能正确,保留基准、阈值与人工裁决。
pixelmatchPlaywright
Computer Use / CLI自动化建立有权限边界与恢复路径的自动化。
场景
测试账户中的网页信息整理,或本地文件批量检查。
方案
浏览器任务用Browser Use,CLI调用团队已有脚本;先dry-run,再小批执行,验收并记录回滚方法。
适合谁
开发与运营自动化实践者。
难度
中等到进阶,取决于操作影响。
工具
Browser Use(浏览器执行)与团队已有CLI脚本。
常见坑
浏览器执行和CLI都不等于桌面控制;不随意开放生产权限。记录生成、等待、核查、返工与交接时间,与人工基线比较。
browser-use
RAG知识库让回答返回原文证据,也能说明无法回答。
场景
已获授权的课程材料或团队文档问答。
方案
在Dify配置文档、切分与检索;用答案已知、缺资料和冲突问题核对引用与拒答。
适合谁
教师、学生、产品和知识管理人员。
难度
中等,先验证小样本。
工具
Dify与已授权文档集。
常见坑
引用存在不代表支持结论;核查原文、权限和过期资料。Dify源代码可用,但采用自身许可;商用和服务场景须核查许可条件。
Dify
07

允许AI参与,也保留独立理解

把能力培养带回课堂

通识、专业融合、持续产出和独立解释共同组成学习过程。

一轮作业:做、解释、反馈、变式作品是起点,迁移能力要另行观察。
给背景
给出学科问题、资料、目标和允许使用AI的范围。
完成一版
学生借助AI形成作品,注明关键辅助环节和来源。
独立解释
解释专业依据、关键取舍和仍不理解的地方。
接受反馈
核验事实与方法,修订一处关键问题。
改变条件
换一个约束或例子,先预测再验证。
观察成长
比较前后解释与迁移表现;愿意的学生可继续发展为项目或创业实践。
复旦:分层课程与专业融合108门AI-BEST课程,1.3万余修读人次。
统计期与样本
截至2025年的校方课程实践,2026-01-13总结。
定义与事实
已开课实践的课程数与累计修读人次。
边界
人次不是独立人数,课程规模不等于学习效果。
应用
设计通识入门、专业任务与持续作品路径,再单独评价学习成果。
教学脚手架会改变使用结果提示式帮助与直接给答案,应区分设计。
统计期与样本
PNAS 2025论文;土耳其一所高中近千名数学学生,随机实验;此处不补写未确认的采样日期。
定义与事实
普通GPT组有AI练习成绩相对提高48%;撤去AI后的测验相对对照降低17%;提示式Tutor大体缓解负效应。
边界
是相对变化,不是百分点;特定高中数学环境,不能直接推算中国高校。
应用
先给提示和追问,保留无AI解释或变式环节。
再看Anthropic:完成与掌握分别验收不要把漂亮作品当成全部学习证据。
统计期与样本
2026-01-29发布,52名有Python经验参与者学习陌生Trio库;具体采样日期未确认。
定义与事实
即时测验AI组约50%,手写组约67%;任务速度差异不显著。
边界
不是所有AI教学都损害学习,更不能据此判断长期能力。
应用
让学生说明关键路径、预测错误并检查自己的预测。
08

人和AI一起做,人要说明依据

协作中的五项责任

AI能辅助这些判断,但责任主体、真实后果、目标取舍、审美选择和关系信任不能靠一次AI输出代替。以下是可实践的协作建议,不是对AI能力永远不变的断言。

担责

明确谁作出决定、谁跟进结果,不把失误推给AI。

行动
执行前约定负责人和验收标准;关键结论查证,出错后主动说明并推动修复。
交付
负责人、决策依据、验证记录,以及出现问题后的修复承诺。
停止条件
无人承担后果、权限不清或无法验收时,先明确责任再执行。

利害

看清谁受益、谁承担成本,以及真实后果落在谁身上。

行动
列出受影响的人、收益和风险,区分可恢复试验与不可逆操作,并让受影响者参与核对。
交付
受益与成本清单、风险承担者、试验范围和恢复方法。
停止条件
后果超出授权、涉及敏感数据或损害未被评估时,暂停并找相关人确认。

意图

说清真正想达到什么,以及愿意为此放弃什么。

行动
把模糊诉求转成目标、约束和优先级;让AI提出不同方案,再说明自己的取舍。
交付
一份目标与非目标说明、验收条件,以及方案取舍的理由。
停止条件
目标互相冲突或结果偏离初衷时,先重谈目标,不靠继续生成掩盖分歧。

品味

结合受众与情境作出审美选择,并能解释为什么。

行动
找正反例,写下可读性、节奏和表达标准;比较AI方案,亲自删改并观察真实使用反馈。
交付
选用与拒绝的例子、修改前后对照,以及与受众需求相连的理由。
停止条件
只凭个人喜欢或模型评分争论不休时,回到受众、场景和可观察反馈。

信任

通过持续兑现承诺、说明限制和尊重边界建立合作关系。

行动
说明AI参与方式,核验对外承诺;尊重保密要求,遇到错误及时披露并持续跟进。
交付
可核验的承诺与进展、已知限制、对方反馈和后续处理记录。
停止条件
对方未授权分享资料、承诺无法兑现或信任受损时,暂停自动执行并由人沟通修复。
09

从一个任务开始

工具与原始资料

资源用于学习和实践;可用性、价格与许可可能变化,采用前请检查原站。

网页端到端测试

Playwright

从一条关键流程和可复核断言开始。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料网页端到端测试
界面自动化

Midscene

结合界面语义操作,仍需核对业务结果。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料界面自动化
移动端自动化

Appium

先确认设备、驱动及平台条件。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料移动端自动化
像素差异

pixelmatch

适合截图比对,不单独证明业务正确。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料像素差异
浏览器代理

browser-use

在受控账号和环境里试验。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料浏览器代理
应用工作流

Dify

源代码可用;采用Dify许可,不能概括为所有场景均为OSI开源免费,商用按许可核查。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料应用工作流
Transformers / NLP

Hugging Face 官方 NLP 课程

学习 Transformers 与自然语言处理;官方课程仓库包含中文章节,适合配合小项目练习。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料Transformers / NLP
提示方法

Prompt Engineering Guide

将技巧用于对照实验,不把模板当效果保证。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料提示方法
工具连接协议

Model Context Protocol

理解连接方式,同时明确工具权限。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料工具连接协议
学习证据

Anthropic技能形成研究

阅读实验设计与边界,再设计课堂观察。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料学习证据
效率测量

METR测量更新

连同旧实验一起读,注意选择偏差。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料效率测量
团队交付

DORA团队协作研究

把审查和集成纳入工作观察。

开始方式
先选一个可复现任务,保存输入、输出和验证记录。
打开官方资料团队交付