本文来自 @Thomas Wolf 的 substack,由 @Selina 和 @AI小舟哥 翻译
原文标题:What Jobs Are Made Of - Judgment, Agency, and the Limits of AI Benchmarks
15 年前,也就是 2010 年的冬天,我博士快毕业了,正计划去探索象牙塔外的世界。那年巴黎前所未有的冷,到处都是大雪皑皑,我记得刚结束一场研发岗位的面试,坐在冰冷的返程列车上,心里只有失望和困惑。
虽然我对这一行业研发团队使用的工具了如指掌,也自信能快速补齐短板,但看起来还是不够,面试官拒绝我的理由很万金油:他们想要「更有经验」的人。
当时我才二十出头,觉得这简直不可理喻。在我看来,「经验」只是他们无视我的能力、拒绝我入职的一个模糊借口,而完全忽略我显而易见的能力和求知若渴的状态。
最近看到的一组关于初级岗位(尤其是程序员)缩招的数据,让我不禁代入到了现在的年轻人状态中。
斯坦福大学在 2025 年夏天做了一项分析:在那些受 AI 冲击最大的行业里,22 到 25 岁的年轻人,在 2022 年底到 2025 年中期这段时间,就业率跌了大概 6%。而同期,同行业的资深打工人就业率反而涨了 6% 到 9% [1]。
Brynjolfsson, E., Chandar, B., & Chen, R. Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence – August 2025
上图中这个转折点实在太明显了。
不管这是基于相关性还是因果关系 [2],2022 年秋天都是分水岭。ChatGPT 的发布让公众第一次见识了 AI 的真本事。随后军备竞赛彻底点燃,OpenAI、Anthropic 领跑,Google、xAI、阿里巴巴(Qwen)、DeepSeek、Mistral 等各路神仙紧随其后。
过去三年,AI 在跑分榜上的进步可以用「炸裂」来形容。
Claude Opus 4.5 这种级别的模型,现在能搞定 SWE-bench 上约 75% 的真实编程任务 [3];Gemini 3 和 GPT-5 在科学奥赛上更是金牌水准的表现 [4]。同时,ChatGPT 的周活用户也接近 10 亿了 [5]。
单看这些技术指标,AI 的能力和普及速度都在狂飙,仿佛马上就要和行业或人类积累的水平平起平坐。
GDPval Measuring the performance of our models on real-world tasks – https://openai. com/index/gdpval/
但吊诡的是,从宏观上看,却似乎相当平静。
尽管 AI 拿奖拿到手软,尽管初级岗位在流失,但从全球和行业层面看,AI 对 GDP 的影响依然微乎其微 [6]。最近甚至有报道称,除了那些公关通稿,大多数企业的生成式 AI 试点项目根本没跑通,无法产生持续价值 [7]。
再看那些更真实的「在场测试」,比如 Remote Labor Index(远程劳动力指数),它让 AI 去接真实世界的自由职业者的外包单子。结果很打脸,即便是目前最强的系统(比如 Manus AI),成功率也只有 2.5% 左右 [8]。
模型在评测中的高分,和在组织内部的实际应用,完全是两码事。
通常对于理论和现实落差的解释有如下几种:一是组织惯性:大公司反应慢,历史系统一团糟,部署难度高 [9]。 二可能是时机未到:虽然 AI 在某些 AGI 量化测试里拿了 60 分,但离实现真正的人类智能还有距离 [10]。
这些理由似乎都对,但它们都陷在一个误区里:把「工作」主要看作是「执行任务」。
这个视角在我看来太不完整了。实际上,一份工作很少只是一串待执行的任务清单,一个同事也很少能被简化为仅仅是一堆技术技能的集合 [11]。
作为一名创业者,我有一半的精力在招人,也从中有很多心得。我倾向的候选人,往往结合了三种特质:
执行力(Execution)或业务能力:能把活完成好,并掌握相应的工具和方法。
判断力(Judgment):也就是常识。得知道做这件事的价值,它如何服务于更大的目标、企业价值观、文化和方向。
主观能动性(Agency/Taste):或者说是「品味」。能预判下一步该做什么,该提什么建议,什么不该做,什么时候该扭转方向,甚至什么时候该彻底停下来才是最好的选择。
执行力相对容易观察、测试,也容易 在跑分榜上量化。一旦任务明确,问题就在于解决好它。
但判断力和能动性太难衡量了。它们往往体现在那些非稳定状态的局面里:当问题定义不清、优先级变动、或者需要质疑任务本身时。这才是团队里的高阶人才发光的时刻。
通过这个视角,我终于理解了 2010 年的那次面试。
当年的面试官,其实不只是在考量我会不会用那些工具和技巧。他们是在暗中校准:一旦问题变得模糊不清,我会怎么表现。
这种对工作的设定也解释了为什么初级岗位最先受到冲击。传统意义上的职场新人的工作内容,多是「执行」。随着时间推移和经验积累,人的价值才会转向「判断」和「能动性」:定义问题、选择着力点、厘清模糊地带
比起这些方向,AI 现在正在快速成为越来越高效的「执行者」,导致纯执行层面的工作成本越来越低,初级从业者的职位自然首当其冲受到影响。
长远来看,这的确让人担忧。判断力和能动性虽有天赋成分,但也需要通过大量的「执行」来磨练。如果入门级工作快速消失,未来的资深专家又从何而来?
这也解释了为什么 AI 的经济效益还没大面积爆发,解决更广泛、更大的任务依然存在挑战。限制 AI 的,并非生成文本或代码的能力,而是它往往难于关注上下文:无从探究整个公司/团队的整体情况,难以理解模糊需求,优先级考量,不懂权衡和妥协,决策关键问题或者甚至说无法判断何时叫停。
执行显然重要。它只是不能代表工作的全部,正如 Cursor 的 Ryo Lu 最近所说,执行不像人们认为的是工作中最重要的部分:
「传统的规模性团队的模式已经死了。以前我们招专业人才——设计师、工程师、产品经理——各司其职,通过招更多的人扩大公司规模。但当 Cursor 能让你在几分钟内把想法变成代码时,执行力不再是瓶颈,品味和判断力才是。」
挑战在于,判断力和能动性很难被量化,它们通常只在更宽泛、非线性的大背景下才有意义,所以它们在跑分榜里很少被关注 [12]。
但这些标准往往能够体现出一个人在组织内创造的价值。如果我们希望真正理解 AI 的经济潜力,最终就需要超越单纯技术执行层面的评估方式,转而采用能够反映真实工作中跨团队、跨职能(纵向协作)特征的评估体系;同时也必须承认,现实中极少有工作是只需在一个相对静态的环境中,按一套既定、量化的规则机械执行。
未来的 AI 时代,判断力、品味和主观能动性——这些最难描述、最难跑分、也最难被替代的部分——将拥有前所未有的权重。
回头看,这种「跑分无敌但干不了活」的差距,像极了那个 20 岁出头、拿着满分简历却被拒之门外的我。
参考文献与注释(References):
[1] Brynjolfsson, E. 等人(2025). 《煤矿里的金丝雀?关于近期 AI 对就业影响的六个事实》 (Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence.)注:该论文指出,2022 年底至 2025 年中期,高 AI 暴露职业中 22-25 岁工人的就业率显著下降,而年长工人就业率同期上升。 (斯坦福数字经济实验室)
[2] Brynjolfsson 等人的研究令人信服地指出了这其中的因果关系。
[3] SWE-Bench 及 SWE-Bench Verified 排行榜 显示最新的前沿模型及 Agent 系统已经能够解决绝大部分源自真实代码库的软件工程任务。截至 2025 年底,Claude Opus 4.5 已能解决约 75% 的真实软件工程任务。https://www. swebench. com
[4] 利用大型推理模型进行竞技编程https://arxiv. org/abs/2502.06807v1
Google DeepMind 关于 Gemini 在 ICPC 世界总决赛达到金牌水平的博客。
https://deepmind. Google/blog/gemini-achieves-gold-medal-level-at-the-international-collegiate-programming-contest-world-finals/
[5] https://openai. com/index/the-state-of-enterprise-ai-2025-report/
[6]人工智能与劳动力市场 https://www. nber. org/papers/w33509
AI 时代的经济转变 https://institute. bankofamerica. com/content/dam/economic-insights/ai-impact-on-economy. pdf
奇迹还是神话:评估 AI 带来的宏观经济生产力收益 https://cepr. org/voxeu/columns/miracle-or-myth-assessing-macroeconomic-productivity-gains-artificial-intelligence
[7] MIT 报告:95% 的企业生成式 AI 试点项目宣告失败
https://fortune. com/2025/08/18/mit-report-95-percent-generative-ai-pilots-at-companies-failing-cfo/
[8] 远程劳动力指数:衡量 AI 对远程工作的自动化程度
https://arxiv. org/abs/2510.26787
[9] GenAI 鸿沟https://mlq. ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report. pdf
[10] AGI 的定义 https://arxiv. org/abs/2510.18212
[11] 关于专业技能的研究https://www. nber. org/papers/w33941
[12] 无论是在 AI 研究还是经济学领域,常识性判断(Common-sense judgement)和能动性(Agency)的评估往往被忽视,作者表示几乎找不到深入探讨这两个方面的文章。