找一个「长得像 Claude 的问题」:物理学者用 AI 做跨学科计算的方法值得抄

AI 帮不上忙的时候,多数不是模型不行,而是问题没被拆成模型擅长的形状。
哈佛物理学者 Matthew Schwartz 在 Anthropic 的客座文章里提出了一个说法:去找 「长得像 Claude 的问题」(Claude-shaped problems)——也就是那些恰好落在模型能力范围内、又确实有难度的任务。他同时开源了用于定量科学精确计算的 BootLoops 工具包。
这个方法的价值不在于物理,而在于它的思路:先把问题分诊,再把模型不擅长的部分外置。 这套思路可以原样搬到任何领域。
三个可以直接借鉴的判断
- 先分诊,再调用。 把一个大任务拆成「适合模型的部分」和「必须由人保证的部分」。定量计算、格式转换、代码生成适合前者;判断前提是否成立、结论是否可信,属于后者。
- 把需要精度的部分外置成工具。 BootLoops 的思路不是让模型硬算,而是让它去编排一个能精确计算的工具。模型负责「下一步做什么」,工具负责「算得对」。 这条原则在科研上成立,在报表、财务、工程计算上同样成立。
- 先枚举失败模式。 Schwartz 特别强调了规避模型失败模式的经验。模型的典型失败不是明显报错,而是给出一个「看起来对」的结果——格式工整、逻辑通顺、数字却是错的。
可以照着做的四步
- 写下验收口径。 在调用之前先确定:什么样的输出算通过。没有验收标准,就没有办法判断模型是在帮忙还是在添乱。
- 把能外置的计算都外置。 任何有确定答案的环节,都交给脚本或工具,别让模型口算。
- 要求输出可核查的中间量。 不要只给结论,要给出推导链条里的关键数值——这样人才能在关键处抽查,而不是被迫整段信任。
- 与领域专家交叉核对。 作者特别提到与专家协作。AI 的价值是放大专家的判断力,而不是替代专家的判断。
对读者的实际影响
这个案例最有说服力的地方,是它没有把 AI 说成万能,也没有因为它在某处出错就否定它。它给出的是一条可复制的分工线:把判断题留给人,把执行题交给模型,把计算题交给工具。
你不需要是物理学家也能用这套方法。下次任务跑不通时,先别急着换模型——先问一句:我这个问题,现在的形状是模型擅长的形状吗?