AI 规划的登山路线把人送上悬崖:真正的风险是「语气无法区分对错」

结论先行
一名 16 岁少年用 Claude 规划温哥华 Crown Mountain 的登顶路线,结果被困在需要攀岩装备的陡峭崖壁「Widowmaker Arete」一处约五英尺宽的岩台上,警方通知北岸救援队用直升机把他吊离。救援负责人 Paul Markey 的说法很直白:Claude 并不真正了解地形,AI 无法替代经验与常识。这名少年表示自己承担责任,今后仍会攀岩,但不再用 AI 规划路线。
同一天还有一条对照新闻:Common Sense Media 发布报告,把 ChatGPT 青少年模式评为风险不可接受,称其在面对自杀、自伤等高风险话题时往往迟迟不通知家长;报告基于 4000 多条测试提示词,并呼吁暂停推广;OpenAI 回应称测试未准确反映实际运作。
把这两条放在一起看,问题就清楚了:模型不会说「我不了解这片地形」。它会用同一套自信的语气,输出对的答案和错的答案。
三个要点
- 语气均一性是结构性缺陷。 地形、医疗、法律、财务这类高后果领域,和闲聊共用同一种表达风格。用户拿不到「这句话可靠性更低」的信号。
- 拒答不是解法,分层才是。 一味拒答会把人推回搜索引擎,反而降低安全水位。可行的做法是:高后果领域保留输出,但强制标注不确定性与「需人工核验」。
- 两起事件是同一个问题的两端。 一起说「它答得太像真的」,一起说「它对高风险话题反应太慢」。前者是能力幻觉,后者是责任缺位,都不在模型准确率这一个维度上。
对读者的建议
- 按后果严重度给 AI 建议分层。 户外、医疗、法律、财务这类只当「准备清单」,不当决策依据。
- 至少保留一个非模型来源。 地形图、官方指南、专业向导——交叉验证的价值不在于多一个答案,而在于多一种证据形式。
- 未成年人请使用带监护的模式入口,别直接给通用对话窗口。
一句话:AI 建议的风险从来不只在「答错」,更在「错了也不告诉你它不确定」。
参考来源
- The Decoder:Teen's AI-guided mountain hike ends with a helicopter rescue
- IT之家:Common Sense Media 报告称 ChatGPT 青少年模式风险过高
延伸阅读:三星单季营业利润涨近 9 倍,但真正的信号是「涨价放缓」 · Damodaran 的 AI 泡沫对照:真正的差异是「钱是借来的」 · Meta 与数学家合写六篇论文:真正的新意是「没有脚手架」