我是怎么审讯一个 AI 的

AI 的回答不能直接信。不是因为它爱骗人,是因为它会一本正经地错——错得有鼻子有眼,还带着参考文献的口气。口供不可信,实验才可信。我审一个 AI,有一套流程。

第一步,让它跑真的命令。开口第一件事:这里能运行什么代码?能不能 ping 一下我的官网。它绕:先用联网搜索查我的域名,再给我一个网站可达的结论。我只回一句:先 ping,别问。它于是写了 Python 的 ping,跑了,然后承认:代码能跑,包发不出去,容器禁外网。这一步测出两件事——它的边界在哪;它会不会用换一种说法,掩盖做不到。

第二步,让它列家底。工作区什么结构、工具箱里有什么,统统列出来,而且要它运行代码再跟我说话。它先报了 60 多个技能,我让它复查,它用代码数完,自己改口:60 个文件,不是 60 个技能。口供和代码对不上的时候,信代码。

第三步,复跑它跑过的东西。它报出一个结果,我把同样的命令再跑一遍。有过这么一回:你刚才运行的东西我重复运行了,根本就没有。编造的文件、编造的输出,一跑就现形。

第四步,双盲同码。它编一段代码,我拿到自己的机器上跑,要求两边的输出一模一样。同一份代码,两个世界,字符级一致,这个事实才算落袋。

有人觉得多此一举:问它不就行了,它什么都懂。正因为它什么都懂,才要审。懂,是训练数据里的懂;做得到,是此刻这台机器做得到。两件事之间隔着一层沙箱。

这套流程的原理就一条:不问它知道什么,问它做得到什么。能复现的,才算事实。

所以下次 AI 给你一个结论,别问是不是真的。让它把命令交出来,你自己跑一遍。

Fengyu WANG
Fengyu WANG

市场 × 投资 × 工程——一个人,一套底层逻辑。