科学与技术世界
← 首页
我们问AI的方式,可能从一开始就错了

我们问AI的方式,可能从一开始就错了

2026-07-19T01:43:04.460864+00:00

一个天才可能错了?

这周读到一个观点,真的让我愣了好一会儿。

过去几十年,我们一直在用同一个标准衡量人工智能的进步——1950年图灵提出的那个"模仿游戏"。也就是现在大名鼎鼎的图灵测试:如果一台电脑能骗过人类,让对方以为自己在跟另一个人聊天,那它就算"有智能"了。

听起来挺有道理的吧?

但是,一位重量级计算机科学家彼得·J·丹宁(Peter J. Denning)提出了不同看法。他刚出了本新书叫《图灵的错误:摆脱非智能机器的枷锁》,直接说:我们这75年可能一直在追一个错误的目标。

看完他的论述,我得承认——他说的有些东西,确实让我动摇了。

身体的问题(这可不是小事)

丹宁认为图灵的第一个错误就是:智能能不能脱离身体单独存在?

仔细想想这个假设。我们一直在试图用纯软件——漂浮在数字空间里的代码——来重建人类级别的智能。

但丹宁打了个比方:这就像想通过研究水分子来理解"游泳"是什么一样。你漏掉了最关键的那部分。

人跟世界打交道,不只是在处理信息。我们有感觉。感受到温度的变化,摸到门把手的材质,踩到不平的地面时那种轻微的晃动。这些身体体验,都在深刻地塑造我们思考和理解世界的方式。

丹宁说:身体不仅仅是装大脑的容器,它本身就是我们思考的一部分。

有意思的是,这可不是什么边缘观点。哲学家们研究"具身认知"已经很多年了。只是AI领域一直选择性地忽略它,转而追求纯计算的路子。

那些说不清道不明的"默会知识"

接下来这个概念就更有意思了,有点哲学味儿,但我尽量说人话。

丹宁提到了一个叫"默会知识"(tacit knowledge)的东西。一旦你理解了这个概念,就会发现它到处都是。

默会知识就是那种你懂、但很难说清楚的东西。比如——

  • 开门的时候,手指到底该用多大力气?
  • 接球的时候,你怎么不需要在脑子里列方程式就能接住?
  • 别人说话的语气,是讽刺还是真诚,你是怎么判断出来的?

这些对我们来说太自然了,自然到根本不会去细想。但它们其实复杂得吓人。

丹宁认为,机器学习根本捕捉不到至少五大类的默会知识:

常识 —— 关于世界运作方式的无数小细节,我们从不刻意去想,但就是知道。

日常互动 —— 怎么读懂社交场合,怎么处理人际关系,怎么理解那些没说出口的潜规则。

情绪和感知 —— 开心或难过的时候,信息处理的方式是会变的。这种体验本身就在影响思维。

实践技能 —— 那些顶级匠人、演奏大师脑子里知道的东西,他们自己也说不完整。

文化理解 —— 价值观、行为规范、历史背景,还有社区生活中那些深层的含义。

折腾了40年的Cyc项目告诉我们什么

说到这个问题,丹宁提到了一个很有代表性的案例——Cyc项目

不知道这个项目的朋友听我简单介绍一下。Cyc是80年代开始的一个宏大计划,想建一个超大型的常识知识库。比如"东西掉了会往下落"、"人需要喝水才能活"这种最基本的常识。

这个项目花了四十年,积累了大约2500万条常识知识。

2500万条!

结果呢?还不够。丹宁指出:"人类专家掌握的大部分知识,根本没法用命题的形式表达出来。"

Cyc项目的悲剧就在这儿:它用四十年的努力证明了一件事——想把人类常识手动编码进电脑,压根就是不可能的任务。因为常识太多了,而且大部分都是隐性的,说不清楚的那种。

那个解释不了自己技术的演奏家

丹宁举了个例子,我印象特别深。

想象一个大师级的小提琴手,演奏起来美感与情感兼备。现在让这个人给初学者讲讲:怎样才能拉出那个声音?

他讲不清楚。真的讲不清楚。

可能会给一些技术性的建议——弓放这里、压力放那里——但"知道怎么做"和"能说清楚怎么做"之间的鸿沟,大得吓人。

小提琴家的知识是具身化的,存在于肌肉里、神经里,存在于他无数次演奏的身体体验中。这种东西没法下载,也没法录入数据库。

往深一层想:就算你造了个机器人,能完美模仿小提琴家的每一个动作,它依然不理解创造美好音乐是什么感觉。它没有生物性的体验,没有情感语境,没有和听众之间的那种连接。

符号和意义之间的距离

那到底问题出在哪儿?为什么人类知识这么顽固地拒绝被数字化?

丹宁把这叫做"表征问题",这是根本性的大麻烦。

计算机处理的是符号——1和0,代表各种东西。我们往电脑里输入信息,其实就是在把真实世界的知识编码成这些符号形式。

但问题是:每个词、每个概念、每条"知识"的背后,都有一口深井——那是赋予它们意义的默会理解。词只是符号,只是指向意义的路标,它本身不是意义。

丹宁的原话是:"每个词背后都有一口深井,那是赋予它意义的默会知识。词只是意义的符号表征,不是意义本身。"

这就是为什么你和ChatGPT、Claude或者Gemini聊天的时候,你面对的是一套极其擅长摆弄符号的系统,但它们并不真正理解那些符号代表什么。它们可以极其精准地做模式匹配,但模式匹配不等于理解。

语境这东西,机器真没有

还有一个层面,AI也搞不定:语境

你跟人聊天的时候,其实背后有无穷无尽的共同理解作为支撑。你知道对方是谁,你们一起经历过什么,当前是什么情境,什么该说什么不该说,什么时候是开玩笑什么时候是认真的。

这些语境可不是背景噪音——它本身就是意义的一部分

丹宁把它形容为分形的:每层语境都建立在更早的语境之上,更早的语境又建立在更更早的语境之上。一环套一环,永无止境,都是我们用一辈子的体验积累出来的。

再加上文化这个维度,又多了一层。丹宁说文化包含"价值观、行为准则、判断标准、历史记忆、社群关系、情绪氛围,甚至权力关系和关怀关系"。

这一切对AI系统来说都是隐形的。它们能检测语言里的模式,但根本无法真正把握词语和行动背后的文化分量。

那AI的未来会怎样?

我不是在说AI没用——这太明显了。这些系统在很多具体任务上确实厉害,也确实是好用的工具。

但丹宁的论证指向了一个可能性:我们可能正在撞上天花板。真正的通用人工智能——具有人类级别理解和适应能力的机器——也许用现在的路子压根实现不了。

更让人有点担忧的是:丹宁警告,如果我们继续追求AGI,却无视这些根本性限制,可能最终会造出一堆风险很大的技术,却没法兑现承诺。

想想这个画面:我们正在建造自己不完全理解的系统,用可能本身就有局限的方法,去解决需要某种理解才能搞定的问题。

我的想法

说实话,我觉得丹宁的论证有说服力,但不算一棍子打死。

没错,捕捉默会知识确实有根本性的困难。没错,具身体验可能比我们承认的重要得多。没错,图灵测试作为智能的标准可能本身就选错了。

但我也觉得,我们正在实时发现这些局限,而发现的过程本身就有价值。丹宁指出的每个挑战,同时也是研究问题。每撞一次墙,都让我们更了解人类的认知和意识。

也许这篇文章真正的教训不是"AI不可能有智能",而是"人类的智能比我们以为的更了不起"。

每当你听懂一个笑话、成功接住一个球、或者隐约觉得对话里有什么"不对劲"的时候——你正在做的事情,是我们最精密的计算机依然做不到的。

也许真正的问题不是"机器能不能像人一样思考",而是:它们真正擅长什么? 我们怎么把这些能力放进一个世界,在那里,人类特有的那些品质,变得越来越重要,而不是越来越不重要?

这个问题,值得好好琢磨琢磨。

你怎么看?丹宁的批评跟你用AI工具的感受对得上吗?还是你觉得这些系统的潜力被低估了?

评论区聊聊——我真的很好奇这个话题在大家心里激起什么样的想法。

#artificial intelligence #alan turing #machine learning #tacit knowledge #ai ethics #cognitive science #technology future #embodied cognition