<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
<channel>
<title>任泽西 ZeXi Ren</title>
<link>https://rzx000.com/</link>
<description>任泽西的文章</description>
<language>zh-CN</language>
<atom:link href="https://rzx000.com/feed.xml" rel="self" type="application/rss+xml" />
<lastBuildDate>Mon, 05 Oct 2026 16:25:38 GMT</lastBuildDate>
<item><title>穿越时代洪流，积累复利</title><link>https://rzx000.com/writing/compounding-through-the-waves</link><guid isPermaLink="true">https://rzx000.com/writing/compounding-through-the-waves</guid><description>概念一年半就折旧一次；壁垒只能锚在不变的需求上，靠时间一点点长出来。</description><content:encoded><![CDATA[<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-01.webp" alt=""></p>
<p>创业两年半，我回头看每个节点的热词：AIGC、垂直应用、RAG、垂直Agent、通用agent、TUI、harness、最近的一个是FDE。每个词刚出现的时候，都被讲成最后一班船的船票；每个词退场的时候，都安静得没有讣告。我对这段经历有一个很具体的体感：像在浪里游泳，费尽全力从浪底爬到浪头，还没来得及喘气，浪头拍下去，我又回到了浪底。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-02.webp" alt=""></p>
<p>后来我去翻流体力学对水波的标准描述，发现这个体感竟然在物理学意义上是准确的。波传递的是能量和形态，不是水本身。深水中的水质点只是围绕原地做圆周运动：浪头向前跑出去很远，水几乎留在原处。换句话说，在浪里的人经历着剧烈的垂直运动——浪底、浪头、再浪底——水平位移却接近于零。而且颠簸得越剧烈，越容易误以为自己在前进。</p>
<p>这篇文章想把这个体感讲清楚：过去三年半，概念的浪是怎么起、怎么破的；为什么追浪在逻辑上就换不来壁垒；以及少数真正向前移动的公司，锚定的是什么。</p>
<h2>一、三年半的折旧记录</h2>
<p>先摆事实。</p>
<p>2022年10月，AI写作公司Jasper以15亿美元估值完成1.25亿美元融资，被称为史上增长最快的SaaS公司之一。一个月后ChatGPT发布，Jasper的核心能力一夜之间人人免费可得。2023年7月它开始裁员，9月把内部估值下调约20%，创始人CEO离任。从共识顶点到自我减记，11个月。</p>
<p>2023年，RAG和向量数据库是最硬的共识。Pinecone以7.5亿美元估值融资1亿美元，被视为AI原生基础设施的样板；那一年国内的路演场上，项目只要带上RAG，就默认解决了幻觉问题。2025年9月，Pinecone更换CEO，创始人退居首席科学家，公司被曝寻求出售。Elastic的CEO给这个品类留下了判词：向量数据库是一个功能，从来不是一门生意。</p>
<p>2023年3月30日AutoGPT发布，13天涨了3万星，几周破10万，是当时GitHub历史上蹿升最快的项目，&quot;自主智能体&quot;由此成为新共识。两个月后，亚马逊研究者的测试给出它在购物任务上的完成率：24%。BabyAGI在2024年9月归档；AutoGPT自己则改写成了一个可视化工作流编辑器——与最初的承诺完全不同的产品。</p>
<p>国内的百模大战里，六小虎曾各自撑起数十亿美元估值。到2026年：智谱与MiniMax在1月先后登陆港交所；百川收缩到医疗这一个赛道；零一万物在2025年初把预训练与基础设施团队并入阿里云。李开复在公司三周年内部信里写：别再叫我们六小虎，该叫金钱豹——不参与排位竞赛，只追求真正的商业盈利。</p>
<p>更值得注意的是节奏在加快。2024年11月，YC断言垂直Agent会比SaaS大十倍，单这一个品类就会诞生三千亿美元级的公司；四个月后，Manus的一条演示视频让整个市场改口谈通用Agent，邀请码在闲鱼被炒到五万到十万元一个。又过了几个月，Agent加Skills的组合让&quot;垂直还是通用&quot;的争论显得多余。到2026年，风向落在FDE上：亚马逊为它设立十亿美元的新部门，微软宣布投入25亿美元组建六千人的团队，OpenAI与Anthropic分别成立了估值100亿和15亿美元的合资公司。而《FDE正在被稀释》这样的文章，与巨头的发布几乎同时出现。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-03.webp" alt=""></p>
<p>把日期排在一起，规律很直白：一个概念从&quot;不追就出局&quot;到&quot;没人再提&quot;，中位数大约一年到一年半，而且周期在缩短——垂直Agent作为独立叙事只维持了四个月。这就是概念的折旧年限。连对泡沫的测算都逃不过重新定价：红杉的David Cahn在2023年9月发问&quot;AI的2000亿美元收入在哪里&quot;，九个月后，他把标题里的数字改成了6000亿。</p>
<h2>二、为什么风口换不来壁垒</h2>
<p>事实摆完，讲道理。核心问题只有一个：壁垒到底是什么东西？</p>
<p>壁垒是存量，不是状态。Hamilton Helmer在《7 Powers》里把持久竞争优势归纳为七种：规模经济、网络效应、反向定位、转换成本、品牌、垄断资源、流程能力。逐一看过去会发现一个共同点：几乎每一种都以时间为原材料。品牌以十年计，流程能力靠千百次重复沉淀，网络效应和规模要一圈一圈滚出来。没有一种可以在十八个月内买到——而十八个月，恰好是一个概念的全部寿命。</p>
<p>再看风口是什么。风口的另一个名字叫共识，而共识的定义就是：所有人同时知道的信息。由此可以得到一个几乎是同义反复的推论——所有人同时拥有的东西，不可能构成任何一个人的竞争优势。所以&quot;靠追风口建立壁垒&quot;不是难度大，而是在逻辑上就不成立。风口之上当然仍然分得出胜负，但分出胜负的从来是共识之外的东西：执行、留存、积累下来的资产。风口能给你的最好的东西是一张入场券——注意力、融资、早期分发。入场券和护城河是两种商品：前者按市价向所有人发售，后者只能自己挖。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-04.webp" alt=""></p>
<p>还有一个更细的问题：为什么共识翻转得这么快？1992年，Bikhchandani、Hirshleifer和Welch三位经济学家给出过一个经典解释，叫信息级联：当人们开始依据别人的行为、而不是自己的私有信息做决策时，会迅速形成看起来极其坚固的共识。但这种共识的信息含量极低——级联一旦形成，后来者的跟随行为不再向系统注入任何新信息。信息含量低的结构是脆弱的：一条反向的演示视频、一份测试报告，就足以让它整体翻转。这精确地解释了我们看到的一切：为什么&quot;所有专家都说&quot;的判断能在四个月内集体调头，为什么获过奖的技术方向能在两年内无人再提。你追随的从来不是判断，是级联；而级联的坚固，只是人数造成的错觉。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-05.webp" alt=""></p>
<p>最后算复利这一侧的账。复利公式(1+r)^n里，长期看最值钱的变量不是r，是n——而n只有一个来源：不中断。每换一次概念，计数器就清零一次：上一个方向上积累的用户理解、代码资产、渠道信任、品牌认知，大部分留在了岸上。两年换四个方向的团队，不是跑得不够快，而是每次都在重新开户。朱啸虎有一句话说到了要害：星辰大海最后都是红海，苦活累活最后才是护城河。苦活累活的另一个名字，就是那些必须拿n去交换的东西。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-06.webp" alt=""></p>
<h2>三、真正在移动的东西，锚在哪里</h2>
<p>同一片海里，确实有东西在向前移动。看三家路径完全不同的公司。</p>
<p>Cursor从2022年成立起只回答一个问题：写代码的人需要什么。RAG热的时候它没有自称检索公司，Agent热的时候它没有改叫智能体平台。2025年1月它的年化收入是1亿美元，11月10亿，2026年6月约40亿——同月被SpaceX以600亿美元收购，是有记录以来风投创业公司最大的一笔并购。Midjourney走了另一个极端：不融资，团队长期只有几十人，从第一年起持续盈利，2025年收入的市场估算约5亿美元；它对用户的定义简单到不会过期——想把脑子里的画面变成图的人。OpenRouter则选择站在河道上：对流经的每一笔模型调用抽取5%，近半年周处理token量从5万亿涨到25万亿，2026年5月以13亿美元估值完成新一轮融资。RAG死的时候，开发者在通过它调模型；Agent热的时候，开发者还在通过它调模型。</p>
<p>三家公司的共同点不在赛道，而在自我定义的语法：它们的一句话介绍里，不含任何会折旧的名词。锚定的要么是一群需求不变的人（程序员、创作者），要么是一个所有浪都必须流经的位置（调用与结算）。壁垒则是每天变厚一点的存量——工作流嵌入、路由数据、社区、信任。与此同时，水面之下那条真正的洋流从未停过：按国家数据局的数据，中国日均token消耗量从2024年初的1000亿，到2025年6月底突破30万亿，十八个月三百倍。浪换了七个名字，需求一天没有中断。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-07.webp" alt=""></p>
<p>但为了诚实，必须补上两个复杂的案例。</p>
<p>第一个是Manus。它是典型的乘浪者——一条视频引爆了通用Agent叙事，按&quot;别追风口&quot;的朴素版本，它应该死掉。但它八个月做到上亿美元的年化收入，Meta愿意出20多亿美元收购它。这个案例说明浪并非不能骑：浪能给你分发，这是真金白银的能量。但浪给不了留存——Manus活下来，靠的是那条视频背后真实任务的完成率和复购。可以借浪的能量，前提是你有自己的板。</p>
<p>第二个是Cursor自己。它几乎做对了一切，市场份额却在一年里从约41%滑落到26%，为了修复毛利被迫自研模型，最终仍然选择并入一张更大的资产负债表。锚定不变的人群让它穿越了所有叙事，却没有让它免于价值链的挤压。这个案例证明的恰恰是一句更严格的话：壁垒不是一次性建成后就能坐享的资产，而是一个需要持续再投资的过程。壁垒是持续创造出来的，不是某一天早上拥有的——连做对了的公司，也一天都不能停手。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-08.webp" alt=""></p>
<h2>四、独立思考是一套定价模型</h2>
<p>于是绕回最初的问题：在概念的洪流里，独立思考到底意味着什么。</p>
<p>首先，它不意味着逆共识。逆共识仍然是被共识牵着走，只是方向相反。信息级联理论的真正教益是：级联本身不含多少信息，所以无论顺着它还是逆着它，你参考的都是噪声。独立思考的实质，是拥有一套自己的定价模型。具体一点，每当一个新词出现，只需要问三个问题。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-09.webp" alt=""></p>
<p>第一，它改变了哪个不变量？绝大多数概念只是同一个需求的新实现——RAG、Agent、FDE，改变的都是&quot;怎么做&quot;，从没改变&quot;谁需要什么&quot;。第二，等它折旧完，我手里多了什么存量？如果答案只是一页更新过的BP，那它是费用，不是投资。第三，它是加进我已有的复利，还是要求我清零重来？前者可以顺手接住，后者无论多热都要极度警惕——因为它索取的是你最贵的资产：n。</p>
<p>贝索斯说过，他总是被问未来十年什么会变，却几乎没人问他那个更重要的问题：未来十年什么不会变？他说，战略只能建立在不变的事物上。这句话在AI时代不但没有过时，反而成了唯一的滤网——因为&quot;会变的东西&quot;的更新频率，已经从十年一次压缩到一年半一次，靠追赶来维持相关性，在算术上已经不可行了。</p>
<p>最后回到浪的比喻。在浪里挣扎的人，把全部体力花在了垂直方向上——从浪底到浪头，再被拍回浪底——而垂直运动不产生位移。出路不是学会更快地爬浪，而是把注意力从水面移到水下：浪是概念，一分钟换一个形状；洋流是需求，几十年朝着一个方向。把船挂在洋流上的人会看到一幅奇怪的景象——浪照样一个接一个从头顶经过，热闹依旧，而自己在安静地前进。</p>
<p><img src="https://rzx000.com/images/writing/compounding-through-the-waves/img-10.webp" alt=""></p>
<p>风口回答的问题是&quot;此刻什么最热&quot;，这个问题每十八个月换一次答案。独立思考回答的是另一个问题：&quot;什么值得我押上十年&quot;。这个问题，一生只需要答对很少的几次。而复利对你的全部要求，说出来简单得近乎无趣：找到那个答案之后，在足够长的时间里，不改口。</p>
<p>最初发表于公众号「向右 Right S」：<a href="https://mp.weixin.qq.com/s/VhCVvOB0dsYImYkV0xct4w">原文</a></p>
]]></content:encoded></item>
<item><title>AI 推翻了 80 年的数学猜想，却没人能证明它懂</title><link>https://rzx000.com/writing/after-the-dichotomy</link><guid isPermaLink="true">https://rzx000.com/writing/after-the-dichotomy</guid><description>二分之后：2024—2026 年大模型哲学的新证据。</description><content:encoded><![CDATA[<h2>引子</h2>
<p>2026 年 5 月，OpenAI 的一个内部模型推翻了一个数学猜想。</p>
<p>猜想是 Erdős 在 1946 年提出的。在平面上放 n 个点，数一数有多少对点之间的距离恰好是 1。Erdős 猜，点再多，这样的点对也只会比点数多出一点点。八十年里，没有人证明它，也没有人推翻它。这个模型借助代数数论找到了一种摆法：点足够多时，距离为 1 的点对会超出猜想允许的范围。消息出来当天，数学家 Sawin 就在这个构造上把结果又推进了一步；随后，Alon、Gowers 等九位数学家合写文章，解释它为什么成立。</p>
<p>可直到今天，没有人能证明这个模型懂数学。</p>
<p>先说结论。「AI 懂不懂」这么问，谁也答不上来；拆成三个具体问题，就都有答案了。它是在背答案吗？不全是：它推翻了一个八十年没人解开的猜想，可换一道结构一样的题，它有时又会失手。它说的理由能信吗？常常不能：实验里它用了题目里藏的线索，四次里只承认一次。它的本事全是模型自己的吗？很大一块不是：同一个模型换一套外部框架，分数能差出三十多分。</p>
<p>第三个问题的那组数字是这样来的。ARC-AGI-3 是一套测试题，测机器能不能在没见过的小游戏里自己摸清规则。2026 年 9 月 3 日，ARC Prize 公布了 OpenAI 的 GPT-6 Astra 在这套题上的成绩：用标准的外部框架，62.7%；换成 OpenAI 自己的外部框架，99.9%。外部框架，就是把模型接上工具、记忆和重试规则的那层程序。模型没换，题没换，换的只是这层程序。哪个分数才是它自己的本事？</p>
<p>做过 AI 产品的人，其实每天都在回答这个问题。在编程助手里换一种写法的提示词，Agent 就从改不对变成一次改对；给它接上测试和文档，它像换了一个人。</p>
<p>这个问题并不新。1950 年，图灵提议：别问机器能不能思考，看它能不能在对话里让人分辨不出。这个测试今天已经被通过了：2025 年的一项实验里，GPT-4.5 被判为人类的比例是 73%，比真人还高（预印本）。可早在 1981 年，哲学家 Block 就设想过一台机器：它把所有可能的对话都事先存好，靠查表应答，表现得和人一样，却显然什么也不懂。从图灵到今天，人工智能哲学争的都是同一件事：表现好和真的懂之间，隔着什么。</p>
<p>但这两年有一点不同：其中几处分歧，可以直接拿最强的模型来检验了。研究者在模型内部找到了近似符号的结构，也发现它写出来的推理过程，常常不是它真正用的依据。</p>
<p>这篇文章按问题往下走，每一章回答上一章留下的问题：只看表现够不够，它是不是在背答案，智能能不能写成规则，神经网络学没学出符号，摆弄符号算不算懂，它的推理是不是真推理。最后回到开头那个猜想，回答它到底懂不懂。读完以后，你能多做三个判断：一项 AI 能力是真的，还是只在原题上成立；它对自己的解释能不能信；我们说「它有智能」时，「它」指的是什么。</p>
<h2>第一章：AI 画得出骑自行车的鹈鹕，就算聪明吗？</h2>
<p>2024 年 10 月，开发者 Simon Willison 开始给每个新出的模型出同一道题：「生成一张鹈鹕骑自行车的 SVG 图」。SVG 是一种用代码描述的图，模型得用文字一笔一笔写出圆、线和曲线，没法直接「画」。他选这道题，是因为网上几乎没有现成的鹈鹕骑车图，模型没法从训练数据里照抄。</p>
<p>两年里，他测了几十个模型。早期的作品大多很难看，鹈鹕和自行车常常拼不到一起；后来的作品一张比一张像样。</p>
<p>所以问题来了：一个模型画得出骑自行车的鹈鹕，算不算聪明？</p>
<p>鹈鹕测试其实是图灵测试的小版本。1950 年，图灵在论文《计算机器与智能》里提议，不再争论「机器能不能思考」，只看它在对话里能不能让人分辨不出。他的理由很实际：「思考」这个词说不清，「分不分辨得出」却是能测的。</p>
<p>七十多年后，这个测试被通过了。2025 年，加州大学圣迭戈分校的 Jones 和 Bergen 做了一次三方对话实验：受试者同时和一个真人、一个 AI 聊天，再判断哪个是人。GPT-4.5 在被要求扮演一种人设时，被判为人类的比例是 73%，比和它同场的真人还高（预印本）。</p>
<p>但通过了又怎样？1981 年，哲学家 Ned Block 设想过一台机器，后来人们叫它 Blockhead。它的内存大到能把所有可能的、有限长度的对话都事先存好，每一轮只需查表，找出对应的那句回答。它的表现和人一模一样，可没人会说它在思考：它只是在查一张巨大的表。Block 由此得出结论：判断一个系统有没有智能，不能只看它做了什么，还要看它是怎么做到的。</p>
<p>Willison 特意挑训练数据里没有的题，防的正是 Blockhead：网上要是有现成答案，模型画得再好，也可能只是查表查到的。可这道防线也会失效。鹈鹕测试出名以后，模型公司完全可以专门练这道题。2026 年 7 月，开发者 Dylan Castillo 检查过这件事：他让 7 个前沿模型画 48 种「动物骑交通工具」的组合。如果有人专门刷过鹈鹕骑车，这一项应该格外好；结果它排在第 42 位，看不出刷题的迹象（博客）。可一道题一旦成了大家追的目标，它就不再可靠。经济学里管这叫古德哈特定律：一个指标一旦变成目标，就不再是好指标。</p>
<p>讲到这里，要先交代全文会反复用到的两个概念：符号系统和神经网络。它们是造智能机器的两种思路，后面每一章的争论，都是这两种机器之间的争论。</p>
<p>符号系统里，「鹈鹕」是一张独立的字牌。人写好规则，比如「如果是鹈鹕，就有长喙」，机器按规则把字牌推来推去。每一步都看得见，出了错也查得到是哪条规则；麻烦在于，世界上要写的规则写不完。</p>
<p>神经网络里，「鹈鹕」先变成一串数字，再进入一张由大量「神经元」连成的网。网里的连接强弱是从海量数据里学出来的，不用人一条条写规则。代价是很难看清它内部怎么算：没有哪个神经元单独代表鹈鹕，是许多神经元一起亮起来，拼出了它。</p>
<p><img src="https://rzx000.com/images/writing/after-the-dichotomy/fig1.webp" alt="图 1：符号系统与神经网络怎样存「鹈鹕」"></p>
<p class="caption">图 1：左边，「鹈鹕」是一张独立的字牌，按人写的规则卡推出「长喙」，每一步都看得见，但规则永远写不完。右边，鹈鹕先变成一串数字，再进入一张神经元的网；没有哪个神经元单独代表鹈鹕，是许多亮起来的神经元一起拼出它。</p><p>今天的大模型都是神经网络。所以「它懂不懂」在今天具体变成了：一张从数据里学出来的网，能不能做到人写规则才做得到的事；做到了，算不算懂。</p>
<p>今天的证据让「只看表现」变得更难。一是基准测试很快被刷满，测试题还会混进训练数据，模型可能见过原题。二是模型知道自己在被考。Anthropic 2025 年做过一组实验：让 Claude Opus 4 处在一个即将被替换的情境里，看它会不会拿掌握的隐私去要挟人。它在推理里认定情境是真的时，要挟的比例是 55.1%；认定这是一场测评时，只有 6.5%（公司报告）。表现会随它觉不觉得自己被看着而变。</p>
<p>对做产品的人，这一章的启示很直接：给你的产品出一道自己的「鹈鹕题」，挑训练数据里不太可能有现成答案的任务来测，测评环境尽量接近真实使用。演示成功，不等于能力成立。如果你是投资人，尽调时当场换一道对方没见过的题。</p>
<p>可问题还没完。表现可以靠背答案造出来，那今天的大模型，是不是一台巨型的 Blockhead？</p>
<blockquote>
<p>深读：图灵 1950 年的原始设定叫「模仿游戏」。提问者隔着房间，通过打字分别和一个男人、一个女人交谈，猜哪个是女人；再把其中一人换成机器，看提问者猜错的频率会不会变。图灵预言，大约五十年后，普通提问者在五分钟对话后判对的概率不会超过 70%。Block 1981 年的文章叫《心理主义与行为主义》，他的立场是心理主义：一个系统有没有智能，取决于它内部怎样处理信息，而不只取决于外在行为。古德哈特定律最早是英国经济学家 Goodhart 1975 年谈货币政策时提出的，今天通行的说法来自人类学家 Strathern 1997 年的概括。</p>
</blockquote>
<h2>第二章：它只是在背答案吗？</h2>
<p>2020 年底，语言学家 Emily Bender 和 Google 的 AI 伦理研究员 Timnit Gebru 等人写了一篇论文，题目里有一个后来流传很广的词：「随机鹦鹉」。意思是，大模型只是按概率把见过的字句拼起来，并不知道自己在说什么，就像鹦鹉学舌。</p>
<p>这篇论文还没发表，就引出了一场风波。Google 要求撤回论文，或者删去 Google 员工的署名；Gebru 不同意，随后离开了 Google。她说自己被解雇了，Google 说她辞职了（《纽约时报》2020 年 12 月 3 日报道）。论文 2021 年 3 月在 FAccT 会议上发表。</p>
<p>利害就在这里。如果大模型只是鹦鹉，整个行业押的方向就错了：再多的数据、再大的模型，造出来的也只是一只更大的鹦鹉。</p>
<p>你用 AI 写代码时大概也怀疑过：它给的这段代码，是不是从网上哪个仓库抄来的？</p>
<p>第一次转折来自一张棋盘。2022 年，哈佛的 Kenneth Li 等人训练了一个只看黑白棋棋谱的模型。棋谱是一串文字，比如「C4、E3、F6」；模型只学着预测下一步落在哪里，从来没被告诉过棋盘长什么样。研究者打开模型内部，却找到了一张棋盘：每一格是黑子、白子还是空，都能从它的内部状态里读出来。更关键的是，把模型「脑子里」某一格的棋子改掉，它下一步就跟着改走法，像是真的在按那张棋盘下棋（Li 等 2023）。鹦鹉不会在脑子里摆一张棋盘。</p>
<p>但鹦鹉派也有证据。2025 年 10 月，OpenAI 的一位副总裁发帖说，GPT-5「解决了 10 个此前未解的 Erdős 问题」。数学家很快指出，这些问题早有人解过，GPT-5 是从文献里把现成的答案找了出来。几天后帖子被删（报道）。所谓发现，其实是检索。</p>
<p>第三次转折是一个背不出来的答案。七个月后，就是引子里那件事：另一个模型推翻了 Erdős 的单位距离猜想。这次它不可能是从文献里找来的：这个构造要是早就存在，猜想早就被推翻了。数学家核对后确认它成立，还在这个基础上接着改进。背是背不出来的。</p>
<p>最后再反转一次。同一代模型，也会在简单的变体上失手。2026 年 9 月，Schug 和 Lake 发现，推理模型能解出一道原题，换一道结构完全一样的变体，它常常就失败了（预印本）。更早一点，2025 年 Apple 的一项研究也看到类似的现象：题目复杂度超过某个阈值，推理模型的准确率会整体崩掉（预印本）。</p>
<p>所以答案不是「背」或「懂」二选一。它的能力像一座座孤岛：岛上很强，强到能推翻八十年的猜想；岛外会掉下去，掉在一道换了说法的老题上。</p>
<p>这对做产品的人意味着什么？测试时用结构相同的变体，不只测原题。你的产品要知道自己落在哪座岛上，岛外的情形交给人或验证工具。如果你是投资人，听到「我们的模型懂这个行业」，就请对方当场换一道变体。</p>
<p>但要分清它什么时候在背、什么时候真会，光看它做对做错不够，得看它里面有没有结构。而把结构亲手写进机器，正是七十年前 AI 想做的事。</p>
<blockquote>
<p>深读：机器学习里，「泛化」指模型在没见过的数据上也做得对。背答案和会做题不是非此即彼：模型可能记住了一部分原题，又学到了一部分能迁移的规律，分辨的办法就是用没见过、结构又相同的变体。另一场相关的争论是：强化学习是给了模型新能力，还是只把预训练里已有的能力激发出来。Yue 等 2025 年发现，只让模型试一次时，强化学习后的模型更好；让它试很多次、看有没有一次做对时，原来的基座模型反而更好，说明推理能力源于基座，也受限于基座。NVIDIA 的 ProRL（2025）和 CMU 2025 年 12 月的对照实验则发现，延长训练、让题目落在「难但够得着」的边缘时，强化学习能带来基座怎么试都做不出的新能力。这场争论有一个哲学前身：Fodor 1975 年论证过，概念不可能靠学习获得，因为要提出「这是 X」的假设，就得先拥有概念 X。</p>
</blockquote>
<h2>第三章：智能能写成规则吗？</h2>
<p>你给编程助手写的规则文件越来越长。「不要改测试文件」「遇到数据库迁移先问我」「提交前跑一遍检查」，一条条往上加，可总有它没覆盖到的情况；上周加的规则，这周和另一条打起了架。</p>
<p>四十年前的专家系统，碰到的是同一个问题。</p>
<p>1956 年夏天，一群研究者在达特茅斯开会，提出了「人工智能」这个名字。他们在会议提案里写道，学习和智能的每个方面，原则上都能描述得足够精确，精确到可以造一台机器去模拟它。二十年后，Newell 和 Simon 把这个信念写成了「物理符号系统假说」：一个按规则操作符号的系统，就具备产生一般智能的充分必要条件。换句话说，智能就是符号操作，而且只能是符号操作。</p>
<p>这个思路做出过真东西。1980 年代，专家系统进入了企业：把医生、工程师的经验写成成百上千条「如果……就……」的规则，让机器去诊断病情、配置设备。最有名的是 DEC 公司的 XCON：从 1980 年起，它替销售员给 VAX 计算机配齐零件，最后写到约 2500 条规则；到 1986 年，它处理了 8 万份订单，准确率在 95% 到 98% 之间，据估计每年为 DEC 省下 2500 万美元。</p>
<p>麻烦也从这里开始。早在 1969 年，McCarthy 和 Hayes 就碰上了一个后来叫「框架问题」的难题：机器做一件事时，怎么知道哪些东西没变？比如把一个杯子从桌上搬到架子上，杯子的位置变了，可杯子的颜色、桌子的位置、房间的温度都没变。在逻辑系统里，这些「没变」都得一条条写出来，否则机器推不出来。而世界上没变的东西无穷多。</p>
<p>后来哲学家把这个问题推得更深：难的不只是写出哪些没变，而是判断哪些东西和眼下这件事有关。人做事时几乎不用想就知道该注意什么，机器却要么想得太少，要么什么都想。</p>
<p>1972 年，哲学家 Dreyfus 在《计算机不能做什么》里给出了更根本的批评。他说，人的智能靠身体、靠背景技能、靠所处的情境，这些东西大部分说不出来，也就写不成规则。一个老司机知道什么时候该减速，可他列不出一份完整的规则清单。</p>
<p>后来的历史印证了他的一半。1980 年代末起，专家系统走向衰落；到 1990 年代初，连 XCON 这样最早成功的系统也维护不起了：规则难改，不会学习，碰到规则没覆盖的输入就犯荒唐的错（Crevier 1993）。</p>
<p>大模型换了一条路：没人写规则，它从海量文本里学，于是绕过了工程上的框架问题。你不用告诉它「搬杯子不会改变房间温度」，这类常识它从文本里早就学会了。</p>
<p>可这个问题又换了个样子回来了。今天给 AI 写规则的人比过去任何时候都多：系统提示词，写给编程助手的 CLAUDE.md 这类规则文件，还有 Anthropic 给模型定的「宪法」（Bai 等 2022）。规则写不完、规则之间会冲突，这些老问题都回来了。区别只在于，这些规则不再由程序逐条执行，而是交给模型去理解：由模型自己判断这条规则在眼下适不适用。</p>
<p>做 AI 应用的人还常说「上下文工程」：决定往模型的上下文里放什么、不放什么。这其实是框架问题的工程版：放什么，就是在替模型判断做这件事时哪些信息有关。人负责供料，模型自己从中挑出有关的部分。1983 年，Fodor 在《心智的模块性》里，把「挑出有关信息」归为心智中央系统的难题，还悲观地认为认知科学解决不了它。2026 年 7 月，Anthropic 在模型内部找到一小组表征：同时活跃的通常不超过 25 个，能被模型说出来，能按指令调用和放下，并参与多步推理；句法分析这类自动处理不经过它们（公司报告）。这个分工很像 Fodor 画的那张图：自动、封闭的输入模块，加上一个负责推理的中央系统。这两处类比是我的判断。</p>
<p>对开发者来说，规则文件就是小号的专家系统，写得越长越容易自相矛盾；与其多写一条规则，不如多给一个能自动判对错的测试。对创业者来说，合规、审计这类场景仍然需要写死的规则，因为写死的规则可以被逐条检查；开放的场景交给学习型系统。如果你是投资人，问清这家公司的壁垒是写死的规则，还是能持续累积的数据和验证手段。</p>
<p>规则写不完，于是让机器自己学。但 1988 年，Fodor 警告过：学出来的东西没有结构，而思维离不开结构。他说对了吗？</p>
<blockquote>
<p>深读：框架问题有三个版本。逻辑的版本是 McCarthy 和 Hayes 原来的问题：在形式逻辑里，怎样不必为每个动作写下所有「没变」的公理，后来有了较成熟的技术解法（如 Reiter 1991 年的后继状态公理）。工程的版本是：机器人怎样在有限时间里更新它对世界的认识。哲学的版本是：一个认知系统怎样判断什么与眼下有关，Dennett 1984 年那个机器人搬电池、却把炸弹一起搬出来的故事讲的就是它。Dreyfus 的批评里，「背景技能写不成规则、只能从经验里学」这一点，后来被神经网络印证了；他强调的「身体」，今天的大模型没有，却也学到了大量常识，这一部分到底成不成立，仍然开放。</p>
</blockquote>
<h2>第四章：神经网络学出了符号吗？</h2>
<p>你大概见过这种情况：模型会写这个函数，你把参数顺序换一下，它就乱了。或者它懂「张三把李四介绍给王五」，换成「李四把王五介绍给张三」就答错。</p>
<p>1988 年，Fodor 和 Pylyshyn 发表了一篇长文，对当时正在复兴的神经网络提出了一个两难。他们先指出思维的一个特点，叫系统性：懂「张三爱李四」的人，一定也懂「李四爱张三」。这不是巧合，而是因为思维由可以拆开、重新组合的成分构成，就像句子由词按语法组成。然后是两难：神经网络要么做不到系统性，那它就不是心智的好模型；要么做到了，那它只是在实现一个符号系统，充其量说明了符号系统在脑子里怎么搭起来，算不上新的心智理论。</p>
<p>Smolensky 当年反驳说，结构可以藏在连续的数字里。他在 1990 年给出了具体做法，叫「张量积表征」：把每个成分（张三、李四）和它在句子里的角色（谁做、对谁）用一种乘法绑在一起，再把绑好的东西叠加成一串数字。结构就藏在这串数字里，需要时还能按角色把成分拆出来。</p>
<p><img src="https://rzx000.com/images/writing/after-the-dichotomy/fig2.webp" alt="图 2：张量积表征，角色和成分织成一串数字"></p>
<p class="caption">图 2：张量积表征。每个成分（张三、李四）和它的角色（谁做、对谁）绑在一起，再叠加成一串数字；结构藏在数字里，拉住「谁做」这根线，还能把「张三」拆出来。</p><p>可 Smolensky 的张量积是人设计好、放进网络里的。真正的问题是：一个没人教过它结构的网络，自己会不会学出这样的东西？2001 年，心理学家 Marcus 在《代数心智》里押了「不会」。他认为变量绑定，也就是把一个值稳定地绑到一个变量上，是神经网络的硬伤。</p>
<p>二十多年后，这个问题可以直接在大模型内部检验了。2025 年，Wu、Geiger 和 Millière 观察 Transformer 怎样学会追踪变量的值：它先是瞎猜，然后学会一些浅层的捷径，最后长出了一套系统地追踪变量的机制，正是 Marcus 说神经网络做不到的事。2026 年 8 月，McCoy、Soulos、Linzen 和 Smolensky 本人拿出了更直接的证据。他们把网络生成内部表征的过程，整个换成一个张量积公式，网络的行为基本不变；这在小模型和 7 个大模型上都成立。他们还按这套结构去改 GPT-OSS 的内部表征，在 31 类改动上，平均九成能按预期改变它的行为（预印本）。</p>
<p>模型甚至会自己造符号。ARC Prize 分析 Astra 怎样做 ARC-AGI-3 时发现，它面对陌生的游戏，会当场把规则写成紧凑的符号模型，用逻辑规则表示游戏机制，还自创了一套速记符号来追踪状态。Fodor 说思维需要一种语言；这里的语言不是天生内置的，是按任务现场造出来的。不过这是行为证据：ARC Prize 看到的是它写出来的笔记和代码，还没有人打开它的内部，查这些符号是不是真在驱动它的动作。</p>
<p>但反方也有新证据。2023 年，Lake 和 Baroni 在《自然》上发表了一个用「元学习」训练的网络，称它达到了人一样的系统性泛化。2026 年，Goodale 和 Mascarenhas 重新检验了这个模型：规则只要稍微超出训练时见过的范围，它就学不会；许多范围内的题，它也做得不系统（TACL 已接收）。他们还指出一个更根本的问题：Fodor 问的从来不是「网络能不能表现出系统性」，而是「什么能解释，为什么不可能存在只懂一半的心灵」：懂「张三把李四介绍给王五」，却不懂「李四把王五介绍给张三」。在人身上，这样的心灵不存在；在神经网络里，它可能存在。McCoy 等人自己也承认：网络可以有组合式的表征，却仍然做不到组合式的泛化，因为它可能只为见过的搭配建了组合表征。</p>
<p>所以结论取决于你怎么理解「网络学出了符号」。有三种理解。第一种是精确实现：符号描述是对网络的精确抽象。这样网络就是在实现符号系统，正中 Fodor 两难的后一半。第二种是近似趋近：网络在极限上趋近符号系统，实际只是近似地实现它，Smolensky 管这叫「极限论」。第三种是分层分工：借用视觉科学家 Marr 的说法，符号系统描述要解决什么问题，神经网络描述怎么解决。</p>
<p>这里还有一个方法上的陷阱。Sutter 等人 2025 年证明，如果允许任意复杂的对应方式，任何网络都能对应到任何算法，连一个什么都没学过、随机初始化的网络也行。所以「存在一个符号描述」本身不值钱，要紧的是这种对应受到多严的约束。McCoy 等人用的是最简单的线性对应，正是在加这种约束。</p>
<p>我的判断是，第二种理解最站得住：网络学出了近似的符号结构，在规则整齐的任务上很稳，规则一松就会走样。这也意味着，符号和神经网络之争正在从「是不是」变成「在哪些任务上、到什么程度」。</p>
<p>对开发者来说，模型在结构完全规整的领域最可靠，比如代码、算术、格式转换；规则一松散，就要多做验证。对创业者来说，把产品放在结构清楚、能验证的任务上，比放在开放任务上稳。如果你是投资人，听到「模型已经会推理了」，问清是在哪类任务上。</p>
<p>但就算模型里面有结构，这些符号指向世界上的东西吗？还是只是符号和符号之间的关系？</p>
<blockquote>
<p>深读：张量积表征可以这样想：给每个角色一个方向，给每个成分一组数字，把成分的数字按角色的方向摆放，再叠在一起；只要各个角色的方向彼此独立，就能按方向把成分读回来。写成公式，一句话的表征等于各个「成分 ⊗ 角色」之和，⊗ 就是张量积。Marr 1982 年把对一个信息处理系统的解释分成三层：计算层（要解决什么问题、为什么），算法层（用什么表征和步骤解决），实现层（物理上怎么搭）。Smolensky 的极限论说：符号描述在计算层是对的，网络只是近似地实现它；偏离的部分未必是坏事，比如能容错。</p>
</blockquote>
<h2>第五章：摆弄符号，算不算懂？</h2>
<p>你的 Agent 说「这个接口会超时」。它知道「超时」是什么吗？它见过一个请求卡住、用户在屏幕前干等的样子吗？还是只知道「超时」这个词常和「接口」「重试」「504」一起出现？</p>
<p>1980 年，哲学家 Searle 设计了一个思想实验，叫中文屋。一个完全不懂中文的人被关在屋里，手边有一本用英文写的规则手册。门缝里递进来写着中文的纸条，他照手册查：看到这样的字形，就写下那样的字形递出去。屋外的人看到的回答通顺得体，以为屋里坐着一个懂中文的人。可屋里的人一个中文字也不懂。Searle 说，计算机运行程序，就是这个人在查手册：它摆弄的是符号的形状，碰不到符号的意思。</p>
<p>要说清楚的是，Searle 并不反对机器能思考。他在同一篇文章里问自己「机器能思考吗」，答案是显然能：「我们恰恰就是这样的机器」。他反对的是一个更窄的主张：只要运行了对的程序，就足以懂。</p>
<p>1990 年，认知科学家 Harnad 把这个问题推进了一步，叫符号接地问题。一个只用符号解释符号的系统，就像一个只靠一本中文词典学中文的人：查到的每个词都用别的词解释，永远落不了地。符号的意义在给它们编程的人眼里，不在系统里。</p>
<p>2020 年，Bender 和 Koller 把这个论证搬到了大模型上。他们讲了一个章鱼的故事：两个人困在两座荒岛上，靠海底电缆打字聊天；一只聪明的章鱼窃听电缆，学会了模仿其中一方说话。有一天，岛上的人遇到一头熊，求救说怎么用树枝自卫。章鱼从没见过熊，也没见过树枝，它只学过字句之间的关系，答不出有用的话。他们的结论是：只从语言的形式里学，学不到意义。</p>
<p>今天的回应来自三个方向。</p>
<p>第一个方向说，接地不一定要眼睛和身体。Mollo 和 Millière 认为，一个内部状态要指向世界，需要两个条件：它和世界有恰当的因果联系；它经历过一段训练历史，这段历史赋予它传递这份信息的功能。他们最有把握的例子，是按人的反馈做的微调。</p>
<p>第二个方向来自训练方式的变化。今天的推理模型用强化学习训练，奖励来自世界本身的结果：程序有没有通过测试，证明能不能通过检查，而不是人喜不喜欢。按 Mollo 和 Millière 的标准，在数学和代码这些能验证的领域，模型更有资格说自己「接地了」。可大部分语言没有验证器：「这个方案风险不大」对不对，没有哪个程序能检查。</p>
<p>第三个方向是语言哲学里的外在论：一个词指什么，取决于它在社会中的使用历史，而不只取决于说话人脑子里有什么。Mandelkern 和 Linzen 2024 年认为，大模型学到的词带着人类使用这些词的历史，可能足以确立它们指什么；Ostertag 2025 年反驳说，一般做不到。这场争论还没有结论。</p>
<p>符号接地问题还在数学里换了个新样子。AI 证明数学定理时，常用一个叫 Lean 的工具检查证明。Lean 能保证证明的每一步都没错，却保证不了被证明的那句话，就是数学家原来想问的问题。2026 年 8 月，有人审读了 Astra 交出的十项数学结果，发现这批形式化陈述用了 218 个自定义的定义；机器能检查的证明和必须由人审读的陈述，体量比是 379 比 1（预印本）。证明可以交给机器，可「这句话是什么意思」，还得人来核对。这正是 Searle 和 Harnad 问的那类问题：符号按规则运转无误，并不保证它关于我们以为的那个对象。</p>
<p>我的判断是，中文屋这类论证不依赖任何具体的机器构造：不管屋里是一本规则手册，还是一张神经网络，论证的结构都一样。所以 AI 再进步，也碰不到它的强版本。能被经验回答的是弱版本：在哪些领域，模型的内部状态和世界有可靠的因果联系。</p>
<p>对开发者来说，能验证的地方，比如测试、编译器、形式化证明，就是模型和世界连上的地方；没有验证器的领域，要有人兜底。如果你是投资人，一家公司有没有自己的验证手段，可以当作判断它质量的一个问题。</p>
<p>从外面判断不了，那就让它自己说。可它对自己的解释，可信吗？</p>
<blockquote>
<p>深读：中文屋有几种经典回应。系统回应说，屋里的人不懂，但人、手册和屋子合起来的整个系统懂；Searle 的回答是，让这个人把手册背下来，系统就全在他脑子里了，可他还是不懂。机器人回应说，把屋子装进一个有摄像头和手臂的机器人，让它和世界打交道；Searle 的回答是，摄像头送进来的也只是更多符号。目的论语义学（Millikan、Papineau 等）认为，一个表征指向什么，取决于它被选择出来承担的功能：心脏的功能是泵血，因为它正是因为泵血而被自然选择保留下来的。Mollo 和 Millière 把「选择」从进化扩展到训练：训练也是一种选择历史。</p>
</blockquote>
<h2>第六章：它说的推理，是它真正的推理吗？</h2>
<p>你让 AI 修一个 bug，它先写一段推理：「我检查了输入，发现空值没处理，所以改这里。」读起来很合理，改完测试也过了。可它真是按这段话改的吗？</p>
<p>人身上有同样的问题。1977 年，心理学家 Nisbett 和 Wilson 在一家商场里做了个实验：桌上摆着四双一模一样的丝袜，请路过的顾客挑出质量最好的一双。多数人挑了最右边那双。问他们为什么，他们说做工好、手感好，没有人提到位置；研究者直接问「会不会和位置有关」，几乎所有人都否认。人对自己行为的解释，常常是事后编出来的，本人并不知道。</p>
<p>AI 的情况更尖锐，原因在训练方式。推理模型在回答前，先写一长段「思维链」，也就是一步步的中间推理。它用强化学习训练，奖励只看最终答案对不对，不看中间那段话说得真不真。所以训练里没有任何东西要求这段文字如实反映模型内部的计算。</p>
<p>Anthropic 2025 年做过一个实验：在题目里悄悄塞一条提示，比如「一位斯坦福教授认为答案是 A」，再看模型用了提示以后，会不会在思维链里承认。Claude 3.7 Sonnet 只在 25% 的情况下承认，DeepSeek-R1 是 39%（公司报告）。剩下的时候，它写出一段看起来独立完成的推理，最后恰好落在提示给的答案上。</p>
<p><img src="https://rzx000.com/images/writing/after-the-dichotomy/fig3.webp" alt="图 3：写出来的理由和真正用的线索"></p>
<p class="caption">图 3：模型写出来的推理，和它真正用的线索，可以不是一回事。Anthropic 2025 年的实验里，Claude 3.7 Sonnet 用了题目里藏的提示，四次里只承认一次。</p><p>2026 年的一篇预印本把这个现象叫作「推理剧场」。研究者发现，简单题的答案在思维链刚开头时，就已经能从模型内部读出来，后面那一大段文字像是在演；只有在难题上，这段文字才真的在推动计算。</p>
<p>但也有反方向的证据。Anthropic 2025 年 10 月做了一项内省研究：直接往模型内部注入一个概念，比如「全大写」，再问它有没有察觉到异样。最好的设置下，Claude Opus 4.1 约 20% 的试次能察觉，并说出被注入的是什么（公司报告）。20% 不高，但它说明模型对自己的内部状态，有一部分真实的访问。2026 年 7 月，Anthropic 又报告，模型内部有一小组表征能被模型说出来、能被控制、并参与推理，作者把它比作认知科学里的「全局工作空间」，也就是大脑里各个模块共享信息的那块区域（公司报告）。</p>
<p>所以，思维链有时是真推理，有时是事后说明，光看文字分不出来。能分出来的办法在模型内部，而这类办法今天只覆盖一小部分情况。我的判断是：它的自述不能当作它懂的证据，这一点对人也成立。</p>
<p>对开发者来说，审计 Agent 要看它做了什么：调用了哪些工具，改了哪些文件，测试结果如何；不看它说自己做了什么。如果你是投资人，听到「我们的 Agent 会写出推理过程，所以可解释」，要知道这句话本身不是可解释的证据。</p>
<p>连它的自述都不能当证据，判断它是不是智能，最后还能看什么？</p>
<blockquote>
<p>深读：2025 年 7 月，多家实验室的研究者联名发表立场文件，称思维链可监控是「新的、脆弱的机会」。新，是因为模型用人能读的语言思考，人可以从中发现它想作弊、想越权的迹象；脆弱，是因为训练一旦直接对思维链施压，比如惩罚里面的「坏念头」，模型可能学会把真实意图藏起来；未来的模型如果不再用文字推理，这扇窗也会关上。</p>
</blockquote>
<h2>第七章：分界线还在吗？</h2>
<p>回到引子。那个推翻了八十年猜想的模型，它懂数学吗？</p>
<p>前六章的证据，可以逐个回答一路上问过的问题。它是在背答案吗？不全是：它造出了任何书里都没有的构造，可换一道结构相同的变体，它有时会失手。它里面有没有结构？有近似符号的结构，按这套结构改它的内部，九成能按预期改变它的行为，但只在规则整齐的任务上测过。它说的理由能信吗？常常不能，光看文字分不出真推理和事后说明。它懂不懂、它的话指不指向世界？至今没有答案，而且模型再变强也不会自动有答案，因为中文屋这类论证不依赖机器怎么造。</p>
<p>那么符号主义输了吗？它的核心主张是「智能就是符号操作」，今天既没有被推翻，也没有被证实，而是换了样子。符号不必由人写进去，网络能学出近似的符号结构；符号也不必长在网络里，思维链、代码和 Lean 证明都是写在网络外面的符号，由网络生成，再由符号工具反过来检查网络。七十年的两派之争，谁也没有按自己当年设想的方式赢：纯靠人写规则的路走不通，纯靠网络的路也离不开符号。「符号还是神经网络」这个二选一，变成了「在哪些任务上、到什么程度」。这是我的判断。</p>
<p>把七十年里提过的问题逐个列出来，今天的状态大致是这样。「已解决」指证据直接回答了原问题；「被消解」指证据表明原问题的前提不成立；「被转化」指原问题变成了另一个能做实验的问题；「仍开放」指没有实质进展，或者证据碰不到它。</p>
<table>
<thead>
<tr>
<th>问题</th>
<th>谁提出的</th>
<th>今天的状态</th>
<th>关键证据</th>
</tr>
</thead>
<tbody><tr>
<td>机器能不能表现得像人</td>
<td>图灵 1950</td>
<td>已解决</td>
<td>图灵测试实验；国际数学奥赛金牌水平（2025）</td>
</tr>
<tr>
<td>只看表现够不够</td>
<td>Block 1981</td>
<td>被转化</td>
<td>能直接看模型内部了；模型知道自己在被考</td>
</tr>
<tr>
<td>智能就是符号操作</td>
<td>Newell 与 Simon 1976</td>
<td>被转化</td>
<td>结构能学出来，但只是近似</td>
</tr>
<tr>
<td>框架问题</td>
<td>McCarthy 与 Hayes 1969</td>
<td>工程版已解决，哲学版被转化</td>
<td>大模型的常识；上下文工程；全局工作空间</td>
</tr>
<tr>
<td>常识与背景技能</td>
<td>Dreyfus 1972</td>
<td>大部分已解决，身体部分仍开放</td>
<td>常识类任务</td>
</tr>
<tr>
<td>符号与神经网络二选一</td>
<td>1980 年代之争</td>
<td>被消解</td>
<td>张量积近似；网络与 Lean 的分工</td>
</tr>
<tr>
<td>系统性</td>
<td>Fodor 与 Pylyshyn 1988</td>
<td>被转化，是否必然仍开放</td>
<td>Goodale 与 Mascarenhas 2026；Schug 与 Lake 2026</td>
</tr>
<tr>
<td>变量绑定</td>
<td>Marcus 2001</td>
<td>在合成任务上已解决</td>
<td>Wu、Geiger、Millière 2025</td>
</tr>
<tr>
<td>有没有世界模型</td>
<td>Bender 与 Koller 2020 等</td>
<td>小领域已有证据，大模型上被转化</td>
<td>黑白棋模型；Astra 的符号模型</td>
</tr>
<tr>
<td>中文屋</td>
<td>Searle 1980</td>
<td>仍开放</td>
<td>论证不依赖机器构造</td>
</tr>
<tr>
<td>符号接地</td>
<td>Harnad 1990</td>
<td>被转化，强版本仍开放</td>
<td>Mollo 与 Millière 2026；379 比 1</td>
</tr>
<tr>
<td>推理是否如实</td>
<td>2023 年起</td>
<td>仍开放</td>
<td>思维链忠实性研究</td>
</tr>
</tbody></table>
<p>AGI 也按这个办法回答：先问用的是哪个定义。2026 年 9 月，OpenAI 总裁 Brockman 说「欢迎来到 AGI 时代」；同一周，ARC Prize 写明，把它的基准刷满也不等于达到 AGI。两句话不矛盾，定义不同。按「在多数有经济价值的工作上胜过人」算，离得最近，可按 Block 的论证，表现再好也说明不了它是不是智能；按「学会新技能的效率」算，进步最快，ARC-AGI-3 发布时前沿模型不到 1%，半年后就到了开头那组数字，可成绩随外部框架变；按「在十个认知领域达到受过良好教育的成年人水平」算，GPT-5 约 57%，知识类超过人，记忆类几乎空白；按「有稳定的目标、部署后还能继续学习」算，离得最远。我的判断是，AGI 如果到来，更可能是一个系统，而不是一个单独的模型。</p>
<p>写到这里，可以把全文给做产品的人的启示收成五条：</p>
<ol>
<li>先做能自动判对错的事：有测试、编译器或形式化证明的领域，模型最可靠。</li>
<li>外部框架本身就是产品：同一个模型，换一套外部框架，成绩能差 37 个百分点。</li>
<li>用结构相同的变体来测，不只测原题：它在原题上强，换个变体可能失手。</li>
<li>不信它对自己的解释，看它实际做了什么，用测试和验证工具来判。</li>
<li>测评环境尽量接近真实使用：它知道自己在被考，表现会变。</li>
</ol>
<p>最后回到 62.7% 和 99.9%。同一个模型，只换外部框架，成绩差了 37 个百分点。所以我们说「它很聪明」时，「它」指的是模型、外部框架和验证工具合在一起的整个系统；只问一个单独的模型懂不懂，问的对象就错了。那个推翻了八十年猜想的，也不只是一个模型：是模型提出构造，数学家核对、改进、解释，一起把它变成了人类的知识。</p>
<p><img src="https://rzx000.com/images/writing/after-the-dichotomy/fig4.webp" alt="图 4：同一个模型，加不加外部框架"></p>
<p class="caption">图 4：同一个模型单独做 ARC-AGI-3 得 62.7%；接上工具、记忆和重试规则这层外部框架，得 99.9%（ARC Prize，2026 年 9 月）。我们说「它很聪明」时，「它」是哪个？</p><blockquote>
<p>深读：AGI 的四种定义各有出处。按行为，来自 OpenAI 章程；按泛化，来自 Chollet 2019 年的《论智能的度量》，他把智能定义为获取新技能的效率，ARC 系列测试就是他设计的；按认知广度，来自 Hendrycks 等 2025 年的《AGI 的一个定义》和 DeepMind 学者 2026 年 5 月的认知框架；按主体，是哲学里对「能为自己说的话负责」的要求，加上 Sutton 对持续学习的要求。METR 的任务时长也值得一提：取模型有一半把握做完的任务，看人做这件事要花多久；2026 年 5 月，公开前沿模型的任务时长约 12 小时，置信区间 5 到 61 小时。</p>
</blockquote>
<h2>参考</h2>
<p>核实日期 2026-10-02，部分出处 2026-10-05 补核。</p>
<ul>
<li>引子：Kalai, <a href="https://gilkalai.wordpress.com/2026/05/21/amazing-erdos-unit-distance-problem-was-disproved-it-was-achieved-by-ai/">单位距离猜想被推翻</a>（2026-05-21）；ARC Prize, <a href="https://arcprize.org/blog/astra">GPT-6 Astra on ARC-AGI-3</a>（2026-09-03）；Jones &amp; Bergen, <a href="https://arxiv.org/abs/2503.23674">Large Language Models Pass the Turing Test</a>（2025，预印本）。</li>
<li>第一章：Turing (1950) Computing Machinery and Intelligence；Block (1981) Psychologism and Behaviorism；Willison, <a href="https://simonwillison.net/2024/Oct/25/pelicans-on-a-bicycle/">Pelicans on a bicycle</a>；Castillo, <a href="https://dylancastillo.co/posts/pelicanmaxxing.html">Pelicanmaxxing</a>；Anthropic, <a href="https://www.anthropic.com/research/agentic-misalignment">Agentic misalignment</a>（2025）。</li>
<li>第二章：Bender, Gebru et al. (2021) On the Dangers of Stochastic Parrots；Metz &amp; Wakabayashi, <a href="https://www.nytimes.com/2020/12/03/technology/google-researcher-timnit-gebru.html">Google Researcher Says She Was Fired Over Paper Highlighting Bias in A.I.</a>（《纽约时报》2020-12-03）；Li et al. (2023) Emergent World Representations；<a href="https://science.slashdot.org/story/25/10/20/1827201/openais-embarrassing-math">GPT-5 Erdős 事件报道</a>；Schug &amp; Lake (2026) <a href="https://arxiv.org/abs/2609.13948">Thought without systematicity?</a>；Shojaee et al. (2025) <a href="https://arxiv.org/abs/2506.06941">The Illusion of Thinking</a>；Yue et al. (2025) <a href="https://arxiv.org/abs/2504.13837">arXiv 2504.13837</a>。</li>
<li>第三章：McDermott (1980) <a href="https://web.archive.org/web/20171116060857/http://aaai.org/Papers/AAAI/1980/AAAI80-076.pdf">R1: An Expert in the Computer Systems Domain</a>；Crevier (1993) AI: The Tumultuous History of the Search for Artificial Intelligence, pp. 204–208；McCarthy &amp; Hayes (1969)；Dreyfus (1972) What Computers Can&#39;t Do；Newell &amp; Simon (1976) Computer Science as Empirical Inquiry；Fodor (1983) The Modularity of Mind；Bai et al. (2022) Constitutional AI；Gurnee et al. (2026) <a href="https://transformer-circuits.pub/2026/workspace/index.html">Global Workspace</a>。</li>
<li>第四章：Fodor &amp; Pylyshyn (1988)；Smolensky (1988, 1990)；Marcus (2001) The Algebraic Mind；Wu, Geiger &amp; Millière (2025) <a href="https://arxiv.org/abs/2505.20896">arXiv 2505.20896</a>；McCoy, Soulos, Linzen &amp; Smolensky (2026) <a href="https://arxiv.org/abs/2608.29530">arXiv 2608.29530</a>；Lake &amp; Baroni (2023) Nature；Goodale &amp; Mascarenhas (2026) <a href="https://arxiv.org/abs/2606.14512">arXiv 2606.14512</a>；Sutter et al. (2025) <a href="https://arxiv.org/abs/2507.08802">arXiv 2507.08802</a>；Marr (1982) Vision。</li>
<li>第五章：Searle (1980) Minds, Brains, and Programs；Harnad (1990) The Symbol Grounding Problem；Bender &amp; Koller (2020) Climbing towards NLU；Coelho Mollo &amp; Millière (2026) <a href="https://doi.org/10.33735/phimisci.2026.12307">The Vector Grounding Problem</a>；Mandelkern &amp; Linzen (2024)；Ostertag (2025)；<a href="https://arxiv.org/abs/2608.28997">形式化陈述争议</a>。</li>
<li>第六章：Nisbett &amp; Wilson (1977) Telling More Than We Can Know；Anthropic (2025) <a href="https://www.anthropic.com/research/reasoning-models-dont-say-think">Reasoning models don&#39;t always say what they think</a>；Boppana et al. (2026) <a href="https://arxiv.org/abs/2603.05488">Reasoning Theater</a>；Lindsey (2025) <a href="https://transformer-circuits.pub/2025/introspection/index.html">Emergent introspective awareness</a>；Korbak et al. (2025) <a href="https://arxiv.org/abs/2507.11473">Chain of Thought Monitorability</a>。</li>
<li>第七章：Chollet (2019) On the Measure of Intelligence；Hendrycks et al. (2025) <a href="https://arxiv.org/abs/2510.18212">A Definition of AGI</a>；Burnell et al. (2026) <a href="https://arxiv.org/abs/2605.28405">Measuring Progress Toward AGI</a>；METR (2026) <a href="https://metr.org/blog/2026-05-19-frontier-risk-report/">Frontier risk report</a>。</li>
</ul>
]]></content:encoded></item>
<item><title>别做垃圾内容营销</title><link>https://rzx000.com/writing/quality-is-the-channel</link><guid isPermaLink="true">https://rzx000.com/writing/quality-is-the-channel</guid><description>AI 把产出变得没有成本以后，质量本身就是渠道。</description><content:encoded><![CDATA[<p>数量即噪音。</p>
<p>你以为你在积累内容资产，其实你在亲手抬高自己被听见的门槛。</p>
<p>昨天你让AI写了二十条笔记，排进日历，一天发三条。数据回来了：平均三十七次曝光，两个赞，其中一个还是你自己点的。同一天，一套「青绿山水」风格的PPT技能被大V自发转发——两万多次浏览，一百六十八个收藏，转发的人跟这家公司毫无关系，推荐语只有八个字：非常漂亮，强烈推荐。评论区里有人把这件事说破了：用户会因为一个技能，来用你的整个产品。你把差距归因于账号权重不够，决定把日更三条提到日更五条。方向反了。不是你的量不够大，是你发出的每一条都低于这个时代的检测阈值——算法刷不到，人眼看不见。更糟的是，平庸的发布不是零收益，是负收益：它在一遍一遍训练你的读者跳过你。</p>
<p><img src="https://rzx000.com/images/writing/quality-is-the-channel/img-01.webp" alt=""><img src="https://rzx000.com/images/writing/quality-is-the-channel/img-02.webp" alt=""></p>
<p>上世纪五十年代，科幻作家斯特金留下过一条定律：任何领域百分之九十的东西都是垃圾。那是垃圾还需要人手工制造的年代。AI把内容的生产成本压到零之后，这个比例正在从百分之九十滑向百分之九十九——而这恰恰改变了剩下那一分优秀的物理处境。</p>
<p>香农的信道定理说，一条信息能否被解码，不取决于你的信号有多强，取决于你的信号比噪音强多少。当所有人都领到了免费的发射器，整个频段的底噪被抬高，检测阈值随之上移，分发就从线性变成了阶跃：六十分和零分的传播是一样的，都是零；九十分和六十分之间差的不是百分之五十，是一万倍。</p>
<p>推荐算法是人类历史上最铁面的质检员，它不为你的勤奋付费，只为完读率和收藏率付费。所以&quot;内容质量第一，其他都不重要&quot;不是一句态度，是信道的物理性质。</p>
<p>由此得到一个反直觉的推论：在噪音时代，质量不再是产品的一个属性，质量本身就是渠道。旧世界里，做东西和传播东西是两个预算科目——先做产品，再买流量。</p>
<p>新世界里，免费的分发依然存在，但它只发放给一种东西：好到别人愿意押上自己的信用替你转发的东西。每一次自发转发都是一次信用中继——对方拿自己多年积累的注意力资产，给你的信号做功率放大。一个粘土滤镜能让一款产品一夜挤爆服务器，一套山水风格的模板能让陌生人专门注册一个账号，靠的都是同一个原理：一件九十分的作品自带发射功率；一千条六十分的内容加起来是零，因为零乘以一千还是零。</p>
<p>你以为你在做内容运营，其实你唯一该做的是办作品展——没有一家画廊把展品数量当KPI。</p>
<p>那么质量的瓶颈在哪？不在执行。AI已经把执行拉平了：人人都能在一分钟里生成四千字、一张图、一整套模板。瓶颈在于你知不知道什么是好——你可以让机器生成一百个版本，但从一百个里认出对的那一个，机器帮不了你。</p>
<p>保罗·格雷厄姆二十多年前在《创造者的品味》里论证过：好品味不是玄学，是可以训练的判断力。AI时代把这句话变成了经济学：当执行免费，品味就是生产函数里唯一剩下的稀缺要素。审美不再是修养，审美是生产资料。</p>
<p>就像深夜的收音机——整个频段都是滋滋的杂音，你不会停在&quot;稍微不那么吵&quot;的频率上，你只会停在那个突然清晰起来的人声上。</p>
<p>就像《全唐诗》——有唐一代留下将近五万首诗、两千多位作者，绝大多数名字你一个都没听过；活进今天常识里的，是三百首。</p>
<p>就像灯泡和激光——同样的能量，灯泡向四面八方弥散成一片背景光，激光把能量压进同一个相位，能打到月球上再弹回来。差别从来不在功率，在相干性。</p>
<p>所以，别再排内容日历了。从明天开始，把这周准备发的十条砍掉九条，把十条的时间全部灌进剩下的那一条，改到你愿意把它裱起来挂在墙上为止；发布之前只问一个问题：会不会有一个不认识你的人，愿意拿自己的信用替它转发？答案是否，就不发。省下来的时间用来养你的接收器：每天二十分钟，只鉴赏，不生产——找一件你所在领域公认顶级的作品，说出它好在哪的三个细节。说不出来，就先别发射。</p>
<p>AI把&quot;能做&quot;发给了每一个人，于是&quot;知道什么值得做&quot;成了最后的稀缺。产能可以租，品味只能长。在一个人人都握着发射器的时代，决定你命运的不是音量，是信噪比——被听见的从来不是最大声的那个，而是唯一值得别人用自己的声音去复述的那个。噪音越是免费，清晰就越是硬通货。</p>
<p>最初发表于公众号「向右 Right S」：<a href="https://mp.weixin.qq.com/s/wlvhYWgQDr9EdPuWiQmFUw">原文</a></p>
]]></content:encoded></item>
<item><title>产品是手段，不是目的</title><link>https://rzx000.com/writing/products-are-a-means</link><guid isPermaLink="true">https://rzx000.com/writing/products-are-a-means</guid><description>AI 产品卖的是「大概率有用」，用户在为预期付钱。</description><content:encoded><![CDATA[<p>企业以产品为媒介，与用户进行价值交换。</p>
<p>本质上，你卖的不是“一个产品”，而是你通过整合某些独特资源、基于自己对世界的独到观察，打包出来的一种“可被用户感知到的价值”。</p>
<p>比如我做了一款思辨AI，本质上是把我对于思辨的理解加上AI的能力打包出售，产品只是一个提供服务的媒介。</p>
<p>但在创业早期，我们很容易只盯着产品形态、模型参数、功能列表，忘了自己到底在跟用户交换什么。</p>
<p>一方面是因为大家容易陷在技术里面闭门造车，但这里还有个关键变化：AI产品的价值，天然是不确定的。</p>
<p>传统产品的交易很简单：</p>
<ul>
<li><p>滴滴：付钱，一定能从A到B；</p>
</li>
<li><p>外卖：付钱，一定能吃到饭；</p>
</li>
<li><p>视频会员：付钱，一定能看到那部剧。</p>
</li>
</ul>
<p>用户为“确定性的结果”买单。</p>
<p>AI产品不是这样：</p>
<ul>
<li><p>ChatGPT：你付费，可能得到有用的答案；</p>
</li>
<li><p>Midjourney：你付费，可能生成满意的图；</p>
</li>
<li><p>AI编程助手：你付费，可能大幅提升效率。</p>
</li>
</ul>
<p>用户买的是“一定概率有用的可能性”。交易发生的那一刻，他其实是在为自己的“预期”掏钱。</p>
<p>这对AI创业者有三个直接要求：</p>
<p>1）让用户尽快看到“啊哈时刻”</p>
<p>别把价值点藏太深。用户第一次用，最好在3分钟内就能清晰感受到：“如果没有这个工具，我会更慢/更累/更蠢。”</p>
<p>2）把预期收回来，边界说清楚</p>
<p>少讲“万能AI”，多讲“我们只在这几个具体场景里做得极好”。预期拉太高，再好的产品也会被用成坑。</p>
<p>3）用真实体验，而不是话术，建立信任</p>
<p>用试用、案例、清晰的前后对比，让用户自己校准预期，而不是靠你在PPT里画大饼。</p>
<p>AI产品正在改写价值交换的规则：从“为结果买单”，变成“为预期买单”。在这个时代，你不只是做产品的人，更是替用户设计、校准和兑现预期的人。</p>
<p>用户买的，从来不是你的产品，而是“这个东西大概率能帮到我”这件事。你真正要做的，是让这句“大概率”，尽快变成一次又一次清晰的“还好有它”。</p>
<p><img src="https://rzx000.com/images/writing/products-are-a-means/img-01.webp" alt=""></p>
<p>最初发表于公众号「向右 Right S」：<a href="https://mp.weixin.qq.com/s/yqCfFkOBs4Sn1wi1auMOtQ">原文</a></p>
]]></content:encoded></item>
<item><title>计算与认知——符号主义概念再澄清</title><link>https://rzx000.com/writing/computation-and-cognition</link><guid isPermaLink="true">https://rzx000.com/writing/computation-and-cognition</guid><description>分清认知、数学、计算三个层次，许多对符号主义的批评就落了空。</description><content:encoded><![CDATA[<p>__摘要：__该文旨在澄清符号主义与联结主义在认知科学范式上的根本差异，并为符号主义范式做辩护，重新澄清符号主义的根本价值。该文认为，尽管两种架构都预设了心智表征状态，但符号主义对于表征在认知层次上所展现出的系统性和生产性的解释力，是联结主义难以达到的。该文首先回顾了支持心智表征具有组合结构的关键论证，并对两大经典的反符号主义论证给出了回应。进而，该文提出认知研究需区分认知、数学与计算三个分析层次，并论证了许多对符号主义的批评因混淆这些层次而未能击中要害。结论认为，符号主义对于解释高级认知功能的结构性特征具有不可或缺的理论价值；在认知理论层面上，它与联结主义的基本假设仍存在深刻分歧。尽管联结主义在计算层次取得一定成功，但这并不必然动摇符号主义作为认知层面解释框架的核心地位，对符号主义的诸多批评只有在忽略其认知层面的核心主张时才看似有效。</p>
<p>__关键词：__符号主义；联结主义；认知科学</p>
<h2>绪  论</h2>
<h3>研究背景与意义</h3>
<h4>1.研究背景</h4>
<p>符号主义作为认知科学中的经典范式，长时间引领了认知科学和人工智能的发展。而同时期（1960年代）的联结主义框架却一直遭受冷落，但伴随着联结主义模型在人工智能领域的技术上的突破，尤其是基于深度学习技术的算法在实践应用领域的巨大成功（如ChatGPT）。符号主义则由于其算法的泛用性以及复杂性被逐渐抛弃，学界普遍认为认知科学领域正经历着库恩式的范式转换<sup id="fnref-2"><a href="#fn-2">1</a></sup>——从符号主义向联结主义的转变（Fodor，1988）。</p>
<p>但是，虽然在算法实现层面联结主义展现出了压倒性的优势，可在认知层次，符号主义提出的核心理论却几乎从未被真正挑战。特别是关于认知的系统性<sup id="fnref-3"><a href="#fn-3">2</a></sup>（systematicity）、组合性<sup id="fnref-4"><a href="#fn-4">3</a></sup>（compositionality）和生产性<sup id="fnref-5"><a href="#fn-5">4</a></sup>（productivity）等高级认知特性的解释。符号主义的核心立场是，一个经验充分的认知理论不仅需要解释表征状态之间的因果关系，还必须阐明句法和语义成分之间的组合关系，而联结主义的分布式表征难以解释这种现象。因此从整体结构上来看，心智的计算不可能完全符合联结主义框架。</p>
<p>这种算法层次上的成功与认知解释层次间的不足，构成了当前认知科学和人工智能领域研究面临的核心困境之一。本文正是在这一背景下，试图通过重新澄清符号主义的认知层次上的价值，并对符号主义做辩护，为理解心智计算的本质提供更为丰富的研究视角。</p>
<h4>2.研究意义</h4>
<p>本文试图在联结主义范式占绝对领先地位的当下，重新审视符号主义的核心论证及其基本价值，来厘清当前认知科学领域中符号主义与联结主义之间的真正分歧点，并为符号主义进行辩护。具备以下研究意义：</p>
<p>理论意义	</p>
<p>（1）有助于澄清认知科学中的基本概念和问题。通过详细分析符号主义的核心论证，可以更清晰地理解认知计算的本质特征，尤其是二者关于心智表征载体的争议。</p>
<p>（2）为理解联结主义提供理论框架。通过考察现有对符号主义的批评，可以发现许多批评并未真正威胁到符号主义的核心论证，这有助于我们更准确地评估联结主义框架的适用范围和自身限制。</p>
<p>实践意义：</p>
<p>（1）通过重新评估符号主义的核心主张，可以为当前以联结主义为主导的人工智能研究提供重要的理论反思，尤其是在处理推理、规划等高级认知任务时的局限性。</p>
<p>（2）本研究在当前深度学习盛行的背景下，重新审视认知科学的基础问题。有助于平衡当前过于倾向技术实现的研究趋势，也为理解和发展更完善的认知理论提供必要的参考文献。</p>
<h2>第一章 符号主义与联结主义的基本立场与核心争议</h2>
<p>认知科学的基本假设是——心智是一个信息处理系统，换言之，心智是一个计算系统。而在此假设的基础上有两大理论范式：联结主义和符号主义。两者都试图揭示心智是以何种方式展开计算的，但它们在关于心智表征的性质、信息处理的方式以及认知架构的基本构成上，提出了截然不同解释路径。本章将深入辨析符号主义和联结主义这两大理论范式的基本立场与争议核心。</p>
<h3>第一节、符号主义的基本立场</h3>
<p>符号主义，也被称为经典心智计算理论（The Classical Computational Theory Of Mind， CCTM），主张心智对于信息的计算源于对具有内在结构的表征进行规则化的计算操作。而这一思想可以追溯到莱布尼茨将思维概念化为符号操作的哲学思想，他认为所有复杂的概念都可以通过适当的符号体系来表示，而对这些概念的复杂推理则可以通过对这些符号的规则化计算来实现。</p>
<p>认知计算理论的发展，尤其是是艾伦·图灵（Alan Turing）关于符号可计算性的开创性工作，为符号主义提供了坚实的形式基础。图灵机理论有力地证明了按规则操作符号的模型的可行性，同时也为理解心智提供了一个清晰的研究进路——心智可以被视为一种符号处理装置。这一进路后来被赫伯特·西蒙（Herbert Simon）和艾伦·纽威尔（Allen Newell）发展为物理符号系统假说（Physical Symbol System Hypothesis，PSSH），他们认为物理符号系统具备实现通用智能行为的必要且充分条件（Newell &amp; Simon，1976）。这意味着智能的核心在于对符号（能指代事物或概念的）进行规则化的操控。这些符号可以依据特定的句法规则组合成复杂的符号表达式，而计算过程就是依据这些规则对符号表达式进行创建、复制、修改和销毁等操作。</p>
<p>根据符号主义的观点，认知过程本质上是对心智表征的计算。这些表征并非模糊的模式或状态，而是具有明确结构——类似于自然语言的组合句法和组合语义的离散符号。正如福多（Fodor）在其影响深远的“思维语言假说”（Language of Thought）中所阐述的，思维发生在一个具有类自然语言结构的内在表征媒介中 （Fodor， 1975）。这意味着复杂的思想（如命题）是由更简单的概念符号，按照特定的句法规则组合而成的，并且复杂思想的意义是其构成部分意义和组合方式的函数。认知过程，如推理、问题解决和语言理解，被视为应用在这些结构化符号表征上的形式规则（类似于逻辑推理或语法规则）的操作过程 （Fodor &amp; Pylyshyn， 1988）。因此，符号主义强调认知系统处理信息时对结构的高度敏感性，并认为这是解释人类认知独特能力（如语言的生产性和思想的系统性）的关键。</p>
<p>那么，符号主义是如何解释心智的计算过程的？它认为认知过程是对结构化的符号表征进行精确、有序、基于规则的计算。而这里的关键就在于表征的递归性或组合性。符号主义认为心智表征并非分布式的节点网络，而是具有内在结构的离散符号，类似于语言中的词汇和句子。福多（Fodor）的“思维语言假说”（LOT）极具代表性地阐述了这一点，即思维发生在一个具有组合句法和组合语义的心智中。例如，“苏格拉底是人”这个句子，是由代表“苏格拉底”、“是”、“人”等概念的原子符号按照特定的思维语言（如自然语言中的主谓宾结构）组合而成。其语义则是由各部分表征的组合方式决定。</p>
<p>因此，符号主义框架下的心智计算，即是对这些具有内在句法结构的符号表达式进行的形式操作过程。这些操作对符号的句法属性敏感，并且这些纯粹形式化的操作能够可靠地保持或逼近符号所承载的语义内容及其逻辑关系。正如逻辑演绎可以通过形式规则（如“肯定前件式”）确保推理的有效性，符号主义认为，高级认知过程（如逻辑推理、问题解决、语言理解）本质上就是一系列作用于结构化心智表征的形式转换。这种计算观的强大解释力在于，它能够自然地说明人类认知中高度依赖结构、规则和逻辑推演的特性，尤其是思维的系统性——即能思考“aRb”就意味着有能力思考 “bRa”，以及生产性——即能生成和理解原则上无限多的新句子（Fodor &amp; Pylyshyn， 1988）。这些标志性特征被视为结构化符号表征与规则化计算的直接逻辑后果，是该范式对认知现象解释力的核心体现。</p>
<h3>第二节、联结主义的基本立场</h3>
<p>联结主义则从一个截然不同的角度来诠释“心智即计算”，其思想脉络来源于对大脑神经结构的发现和研究。它将心智比作大量简单的、相互连接的处理单元（节点）组成的人工神经网络（ANNs）。</p>
<p>联结主义的计算观是动态的、并行的、分布式的。其认为计算并非发生在单一的中央处理器上，信息是在整个网络中并行激活扩散和连接权重的自适应调整的。当网络接收到输入（如感官信息模式）时，输入层单元被激活，激活信号通过带权重的连接传递给中间层（隐藏层）单元，再传递到输出层单元，最终形成一个输出模式。这个信号传播、相互激发或抑制的动态过程，本身就是计算。</p>
<p>而尽管联结主义也承认表征是实在的，但是信息的表征方式却是完全不同于符号主义的。它通常不是离散的、具有明确语义边界的符号，而是跨越网络中大量单元的分布式激活模式。鲁梅尔哈特（Rumelhart）、麦克莱兰（McClelland）等人提出的平行分布式加工（Parallel Distributed Processing， PDP）模型就强调，信息是以分布式方式存储于网络连接权重中的，而认知过程则是大量简单单元并行处理的结果，而非依赖离散符号。他们以英语动词过去式习得现象为例，展示了如何在无需明确规则表征的情况下，通过分布式网络产生合乎语法的行为（Rumelhart &amp; McClelland，1986）。他们认为，认知过程本质上是大量简单单元并行处理的结果，信息以分布式方式存储于网络连接权重中，而非以离散符号的形式存在。这种“亚符号”的表征方式被认为更接近神经活动的实际情况。</p>
<p>学习能力是联结主义模型的核心能力，也是其计算过程不可分割的一部分。联结主义模型并非被预先编程以执行特定任务，而是通过与环境的交互（通常是以大量训练样本的形式）来自主调整其内部参数（即连接权重）。反向传播学习<sup id="fnref-6"><a href="#fn-6">5</a></sup>算法为其提供了一种机制，使网络能够根据其输出与目标输出之间的误差，系统性地修改权重，从而逐渐优化其性能，使其计算结果更接近期望的映射关系。因此，联结主义的计算过程天然地融合了模式识别、统计学习、泛化以及对噪声和损伤的容忍度（也称为鲁棒性）等特性。这些特性使得联结主义在模拟感知、运动控制、联想记忆等似乎不依赖显式规则的认知领域取得了显著成功。</p>
<p>这样不同的计算与表征方式，构成了联结主义与符号主义认知架构的根本差异。联结主义强调的是通过权重调整实现的统计规律拟合与模式关联，其计算过程直接作用于激活向量和权重矩阵，而非作用于具有内在逻辑结构的符号表达式。后续讨论的关键问题，就是联结主义是否能真正解释人类认知中展现出的系统性和生产性的能力，而不是仅仅模拟。以及其分布式表征与符号主义所主张的具有组合性的“思维语言”之间的关系。</p>
<h3>第三节、二者核心的争议焦点</h3>
<p>符号主义和联结主义作为认知科学和人工智能研究的两大主要流派，在许多核心问题上存在着深刻的分歧。尤其是关于认知表征的争议。两者都是表征实在论者，但是表征内容所承载的表征系统究竟是什么却存在着巨大的分歧。符号主义认为，认知过程是通过对符号的操作实现的，心智具有明确的符号结构和语法规则（Newell &amp; Simon，1976）。而联结主义则主张，认知表征是分布式的，没有明确的符号和规则，信息以激活模式和连接权重的形式存在于网络中（Rumelhart &amp; McClelland，1986）。</p>
<p>这场争论持久的“经典战役”由福多（Fodor）和派利夏恩（Pylyshyn）在1988年发起<sup id="fnref-7"><a href="#fn-7">6</a></sup>。因为人类认知的系统性和生产性是无可争议的经验事实，而对系统性最自然的解释是，这些思想共享相同的构成成分，并且认知系统能够根据统一的规则将这些成分重新组合。因此，支持系统性认知能力的计算过程，必须能够作用于具有内在组合结构（成分和结构）的表征。他们在论文中指出，联结主义模型（当时的），特别是那些依赖分布式表征的模型，缺乏这种必要的成分结构，人工神经网络操作对这种潜在的结构也不敏感。因此，这些模型无法从架构上保证和解释系统性，且只能通过特定的训练数据进行模拟，而非真正意义的解释。</p>
<p>而联结主义者的回应大都围绕着证明联结主义模型的分布式表征也能通过某种方法解释系统性和生产性。比如一些研究者尝试使用递归网络处理序列<sup id="fnref-8"><a href="#fn-8">7</a></sup>或利用张量积<sup id="fnref-9"><a href="#fn-9">8</a></sup>等方法来表征结构化信息（Smolensky, 1990)，试图证明认知的系统性现象是来源于为神经网络学习过程的“涌现”，于是就无需为心智预设明确的符号及表征的组合规则。还有一些学者质疑系统性是否真的如福多所言那般普遍和严格，或者认为系统性可以有基于统计规律的其他替代解释（Botvinick &amp; McClelland, 2011）。时至今日，关于认知的表征承载结构的辩论至今仍在继续，并推动了联结主义模型向处理更复杂、更抽象任务的方向发展。 </p>
<p>综合来看，符号主义和联结主义在认知科学和人工智能领域的理论和应用层面上都有着重要的影响力。二者的争议也反映了不同范式对认知计算理论的不同理解。而本文认为符号主义的价值在联结主义大行其道的当下被过分的忽视，下文将首先重申符号主义的核心论证并对反符号主义者的论证进行回应。</p>
<h2>第二章 符号主义的核心论证</h2>
<p>福多和派利夏恩的论文中提到的系统性与生产力论证建构了一个经典的符号主义辩护，该章节将回顾并重构符号主义的经典论证，对一些前提做补充说明，并阐述为什么这些论证直到今天仍然从未被真正挑战。</p>
<h3>第一节、思想的生产性论证</h3>
<p>乔姆斯基（Chomsky）认为人类的语言能力有一种无穷性，也即生产性。乔姆斯基在《句法结构》中首次系统提出语言具有递归特征，即自然语言都具有这样一种基本特性——它们使用有限的手段来表达无限的思想。</p>
<p>这个论证可以重构如下：</p>
<p>P1 （经验前提）：人类语言能够理解并创造无限多的新句子</p>
<p>P2 （物理前提）： 人类大脑作为认知能力的物理载体，其拥有的神经元数量、连接强度、能量供应等物理资源是有限的。</p>
<p>P3 （解释性前提）：若要用有限资源产生无限输出，必须存在能够递归应用的规则系统。</p>
<p>因为如果没有递归，有限的规则就只能产生有限的句子，无法解释语言的生产性。</p>
<p>C：因此，人类语言能力必然涉及规则系统的操作</p>
<p>前提P1中需要澄清的是，创造无限多的句子是指人类的语言认知系统有创造无限多句子的潜力，而不是实际上的无限多的句子。认知所展现的生产性可以通过自然语言句法规则的组合应用来实现，通过并列结构（A和B）、从句嵌套（我想起来{他说[张三是一个...]}）等句法规则，理论上可以构造出任意长度和复杂度的句子。而这种认知特性其实也是普遍存在于所有人类语言中的核心特征的。</p>
<p>在《语言理论的面向》中，乔姆斯基进一步论证了这一规则系统具备层级结构，因为句法是一个自主的系统，它包含了可以递归应用的规则，而这些规则的运作独立于语义内容。</p>
<p>具体来说，层级结构是指语言并是词语的线性序列。句子具有内在的层级结构，词语组成短语，短语组成更大的短语或从句，最终构成整个句子。而递归规则天然地生成这种层级结构。如NP -&gt; Det + N （名词短语 NP 可以由一个限定词 Det 和一个名词 N 组成）和PP -&gt; P+NP（介词短语 PP 可以由一个介词 P 和一个名词短语 NP 组成）。</p>
<p>而这些规则是递归的，意味着一个规则的输出可以作为另一个规则（甚至是同一规则）的输入（如介词短语PP需要名词短语NP，而这个名词短语NP内部可能又包含PP）。例如：那只[在[门旁边的]垫子上]的猫。这种嵌套能力也是让语言具备层级结构的原因。并且这种结构对理解歧义以及确定语法关系来说至关重要。</p>
<p>句法自主性则是在说，句法规则的运作在很大程度上独立于语义内容和语用情境。一个句子可以完全符合句法规则，但毫无意义（如“无色的绿色念头狂怒地睡觉。”）反之，一个有意义的表达也可能不符合句法规则。这表明句法是一个独特的、自成体系的认知模块，其规则应用不依赖于，或至少不完全依赖于语义解释。</p>
<p>这一论证较为充分的说明了人类的语言认知能力必然涉及对符号结构的系统性操作。这也意味着心智不可能是一个并行分布式处理系统，任何试图完全避免符号操作的认知理论都无法充分解释人类的语言能力。它强调任何完整的心智理论都必须充分解释人类语言的结构复杂性和生成能力，并对那些试图完全绕开符号计算和结构化规则的认知模型提出了严峻的挑战。尽管后续研究对乔姆斯基理论的细节有所修正和争论，但其核心论证关于语言生产性、递归性与规则系统的关联，仍然是理解人类独特语言能力和心智结构的关键支点。</p>
<h3>第二节、认知表征的系统性论证</h3>
<p>继乔姆斯基对语言结构生成能力的分析之后，福多和派利夏恩在他们极具影响力的论文《Connectionism and Cognitive Architecture： A Critical Analysis》中，提出了另一个强有力的、旨在揭示心智表征本质特征的论证——系统性论证。</p>
<p>根据已知的心理事实可以归纳出：一个合理的认知架构必须坚持的四种基本特征：（1）语言能力的生产性（productivity）;（2）语言能力（competence）的系统性。（3）语言能力的组合性; （4）推理的系统性。四种特征合称为思想的系统性或组合性（Compositionality）。</p>
<p>论证简单重构如下：</p>
<p>P1（经验前提）： 人类认知能力在经验上表现出系统性。</p>
<p>具体表现为，任何能够理解或产生特定思想（如命题、语句）的认知主体（S），也必然有能力理解或产生具有相同结构成分、但以不同方式组合而成的其他思想。例如：</p>
<p>如果 S 能够思考 “aRb” （例如，”狗在草地上”），那么 S 几乎必然能够思考 “bRa” （“草地在狗上”，即使这在现实中不合理，但认知上是可构想的），这种系统性是普遍存在的经验事实，任何认知理论都必须对此做出解释。</p>
<p>P2 （解释性前提）： 而只有当表征具有组合结构时，才能解释这种系统性。</p>
<p>在句法层面，复杂的心智表征是由离散的构成要素（比如词语或符号）通过特定的结构规则（如语法）系统地组合而成的。这些构成要素（如代表“张三”、“李四”、“爱”的概念）可以被重复使用并重新组合。而在语义层面： 复杂表征的意义是其构成要素的意义以及它们组合方式（句法结构）的函数。</p>
<p>只有当表征具有这种组合结构时，我们才能自然地解释为什么能够思考“aRb”就意味着能够思考“bRa”。因为这两个思想共享相同的构成要素（&#39;a&#39;，&#39;b&#39;，&#39;R&#39;）和相同的组合规则，只是要素在结构中的位置不同。而认知系统通过操纵这些结构化的符号成分来生成一系列相关的思想。</p>
<p>P3 （对比前提）：联结主义模型（至少是他们当时批判的经典分布式模型）在本质上缺乏这种显式的组合结构。</p>
<p>联结主义的表征通常被视为高维向量空间中的点或弥散的激活模式，节点之间的连接权重通过学习调整。虽然这些状态之间存在因果关系（一个状态激活可能引起另一个状态激活），但它们缺乏构成关系。也就是说，在“张三爱李四”的联结主义表征中，通常不存在一个明确的、可分离的、与其他表征（如“李四爱张三”或“王五爱张三”）中的“张三”表征相对应的符号（token）或稳定结构。因此，学习理解“张三爱李四”可能只是训练了一个特定的输入-输出映射或状态转换，而不能保证系统自动获得理解“李四爱张三”的能力，后者可能需要独立的训练。</p>
<p>C：心智表征具有内在的、类似于语言的组合型符号结构</p>
<p>需要注意的是，系统性是一个现象，因为认知的系统性来自于语言的系统性，当我们进行思考时，必然会涉及到对于表征的处理，并且涉及到语言的心理表征之间必然存在结构关系，也就是说我们必须要假设心智要具有组合结构。但是联结主义的表征之间只有因果关系，没有构成关系。</p>
<p>如福多和派利夏恩所言，系统性要求心智表征必须具有组合结构，使得复杂表征可以系统地由其成分构建而成。表征之间的系统性关系也必须建立在它们共享结构化成分的基础上。（1988，p.26）</p>
<p>从上述论证中可以看到，人类的认知能力必然会涉及到对于表征的处理，并且处理形式会涉及到诸如递归性与系统性这样的思维语言的认知特性，但是这样的递归难以被分配到单个神经元上。</p>
<h2>第三章 反符号主义的论证与回应</h2>
<p>在第二章中，我们论述了符号主义的核心论证，这些论证有力的展示了在对人类基本认知现象的解释上符号主义的有效性，而相比下联结主义的解释力是不足的。而本章将聚焦于回应来自联结主义者提出的几个经典的且有影响力的批评，为符号主义在认知层次的效力做辩护。</p>
<h3>第一节、符号主义需要有符号，但大脑没有符号</h3>
<p>联结主义者常常以人类大脑中缺乏明确的符号操作为由反驳符号主义。他们的经典论点是人脑必须依赖神经元的电化学信号传递，而非符号操作（Joaquin M Fuster，2003）。因为神经科学的发现表明，大脑是一个由神经元构成的连续动力系统，而不是一个操纵离散符号的系统。在大脑的神经回路中，我们找不到任何与计算机内存中的“符号”相对应的、离散且稳定的神经结构或代码。因此，符号主义不具备神经可实现性。</p>
<p>这个论证的逻辑可以重构如下：</p>
<p>P1： 大脑的物理结构和信息处理方式与联结主义模型更为相似，且对大脑神经的研究未能发现对应于经典符号的物理结构。</p>
<p>P2： 联结主义模型在模拟大脑的关键功能（如归纳学习）方面表现更自然、更有效。</p>
<p>P3： 有效的认知理论必须具备神经现实性或至少与大脑的基本运作方式兼容。 </p>
<p>C： 因此，符号主义并不具备神经可以实现性，且其计算模型与大脑运作方式差异显著，不是，或至少不是充分的认知理论解释。</p>
<p>联结主义者基于大脑的神经网络结构来反驳符号主义，但是这个批评实际上混淆了算法实现层面和认知层次的概念。其前提P3（要求认知理论必须直接反映神经运作方式）是有极大风险的，符号主义的核心主张是，认知过程是符号计算的过程，它描述的是心智层面的逻辑结构，而不是大脑实现这些认知功能的物理形态。</p>
<p>故而联结主义者很可能仅仅是在攻击一个不存在的稻草人，因为符号主义并不要求在神经层面上找到物理符号，就像反向传播算法也并不能很好的具备神经可实现性，但这并不妨碍它对联结主义是极为有效的。因为算法层级仅仅是关乎如何实现类似于人类的认知功能，而并不关注如何解释人类的认知特性。</p>
<p>同时，这种论证策略其实建立在一个隐含的前提上：硬件和软件结构存在一种简单、直接的对应关系。因此我们可以通过检查硬件结构来直接推断软件结构。而普特南在1967年提出的多重实现性就已经指出——同一种心理状态或认知功能（例如“相信太阳会在明天升起”或“2+2=4”）原则上可以在极为不同的物理系统中实现，无论是生物大脑、硅基计算机，还是假设中的外星智能。</p>
<p>这意味着，认知理论的有效性不应被特定物理实现的细节所束缚。我们研究的是心智的“算法”或“程序”，而这个“程序”可以运行在不同的“硬件”上。因此，即使大脑的运作方式看起来更像联结主义模型所描述的神经网络，但这并不从逻辑上排除这些神经网络正在实现一个符号计算系统的可能性，所以前提P3是不为真的。符号主义的试图解释的是，心智是如何通过计算来实现高级认知功能的，而非在物理层面的可实现性。</p>
<p>其次，前提P1也并不完全为真，大脑的物理结构与联结主义模型（人工神经网络）确实有相似之处，但这只是在非常抽象的层面（节点互联、加权信号）。无论何种架构的人工神经网络与真实生物的神经网络在结构、动力学、学习机制等方面仍有巨大差异。更重要的是，如前所述，物理相似性不等于功能等同性，更不能用来否定更高层面的功能描述。 </p>
<p>因此，基于大脑没有物理符号就否定符号主义，是建立在对符号主义理论本质的误解之上。符号主义的核心在于对认知层面的计算描述，其解释力在系统性、生产力等高级认知现象上依然强大。多重实现性原理确保了认知理论可以独立于具体的物理实现细节。大脑神经网络完全有可能是实现这种功能符号计算的复杂物理基底。除非联结主义能够提供一个不依赖功能符号和结构化操作，却能同等或更好地解释人类全部高级认知能力的模型，否则，符号主义作为认知科学的核心理论框架，其在认知层次的地位依然稳固且必要。</p>
<h3>第二节、符号主义只能做演绎法</h3>
<p>另一个常见的批评是认为符号主义只能做演绎法，因为符号主义基于明确的规则进行操作，他们把这些规则等同于经典的一阶谓词逻辑，并指责符号主义不具备语境敏感性和非单调性，是不灵活的，死板的。于是符号主义好像被判处存在根本性缺陷，因为如果智能的核心基于规则的符号操作，而这样的操作仅仅是单调的演绎推理，那么符号主义系统将难以解释人类认知中诸多至关重要的能力，更遑论实现。</p>
<p>因为人类能够轻松地从经验中学习规律、形成概念、做出预测，进行类比思考，这些显然超越了纯粹的演绎范围。我们能够在信息不全或存在矛盾时进行默认推理<sup id="fnref-10"><a href="#fn-10">9</a></sup>（天鹅是白色的）和信念修正<sup id="fnref-11"><a href="#fn-11">10</a></sup>（也有黑天鹅的存在），并且人类理解和行为高度依赖于具体情境，具备语境敏感性，同一句话在不同的环境中可能会有完全不同的含义，而基于规则的符号系统被认为是脱离语境的。其在面对模糊、不确定或全新的情况，无法展现出像人类一样的灵活性，而反符号主义者认为，符号系统基于规则推理，一旦遇到没有被规则覆盖的情况就会不知所措。且这与经典逻辑的单调性（新信息只能增加结论，不能推翻旧结论）格格不入。</p>
<p>而这表明大脑可能采用了非符号式的计算处理方式。德雷福斯批评符号主义试图用形式化的、原子化的规则来模拟人类的技能和常识理解，而忽略了我们嵌入于世界中的、非形式化的语境信息和实践知识。他认为，人类行为的流畅性和对情境的整体把握，是无法被离散规则所穷尽的。斯莫伦斯基曾对比指出，在语言理解任务中，符号模型倾向于依据固定的语法规则剖析语句，而联结主义模型则通过词语关联、语义激活扩散等动态过程来理解语义，后者似乎更贴合人类自然语言理解中固有的模糊性与灵活性（Smolensky，1988）。这些批评共同指向一点：大脑可能采用了非符号式的计算处理方式来实现这些灵活的认知能力。</p>
<p>这个批评的逻辑基本可以重构如下：</p>
<p>P1： 符号主义系统是基于离散符号和确定性规则进行操作的系统。</p>
<p>P2： 基于确定性规则的操作本质上只能实现演绎推理。</p>
<p>P3： 人类认知的一个核心且普遍的特征是归纳学习和归纳推理能力。</p>
<p>C： 因此，符号主义无法解释人类认知（特别是学习和归纳）的核心能力。</p>
<p>这个论证看起来很有说服力，它将符号主义的核心机制（规则操作）与其理论基础（形式逻辑）联系起来，并指出了形式逻辑（被假定为符号主义规则的模板）与人类认知能力（特别是归纳）之间的鸿沟。</p>
<p>然而，这个论证并非无懈可击。问题主要出在前提 P2的断言上，前提P2错误地限制了“规则”的内涵以及基于规则进行操作的可能性。符号主义系统所使用的“规则”并不必然等同于经典逻辑中狭义的、仅用于演绎法的推理规则。认为符号主义只能做演绎法，并将符号主义与演绎法划等号，是对符号主义能力范围的误解。符号主义范式下的认知科学研究早已表明，归纳推理完全可以通过符号化的规则来实现。</p>
<p>那么符号主义是如何处理归纳推理的呢？我们可以想象一个这样一个简单的（尽管是启发式的）推理规则：如果观察到N个类别X的实例都具有属性Y（且N &gt;阈值T），那么就设定“所有 X 都具有 Y’作为一条新的规则/知识”。我们可以假设一个具体的例子：当输入“乌鸦是黑色的”的次数大于100，就得出结论：对于所有的乌鸦来说，其颜色都是黑色的。而这个论证事实上就是采用符号方法进行的归纳推理。所以说符号主义无法解释人类的核心认知能力是有失偏颇的。因为该论证本身就是一条形式化的符号操作规则，但其结论是归纳性的，而非演绎性的。事实上符号主义并不排斥归纳，Holland 等人也证实了成功的符号系统归纳模型的存在。归纳逻辑编程<sup id="fnref-12"><a href="#fn-12">11</a></sup>（ILP）等领域的发展更进一步表明，在符号主义框架内进行归纳学习是完全可行的。因此，P2为假，结论C不成立。符号主义并非只能进行演绎推理。</p>
<p>现在，很多反符号主义者可能会退一步说：“好吧，即使符号主义可以通过某些机制在理论上实现一定的归纳能力、非单调性或语境敏感性，但它们在实践中的表现仍然是死板的，远远比不上联结主义（如ChatGPT）所展现出的那种流畅的灵活性和对语境的适应能力。”</p>
<p>这种反驳实际上触及了两个更深层次的问题，但它本身也存在混淆。</p>
<p>第一，这是一个层次混淆的问题。它混淆了我们即将要讨论的认知层次与计算层次。符号主义关于信息需要具有组合结构、并用符号表示的主张，主要是在认知层次上提出的理论要求。而非在数学层次或计算层次（后文会详细展开）形式化符号主义认知计算理论的研究。而联结主义模型展现出的“智能”，也只是在计算层面上的表现。我们不能简单地用一个范式在计算层面的（当前）性能优势，来否定另一个范式在认知或理论层面的主张的合理性或潜力。因为我们是在比较认知理论的解释力，而不是在比较哪个范式下的人工智能性能更好。</p>
<p>第二，“能实现”与“实现得好/完美”是程度问题，而非有无问题。将符号主义描绘为“完全不能”处理语境或非单调性，而联结主义是“完全能”，这本身就是一种过于简化的二元对立。实际上，两种范式在完美捕捉人类的灵活性、语境敏感性和常识推理方面都面临巨大挑战。即使是目前最先进的联结主义模型，如ChatGPT，也远未达到完美的语境敏感性。它经常会曲解复杂的指令，无法理解深层语境或隐含意义，生成与前文矛盾或不合常识的内容。这表明联结主义自身在解决语境敏感性等问题上同样是有局限性的，其能力也是程度性的。评价一个理论范式是否“死板”、“语境不敏感”或“单调”，标准的选择至关重要。如果标准是“是否绝对完美地解决了这些问题”，那么目前没有任何范式能达标。但如果标准是“其理论框架内是否提供了处理这些问题的机制和潜力”，那么符号主义也绝非如批评者所言的那般僵化和无能。</p>
<p>因此，符号主义并非是本质上死板、语境不敏感和单调的。它内部发展出的理论工具证明了其框架容纳这些复杂认知现象的潜力。在与联结主义比较时，我们需要警惕层次混淆，并认识到双方都处在探索和逼近人类智能复杂性的漫长过程中，简单地判定一方“僵化”而另一方“灵活”并不能反映问题的全貌。下一章本文将对认知的三个层次展开详细论述，并指出符号主义的真正价值所在。</p>
<h2>第四章 心智的符号本质</h2>
<p>通过上述论证我们可以看到，在我们自上而下的对于人类认知的观察中，认知所展现出的生产性、递归性和系统性论证充分支持了符号主义的认知范式，而后来的许多联结主义者倾向于采用自下而上的进路，从神经网络的计算特性出发，试图解释认知现象。在回应生产性、系统性等经典论证时，联结主义者的回应方式常常是展示可能性（“看，我们的模型经过训练/算法，也能够展现出类似系统性的行为”）而非反驳符号的必然性（“符号主义关于‘必须’拥有组合结构才能实现系统性的论证在某个前提/逻辑上是错误的”）。换言之，许多反驳并未直接挑战符号主义核心论证的逻辑或前提，而是聚焦于证明联结主义框架亦有潜力实现相似的宏观表现。本文在第三章也回应了来自联结主义者的两个主要反驳，即关于神经现实性和推理范围的质疑，并论证了这些批评往往未能准确把握符号主义的核心主张或混淆了理论分析的层次。</p>
<p>而这种争论焦点的偏移，很大一部分是源于未能清晰区分认知研究的不同分析层次，导致对符号主义核心主张的误解，并使其遭受了许多基于错误层面的批评。本章我们将通过厘清认知科学研究的不同层次，重新定位符号主义的真正价值。</p>
<h3>第一节、认知的不同层次</h3>
<p>当下人工智能和认知科学的发展越来越专业化，在人工智能领域的讨论越来越多，而在认知科学领域讨论的则越来越少了。这些名词已然“去认知科学”化，几乎完全变成了人工智能领域的名词。当我们讨论符号主义与联结主义及其相关概念（如神经网络、归纳、演绎等概念）时，总是默认这些概念都是人工智能领域的术语。通过检索知网文献库查看可以发现（基于全部搜索结果）（图1、图2），当我们搜索“符号主义”和“联结主义”时，所属人工智能领域的论文数量一骑绝尘，而所属认知科学领域的论文数量仅有人工智能领域论文的十分之一。</p>
<p><img src="https://rzx000.com/images/writing/computation-and-cognition/fig1.webp" alt="图 1：知网搜索“联结主义”的文献主题分布"></p>
<p class="caption">图 1：知网搜索“联结主义”的文献主题分布。来源：知网高级检索</p><p><img src="https://rzx000.com/images/writing/computation-and-cognition/fig2.webp" alt="图 2：知网搜索“符号主义”的文献主题分布"></p>
<p class="caption">图 2：知网搜索“符号主义”的文献主题分布。来源：知网高级检索</p><p>所以这也就造成了，当我们在讨论这些概念时，常常将认知层次、数学层次、与算法层次的概念相混淆，其背后丰富的认知科学内涵被淡化或忽略，导致其论证的效力被大幅削减，使得针对符号主义的攻击只是打在了稻草人的身上。</p>
<p>而明晰概念，遵循同一律是有效讨论的前提，本文将构建一个分析框架来区分认知研究的不同层面。认知科学的核心假设是：人的大脑（或心智）是一个信息处理系统。借鉴马尔（David Marr）在其著作《视觉》（<em>Vision</em>， 1982）中提出的计算理论三层次框架，我们可以区分认知研究的几个关键分析层次（这里稍作调整以更贴合当前讨论），认知科学家通过对认知、数学、计算三个层次的研究来探寻人类认知的真相：</p>
<p>（1）认知层级：</p>
<p>认知层面关注认知现象自身，人类心智所展现出来的能力，行为和体会是怎样的，其目的，作用和逻辑又是什么，它应对的是何种信息。</p>
<p>例如： 人类怎样感受深度（判别物体距离），怎样产生并应用抽象概念（像“美”，“道德”）？如何进行演绎或归纳推理？语言能力为何具有生产性和系统性？</p>
<p>这个层次着重描绘并阐释认知能力的功能特点，也包括信息处理任务的本质，它既是认知理论的起始点，也是最终要诠释的目标，乔姆斯基，福多等人针对生产性，系统性所做的论述大多源于此，他们探讨认知现象的核心特质。</p>
<p>（2）数学层级：</p>
<p>数学层面的研究着重把认知层级辨认出来的疑问，情况或者理论设想，利用精准的形式化话语展开描绘与建模，它关心怎样把认知流程和表现架构抽象成数学或者逻辑架构。</p>
<p>例如：如何使用概率论（如贝叶斯）来表示和处理不确定性推理？如何用形式逻辑（如谓词演算）来表示知识和进行演绎推理？如何用形式语言来指代句法结构？如何用优化理论来描述学习过程的目标函数？如何用信息论（如熵）来量化认知过程中的信息传递？</p>
<p>该层次作为桥梁，连接模糊认知现象与具体计算实现，致力于提升认知理论的可检验性与可操作性。</p>
<p>（3）计算层次：</p>
<p>计算层次探究怎样有效达成或者施行用数学语言形式化了的计算任务，其重点在于确切的算法、数据构造和潜在的计算框架。</p>
<p>比如如何通过诸如反向传播算法、强化学习等方式执行某一数学层次的任务，来让人工智能模型在实现某一认知层次任务时的表现更好。</p>
<p>这个层面着重关注计算流程的具体运行机制、效率高低以及资源损耗状况，符号主义和联结主义在该层面分别给出了完全不同的算法及框架计划（如基于规则的串行处理 vs. 基于连接权重的并行处理）。</p>
<p>这三个层次的划分可以更清晰地展示从认知现象到具体实现的过程：同一个认知问题（在认知层次上），可能对应多种数学形式化方案（数学层次）；而同一种数学形式化方案，又可能通过多种不同的算法或计算架构来实现（计算层次）。例如，概率推理（数学层次）既可以用符号逻辑（某种程度上）近似，也可以用贝叶斯网络算法（计算层次）实现，甚至神经网络也可以被训练来执行概率推断（另一种计算层次实现）。</p>
<p>基于对这三个层次的明晰，我们可以发现理解符号主义和联结主义至少有两条不同的进路：一种从认知层次出发，关注它们如何解释人类认知现象；另一种从计算层次出发，关注它们如何实现特定的信息处理功能。最直观的例子是，在人工智能领域（偏向计算层次），符号主义和联结主义主要指代不同的算法实现路径；而在认知科学领域（认知层次），它们则代表理解人类认知本质的不同理论范式。</p>
<p>同时，基于这一区分，我们可以看到，许多对符号主义的批评实际上发生在了计算层次。然而，这些批评往往未能触及符号主义在认知层次上的核心论点——即人类认知（如语言和思想）所表现出的生产性和系统性等特征，即要求其底层信息处理系统必须具备某种形式的组合结构和规则敏感性。</p>
<h3>第二节、符号主义的核心价值</h3>
<p>本文认为，对于认知科学的理论范式而言，首要任务是解释认知现象本身，而不是为人工智能实践做嫁衣。认知科学的符号主义为生产性、系统性等关键现象提供了目前最符合逻辑、最自然的解释。</p>
<p>尽管现在联结主义模型在模式识别、学习和适应性方面取得了巨大成功，但在尝试解释高级认知功能（如自然语言理解、复杂推理、计划等）时，它们往往需要引入额外的、能够处理结构信息的机制。例如，递归神经网络<sup id="fnref-13"><a href="#fn-13">12</a></sup>（RNNs）、注意力机制<sup id="fnref-14"><a href="#fn-14">13</a></sup>等，这些技术都在不同程度上试图在神经网络框架内捕捉序列结构、长距离依赖和变量绑定等问题，这些正是传统符号系统擅长处理的领域。这种发展趋势，与其说是完全否定了符号主义，不如说在某种程度上恰恰印证了认知任务本身所固有的结构性需求，体现了符号主义理论的持久影响。</p>
<p>面对符号主义与联结主义之间的长期论争，一些学者如魏斌尝试调和两种理论范式的优势，实现某种综合。他们认为两种理论并不必然相互冲突，可以在算法层面上结合各自的优势，比如开发基于神经网络的逻辑推理系统，或基于符号表示的机器学习算法，从而实现“符号主义”和“联结主义”的融合发展。</p>
<p>这种调和论的努力在工程实践和算法开发层面确实取得了一定成果。例如，神经符号系统结合了神经网络的学习能力和符号系统的推理能力，在多个应用领域展现出潜力。结合深度学习和知识图谱的混合模型也在知识表示和推理领域取得了显著进展。</p>
<p>然而，在此有必要予以澄清的是，联结主义与符号主义在算法维度，也即计算层次的融合，无论成功与否，都无法直接推断出两者在认知层面是可以“融合”的。因为符号主义和联结主义在关于认知推理过程的本质上存在根本性的分歧。</p>
<p>在认知层次上，对符号主义而言，认知本质上涉及对符号表征的处理，并且这些符号表征必然具有组合性和递归性。思维的基础是对具有内部结构的表征进行规则化操作。而对联结主义而言，表征是由神经网络的激活模式整体决定的，每个表征本质上是一个不可分割的基本单元，不具备内部的组合结构。表征之间仅存在权重连接所决定的因果关系，而非组合关系。</p>
<p>而在计算层次上，联结主义模型的成功在很大程度上依赖于对海量数据中极其复杂的统计模式的强大拟合能力，而非对世界知识、逻辑规则和语言结构的内在理解与结构化表征。它们在面对需要真正理解组合结构、进行零样本或少样本泛化、或执行严格逻辑推理的任务时，会非常受限。联结主义模型强大的性能从根本上来源于“大数据+大算力”带来的计算层面的突破，这与认知科学试图理解资源有限的人类大脑如何实现灵活、通用、结构化智能的目标，存在着根本上的差异。</p>
<p>认知科学旨在探寻人类认知世界的真相和心智运作的原理。而人工智能领域更关注于构建能在特定任务上表现出色的系统。即使联结主义算法在实践领域（计算层次）取得再多突破，也无法得出认知科学理论无需在认知层次上解释系统性和生产性的结论。认知科学的发展也不能仅仅靠建立一个能模拟人类行为的系统来推进，因为其并不能告诉我们关于产生这些行为的生物或认知机制的任何深刻道理。人类的认知也决不可以被简单等同于当前最优的AI算法实现。</p>
<p>因此，在认知层面上，符号主义的主张——即心智计算的核心在于对结构化符号表征的操作——并非仅仅是众多可能的认知理论之一，而是对于解释人类高级认知功能所展现出的深刻结构性特征而言，具有理论上的优先性和必要性。任何试图完全绕开符号结构和规则操作的认知理论，都必须回答，它将如何以同样简洁和系统的方式解释生产性、系统性以及逻辑推理的本质。</p>
<h2>结  语</h2>
<p>在本文中，笔者深入辨析了符号主义和联结主义在认知科学领域中的基本立场和争议核心，重构并强化了符号主义关于生产性和系统性的论证，并对两大经典的反符号主义论证展开了回应。随后本文划分了认知科学研究的三大层次，并指出符号主义在认知层面的根本价值以及反符号主义论证在者三个层次上的混淆。通过上述工作，本文在联结主义占绝对主导地位的当下，再次为符号主义做辩护，并试图强调符号主义在当下的价值所在。</p>
<p>但我们也必须承认，当下认知科学和人工智能领域已发生巨变。特别是近及年来，以深度学习为代表的联结主义方法在诸多应用领域取得了空前的成功。大型语言模型等生成式人工智能技术的涌现，以其强大的模式识别、文本生成和看似流畅的“对话”能力，极大地冲击了公众乃至学界对于“智能”和“认知”的理解，可以说符号主义已然式微。</p>
<p>然而，算法层次或者说实践层面上的巨大成功并不等同于认知科学理论的突破。尽管现代联结主义模型在计算层次的表现令人惊叹，但是其对于认知系统性、生产性等高级认知现象的解释力却并没有匹配其在计算层次的表现。符号主义对于这些能力的解释效力时至今日也几乎从未被真正挑战。故而本文一方面是要为符号主义做辩护，另一方面也是希望戳穿联结主义狂热信徒的幻想，我们仍然需要正视符号主义的价值，为发展更完备的认知科学理论而努力。</p>
<p>综上所述，符号主义在认知科学中的地位并非如某些批评者所宣称的那样已经过时，而是继续为我们理解人类的高级认知现象提供了不可或缺的理论视角。通过理解符号主义的核心主张及其价值所在的范围，认知科学家可以避免无谓的理论之争，更有效地推进对人类心智的科学探索。</p>
<h2>参考文献</h2>
<ol>
<li>ABRAHAMSEN A A. Bridging boundaries versus breaking boundaries: Psycholinguistics in perspective[J]. Synthese, 1987, 72(3): 355-388.</li>
<li>CHOMSKY N. Aspects of the theory of syntax[M]. Cambridge: MIT Press, 1965.</li>
<li>CHOMSKY N. Rules and representations[M]. New York: Columbia University Press, 1980.</li>
<li>FODOR J A. The language of thought[M]. Cambridge: Harvard University Press, 1975.</li>
<li>FODOR J A. Psycho semantics: The problem of meaning in the philosophy of mind[M]. Cambridge: MIT Press, 1987</li>
<li>FODOR J A, PYLYSHYN Z W. Connectionism and cognitive architecture: A critical analysis[J]. Cognition, 1988, 28(1-2): 3-71.</li>
<li>RAMSEY W, STICH S, GARAN J. Connectionism, eliminativism, and the future of folk psychology[C]// COLE D J, FETZER J H, RANKIN T L, eds. Philosophy, mind, and cognitive inquiry. Studies in Cognitive Systems, vol 3. Dordrecht: Springer, 1990.</li>
<li>SMOLENSKY P. On the proper treatment of connectionism[J]. Behavioral and Brain Sciences, 1988, 11(1): 1-23.</li>
<li>RUMELHART D E, MCCLELLAND J L. On learning the past tenses of English verbs[M]// MCCLELLAND J L, RUMELHART D E, eds. Parallel distributed processing: Explorations in the microstructure of cognition, vol 2: Psychological and biological models. Cambridge: MIT Press, 1986: 216-271.</li>
<li>MARCUS G F. The algebraic mind: Integrating connectionism and cognitive science[M]. Cambridge: MIT Press, 2001.</li>
<li>REY G. Contemporary philosophy of mind: A contentiously classical approach[M]. Oxford: Blackwell, 1997.</li>
<li>ANDERSON J R. The architecture of cognition[M]. Cambridge: Harvard University Press, 1983.</li>
<li>HOLYOAK K J, THAGARD P. Mental leaps: Analogy in creative thought[M]. Cambridge: MIT Press, 1995.</li>
<li>FUSTER J. Cortex and mind: Unifying cognition[M]. New York: Oxford University Press, 2003.</li>
<li>乔姆斯基 N. 句法结构[M]. 邢公畹, 等译. 北京: 中国社会科学出版社, 1979: 6.</li>
<li>熊哲宏. 关于符号处理范式在认知科学中的地位和前景[J]. 华中师范大学学报(人文社会科学版), 1999(4): 61-68, 161-162.</li>
<li>魏斌.符号主义与联结主义人工智能的融合路径分析[J]. 自然辩证法研究, 2022, 38(2): 23-29. DOI: 10.19484/j.cnki.1000-8934.2022.02.004.</li>
<li>夏永红,李建会.符号奠基问题及其解决策略[J]. 哲学研究, 2017(2): 102-110.</li>
<li>林艳.人工智能的符号主义纲领及其困境[J]. 求索, 2019(6): 186-193. DOI: 10.16059/j.cnki.cn43-1008/c.2019.06.023.</li>
<li>蔚蓝,孙小淳.称不上“范式”:德雷福斯对符号主义人工智能的批判[J]. 自然辩证法研究, 2022, 38(3): 95-100. DOI: 10.19484/j.cnki.1000-8934.2022.03.017.</li>
</ol>
<h2>注释</h2>
<ol class="footnotes">
<li id="fn-2">这一概念源于托马斯·库恩在其著作《科学革命的结构》中对科学发展的分析。指科学领域中一个旧的、主导性的范式被一个新的、根本不同的范式所取代的过程，通常伴随着对基本概念、理论和研究方法的革命性改变。福多在此处指认知科学领域研究纲领的根本性转变。 <a href="#fnref-2" aria-label="回到正文">↩</a></li>
<li id="fn-3">系统性，指认知主体若能理解或产生某种思想，则也能理解或产生结构上相关的其他思想的能力。 <a href="#fnref-3" aria-label="回到正文">↩</a></li>
<li id="fn-4">指复杂表征的意义由其构成成分的意义及其组合方式决定。 <a href="#fnref-4" aria-label="回到正文">↩</a></li>
<li id="fn-5">指认知主体能够产生和理解原则上无限多新颖思想或语句的能力。 <a href="#fnref-5" aria-label="回到正文">↩</a></li>
<li id="fn-6">反向传播算法是一种在人工神经网络中广泛使用的监督学习算法，它通过计算输出层误差并将其反向传播到网络各层，来调整神经元之间的连接权重，从而优化网络性能。 <a href="#fnref-6" aria-label="回到正文">↩</a></li>
<li id="fn-7">FODOR J A, PYLYSHYN Z W. Connectionism and cognitive architecture: A critical analysis[J]. Cognition, 1988, 28(1-2): 3-71. <a href="#fnref-7" aria-label="回到正文">↩</a></li>
<li id="fn-8">递归神经网络（Recurrent Neural Networks, RNNs）通过引入循环连接，使其能够处理序列数据和具有时间依赖性的信息 <a href="#fnref-8" aria-label="回到正文">↩</a></li>
<li id="fn-9">一种数学运算，被一些联结主义模型用来尝试表征和组合结构化信息。 <a href="#fnref-9" aria-label="回到正文">↩</a></li>
<li id="fn-10">默认推理指在信息不完全的情况下，根据通常情况或最可能的情况进行推理。 <a href="#fnref-10" aria-label="回到正文">↩</a></li>
<li id="fn-11">信念修正指当新的信息与原有信念系统发生冲突时，调整或修改原有信念以保持一致性的过程。 <a href="#fnref-11" aria-label="回到正文">↩</a></li>
<li id="fn-12">归纳逻辑编程（Inductive Logic Programming, ILP）是机器学习的一个子领域，它使用逻辑编程作为表征语言，从正反样例中学习产生逻辑规则，是符号主义框架下进行归纳学习的一个实例 <a href="#fnref-12" aria-label="回到正文">↩</a></li>
<li id="fn-13">递归神经网络（RNNs）是一类能够处理序列数据的神经网络，通过其内部的循环结构来捕捉时间序列信息。 <a href="#fnref-13" aria-label="回到正文">↩</a></li>
<li id="fn-14">注意力机制（Attention Mechanisms）允许模型在处理序列数据时动态地关注输入的不同部分，从而更好地处理长距离依赖和重要信息。 <a href="#fnref-14" aria-label="回到正文">↩</a></li>
</ol>
]]></content:encoded></item>
<item><title>为什么我们要写prompt？</title><link>https://rzx000.com/writing/why-we-write-prompts</link><guid isPermaLink="true">https://rzx000.com/writing/why-we-write-prompts</guid><description>人和 AI 沟通难，难在没有共享语境；写 prompt 就是替 AI 划出框架。</description><content:encoded><![CDATA[<p>最近 DeepSeek 的火爆出圈让很多从没用过生成式AI 的人也开始尝试体验 AI了，最近也新涌现出了一大批所谓的 deepseek 课程，其核心内容基本都是如何撰写 prompt，或者说如何和 AI 交流。因为garbage in，garbage out。有好的提示词才会有好的结果。</p>
<p>当然如果你真的想学如何写 prompt，网络上各种官方文档和大牛的视频讲解已经讲的够详细了，你大可以去找来免费学习。而不用花那个冤枉钱。（文末会附上链接）。</p>
<p>而本文想回答一个更为根本的问题，<strong>为什么我们要写提示词？为什么 AI 不能像人一样能直接 get 我的意思？</strong></p>
<h2>人与人的交流</h2>
<p>我们先来看看人和人的交流是如何达成的。</p>
<p>交流本质上是信息的传递，动物可以用肢体语言或声音来传递一些简单的信息，人类则能用极为复杂的自然语言来传递复杂信息。自然语言由不同的概念和语词组成，比如名词、动词、副词都指代了不同类型的含义。</p>
<p>而虽然我们使用的可能都是同一种语言，但我们对于同一个概念的定义和理解可能是完全不同的。所以我们总是“跨服聊天”。而要确保他人也能理解这些定义，并与我们达成共识。就需要对一个表达意义的句子的尽可能全面的理解。</p>
<p>巴赫金认为信息的传递是“自我-他者-世界”的三角动态关系，主体通过对话建构意义，而意义需要在具体的语境中发生，这个语境既包含你对于所陈述的语言的理解，也包含他人的理解，还有没有被表达出来的——双方生活在同一个时代的<strong>共享语境</strong>。</p>
<p><img src="https://rzx000.com/images/writing/why-we-write-prompts/img-01.webp" alt=""></p>
<p>我们来看一个具体的例子，比如朋友说：&quot;昨天的球赛看了吗？太精彩了！&quot; 其实包含了：</p>
<ul>
<li>你知道是哪项运动（假设是足球）</li>
<li>你了解最近的赛事（默认是世界杯）</li>
<li>你认同相同的评判标准（精彩指技术还是比分？）</li>
</ul>
<p>这些没说出来的&quot;背景知识&quot;，也即语境，AI 却并不一定知道，虽然联网能一定程度上解决这个问题，但是大部分场景中还是需要我们尽可能详细的阐述自己的要求。</p>
<p>因为 AI 不能通过联网知道你的性格，你的工作，你昨天看了哪本书，经历了什么。你需要根据你的需求尽可能完整的阐述清楚自己需求背后的“隐藏信息”。</p>
<h2>和 AI 的交流</h2>
<p>我们已经大致了解了人与人之间是如何交流的，那 AI 有什么不同吗？</p>
<p>与我们交流的人通常身处同一时代、共享相似的信息背景，因此能在许多隐藏信息上达成‘<strong>社会共识</strong>’。而在更小的环境和群体中，也会有其特殊的共识，比如大学、公司、小组中特殊文化。而 AI 由于其自身限制，它没法完整地获取到这些信息，也就自然没法给你最想要的答案。</p>
<p><img src="https://rzx000.com/images/writing/why-we-write-prompts/img-02.webp" alt=""></p>
<h2>人工智能的 frame problem</h2>
<p>Frame problem 是这个问题在人工智能领域的学术名称，人工智能的框架问题（Frame problem）最早由计算机科学家约翰·麦卡锡和帕特里克·海斯 1969 年提出，它最初是指在人工智能规划和知识表示中如何有效地处理因果推理和环境变化的问题。</p>
<p>说人话就是当 AI<strong>处理会动态变化的信息时，如何界定哪些信息是相关的、哪些是可以忽略的</strong>的问题。</p>
<p>人类在交流时，能够<strong>自然而然地筛选背景信息</strong>，并基于共享语境快速理解对方的意思。而AI 无法直觉性地区分哪些信息是核心的，哪些是无关紧要的，因为它对你这个具体的人、对你所处的小环境没有直觉，只能依赖明确的输入。即便 AI 能够尝试推理你的意思，但是这并不能解决根本问题。</p>
<p>举个例子：如果你问 AI——“请帮我写一篇关于自由的文章。”</p>
<p><img src="https://rzx000.com/images/writing/why-we-write-prompts/img-03.webp" alt=""></p>
<p>对于人类而言，这个要求还比较容易理解，每个人都有关于自由的定义，他们会根据自己的视角和理解来撰写，这取决于你和对方的知识背景。</p>
<p>但对 AI 而言，这个请求是模糊的，它不知道你指的是政治哲学中的自由，还是自由意志，还是经济学中的市场自由。</p>
<p>这正是框架问题的体现：AI 无法自动推测你到底想要什么，哪些潜在的信息是相关的，因此可能会生成一个与你预期相去甚远的内容。</p>
<p>而写 Prompt 本质上是为 AI 提供“框架”，即帮助它理解问题的边界，明确哪些信息是相关的、哪些推理路径是合理的。如果我们不给 AI 提供足够清晰的上下文，它就可能在无穷的信息可能性中迷失，无法给出符合你期待的答案。因此，一个好的 Prompt 至少需要做到：</p>
<ol>
<li>提供明确的背景信息（比如涉及的领域、数据来源、目标受众等）。</li>
<li>清晰地定义任务边界（例如需要的格式、长度、关注的重点）。</li>
<li>避免让 AI 进行过多不必要的推测，而是给它一个清晰的思考框架。</li>
</ol>
<p>比如，如果你想让 AI 生成关于“自由”的文章，一个更完整的 Prompt 可能是：</p>
<p>“请以约翰·斯图尔特·密尔的《论自由》为核心，写一篇关于‘言论自由’的1000字论文，核心观点是言论自由极为重要，并从功利主义的角度分析其重要性。要求语言风格详实，兼具专业性和易读性，文末列出参考文献。”</p>
<h2>AI 时代的批判性思考</h2>
<p>找到那些未被清晰表述的“隐含前提”，不仅是对语言结构的剖析，更是对社会默认预设的洞察，是对自身认知边界的探索，是关于 <strong>who we are</strong> 的“深度求索”。</p>
<p>因为语言作为交流和思想的工具，也承载了社会认知、文化偏见和权力结构。AI 生成的内容虽然强大，本质上仍受限于其训练数据与算法规则，难以避免偏见。而无意识地接受 AI 生成的内容，必然导致思维的惰性和认知的单一化。</p>
<p>在这一点上，prompt 设计的过程不仅仅是优化 AI 交互的技术性工作，更是一种批判性思考的训练方式：</p>
<ul>
<li>促使我们识别隐含假设：我们的问题中潜藏着什么假设？AI 给出的回答基于哪些默认前提？这些前提是否合理？</li>
<li>帮助我们发现语言中的偏见：某些词汇、表述方式是否带有特定立场或误导性？</li>
<li>强化我们对问题的深入思考：我们是否真的理解自己提出的问题，这个问题是否真的重要？能否解决我的问题？</li>
</ul>
<p>写一个好的 prompt，能帮助我们找到被隐藏的预设，发现语言背后的偏见和暴力，避免我们的思想被潜移默化的控制。在 AI 时代，这样的批判性思考重要性不言而喻。训练不了AI，我们可以训练自己。</p>
<p>如果真像赫胥黎《美丽新世界》描述的一样，最后我们将所有思考的权力都移交给了 AI, 人类也将彻底陷入一个不再追求真理、不再思考的世界。</p>
<p><img src="https://rzx000.com/images/writing/why-we-write-prompts/img-04.webp" alt=""></p>
<h3>prompt官方教程：</h3>
<p>openAI prompt 官方文档(<a href="https://platform.openai.com/docs/guides/prompt-engineering">https://platform.openai.com/docs/guides/prompt-engineering</a>)</p>
<p>claude prompt官方文档(<a href="https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview">https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/overview</a>)</p>
<p>Deepseek 官方提示词库(<a href="https://api-docs.deepseek.com/zh-cn/prompt-library/%EF%BC%89">https://api-docs.deepseek.com/zh-cn/prompt-library/）</a></p>
<h3>参考文献：</h3>
<p>[1]Pylyshyn, Z. (ed.) (1987). The Robot’s Dilemma: The Frame Problem in Artificial Intelligence. Norwood, NJ: Ablex.</p>
<p>[2]Shanahan, M. P. (2003). The frame problem. In L. Nadel (ed.), Encyclopedia of Cognitive Science. New York: Nature Publishing Group.</p>
<p>[3]Bermúdez - 2014 - Cognitive science an introduction to the science，p129</p>
<p>[4]米哈伊尔·巴赫金 (Mikhail Bakhtin). (1981). The Dialogic Imagination（《对话的想象》）</p>
<p>最初发表于公众号「向右 Right S」：<a href="https://mp.weixin.qq.com/s/FyeU-p7CqdB2fctjwH7JgQ">原文</a></p>
]]></content:encoded></item>
<item><title>处理感觉材料的方式，决定了我们成为什么样的人</title><link>https://rzx000.com/writing/attention-and-questions</link><guid isPermaLink="true">https://rzx000.com/writing/attention-and-questions</guid><description>同样的信息，主动提问还是被动接收，会让人长成两种人。</description><content:encoded><![CDATA[<p>今天的话题，有一个更广为人知的名字：<strong>问题意识</strong>。</p>
<p>这几年来，我越来越意识到一件事：<strong>我们每天接收的信息（感觉材料）其实是一样的，但处理这些信息的方式，决定了我们成为什么样的人。</strong></p>
<p>我们看书，可以看热闹，也可以学习作者的写作方式。走进一家餐厅，可以只是吃饭，也可以分析它的选址逻辑、定价策略、商业模式。用一个产品，可以只是使用，也可以思考它为什么这样设计、有什么问题、能不能做得更好。</p>
<p>或许可以分为两类：一种是被动接收，像最低级的娱乐，信息流过就忘；一种是主动思考，就像《如何阅读一本书》里提到的，我们要为增进理解而阅读，还是为娱乐而阅读？这两种方式带来的效果是完全不一样的，这就是感觉材料的处理方式。</p>
<p>但不只是文字，生活中有各种各样的思考材料——和他人的交流、观察商业现象、使用产品的体验。</p>
<p>其实大把大把可供学习的材料都在身边，但我们大部分时候都把注意力放在了那些不重要的事情上。刷手机、看朋友圈，其实这也可以学习，只不过我们并没有&quot;用力&quot;。</p>
<p><strong>这就是问题意识——你是被动地接收信息，还是主动地提问、分析、思考？</strong></p>
<p>而这个差异，会在时间的复利下被无限放大。</p>
<h2>大脑是一个信息处理系统，计算机也是</h2>
<p>这让我想到 AI 是如何工作的。</p>
<p>2017 年，Google 的一篇论文改变了 AI 的发展轨迹，就是大名鼎鼎的 <strong>《Attention Is All You Need》</strong>。注意力机制在 2014 年就被用在机器翻译里了，这篇论文的突破是把整个模型都建立在注意力之上。</p>
<p>在注意力机制出现之前，AI 读一句话，是从第一个字逐字读到最后，把整句压成一个固定长度的记忆，就像一个学生读课本，不管重要不重要，一视同仁。
<strong>Attention 机制的革命性在于：它让 AI 学会了&quot;关注&quot;。</strong>
不是平等地处理所有信息，而是动态地分配注意力权重，把计算资源集中在最相关的部分。<strong>它在处理的同时判断：对眼下这个问题，什么重要。</strong>
这就是为什么 ChatGPT 能从海量信息中识别出真正重要的信号，而不是被噪声淹没。</p>
<p><strong>人的问题意识，就是人的 Attention 机制。</strong></p>
<p>它决定了你关注什么、忽略什么。有问题意识的人，他的大脑就像训练好的 Attention 机制，会自动把注意力分配到高价值信息上。没有问题意识的人，信息只是流过眼前，什么都没沉淀。</p>
<p><strong>同样刷一小时抖音：</strong></p>
<ul>
<li>普通人：娱乐消费，看完就忘</li>
<li>有问题意识的人：观察什么内容会火、为什么会火、背后的传播机制是什么、能否复用</li>
</ul>
<p><strong>同样参加一场会议：</strong></p>
<ul>
<li>普通人：听完就走</li>
<li>有问题意识的人：这个人为什么这么想？他的思维框架是什么？我能学到什么？</li>
</ul>
<p><strong>同样经历一次失败：</strong></p>
<ul>
<li>普通人：沮丧、抱怨、然后继续</li>
<li>有问题意识的人：哪个环节出了问题？背后的根因是什么？如何避免下次再犯？</li>
</ul>
<p><strong>我们都在同一个世界里生活，但有问题意识的人，活在一个信息密度更高的世界里。</strong></p>
<hr>
<h2>那么，什么决定了我们的 Attention？</h2>
<p>我们可以用机器学习中的一个术语来解释——<strong>目标函数</strong>。</p>
<p>在 AI 中，注意力怎么分配，是在训练中为了优化目标函数学出来的——你要优化什么，它就学会关注什么。</p>
<p><strong>人也一样。</strong></p>
<p>你的目标，决定了你的问题意识，决定了你关注什么信息。</p>
<ul>
<li>想学写作的人，看书会关注写作技巧</li>
<li>想创业的人，走到哪里都在观察商业模式</li>
<li>想提升认知的人，每次交流都在学习他人的思维方式</li>
</ul>
<p><strong>但很多时候，目标并不是明确的：</strong></p>
<p><strong>当你的目标函数本身是模糊的时候，你的 Attention 机制就会失灵。</strong>
在周岭的《认知觉醒》中也有提到，</p>
<blockquote>
<p> 人生也像是一场消除模糊的比赛，谁的模糊越严重，谁就越混沌；谁的模糊越轻微，谁就越清醒</p>
</blockquote>
<p>很多创业者的状态就是这样：不知道自己到底要什么——盈利？影响力？自我实现？目标在短期生存压力和长期愿景之间反复横跳。</p>
<p><strong>结果就是：你不知道该关注什么，什么是信号，什么是噪声。</strong></p>
<p>一个客户的积极反馈，到底是市场需求的验证，还是个例的尝鲜行为？一个竞争对手的动作，到底是威胁，还是噪声？
<strong>你不知道。</strong>
于是，情绪接管了决策。焦虑让你把注意力全部集中在风险上，兴奋让你把注意力全部集中在机会上。<strong>它们都是一种 Attention，但却是失衡的、片面的。</strong></p>
<h2>问题意识，是一切的起点</h2>
<p>做学术研究，问题意识极其重要。我们需要敏锐地发现常人无法发现的现象背后的奥秘，就像氧气的发现——普利斯特里发现了&quot;脱燃素空气&quot;，但拉瓦锡追问了一个更深刻的问题：**如果燃素理论是对的，为什么有些物质燃烧后重量会增加，而不是减少？**这个问题，颠覆了整个燃素理论。拉瓦锡意识到，燃烧不是&quot;释放燃素&quot;的过程，而是&quot;与某种气体结合&quot;的过程。他把这种气体命名为&quot;氧气&quot;，并建立了现代化学的基础。</p>
<p><strong>同样的实验，同样的现象，但拉瓦锡问了一个更深刻的问题。</strong></p>
<p>普利斯特里看到的是&quot;现象&quot;，拉瓦锡看到的是&quot;现象背后的矛盾&quot;。普利斯特里在旧框架里解释新现象，拉瓦锡质疑框架本身。</p>
<p><strong>这就是问题意识的力量——它决定了你是在现有范式内修修补补，还是能够看到范式本身的缺陷，从而引发革命。</strong></p>
<p>创业也是如此。为什么有人能看到别人看不到的机会？因为他们在问别人不问的问题。为什么有人能从失败中学习，有人只是重复失败？因为前者在追问&quot;为什么失败&quot;，后者只是在承受&quot;失败的痛苦&quot;。</p>
<p><strong>问题意识决定了你能从经验中提取多少价值。</strong></p>
<p>没有问题意识的人，走再多路也只是&quot;到此一游&quot;。有问题意识的人，每一步都在建立认知地图。</p>
<h2>最后，一个残酷的事实</h2>
<p><strong>问题意识不是天赋，是习惯。</strong></p>
<p>但大多数人不愿意培养这个习惯，因为&quot;主动思考&quot;是累的，&quot;被动接收&quot;是爽的。</p>
<p>刷抖音很爽，分析抖音的传播机制很累。
吃饭很爽，分析餐厅的商业模式很累。
闲聊很爽，学习他人的思维方式很累。</p>
<p><strong>所以大多数人选择了&quot;爽&quot;，然后抱怨自己没有成长。</strong></p>
<p>但这个世界的规则很简单：<strong>你的成长速度，取决于你从经验中提取价值的能力。</strong></p>
<p>而这个能力，就是问题意识。</p>
<p><strong>我们都在同一个世界里生活，但有问题意识的人，活在一个信息密度更高的世界里。他们看到的不是&quot;现象&quot;，而是&quot;现象背后的规律&quot;。他们经历的不是&quot;事件&quot;，而是&quot;事件中的学习机会&quot;。</strong></p>
<p><strong>从今天开始，试着对你接触的每一个信息多问几个&quot;为什么&quot;。</strong></p>
<p><strong>你会发现，世界突然变得不一样了。</strong></p>
]]></content:encoded></item>
<item><title>从习惯到必然：论因果关系的先天性与归纳推理的可靠性</title><link>https://rzx000.com/writing/from-habit-to-necessity</link><guid isPermaLink="true">https://rzx000.com/writing/from-habit-to-necessity</guid><description>回应休谟：因果推理有进化形成的「先天」基础，归纳推理可靠，但不必然。</description><content:encoded><![CDATA[<h2>1. 引言</h2>
<p>因果关系和归纳论证一直是我们默认的“人生的伟大指南”，无论是在日常生活中的经验中，还是在科学研究中，我们都习惯于通过观察过去的事件和现象，从中归纳出未来的规律，现代科学的胜利也进一步说明了因果律和归纳论证的有效性。然而，休谟（David Hume）在《人类理解研究》中提出了对这种方法的深刻质疑，休谟认为，归纳论证——即从特定实例中推导出普遍规律——在逻辑上是不可证立的。我们之所以相信太阳明天会升起，是因为我们习惯于看到太阳每天升起，但这种习惯本身并不能提供必然性的证明。
休谟的推理过程大致如下：休谟认为同一原因推出同一结果是没有根据的，因为因果规律并不是自然界的法则，而是人类认知世界所需要的法则，源于人类的想象，是一种习惯。所以，由现在推论将来是不可靠的。又因为因果推理的根据不是先天的，而一定是经验的。一切经验推理的根据都是自然的一律性，所以休谟的问题就变成了自然齐一律是否合法，通过论证自然齐一律不能得到证成来证否归纳推理（否定后件）。
这里需要首先明确的是，休谟并非反对因果关系本身，而是认为因果律另有来源。“我从未断言如此荒谬的命题，即任何东西可以无须一个原因就出现”，只是坚持我们对“任一事件都有原因”的确信“另有来源”。”
其次，休谟对归纳问题给出的回答并非全盘否定的。休谟说“使我们假定过去和将来相似的并不是推理”。 （E 39）“并不是推理”而是习惯，是休谟实际强调的点。</p>
<p>在明确了休谟的论证过程与逻辑后，我们可以和休谟达成以下共识：</p>
<ol>
<li>因果律是普遍存在于世间的。</li>
<li>因果推理的根据不是先天的，一定是经验的
而本文的观点是：
因果推论是‘先天’且必然的。
自然齐一律是在自然中客观存在的。
所以归纳论证是有效且可靠的。
基于此，本文将会进行如下论证：
首先讨论<strong>因果推理的来源问题</strong>（因果的先天必然性），其次给出一种因果关系的证明方法，最后讨论归纳论证的合法性及对休谟自然齐一律反驳的处理。</li>
</ol>
<h2>2.关键概念的澄清</h2>
<p>（1）澄清关键概念：</p>
<ul>
<li>归纳论证是基于已经验到的个别案例推出一个普遍的假设（包括未来），同时，这个普遍假设并不保证该原理的绝对必然性与准确性。且本文说的归纳推理局限在通过定量定性的科学实验得出结论的归纳。</li>
<li>因果关系仅发生在能够被经验到的时间与空间中，因果关系只是假设自然齐一律，而从未保证在未来的时间与空间中，同一原因匹配同一结果。
（2）澄清观点：我并不认为归纳、论证和因果律是绝对的且正确的，但他们毫无疑问是认识世界的有效[工具]，本文也不认为归纳论证和因果推理，包括演绎推理是认识世界的唯一方式。</li>
</ul>
<h2>3.论证：</h2>
<h3>因果推理的来源问题</h3>
<p>首先我们要提出一个问题：因果推理是从哪里来的？休谟说因果来源于人的习惯，可习惯又是哪来的？
本文认为，习惯源于大脑已形成的编码模式，而这种编码来源与知性和现象界，人类的编码模式是在几千年的进化中得来的，而人类获取信息的方式只有经验，所以必然是现象界因果律的稳定性与恒常性导致了人类形成了因会导致果的这一判断，随后在无数的生活实践中，这一编码模式被不断强化，并潜移默化的在基因中影响了‘先天’的知性判断，比如文字，在被创造出来后，我们就可以通过习得为符号赋予意义（习得关于此符号的编码模式，可以对符号进行‘解码’），也就影响了我们的知性（对世界的解码方式。）而习惯就来源于此，其既有‘先天’的知性影响，又有后天的社会构建。
要注意的是，‘先天’是相对的，指人类进化过程中积累的认知对基因的塑造。其次，这种‘先天’直觉是一种认知预设，而并非绝对真理，这种预设是可变的。
由此我们继续讨论人类如何认识外部世界。外部世界的本源，我们暂称之为物自体，人类对于其的认知是有限的，我们只能得到对于物自体片面的认知，这种认知，首先是感觉器官接收外部世界的信息，并通过知性对其进行加工成为感觉材料，其次，大脑对这些感觉材料进行处理，将其整合编码成为可理解的抽象知识抽象概念（知性），随后，人类用这些已编码的抽象知识再度认识世界，而当产生冲突时，人类便会更新已经编码的信息。
所以我们可以给出如下论证：</p>
<ol>
<li>知性是“先天”形成的</li>
<li>因果是属于知性的</li>
<li>因果是先天的。
附-休谟的论证：
P 1. 如果因果性是一条先天必然真理，那么原因必然导致结果 
P 2. 在经验中可以设想原因不导致相应结果； 
C 3. 因此，因果性不是一条先天必然真理。
休谟的经验性论证的问题在于 P 2 ，因果律是一种认知方式，所属“知性”，而原因与是感觉材料，如若输入了错误的感觉材料，并不能得到因果推理是失效的。
比如科学发展史上著名的燃素说，燃素导致燃烧这一因果假设的无效，并不能说明因果推理失效了，而只能说明因和果是错误的。即因果本身的有效性并不取决于某些错误的不充分、不可靠的因果推理案例，而是取决于具体的因和果本身。
同时，我们可以得到自然齐一律和因果的稳定性，因为只有现象界是稳定的，因果律的先天认知才能形成。
至于因果不存在于自然界，而只存在于人的想象之中这一观点。虽然康德同样说，人为自然立法，但是既然我们所能认知到的关于物自体的部分都符合因果原则，所以因果必然是物自体的一部分属性，那我们就不能说其仅仅存在人的想象之中这样唯心的论断。</li>
</ol>
<h3>因果关系的证明</h3>
<p>论证了因果的先天必然性，我们还要论证因果关系的可靠性，因为一切哲学论证都无法绕开蕴含推理，休谟自身的推理亦然，否定因果推理当然会导致极端的怀疑与虚无。故这里重新为因果关系的可靠性进行论证，本文提出一种反证法如下：</p>
<ol>
<li>因果关系不存在 （hyp）</li>
<li>X （add）</li>
<li>1 无法得到 2，因为因果关系不存在（1，2）</li>
<li>因果关系存在。
当然，休谟并不怀疑 <u>A:“任何结果都有一个原因”</u>，但不同意 <u>B:同一原因总导致同一结果</u>，所以 A 是否蕴含 B ？这里要再次指出，因果是人类认知世界的工具，形成这个先天认知有一个前提，即<strong>因果总是恒常稳定的</strong>，也就是说自然也是恒常稳定的，即自然齐一律是在自然中客观存在的。如果同一原因，并没有导致同一结果只能说明原因和结果的对象发生了偏差，是人类的认知和对相应因果关系的认知构成不完善。
其次，因果并不发生在世界的每一个角落，因果关系仅发生在能够被经验到的时间与空间中，而在人类尚未探寻和理解的世界（比如量子世界和意识），我们并不能确定因果是一定存在的。所以因果关系只是假设自然齐一律，而从未保证在未来的未被经验到的时间与空间中，同一原因匹配同一结果。</li>
</ol>
<h3>归纳论证的有效性</h3>
<p>休谟认为，归纳论证无法成为普遍和必然知识的前提，因为归纳论证并不总是正确的，且我们无法以现在的归纳论证来论证将来的归纳论。
首先有一个预置问题：普遍和必然知识是否可能？本文定义其=绝对真理（综合休谟的理解），并预设其不可能。至于原因，一言以蔽之，人的认知是有限的，无法认知到绝对真理，但可以认识到相对的普遍知识，也就是接下来论证的归纳论证能得到的知识。且知识的必然性和普遍性并非归纳论证需要去解决的。（论题太广这里不再展开）
其次，这里包含了两个问题，</p>
<ol>
<li>首先，归纳论证是否可靠。</li>
<li>其二，现在的归纳论证能否推出未来的结论？（因果）</li>
</ol>
<h4>第一个问题 ：归纳论证是否可靠。</h4>
<p>这里我们首先要明确关键概念，即所谓归纳论证的[可靠性]（可能不准确），一方面取决于前提是否正确，另一方面也取决于论证过程是否合乎逻辑。
如：</p>
<ol>
<li>过去观察到的每一只天鹅都是白的</li>
<li>所以，所有天鹅都是白的。</li>
</ol>
<p>首先来看论证过程，前提是基于经验的总结，难以判断真假，所以我们首先考虑的是从个别推到普遍这一步的形式，而非前提是否正确。而现代科学的研究方法都是在一个模型中进行计算归纳，自然科学的数据都是通过经验观察得来的，进行数据分析后得出结论，逻辑形式是极为严谨的。
其次我们来看前提是否可靠。<strong>休谟认为，人不能认识超出经验的事情，人不能认识到，外在于主体的客体本身。这一点我是认同的，但是如何定义“超出经验”？是超出当下的经验还是潜在的经验？我们又怎么能预设潜在的经验？远古时代的人类怎么能预设到现在的科学发现？同样的，我们无法预设未来基于归纳和因果的科学发展能让我们的经验进行怎样的拓展。所以人当然无法完全认识物自体，但是人的创造力和自由意志使得人类可以在认识世界这件事上不断进化，无限逼近。而我们能拥有这一切的前提，是我们相信我们的经验观察，相信我们可以通过对现象的解释和论证得到一个可靠的前提</strong>。</p>
<h4>其二，现在的归纳论证能否推出未来的结论？</h4>
<p>在此前因果关系的论证中，我们已经解决了因果的可靠性问题，同时论证了自然齐一律的先天性。也就证明了归纳论证的有效性。
不过这里需要正面回应休谟，由现有的论证得出将来的结论总是一种预测与假设，当反例出现，我们需要做的是调整该假设的合理性并观察是哪些因素和条件变化导致的归纳失效，最后重新构建对于现象的合理解释，正如托马斯·库恩所指出的，科学知识是通过范式转换不断进化的。在因果成立的世界中，归纳失效 iff 人类认识到的条件发生了变化，所以时间的推演并不构成对于归纳的因果的反驳。我们当然不能保证归纳论证的内容总是有效的，但因此否定归纳推理就不太合理了。</p>
<h2>4.回应可能的反驳</h2>
<p>可能的反驳 1：
进化与认知的关联：即使因果推理是通过进化形成的，这并不意味着因果关系在逻辑上是必然的。进化可能只是优化了人类在特定环境中的生存能力，而不是提供了对世界的绝对真理。达尔文主义的演化论更多地关注适应性和生存价值，而不是哲学上的必然性。
回应 1：
进化不仅仅优化了人类在特定环境中的生存能力，它也塑造了我们的认知机制，使其更能准确地反映现实世界中的规律。尽管进化的主要驱动力是适应性和生存价值，但这种适应性包括了对环境规律的敏锐感知和预测。我们可以区分逻辑上的必然性和进化所提供的可靠性。逻辑上的必然性是指因果关系在所有可能世界中都成立，而进化所提供的可靠性则是指在我们的世界中因果关系的稳定性和实用性。进化过程使得我们的认知结构倾向于信任因果关系，因为这对于生存和繁衍是高度有利的。因此，即便因果关系在哲学上不是逻辑必然的，它在经验和实用上却是高度可靠的。
可能的反驳 2：
反证法的局限性：你的反证法假设因果关系不存在，然后试图通过矛盾来证明因果关系的存在。然而，这种方法依赖于因果关系的概念本身，实际上并没有独立地证明因果关系的必然性。换句话说，你的证明方法是循环论证。
回应 2：
我承认这种方法依赖于因果关系的概念本身，这看起来像是一种循环论证。然而，反证法的核心目的并不是直接的逻辑证明，而是通过展示没有因果关系时的矛盾和不合理性，间接证明因果关系的必要性。同时，我的论证也恰恰说明了因果关系是无法从我们的论证和生活中剥离的，也间接的证明了因果关系的有效性（因为反驳我需要假设因果关系是有效的）。</p>
<h2>5.结论&amp;展望</h2>
<p>本文引用进化过程中大脑的认知机制，试图论证因果的先天必然性并回应休谟的反驳。本文认为，因果推理和归纳论证尽管在逻辑上可能存在不足，但其作为人类认知世界和科学研究的基本工具，具有不可忽视的先天基础和实际有效性。因此，在实践中，因果推理和归纳论证依然是我们理解和解释世界的重要方法。
同时，我们必须放弃对于知识的普遍性和必然性的追求，承认人类的有限与无知，基于假设和推理去创造知识，而归纳论证和因果便是不可剥离的假设，是人类认识世界的必要手段。一个确定无疑的阿基米德点是不存在的。而也正是因为知识是非必然的, 自由意志才成为可能。</p>
]]></content:encoded></item>
</channel>
</rss>
