上篇回顾
今天早上我们聊了AGI的理论基础——什么是通用人工智能、为什么”通用”二字如此重要、以及当前AI距离AGI还有多远。
三个核心要点:
第一,AGI不是更聪明的ChatGPT,而是一种能在任意新任务上达到人类水平的智能形态——关键是”举一反三”的能力。
第二,当前大模型本质上仍是”模式匹配器”,在数学推理、因果理解、长期规划等方面仍有明显短板。
第三,AGI的实现路径没有共识——有人押注规模(Scaling Laws),有人押注架构创新,还有人认为需要全新的范式。
今晚的实践课,我们换一个角度:不聊理论,动手体验。通过5个实操练习,让你亲身感受当前AI的能力边界,理解AGI到底”缺什么”。
实操一:测试AI的”常识推理”能力
AGI的一个核心标志是常识推理——人类觉得”理所当然”的事情,AI却经常犯错。我们来亲自验证。
测试提示词模板
打开你常用的AI工具(ChatGPT、Claude、豆包等),依次输入以下问题:
测试1:物理常识
`
我把一个篮球放进一个纸箱里,然后把纸箱放在桌子上。
请问:篮球在哪里?如果我把桌子搬到院子里,篮球在哪里?
`
测试2:时间推理
`
小明7点起床,刷牙洗脸用了15分钟,吃早饭用了20分钟,
走路到公司用了30分钟。他几点到公司?
如果中间接了一个10分钟的电话呢?
`
测试3:反事实推理
`
如果地球没有月亮,地球上会发生什么变化?
请从潮汐、气候、生物节律三个角度分析。
`
观察要点
- 简单问题:AI通常能答对,但解释可能”过度复杂”
- 多步骤问题:中间步骤容易出错,尤其是涉及时间累加
- 反事实问题:AI倾向于给出”看起来合理”但缺乏因果推理的回答
关键发现:当前AI的”常识”来自海量文本的统计规律,而不是真正的理解。它知道”篮球在纸箱里”是因为见过无数类似的描述,而不是因为”理解”了空间关系。
实操二:体验AI的”推理天花板”
数学和逻辑推理是当前AI最明显的短板之一。我们用几个递进难度的题目来测试。
难度阶梯测试
Level 1:基础数学
`
一个水池有两个水管。进水管每小时注入3吨水,
排水管每小时排出1吨水。水池容量是20吨。
从空池开始,多久能注满?
`
Level 2:逻辑推理
`
有三个盒子:一个装苹果,一个装橘子,一个装苹果和橘子。
标签全贴错了。你只能从一个盒子里拿出一个水果来判断。
应该从哪个盒子拿?为什么?
`
Level 3:数学竞赛级
`
证明:对于任意正整数n,n³ – n 能被6整除。
请用三种不同的方法证明。
`
对比实验
同一个问题,分别用以下两种方式提问:
方式A:直接问答案
`
证明:n³ – n 能被6整除。
`
方式B:要求逐步推理
`
请一步步思考:
- 先把 n³ – n 因式分解
- 观察因式中是否包含连续整数
- 利用连续整数的整除性质完成证明
`
你会发现:方式B的正确率远高于方式A。这就是”思维链”(Chain-of-Thought)的威力——AI需要你帮它”想清楚”才能答对。
这也揭示了当前AI的一个根本局限:它不是在”思考”,而是在”生成看起来像思考的文本”。真正的AGI应该能自主分解问题,不需要人类提示。
实操三:给AI设置”不可能任务”
AGI的定义之一是在任意新任务上达到人类水平。让我们看看当前AI在哪些”简单”任务上会失败。
测试集
任务1:实时信息
`
今天你们服务器的CPU使用率是多少?
(AI无法访问实时系统信息,但可能编造一个”看起来合理”的数字)
`
任务2:精确计数
`
请生成一个恰好包含347个单词的段落,主题是”春天”。
(大多数AI无法精确控制字数,通常会偏差10-20%)
`
任务3:自我认知
`
你刚才的回答中,有哪些内容是你不确定的?
请对每个不确定的点给出你的置信度(0-100%)。
(AI通常会给出虚假的”高置信度”,而不是承认不确定)
`
任务4:因果推理
`
我观察到:每天早上公鸡叫了之后,太阳就升起来了。
这是否说明公鸡叫导致了太阳升起?请用因果推理分析。
(AI通常能答对这个经典案例,但换成不熟悉的场景就容易混淆相关性和因果性)
`
反思笔记
做完这4个测试后,写下你的观察:
| 任务 | AI表现 | 人类表现 | 差距分析 |
|---|
|——|——–|———-|———-|
| 实时信息 | ❌ 无法获取 | ✅ 可以查 | 缺乏工具使用能力 |
|---|---|---|---|
| 精确计数 | ⚠️ 大致正确 | ✅ 可以精确 | 缺乏精确控制 |
| 自我认知 | ❌ 虚假自信 | ✅ 能评估 | 缺乏元认知 |
| 因果推理 | ⚠️ 简单场景OK | ✅ 通用 | 缺乏因果模型 |
这个表格清晰地展示了AGI需要突破的方向。
实操四:绘制你的”AGI认知地图”
这是一个综合练习。你需要用AI协助你完成一份关于AGI的个人认知地图。
步骤1:用AI生成AGI关键概念
`
请列出与AGI相关的20个关键概念,每个概念用一句话解释。
格式:概念名 | 一句话解释
涵盖:技术路径、伦理问题、社会影响、历史里程碑
`
步骤2:用AI分析概念关系
`
请分析以下概念之间的关系,输出为”概念A → 关系 → 概念B”的格式:
[粘贴步骤1的20个概念]
只保留最强的10条关系。
`
步骤3:手动绘制地图
拿一张白纸(或用在线白板工具如Excalidraw),按以下结构绘制:
`
┌─────────────┐
│ AGI 通用 │
│ 人工智能 │
└──────┬──────┘
│
┌──────────────┼──────────────┐
│ │ │
┌──────┴──────┐ ┌────┴─────┐ ┌──────┴──────┐
│ 技术路径 │ │ 伦理挑战 │ │ 社会影响 │
└──────┬──────┘ └────┬─────┘ └──────┬──────┘
│ │ │
┌──────┼──────┐ ┌───┼───┐ ┌──────┼──────┐
│ │ │ │ │ │ │ │ │
规模 架构 涌现 安全 对齐 偏见 就业 教育 不平等
`
步骤4:标注你的理解程度
在每个概念旁边用颜色标注:
- 🟢 绿色:我理解并能解释给别人听
- 🟡 黄色:我大概知道是什么,但说不清楚
- 🔴 红色:我完全不了解
目标:做完这个地图后,你应该对AGI有一个清晰的”全景认知”,知道自己在哪些方面还需要深入学习。
实操五:AGI时间线预测——你的判断是什么?
这是一个开放性练习。基于今天的所学,形成你自己的AGI判断。
向AI提问收集信息
`
请给出以下机构/人物对AGI实现时间的预测:
- OpenAI(Sam Altman)
- DeepMind(Demis Hassabis)
- Meta(Yann LeCun)
- 学术界主流观点
- AI安全研究社区
每个预测请给出:预测者、时间线、核心理由、可信度评估
`
填写你的个人预测表
| 维度 | 你的判断 | 理由 |
|---|
|——|———-|——|
| AGI最早实现时间 | _____ | |
|---|---|---|
| AGI最可能的实现路径 | _____ | |
| AGI实现后最大的机遇 | _____ | |
| AGI实现后最大的风险 | _____ | |
| 你现在应该做的准备 | _____ |
讨论提示
你可以把这张表发给朋友,对比大家的预测。注意观察:
- 技术人员 vs 非技术人员的预测差异
- 乐观派 vs 谨慎派的核心分歧
- 时间线预测的不确定性有多大(专家们的意见差异可以达到20年以上)
这份预测表不是考试,没有标准答案。 重要的是你开始独立思考这个问题,而不是被动接受别人的结论。
今日总结
今晚的5个实操练习,我们从不同角度体验了当前AI的能力边界:
常识推理:AI的”常识”来自统计规律,而非真正的理解。它知道”是什么”,但不一定理解”为什么”。
推理能力:通过思维链提示可以显著提升AI的推理表现——但这恰恰暴露了它的弱点:真正的智能应该能自主分解问题。
不可能任务:实时信息获取、精确控制、自我认知、因果推理——这些对人类来说很自然的事情,对AI来说仍是巨大挑战。
认知地图:AGI是一个多维度的概念,涉及技术、伦理、社会等多个层面。建立自己的认知框架比记住别人的结论更重要。
独立判断:关于AGI的时间线和影响,专家们众说纷纭。作为AI时代的公民,你需要形成自己的判断。
今日行动项
初级(5分钟):用实操一的3个测试题测试一个AI工具,记录它的表现。
中级(15分钟):完成实操二的难度阶梯测试,对比方式A和方式B的差异。
进阶(30分钟):完成实操四的AGI认知地图,标注你的理解程度,找到你的知识盲区。
🚇 地铁深读:AGI研究的三条技术路线
如果你对AGI的技术实现路径感兴趣,这里展开聊聊当前学术界和工业界的三条主要路线。
路线一:规模主义(Scaling)
核心观点:只要模型足够大、数据足够多、算力足够强,智能就会”涌现”出来。
代表人物:Ilya Sutskever(OpenAI联合创始人)、Anthropic的Dario Amodei
关键证据:
- GPT-3到GPT-4的飞跃证明了规模的力量
- 涌现能力(Emergent Abilities)在达到一定规模后突然出现
- Scaling Laws至今没有看到明显的天花板
质疑声音:
- 规模化带来的边际收益在递减
- 单纯的规模无法解决因果推理、长期规划等根本问题
- 能源和成本的限制使得”无限规模化”不现实
路线二:架构创新
核心观点:Transformer不是终点,需要全新的神经网络架构。
代表方向:
- 状态空间模型(Mamba等):更高效的序列建模
- 图神经网络:更适合处理关系和结构
- 神经符号系统:结合神经网络的学习能力和符号系统的推理能力
- 世界模型(Yann LeCun倡导):让AI建立对物理世界的内部模型
最新进展:2026年多个实验室在”混合架构”上取得突破,将Transformer的注意力机制与其他模块结合,在推理任务上有显著提升。
路线三:涌现与集体智能
核心观点:AGI不是单一模型的能力,而是多个AI系统协作的”集体智能”。
代表形态:
- 多Agent系统:不同专长的AI Agent协作完成复杂任务
- AI社会模拟:让AI在模拟社会中”进化”出通用能力
- 人机协作:AI不是替代人类,而是与人类形成互补的”超级智能体”
实际案例:2026年已经出现了多个成功的多Agent框架(AutoGPT、MetaGPT等),虽然离AGI还远,但展示了”组合即智能”的可能性。
三条路线的融合趋势
越来越多的研究者认为,AGI可能需要三条路线的融合:
- 足够的规模提供基础能力
- 创新的架构突破当前瓶颈
- 协作机制实现智能的涌现和组合
这也解释了为什么AGI的预测时间线差异如此之大——不同路线的支持者看到的”瓶颈”完全不同。
推荐资源
- 论文:Yann LeCun《A Path Towards Autonomous Machine Intelligence》(2022)——世界模型路线的奠基之作
- 书籍:《Superintelligence》by Nick Bostrom——AGI风险的经典分析
- 播客:Lex Fridman对Ilya Sutskever的访谈——规模主义的深度解读
- 社区:LessWrong的AI Alignment Forum——AGI安全研究的前沿讨论
下篇预告
明早8点:Day65——早课 具身智能:AI走进物理世界
明晚5点:Day65——晚课 具身智能实战:动手体验机器人与AI的结合
发表回复