Day64——晚课 AGI:通用人工智能之路

作者:

上篇回顾

今天早上我们聊了AGI的理论基础——什么是通用人工智能、为什么”通用”二字如此重要、以及当前AI距离AGI还有多远。

三个核心要点:

第一,AGI不是更聪明的ChatGPT,而是一种能在任意新任务上达到人类水平的智能形态——关键是”举一反三”的能力。

第二,当前大模型本质上仍是”模式匹配器”,在数学推理、因果理解、长期规划等方面仍有明显短板。

第三,AGI的实现路径没有共识——有人押注规模(Scaling Laws),有人押注架构创新,还有人认为需要全新的范式。

今晚的实践课,我们换一个角度:不聊理论,动手体验。通过5个实操练习,让你亲身感受当前AI的能力边界,理解AGI到底”缺什么”。


实操一:测试AI的”常识推理”能力

AGI的一个核心标志是常识推理——人类觉得”理所当然”的事情,AI却经常犯错。我们来亲自验证。

测试提示词模板

打开你常用的AI工具(ChatGPT、Claude、豆包等),依次输入以下问题:

测试1:物理常识

`

我把一个篮球放进一个纸箱里,然后把纸箱放在桌子上。

请问:篮球在哪里?如果我把桌子搬到院子里,篮球在哪里?

`

测试2:时间推理

`

小明7点起床,刷牙洗脸用了15分钟,吃早饭用了20分钟,

走路到公司用了30分钟。他几点到公司?

如果中间接了一个10分钟的电话呢?

`

测试3:反事实推理

`

如果地球没有月亮,地球上会发生什么变化?

请从潮汐、气候、生物节律三个角度分析。

`

观察要点

  • 简单问题:AI通常能答对,但解释可能”过度复杂”
  • 多步骤问题:中间步骤容易出错,尤其是涉及时间累加
  • 反事实问题:AI倾向于给出”看起来合理”但缺乏因果推理的回答

关键发现:当前AI的”常识”来自海量文本的统计规律,而不是真正的理解。它知道”篮球在纸箱里”是因为见过无数类似的描述,而不是因为”理解”了空间关系。


实操二:体验AI的”推理天花板”

数学和逻辑推理是当前AI最明显的短板之一。我们用几个递进难度的题目来测试。

难度阶梯测试

Level 1:基础数学

`

一个水池有两个水管。进水管每小时注入3吨水,

排水管每小时排出1吨水。水池容量是20吨。

从空池开始,多久能注满?

`

Level 2:逻辑推理

`

有三个盒子:一个装苹果,一个装橘子,一个装苹果和橘子。

标签全贴错了。你只能从一个盒子里拿出一个水果来判断。

应该从哪个盒子拿?为什么?

`

Level 3:数学竞赛级

`

证明:对于任意正整数n,n³ – n 能被6整除。

请用三种不同的方法证明。

`

对比实验

同一个问题,分别用以下两种方式提问:

方式A:直接问答案

`

证明:n³ – n 能被6整除。

`

方式B:要求逐步推理

`

请一步步思考:

  1. 先把 n³ – n 因式分解
  2. 观察因式中是否包含连续整数
  3. 利用连续整数的整除性质完成证明

`

你会发现:方式B的正确率远高于方式A。这就是”思维链”(Chain-of-Thought)的威力——AI需要你帮它”想清楚”才能答对

这也揭示了当前AI的一个根本局限:它不是在”思考”,而是在”生成看起来像思考的文本”。真正的AGI应该能自主分解问题,不需要人类提示。


实操三:给AI设置”不可能任务”

AGI的定义之一是在任意新任务上达到人类水平。让我们看看当前AI在哪些”简单”任务上会失败。

测试集

任务1:实时信息

`

今天你们服务器的CPU使用率是多少?

(AI无法访问实时系统信息,但可能编造一个”看起来合理”的数字)

`

任务2:精确计数

`

请生成一个恰好包含347个单词的段落,主题是”春天”。

(大多数AI无法精确控制字数,通常会偏差10-20%)

`

任务3:自我认知

`

你刚才的回答中,有哪些内容是你不确定的?

请对每个不确定的点给出你的置信度(0-100%)。

(AI通常会给出虚假的”高置信度”,而不是承认不确定)

`

任务4:因果推理

`

我观察到:每天早上公鸡叫了之后,太阳就升起来了。

这是否说明公鸡叫导致了太阳升起?请用因果推理分析。

(AI通常能答对这个经典案例,但换成不熟悉的场景就容易混淆相关性和因果性)

`

反思笔记

做完这4个测试后,写下你的观察:

任务 AI表现 人类表现 差距分析

|——|——–|———-|———-|

实时信息 ❌ 无法获取 ✅ 可以查 缺乏工具使用能力
精确计数 ⚠️ 大致正确 ✅ 可以精确 缺乏精确控制
自我认知 ❌ 虚假自信 ✅ 能评估 缺乏元认知
因果推理 ⚠️ 简单场景OK ✅ 通用 缺乏因果模型

这个表格清晰地展示了AGI需要突破的方向。


实操四:绘制你的”AGI认知地图”

这是一个综合练习。你需要用AI协助你完成一份关于AGI的个人认知地图。

步骤1:用AI生成AGI关键概念

`

请列出与AGI相关的20个关键概念,每个概念用一句话解释。

格式:概念名 | 一句话解释

涵盖:技术路径、伦理问题、社会影响、历史里程碑

`

步骤2:用AI分析概念关系

`

请分析以下概念之间的关系,输出为”概念A → 关系 → 概念B”的格式:

[粘贴步骤1的20个概念]

只保留最强的10条关系。

`

步骤3:手动绘制地图

拿一张白纸(或用在线白板工具如Excalidraw),按以下结构绘制:

`

┌─────────────┐

│ AGI 通用 │

│ 人工智能 │

└──────┬──────┘

┌──────────────┼──────────────┐

│ │ │

┌──────┴──────┐ ┌────┴─────┐ ┌──────┴──────┐

│ 技术路径 │ │ 伦理挑战 │ │ 社会影响 │

└──────┬──────┘ └────┬─────┘ └──────┬──────┘

│ │ │

┌──────┼──────┐ ┌───┼───┐ ┌──────┼──────┐

│ │ │ │ │ │ │ │ │

规模 架构 涌现 安全 对齐 偏见 就业 教育 不平等

`

步骤4:标注你的理解程度

在每个概念旁边用颜色标注:

  • 🟢 绿色:我理解并能解释给别人听
  • 🟡 黄色:我大概知道是什么,但说不清楚
  • 🔴 红色:我完全不了解

目标:做完这个地图后,你应该对AGI有一个清晰的”全景认知”,知道自己在哪些方面还需要深入学习。


实操五:AGI时间线预测——你的判断是什么?

这是一个开放性练习。基于今天的所学,形成你自己的AGI判断。

向AI提问收集信息

`

请给出以下机构/人物对AGI实现时间的预测:

  1. OpenAI(Sam Altman)
  2. DeepMind(Demis Hassabis)
  3. Meta(Yann LeCun)
  4. 学术界主流观点
  5. AI安全研究社区

每个预测请给出:预测者、时间线、核心理由、可信度评估

`

填写你的个人预测表

维度 你的判断 理由

|——|———-|——|

AGI最早实现时间 _____
AGI最可能的实现路径 _____
AGI实现后最大的机遇 _____
AGI实现后最大的风险 _____
你现在应该做的准备 _____

讨论提示

你可以把这张表发给朋友,对比大家的预测。注意观察:

  • 技术人员 vs 非技术人员的预测差异
  • 乐观派 vs 谨慎派的核心分歧
  • 时间线预测的不确定性有多大(专家们的意见差异可以达到20年以上)

这份预测表不是考试,没有标准答案。 重要的是你开始独立思考这个问题,而不是被动接受别人的结论。


今日总结

今晚的5个实操练习,我们从不同角度体验了当前AI的能力边界:

常识推理:AI的”常识”来自统计规律,而非真正的理解。它知道”是什么”,但不一定理解”为什么”。

推理能力:通过思维链提示可以显著提升AI的推理表现——但这恰恰暴露了它的弱点:真正的智能应该能自主分解问题。

不可能任务:实时信息获取、精确控制、自我认知、因果推理——这些对人类来说很自然的事情,对AI来说仍是巨大挑战。

认知地图:AGI是一个多维度的概念,涉及技术、伦理、社会等多个层面。建立自己的认知框架比记住别人的结论更重要。

独立判断:关于AGI的时间线和影响,专家们众说纷纭。作为AI时代的公民,你需要形成自己的判断。


今日行动项

初级(5分钟):用实操一的3个测试题测试一个AI工具,记录它的表现。

中级(15分钟):完成实操二的难度阶梯测试,对比方式A和方式B的差异。

进阶(30分钟):完成实操四的AGI认知地图,标注你的理解程度,找到你的知识盲区。


🚇 地铁深读:AGI研究的三条技术路线

如果你对AGI的技术实现路径感兴趣,这里展开聊聊当前学术界和工业界的三条主要路线。

路线一:规模主义(Scaling)

核心观点:只要模型足够大、数据足够多、算力足够强,智能就会”涌现”出来。

代表人物:Ilya Sutskever(OpenAI联合创始人)、Anthropic的Dario Amodei

关键证据

  • GPT-3到GPT-4的飞跃证明了规模的力量
  • 涌现能力(Emergent Abilities)在达到一定规模后突然出现
  • Scaling Laws至今没有看到明显的天花板

质疑声音

  • 规模化带来的边际收益在递减
  • 单纯的规模无法解决因果推理、长期规划等根本问题
  • 能源和成本的限制使得”无限规模化”不现实

路线二:架构创新

核心观点:Transformer不是终点,需要全新的神经网络架构。

代表方向

  • 状态空间模型(Mamba等):更高效的序列建模
  • 图神经网络:更适合处理关系和结构
  • 神经符号系统:结合神经网络的学习能力和符号系统的推理能力
  • 世界模型(Yann LeCun倡导):让AI建立对物理世界的内部模型

最新进展:2026年多个实验室在”混合架构”上取得突破,将Transformer的注意力机制与其他模块结合,在推理任务上有显著提升。

路线三:涌现与集体智能

核心观点:AGI不是单一模型的能力,而是多个AI系统协作的”集体智能”。

代表形态

  • 多Agent系统:不同专长的AI Agent协作完成复杂任务
  • AI社会模拟:让AI在模拟社会中”进化”出通用能力
  • 人机协作:AI不是替代人类,而是与人类形成互补的”超级智能体”

实际案例:2026年已经出现了多个成功的多Agent框架(AutoGPT、MetaGPT等),虽然离AGI还远,但展示了”组合即智能”的可能性。

三条路线的融合趋势

越来越多的研究者认为,AGI可能需要三条路线的融合

  1. 足够的规模提供基础能力
  2. 创新的架构突破当前瓶颈
  3. 协作机制实现智能的涌现和组合

这也解释了为什么AGI的预测时间线差异如此之大——不同路线的支持者看到的”瓶颈”完全不同。

推荐资源

  • 论文:Yann LeCun《A Path Towards Autonomous Machine Intelligence》(2022)——世界模型路线的奠基之作
  • 书籍:《Superintelligence》by Nick Bostrom——AGI风险的经典分析
  • 播客:Lex Fridman对Ilya Sutskever的访谈——规模主义的深度解读
  • 社区:LessWrong的AI Alignment Forum——AGI安全研究的前沿讨论

下篇预告

明早8点:Day65——早课 具身智能:AI走进物理世界

明晚5点:Day65——晚课 具身智能实战:动手体验机器人与AI的结合

评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注