Skip to content

Commit a427a9f

Browse files
committed
add: cogg 研究 | concept: Grokking学习曲线, 短期实验误导 | reference: Harry设计者, 联想记忆谱系
2026-04-19~20 24 小时完整研究:从知乎私信到 12M 局 cogg 实证,建立 Harry 人物档案 + cogg 所在的联想记忆谱系时间线 + Grokking 学习曲线通用概念 + 短期实验误导方法论教训. 五个文件互相引用,和已有概念 [[关联记忆]] / [[记忆假肢]] / [[侯世达]] 等连接.
1 parent dcf771a commit a427a9f

5 files changed

Lines changed: 747 additions & 0 deletions

File tree

Lines changed: 111 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,111 @@
1+
---
2+
tags: [AI, 认知科学, 方法论]
3+
---
4+
5+
# Grokking 学习曲线
6+
7+
**提出者**:Power et al. (OpenAI, 2022)
8+
**日期**:2026-04-20
9+
**来源**:[[从知乎私信到 cogg 完整复现]]
10+
11+
## 定义
12+
13+
机器学习中的一种相变现象:模型在长时间"表面上没学会"(训练误差下降但测试误差仍高)的平台期之后,**突然**达到高泛化性能。
14+
15+
"grok" 是英语俚语,意思是"彻底、本能地理解"。
16+
17+
## 典型特征
18+
19+
```
20+
训练误差
21+
22+
│╲___________________________
23+
│ → 很快下降后平坦(已拟合训练集)
24+
└─────────────────────────→ 训练步数
25+
26+
测试误差
27+
28+
│╲_______________________
29+
│ ╲
30+
│ ╲____
31+
│ ↓ 在某一步突然下降
32+
└─────────────────────────→ 训练步数
33+
```
34+
35+
## 机制(当前理解)
36+
37+
Grokking 发生的阶段性:
38+
39+
1. **记忆阶段 (Memorization)**:模型死记硬背训练样本
40+
2. **内部重组阶段**:表面误差停滞,但内部表征在悄悄寻找更泛化的结构(圆周上的位置、代数结构等)
41+
3. **顿悟阶段 (Grokking)**:内部结构对齐完成,测试误差暴跌
42+
43+
关键假设:**简单结构需要很多步才能从随机初始化中"浮现"**,尤其在显式正则化 (weight decay) 的压力下。
44+
45+
## 为什么重要
46+
47+
### 1. 实证警告:不要用短期训练下结论
48+
49+
如果在内部重组阶段提前停止,会错误地认为"这方法不 work"。
50+
51+
**教训**:评估新方法必须跑到"相对稳定"或"明显饱和"才下结论。
52+
53+
### 2. 和 Foundation Model 范式同源
54+
55+
LLM 的 "scaling law" 和 "emergent capabilities" 某种意义上是宏观版 grokking:
56+
- 小模型 + 少数据:平台期(没涌现)
57+
- 大模型 + 多数据过某阈值:某些能力突然出现(算术、类比、推理)
58+
59+
### 3. 可能是人类学习的隐藏模式
60+
61+
长期 broad 积累(读各种"无用"书)看似没进展,但内部在构建跨域连接图谱。某个刺激到来时突然"开窍"。
62+
63+
这解释了为什么:
64+
- 标准化教育体制外的自学者常常"大器晚成"
65+
- 跨学科阅读的隐藏价值
66+
- 早期 exposure 的长期复利效应
67+
68+
## 与其他概念的连接
69+
70+
- [[多层有损压缩]] — 内部重组可能就是寻找最优压缩
71+
- [[关联记忆]] — 联想系统也可能出现"记忆 → 泛化"相变
72+
- [[Foundation Model 范式]] — 大规模预训练 + fine-tune 可视为宏观 grokking
73+
- **反直觉推论**:快速收敛的方法不一定最优;慢收敛可能是在找更深的结构
74+
75+
## 应用与警示
76+
77+
### 应用于实验设计
78+
79+
- 任何慢学习方法要跑到**绝对饱和**才评估
80+
- 不要相信"前 10% 的曲线"
81+
- 记录完整的训练轨迹,而非只看终点
82+
83+
### 应用于 cogg 验证
84+
85+
2026-04-20 的 cogg 实证案例:
86+
- 2000 局:胜率看似等于随机 → 错误下结论"不能学"
87+
- 10000 局:+5% 学习信号
88+
- 12000000 局:+17.7% 明显学习
89+
- **差 3 个数量级才看到真实表现**
90+
91+
这是一次 grokking 式误判的活体样本。
92+
93+
### 应用于人类判断
94+
95+
对于"看似无进展"的长期积累:
96+
- 不要过早放弃
97+
- 不要用短期输出评估
98+
- 相信内部重组的存在
99+
100+
## 参考文献
101+
102+
- Power, Burda, Edwards, Babuschkin, Sutskever (2022). "Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets"
103+
- OpenAI blog: 关于 grokking 的进一步分析
104+
- Liu et al. (2022) "Towards Understanding Grokking: An Effective Theory of Representation Learning"
105+
106+
## 关联概念
107+
108+
- [[多层有损压缩]]
109+
- [[关联记忆]]
110+
- [[短期实验误导]]
111+
- [[进化搜索记忆系统]]

1-concepts/短期实验误导.md

Lines changed: 129 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,129 @@
1+
---
2+
tags: [方法论, AI, 实验]
3+
---
4+
5+
# 短期实验误导
6+
7+
**提出者**:方治宇(实证归纳)
8+
**日期**:2026-04-20
9+
**来源**:[[从知乎私信到 cogg 完整复现]]
10+
11+
## 定义
12+
13+
基于训练量不足的实验样本下结论,会系统性地错误评估一个方法的真实能力 —— 特别是对**学习速率慢****有 grokking 特征**的方法。
14+
15+
## 触发条件
16+
17+
以下任一情况下,短期实验几乎必然误导:
18+
19+
1. 方法需要**大量样本**才能积累足够统计信号
20+
2. 方法在学习过程中经历**平台期**(参考 [[Grokking 学习曲线]])
21+
3. 方法没有显式梯度更新,依靠**统计累积**的间接信号
22+
4. 评测的 variance 比学习带来的信号差异还大
23+
24+
## 实证案例(2026-04-20 cogg 验证)
25+
26+
对 Harry 的 cogg 架构(关联记忆派系)做井字棋验证:
27+
28+
| 训练量 | 胜率 vs 随机 | 判断 |
29+
|--------|-----------|------|
30+
| 2,000 局 | ≈ 58% (= 随机基线) | "cogg 不能学" ❌ 错误 |
31+
| 10,000 局 | 62% (+3.5) | "学得很慢" ⚠️ 不完整 |
32+
| **12,000,000 局** | **76%** (+17.7) | "cogg 确实能学" ✅ 正确 |
33+
34+
**差距 3 个数量级才看到真实表现**。如果只跑 2000 局就下结论,会**完全错判**这个方法。
35+
36+
## 核心机制分析
37+
38+
### 为什么学习信号会被淹没
39+
40+
```
41+
胜率 = 基础信号 + 噪音
42+
43+
小样本 (N=2000):
44+
学习信号 = +3% (可能隐藏在学习的早期平台)
45+
噪音标准差 = ±2.2% (置信区间)
46+
信号 / 噪音 ≈ 1 → 无法区分
47+
48+
大样本 (N=12M):
49+
学习信号 = +17%
50+
噪音标准差 < ±0.1%
51+
信号 / 噪音 > 100 → 清晰可辨
52+
```
53+
54+
### 为什么某些方法特别容易误导
55+
56+
- **非梯度方法**(进化、Hebbian、cogg 式覆盖):没有精准的误差信号传递,只有**统计累积**
57+
- **大状态空间 + 小样本**:很多状态根本没见过,看不出模式
58+
- **评测噪音大**:随机对手本身就有高方差
59+
60+
## 防御方法
61+
62+
### 原则 1:先跑到饱和
63+
64+
```python
65+
# 不好的实验设计
66+
train_for_fixed_budget(method, budget="1 天")
67+
conclude(method)
68+
69+
# 好的实验设计
70+
while not saturated(method): # 直到内部结构不再变化
71+
train_more(method)
72+
log_metrics()
73+
conclude(method)
74+
```
75+
76+
**判断饱和的信号**:
77+
- god_tree / 权重 / 参数 不再显著变化
78+
- 损失/指标曲线进入平坦
79+
- 多次重跑结果一致
80+
81+
### 原则 2:对照组要同时跑
82+
83+
永远跑**相同训练量**下的 baseline,不要用**理论值**做基线。
84+
85+
```
86+
错误:"我的方法胜率 58%,和理论随机基线 58% 一样 → 无效"
87+
正确:"我的方法胜率 58% (N=2000),同样 N=2000 的随机基线 59% → 信号可能被淹没"
88+
```
89+
90+
### 原则 3:看完整轨迹,不只看终点
91+
92+
- 记录每一步的指标
93+
- 关注曲线形状,不只是最终值
94+
- 如果看到 [[Grokking 学习曲线]] 特征 → 继续训练
95+
96+
### 原则 4:资源允许时跑到"无聊"
97+
98+
如果 hardware 允许 10x-100x 的训练,就跑 10x-100x。**额外开销相对于误判成本通常是微不足道的**
99+
100+
cogg 的 12M 局只花了 10 分钟 CPU。误判它"不能学"的代价是**放弃一个方向**,这个代价远大于多跑 10 分钟。
101+
102+
## 推广:人类认知中的版本
103+
104+
短期实验误导不只是 ML 问题,也是**普遍的评估偏误**:
105+
106+
- 评价一个人的长期积累(读书 / 练习)用短期成绩
107+
- 评价一个公司的战略(转型期)用单季财报
108+
- 评价一个关系的质量用初期互动
109+
- 评价一个想法的价值用早期反响
110+
111+
**所有这些都可能犯和"2000 局下结论"同类的错误**
112+
113+
## 反面教训清单(写给未来的自己)
114+
115+
下次遇到这些情况时要警惕:
116+
117+
1. ❌ "跑了个小实验,感觉不 work" → 跑够了吗?
118+
2. ❌ "前几个 epoch 没提升,放弃" → 看过学习曲线整体吗?
119+
3. ❌ "和基线一样,这方法没用" → 同样训练量跑对照了吗?
120+
4. ❌ "快速下结论省时间" → 错判的代价远大于多跑的时间
121+
5. ❌ "学界已经证明这条路不 work" → 学界的实验条件和你的一样吗?
122+
123+
## 关联概念
124+
125+
- [[Grokking 学习曲线]]
126+
- [[研究者过拟合]]
127+
- [[评估时间尺度错配]]
128+
- [[噪声鲁棒性与天花板]]
129+
- [[适应度幻觉]]

0 commit comments

Comments
 (0)