From 8eb92055dcdbcf55066cb3dfbdc19317fea07bf0 Mon Sep 17 00:00:00 2001 From: juhyuni Date: Wed, 27 May 2026 10:12:11 +0900 Subject: [PATCH 1/2] =?UTF-8?q?[DOCS]:=20Boltzmann=20machine=20=EA=B3=84?= =?UTF-8?q?=EC=97=B4=20=EB=85=BC=EB=AC=B8=205=ED=8E=B8=20=EC=A0=95?= =?UTF-8?q?=EB=A6=AC=20(energy-based=20=EC=8B=A0=EA=B7=9C=20=EC=B9=B4?= =?UTF-8?q?=ED=85=8C=EA=B3=A0=EB=A6=AC)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - docs/papers/energy-based/ 신규 디렉토리 + 5편 md 작성: - 1985-boltzmann-machine-hinton: Ackley+Hinton+Sejnowski, BM 원조 (energy + Gibbs sampling + contrastive update) - 1986-harmony-theory-smolensky: Smolensky, RBM 원조 (bipartite + conditional independence) - 2002-contrastive-divergence-hinton: Hinton, CD-1 (RBM 실용 학습 breakthrough) - 2006-dbn-hinton: Hinton+Osindero+Teh, DBN (layer-wise pre-training + 딥러닝 부활) - 2009-dbm-salakhutdinov: Salakhutdinov+Hinton, DBM (all-layer undirected) - README.md 갱신: 디렉토리 구조 + 패러다임 분류 표 + Energy-based 인덱스 섹션 추가 - 시사점은 graph energy + paradigm 연결 관점으로 작성: - BM 의 E = -Σ w_ij s_i s_j 와 HybridGraphLinear 의 adj·W 구조 등가성 - RBM bipartite 와 HybridGraphLinear input↔output channel 의 일치 - CD-1 의 "biased but practical" 과 Phase 15 prune 의 magnitude proxy 철학 - DBN/DBM 의 layer-wise growth 와 Phase 16 후보 (Net2Net/LiGO) 의 historical precursor - DBM 의 layer-wise differentiation 과 Phase 17 (attention vs FFN 차등 prune) motivation - papers-lint 통과 (45 → 50편) --- docs/papers/README.md | 17 ++- .../1985-boltzmann-machine-hinton.md | 95 +++++++++++++++ .../1986-harmony-theory-smolensky.md | 91 +++++++++++++++ .../2002-contrastive-divergence-hinton.md | 95 +++++++++++++++ docs/papers/energy-based/2006-dbn-hinton.md | 107 +++++++++++++++++ .../energy-based/2009-dbm-salakhutdinov.md | 110 ++++++++++++++++++ 6 files changed, 514 insertions(+), 1 deletion(-) create mode 100644 docs/papers/energy-based/1985-boltzmann-machine-hinton.md create mode 100644 docs/papers/energy-based/1986-harmony-theory-smolensky.md create mode 100644 docs/papers/energy-based/2002-contrastive-divergence-hinton.md create mode 100644 docs/papers/energy-based/2006-dbn-hinton.md create mode 100644 docs/papers/energy-based/2009-dbm-salakhutdinov.md diff --git a/docs/papers/README.md b/docs/papers/README.md index 258e837..e0d2f8f 100644 --- a/docs/papers/README.md +++ b/docs/papers/README.md @@ -15,6 +15,7 @@ GraphLM 의 핵심 패러다임은 **training-time dynamic parameter count** ( | `graph/`, `hybrid/` (기존 8편) | **data-as-graph** | **Baseline reference 보존** — 직접 채택 대상 아님. "데이터를 graph 로" 의 비교군. | | `computation-graph/` (sparse activation 6편) | **computation-as-graph (sparse activation 위주)** | **부분적 reference** — MoE/MoD/UT 6편은 \"고정 총량 + 동적 활성\" 이라 본 프로젝트 1순위가 아님. AutoFormer (NAS) / GHN-3 (arch-as-graph) 는 architecture-as-graph 측면 보조 정렬. | | `computation-graph/` (dynamic param 22편 + function-level dynamic 7편) ⭐ | **training-time dynamic param count (THIS)** | **1순위 큐레이션** — Growing Networks (5) / DST (5) / DARTS (1) / Adaptive Trigger (5) / Resource·Deployment (6) / **Function-level dynamic (7 신규)** | +| `energy-based/` (5편) | **graph energy reference** | **historical foundation** — Boltzmann machine / RBM / DBN / DBM 의 *graph edge weight 학습* 시초. paradigm 의 `HybridGraphLinear` dual-gated edge 와 구조적 등가성. | | `lm/` (미사용) | LM 일반 | 필요 시 활성화 | 신규 논문 요약 추가 시 **dynamic parameter count 계열** (Growing / DST / DARTS) 을 우선한다. sparse activation (MoE 류) 와 data-as-graph 는 둘 다 reference 자료 — 직접적 baseline 가치가 명확할 때만 추가. @@ -27,7 +28,9 @@ docs/papers/ ├── _template.md # 신규 요약 시 복사할 표준 템플릿 ├── graph/ # 순수 그래프 방법 (GCN, GAT, GraphSAGE 등) ├── lm/ # 순수 언어 모델 (BERT, GPT, T5 등) -└── hybrid/ # 그래프 + LM 결합 / multimodal +├── hybrid/ # 그래프 + LM 결합 / multimodal +├── computation-graph/ # computation-as-graph (sparse activation + dynamic param count + function-level) +└── energy-based/ # graph energy 표현 (Boltzmann machine, RBM, DBN, DBM) ``` 신규 카테고리가 필요하면 같은 깊이로 디렉토리를 추가하고 본 README 의 표를 갱신한다. @@ -195,6 +198,18 @@ docs/papers/ | [computation-graph/2021-modular-transformer-csordas.md](computation-graph/2021-modular-transformer-csordas.md) | 2021 | Are Neural Nets Modular? | Differentiable weight mask 로 Transformer functional modularity 정량 측정 (post-hoc) | | [computation-graph/2018-modular-networks-kirsch.md](computation-graph/2018-modular-networks-kirsch.md) | 2018 | Modular Networks | Hard routing + 학습 가능 (Gumbel-Softmax) — emergent specialization | +### Energy-based (graph energy reference, historical foundation) + +> Boltzmann machine 계열의 *graph edge weight 학습* 시초 — `HybridGraphLinear` 의 `adj_outer · adj_inner · W` 의 dual-gated edge 와 구조적 등가성. paradigm 의 *graph energy 표현* + *layer-wise progressive growth* 의 historical roots. + +| 파일 | 연도 | 모델/방법 | 한줄 요약 | +|---|---|---|---| +| [energy-based/1985-boltzmann-machine-hinton.md](energy-based/1985-boltzmann-machine-hinton.md) | 1985 | Boltzmann Machine | Stochastic graph energy model — `E = -Σ w_ij s_i s_j` + Gibbs sampling + contrastive update (positive/negative phase) | +| [energy-based/1986-harmony-theory-smolensky.md](energy-based/1986-harmony-theory-smolensky.md) | 1986 | Harmonium (RBM 원조) | Bipartite restricted BM, conditional independence 활용 — paradigm 의 bipartite directed graph 와 등가 구조 | +| [energy-based/2002-contrastive-divergence-hinton.md](energy-based/2002-contrastive-divergence-hinton.md) | 2002 | Contrastive Divergence (CD-1) | RBM 실용 학습 breakthrough — k-step Markov chain 으로 negative phase 근사. "biased but practical" 의 historical 시조 | +| [energy-based/2006-dbn-hinton.md](energy-based/2006-dbn-hinton.md) | 2006 | Deep Belief Network | Layer-wise greedy pre-training + variational bound 보장 — 딥러닝 부활 catalyst, Phase 16 후보 (Net2Net/LiGO) 의 historical precursor | +| [energy-based/2009-dbm-salakhutdinov.md](energy-based/2009-dbm-salakhutdinov.md) | 2009 | Deep Boltzmann Machine | 모든 layer 가 undirected RBM — Phase 14 의 full graph block 과 구조적 등가, Phase 17 (layer-wise 차등 prune) 의 motivation | + ## 작성 원칙 - **요약은 자기 언어로** — 논문 abstract 복붙 금지. 본인이 이해한 표현으로 재기술 diff --git a/docs/papers/energy-based/1985-boltzmann-machine-hinton.md b/docs/papers/energy-based/1985-boltzmann-machine-hinton.md new file mode 100644 index 0000000..e723afc --- /dev/null +++ b/docs/papers/energy-based/1985-boltzmann-machine-hinton.md @@ -0,0 +1,95 @@ +--- +title: "A Learning Algorithm for Boltzmann Machines" +authors: "Ackley, D. H., Hinton, G. E., & Sejnowski, T. J." +year: 1985 +venue: "Cognitive Science, 9(1): 147-169" +url: "https://www.cs.toronto.edu/~hinton/absps/cogscibm.pdf" +doi: "10.1207/s15516709cog0901_7" +tags: ["energy-based", "boltzmann-machine", "stochastic", "graph-energy", "gibbs-sampling"] +status: "draft" +cited_in: [] +--- + +# Boltzmann Machine (BM) — 원조 energy-based stochastic network + +## TL;DR (3줄) + +- 노드가 binary stochastic unit 인 fully-connected graph 위에서 energy minimization 으로 학습하는 generative model — Hopfield network 의 stochastic 확장. +- Simulated annealing 으로 visible/hidden unit 의 결합 분포를 학습, Gibbs sampling 기반 contrastive update rule (positive/negative phase). +- 학습 신호 = data-clamped state 와 free-running state 의 통계 차이. 1980 년대 neural network 의 graph energy 학습 방법론 확립. + +## 핵심 기여 + +- **Stochastic neural network 정식화**: deterministic Hopfield (1982) 의 일반화. unit 이 `s_i ∈ {0, 1}` 인데 결정값이 아니라 확률적 (`P(s_i = 1) = σ(net_i / T)`). +- **Energy function**: `E(s) = -Σ_{i