배경 (Phase 16 직후)
Phase 16 (메인 #75, 16a PR #78 + 16b PR #79 둘 다 머지) 에서 paradigm 의 dynamic framework 검증 완료:
- 16a (RigL/SET DST): mechanism OK, perf advantage 없음 (swap 비용)
- 16b (Net2Net grow): mechanism OK, perf advantage 매우 작음 (0-init slow activation)
공통 결론: paradigm 자체 한계 아닌 scale 의 한계. Phase 15/16 sweep 의 ~1M params + 1500 step 은 dynamic method 의 advantage 발현 임계 미달. RigL/Net2Net 등 reference paper 들의 advantage 가 large-scale 에서만 발현 패턴.
목표
가설: scale-up 시 dynamic method 의 advantage (RigL > static, grown ≈ large) 가 발현되는가?
4 mode sweep at larger config:
dense_large — 큰 모델 baseline (target reference)
static_prune_50 — Phase 15 at scale
DST_RigL_50 — Phase 16a 핵심 method at scale (RigL gradient regrow)
grown — Phase 16b method at scale (small → large via Net2Net)
각 mode 의 advantage 가 본 scale 에서 발현되는지 확인.
설계 결정
- scale 확대:
- hidden_dim: 128 → 256
- n_layers: 4 → 6
- ffn_dim: 256 (small) → 512 (large)
- group_size: 16 (유지)
- max_steps: 1500 → 5000 (3.3x 학습)
- block_size: 64 (유지 — char-LM)
- 데이터: TinyShakespeare 유지 (vocab/data 동일, scale 만 model + train)
- GPU 요구: 5000 step × 8 run ≈ 40K step-equivalents at ~3M params. 단일 GPU 1-2시간 가정.
작업 항목
완료 조건
- 221 → ~221 tests (no new tests, scale-up 은 notebook 만)
- coverage 유지 (≥ 70%)
- 노트북 sweep 정상 실행 (GPU 사용자 측), 4 mode 비교 + Phase 15/16 의 가설 재검증
Phase 17 후 가설
| 시나리오 |
다음 단계 후보 |
| scale-up 으로 DST/Net2Net advantage 발현 |
Phase 18: 16a + 16b 결합 (grow + DST 동시) |
| 여전히 advantage 미실현 |
Phase 18: dataset 확대 (OpenWebText subset 등) 또는 method 개선 (Net2WiderNet duplication / RigL period 조정) |
| dynamic method 가 명백히 dense baseline 보다 우수 |
scaling law 분석 + paper writing |
관련
배경 (Phase 16 직후)
Phase 16 (메인 #75, 16a PR #78 + 16b PR #79 둘 다 머지) 에서 paradigm 의 dynamic framework 검증 완료:
공통 결론: paradigm 자체 한계 아닌 scale 의 한계. Phase 15/16 sweep 의 ~1M params + 1500 step 은 dynamic method 의 advantage 발현 임계 미달. RigL/Net2Net 등 reference paper 들의 advantage 가 large-scale 에서만 발현 패턴.
목표
가설: scale-up 시 dynamic method 의 advantage (RigL > static, grown ≈ large) 가 발현되는가?
4 mode sweep at larger config:
dense_large— 큰 모델 baseline (target reference)static_prune_50— Phase 15 at scaleDST_RigL_50— Phase 16a 핵심 method at scale (RigL gradient regrow)grown— Phase 16b method at scale (small → large via Net2Net)각 mode 의 advantage 가 본 scale 에서 발현되는지 확인.
설계 결정
작업 항목
HybridTransformerTrainConfig의 default max_steps 등 reasonable scale-up 시 사용 편의 점검notebooks/02-function-level/17-phase17-scale-up.ipynb신규 — 4 mode × 2 seed = 8 run sweep완료 조건
Phase 17 후 가설
관련
docs/papers/computation-graph/2020-rigl-evci.md(RigL — scale-dependent)docs/papers/computation-graph/2016-net2net-chen.md(Net2Net — LLM-scale 의미)