Skip to content

[FEATURE] neuron Phase 17 — scale-up validation (DST + grow advantage at larger scale) #80

Description

@juhy0987

배경 (Phase 16 직후)

Phase 16 (메인 #75, 16a PR #78 + 16b PR #79 둘 다 머지) 에서 paradigm 의 dynamic framework 검증 완료:

  • 16a (RigL/SET DST): mechanism OK, perf advantage 없음 (swap 비용)
  • 16b (Net2Net grow): mechanism OK, perf advantage 매우 작음 (0-init slow activation)

공통 결론: paradigm 자체 한계 아닌 scale 의 한계. Phase 15/16 sweep 의 ~1M params + 1500 step 은 dynamic method 의 advantage 발현 임계 미달. RigL/Net2Net 등 reference paper 들의 advantage 가 large-scale 에서만 발현 패턴.

목표

가설: scale-up 시 dynamic method 의 advantage (RigL > static, grown ≈ large) 가 발현되는가?

4 mode sweep at larger config:

  1. dense_large — 큰 모델 baseline (target reference)
  2. static_prune_50 — Phase 15 at scale
  3. DST_RigL_50 — Phase 16a 핵심 method at scale (RigL gradient regrow)
  4. grown — Phase 16b method at scale (small → large via Net2Net)

각 mode 의 advantage 가 본 scale 에서 발현되는지 확인.

설계 결정

  • scale 확대:
    • hidden_dim: 128 → 256
    • n_layers: 4 → 6
    • ffn_dim: 256 (small) → 512 (large)
    • group_size: 16 (유지)
    • max_steps: 1500 → 5000 (3.3x 학습)
    • block_size: 64 (유지 — char-LM)
  • 데이터: TinyShakespeare 유지 (vocab/data 동일, scale 만 model + train)
  • GPU 요구: 5000 step × 8 run ≈ 40K step-equivalents at ~3M params. 단일 GPU 1-2시간 가정.

작업 항목

  • 코드 변경 없음 (Phase 15/16 framework 이미 모든 config 지원). 검증 대상은 scale 자체의 영향.
  • (선택) HybridTransformerTrainConfig 의 default max_steps 등 reasonable scale-up 시 사용 편의 점검
  • notebooks/02-function-level/17-phase17-scale-up.ipynb 신규 — 4 mode × 2 seed = 8 run sweep
  • 자동 verdict 갱신:
    • DST_RigL ≤ static_prune (16a 의 advantage 발현?)
    • grown ≤ large_baseline + 0.02 (16b 의 capacity gap 축소?)
    • all-finite (학습 안정성)
    • 추가: 5000 step 학습 시 loss curve 의 plateau 도달 여부

완료 조건

  • 221 → ~221 tests (no new tests, scale-up 은 notebook 만)
  • coverage 유지 (≥ 70%)
  • 노트북 sweep 정상 실행 (GPU 사용자 측), 4 mode 비교 + Phase 15/16 의 가설 재검증

Phase 17 후 가설

시나리오 다음 단계 후보
scale-up 으로 DST/Net2Net advantage 발현 Phase 18: 16a + 16b 결합 (grow + DST 동시)
여전히 advantage 미실현 Phase 18: dataset 확대 (OpenWebText subset 등) 또는 method 개선 (Net2WiderNet duplication / RigL period 조정)
dynamic method 가 명백히 dense baseline 보다 우수 scaling law 분석 + paper writing

관련

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions