Skip to content

[FEATURE] neuron Phase 18 — large model + long training (Phase 17 plateau 미도달 한계 해소) #82

Description

@juhy0987

배경 (Phase 17 직후)

Phase 17 (PR #81 머지) 의 핵심 발견:

  1. scale-up 의 절대적 효과 확인 (loss 0.5-0.6 ↓, ppl 6.7 → 3.8)
  2. dynamic method advantage 부분 진전 — grown 격차 +0.043 → +0.026 (축소), DST 는 +0.005 → +0.009 (소폭 이원)
  3. plateau 미도달 — 모든 mode 가 5000 step 후에도 drift -0.006 (still learning)

5000 step 도 부족. 본격적인 dynamic method advantage 검증을 위해 larger model + longer training 동시 적용 필요.

목표

사용자 명시 방향: Larger model + Longer training 동시 적용.

가설:

  1. plateau 도달 — 충분한 학습 시간으로 진정한 final loss 측정
  2. dynamic advantage 의 발현 영역 검증 — Phase 17 의 trend (grown 격차 축소) 가 plateau 영역에서 명확화?
  3. DST 의 advantage 발현 임계 — 큰 모델 + 긴 학습으로 swap cost amortize 가능?

설계 결정 — Phase 17 대비 추가 scale-up

항목 Phase 17 Phase 18 배수
hidden_dim 256 512 2x
n_heads 8 16 2x (head_dim=32 유지)
n_layers 6 12 2x
ffn_dim (large) 512 1024 2x
max_steps 5000 15000 3x
approx params ~6.4M ~30-40M ~5-6x
dynamic_at_step 2500 7500 (절반) scale 맞춤
dst_period 200 200 (유지) swap cycle 늘림
dst_end_step 4500 13500 마지막 1500 step stabilize

작업 항목

  • 코드 변경 없음 (Phase 15/16/17 framework 그대로). 검증 대상은 추가 scale + 시간의 영향.
  • notebooks/02-function-level/18-phase18-large-long.ipynb 신규 — 5 mode × 2 seed = 10 run sweep (Phase 17 와 동일 mode 구성, hp 만 scale 맞춤)
  • 자동 verdict:
    • Phase 17 동일 4 항목 (all-finite, DST ≤ static, grown ≤ dense + 0.02, plateau 도달)
    • 추가: plateau 도달 검증 (drift < -0.001 = true plateau)
    • 추가: Phase 17 → Phase 18 의 dynamic advantage 변화 trend 정량화

완료 조건

  • 221 → 221 tests (no new tests, scale-up 은 notebook 만)
  • 노트북 sweep 정상 실행 (GPU 사용자 측 — 추정 1-2 시간)
  • plateau 도달 여부 + dynamic advantage 발현 여부 정량 판단

Phase 18 후 시나리오

결과 Phase 19 후보
Plateau 도달 + dynamic advantage 발현 결과 정리 + paper writing
Plateau 도달 + dynamic 여전히 미실현 method 개선 (Net2WiderNet duplication, RigL scheduler) 또는 real dataset (OpenWebText)
Plateau 미도달 (여전히 학습 중) 본 scale 의 학습 budget 더 늘리기 (lr scheduler, gradient accumulation)

Compute 추정

  • 30-40M params × 15K step × 5 mode × 2 seed = 10 run
  • Phase 17 (6M × 5K × 10 run) 의 ~15x compute → 단일 GPU 4-6 시간 추정

관련

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions