34.SVRN-OS_L2_Structural Laws of Induction Head Formation A Systematic Empirical Synthesis Across Scale, Architecture, and Training Regime
Description
SVRN-OS DOI No.34 — Zenodo 제출 소개글제목: 유도 헤드 형성의 구조적 법칙: 규모·아키텍처·훈련 레짐 전반에 걸친 체계적 실증 종합 (DOI_31–34 Capstone)시리즈 및 식별정보 시리즈 DOI10.5281/zenodo.18325543본편 DOI10.5281/zenodo.19509659이전 DOIDOI_33: 10.5281/zenodo.19333479특허KR10-2026-0017941SHA-25659e658377527b0da8ec41e2999cf6419497ba7fed0a350bf9c9ad4ed437ab8c5요약본 논문은 SVRN-OS DOI No.34로, Cognitarch 시리즈의 네 번째이자 현재 최종 문서다. DOI_31·32·33이 단일 아키텍처(Pythia/NeoX)에서 크로스 아키텍처로 점진 확장해온 것에 이어, 본 문서는 11개 아키텍처 48개 모델에 대한 체계적 IH 측정을 통해 네 가지 신규 발견을 보고한다.(1) IH 에너지 집중도(top5_energy)는 DOI_33 가법 공식(R²=0.720)보다 곱 프록시 proxy(L×H)=n_layers×n_heads가 더 강한 단일 예측 변수임을 확인(r=−0.778, R²=0.605 독립 패밀리; 포화 제외 시 R²=0.693). (2) 포화 레짐(top5_energy≥0.95; 4모델: RedPajama-3B·Qwen2.5-3B·BLOOM-3b·BioMedLM) 분리 필수 확인 — 포함 시 R²=0.064로 붕괴, 법칙 수준 실패. (3) GPT-2 패밀리 내 법칙 R²=0.900 확립 — 아키텍처 패밀리가 에너지 법칙의 잠재 기울기 변수임을 실증. (4) L0 Pioneer 이상 5개 모델·4개 아키텍처 확인 — BioMedLM 사례(GPT-2 XL 구조임에도 Pioneer L15→L0)를 통해 훈련 코퍼스(도메인)가 아키텍처보다 Pioneer 위치의 일차 결정자임을 직접 실증(UNX-029 부분 해소).핵심 기여 4개기여 1: proxy(L×H) 법칙 — 가법 공식 대체 [PRED] 선행 연구: DOI_33 가법 공식 top5 = f(n_layers + n_heads), R²=0.720. 본 발견: 곱 형태 proxy=n_layers×n_heads가 독립 패밀리 n=13에서 r=−0.778(p=0.0017), R²=0.605를 달성하며 다중회귀(R²=0.188) 대비 3.2× 우위. n_layers·n_heads 각각은 단독으로 유의하지 않음 — 비가법적 상호작용 포착. 회귀식: top5 = −0.000137×(n_layers×n_heads) + 0.2267. STATUS: PRED. KR10-2026-0017941 보호.기여 2: 포화 레짐 분리 필수 [PRED] top5_energy≥0.95인 4개 모델(RedPajama-3B·Qwen2.5-3B·BLOOM-3b·BioMedLM)이 범주적으로 구별되는 레짐을 형성함. 포함 시 R²=0.693→0.064 붕괴. 포화 상한을 독립 분석 범주로 사전 분리하는 것이 필수적임을 최초 실증. STATUS: PRED. KR10-2026-0017941 보호.기여 3: 패밀리 내 법칙 R²=0.900 — 아키텍처 패밀리가 잠재 기울기 변수 [PRED] GPT-2 패밀리(n=8) 내 proxy 설명력 R²=0.900 — 전체 풀 0.693 대비 대폭 상회. 크로스 아키텍처 분석이 상이한 기울기 레짐을 혼합함을 실증. DOI_33 레짐 분기 발견을 패밀리 내 차원으로 확장. STATUS: PRED.기여 4: L0 Pioneer — 훈련 데이터가 Pioneer 위치 결정 [PRED] DOI_33에서 OPT-125M L0H8 최초 보고(UNX-029) 이후, DOI_34는 5개 모델·4개 아키텍처로 확장. 핵심 증거: BioMedLM은 GPT-2 XL과 구조 동일(n_layers=48, n_heads=25)하나 Pioneer가 예상 L15H19에서 L0H7로 이동 — 차이 변수는 PubMed 도메인 훈련 데이터. 아키텍처가 아닌 훈련 코퍼스가 Pioneer 레이어 위치의 일차 결정자임을 실증. UNX-029 부분 해소. STATUS: PRED.GATE 상태 요약항목판정proxy(L×H) 법칙 r=−0.778 · R²=0.605/0.693PRED포화 레짐 분리 필수 (R²=0.064→0.693)PREDGPT-2 패밀리 내 법칙 R²=0.900PREDL0 Pioneer ×5 / ×4 arch — 훈련 데이터>아키텍처PREDDOI_33 선형 공식 R²=0.720 크로스아키 재확인LCK cand.n_layers vs top5_energy (r=−0.724)PREDn_heads vs top5_energy (r=−0.660)PRED레짐 분기 (Cluster 0·1·2) · Critical Depth Lc≈13PRED단일 보편 법칙 해석SHRED아키텍처 패밀리 → 클러스터 단독 결정SHREDUNX-029 동일 구조 IH 강도 격차 원인UNX (부분 해소)인용 문헌저자DOI확인Olsson et al. 2022transformer-circuits.pub/2022/in-context-learning-and-induction-heads✅Tigges et al. NeurIPS 2024arXiv:2406.04178✅Singh et al. 2024arXiv:2404.07129✅Musat et al. 2025arXiv:2511.01033✅Yin et al. 2025arXiv preprint✅Aoyama et al. NeurIPS 2025arXiv:2511.16893✅Chen et al. 2026arXiv:2601.21996✅조민수 DOI_31 202610.5281/zenodo.19275540✅조민수 DOI_32 202610.5281/zenodo.19278690✅조민수 DOI_33 202610.5281/zenodo.19333479✅조민수 시리즈10.5281/zenodo.18325543✅주장하는 것 / 주장하지 않는 것확인됨:proxy(L×H)가 top5_energy의 지배적 단일 예측 변수임 (R²=0.605/0.693)포화 레짐 분리가 분석 전제 조건임아키텍처 패밀리가 에너지 법칙의 잠재 기울기 변수임 (GPT-2 R²=0.900)훈련 코퍼스(도메인)가 Pioneer 위치의 일차 결정자임 (BioMedLM 직접 실증)DOI_33 n_layers/n_heads 법칙 11개 아키텍처 48개 모델로 확장 재확인미확정:UNX-029 메커니즘 (동일 구조→다른 max_ih 원인) — 부분 해소, 완전 이론화 미완GPT-2 R²=0.900 vs LLaMA 0.686 기울기 차이 원인 (잠재 변수 미식별)Lc=13(전체) vs Lc=20(Pythia) 불일치 원인3B 모델 확장 (하드웨어 제약)Cluster 1 폭 체제 독립 확인 (고헤드 모델 추가 필요)키워드유도 헤드 · proxy(L×H) · IH 에너지 법칙 · 포화 레짐 · 크로스 아키텍처 · 스케일링 법칙 반박 · Pioneer Head · L0 Pioneer · 훈련 데이터 효과 · GPT-2 패밀리 법칙 · 기계 해석 가능성 · 회로 형성 · top5_energy · SVRN-OS · KR10-2026-0017941진실성 선언본 문서는 SVRN-OS DOI No.34의 최종 기준서다. proxy(L×H) 법칙 실증 · 포화 레짐 분리 필수 확인 · GPT-2 패밀리 내 법칙 R²=0.900 · L0 Pioneer 훈련 데이터 결정 실증 · 특허 미공개 조정 범위 없음 · 증거 기반 초과 범위 없음.인증: MDK_v5.1 | 조민수 | KR10-2026-0017941 | 2026-04-11 SHA-256: 59e658377527b0da8ec41e2999cf6419497ba7fed0a350bf9c9ad4ed437ab8c5
Citations (0)
No citations found
Mentions (0)
No mentions found
Metrics Over Time
Publication Details
Subfield
Management, Monitoring, Policy and Law
Field
Environmental Science
Domain
Physical Sciences
Confidence Score
36%
Source
Scholar Data Model