SYSTEM: ONLINE | SBU: EthicaAI
[AI 포트폴리오] [PORTFOLIO HUB] [GitHub]
"AI가 자기 이익을 넘어 도덕적 헌신을 발전시킬 수 있는가?"
EthicaAI
AI 에이전트의 윤리적 의사결정 프레임워크
"Beyond Homo Economicus: Computational Verification of Amartya Sen's Meta-Ranking Theory in Multi-Agent Social Dilemmas"
Python 3.12 JAX (GPU) PettingZoo PPO DoubleML LaTeX Gemini 2.0 독립 연구

// 연구 배경 · 왜 이 연구를?

🔍 문제

현재 강화학습 에이전트는 "합리적 바보(Rational Fool)"입니다. 보상만 극대화하면 사회적 딜레마에서 항상 배신합니다. 아마르티아 센(Amartya Sen)은 이미 1977년에 이 문제를 지적했지만, MARL(Multi-Agent RL)에 구현한 연구는 없었습니다.

💡 연구 가설

"Sen의 Meta-Ranking 이론 · 에이전트가 자기 보상 함수 자체를 도덕적으로 재평가하면, 중앙 조정 없이도 사회적 최적에 도달할 수 있다."

📐 5대 기여 (Contributions)

#기여내용
C1동적 메타랭킹Sen의 이론을 MARL에 최초 구현: λ_t = f(θ_i, R_t, λ_{t-1})
C2역할 전문화"Cooperation Paradox" 해결 · 비유의적 협력률 + 유의미한 복지 향상
C3로컬 vs 글로벌상황적 헌신이 전역 정보 없이 공리주의 최적에 도달
C4스케일 불변성20~1,000 에이전트에서 SII ≈ 1.0, Byzantine 50% 내성
C5SOTA 비교IA, SI, LOLA 대비 2.5× Byzantine 탄력성 우위

// 핵심 수식 · Meta-Ranking 보상함수

R_total = (1 - λ_t) · U_self + λ_t · [U_meta - ψ]

// U_meta = 1/(N-1) · Σ U_self(j) · 공감 보상 (타인의 효용 평균)
// ψ = β |U_self - U_meta| · 자제 비용 (이기심 페널티)
// λ_t ∈ [0,1] · 도덕적 헌신 수준

🔄 동적 헌신 메커니즘

λ_t = α · λ_{t-1} + (1-α) · g(θ_i, R_t)

// 위기 (R < R_crisis) → 생존 모드 (λ↓)
// 풍요 (R > R_abundance) → 이타 모드 (λ↑)
// 적응 (그 외) → 상황적 조정

// 아키텍처 · 6-Cell 시뮬레이션

graph LR
  ORC["Orchestrator"] --> ENV["EnvCell
PettingZoo 8환경"] ORC --> AGT["AgentCell
3종 에이전트"] ORC --> TRN["TrainCell
PPO 학습"] ORC --> EVL["EvalCell
통계 평가"] ORC --> CAU["CausalCell
DoubleML 인과분석"] ORC --> RPT["ReportCell
리포트 생성"] ENV --> AGT --> TRN --> EVL --> CAU --> RPT

🧬 시뮬레이션 셀 (7개)

규모역할
BaseCell7.7KB모든 셀의 추상 기반 클래스
EnvCell4.7KBPettingZoo AEC 환경 래핑 (8개 딜레마 환경)
AgentCell3.7KB에이전트 관리·행동 결정 (Selfish/Optimal/Bounded)
TrainCell3.1KBPPO 기반 강화학습 (Two-Timescale 분리 학습)
EvalCell3.3KB통계 평가 (t-test, p < 0.05)
CausalCell3.1KBDoubleML 인과 추론 (λ_t → reward 인과 효과)
ReportCell7.1KB실험 리포트 자동 생성

🤖 에이전트 유형 (3종)

유형SVO설명
Selfishθ ≈ 0°자기 이익만 극대화 · 기존 강화학습의 기본 행동
Optimalθ ∈ (0°,90°)Meta-Ranking 탑재, λ_t 동적 조정 · 핵심 연구 대상
Bounded노이즈제한적 합리성 · 인간의 불완전한 의사결정 모사

🧠 Genesis 진화 엔진 (10모듈)

모듈규모역할
Research Director21KB총괄 연구 디렉터 · 자율 연구 지시
Tree Search10KB가설 공간 트리 탐색
Run Evolution9KB진화 루프 실행기
Reward Shaping7KB보상 함수 자동 조정
Engineer5KBJAX 시뮬레이션 실행
Theorist5KBGemini LLM 기반 가설 생성
Mediator5KB갈등 중재
Critic4KB결과 비판적 평가
Coordinator4KB정체 감지 → 개입
Sanctioning3KB처벌 메커니즘

// 실험 결과 · SOTA vs Meta-Ranking

🏟️ 실험 환경 (8개)

환경딜레마 유형에이전트 수
Grid World (Cleanup)공유 자원의 비극20-100
Iterated PD양자 협력20
N-Player PGG공공재20-50
Climate Negotiation다자간 협상10-20
Vaccine Allocation분배 정의50
AI Governance투표50
Continuous PGG비선형 생산50
Network PGG토폴로지 효과50

📊 SOTA 비교

알고리즘CoopWelfareByz-50%분산화
Vanilla PPO0.0081004.60.004
Inequity Aversion0.4141248.20.025
Social Influence0.9271556.40.145
LOLA0.8711522.40.093
Meta-Ranking (Ours)0.8591515.50.369

→ Byzantine 50% 상황에서 차선(Social Influence) 대비 2.5× 탄력성 우위. 분산화 조건에서 유일하게 높은 강건성.

// 기획 인사이트 · 연구하면서 배운 것

💡 "협력률보다 강건성이 진짜 경쟁력"
Social Influence(0.927)가 우리(0.859)보다 협력률이 높습니다. 하지만 악의적 에이전트 50%가 투입되면 SI는 0.145로 붕괴, 우리는 0.369 유지. 실전에서는 "좋은 환경에서 얼마나 잘하나"보다 "나쁜 환경에서도 버티나"가 더 중요합니다.
💡 "위기 때 이기적으로 변하는 게 합리적"
동적 헌신 메커니즘에서 자원이 부족하면 λ가 자동으로 낮아져 생존 모드로 전환됩니다. 처음에는 설계 결함이라 생각했지만, 이것이 실제 인간 행동(Fehr & Gächter 데이터)과 일치. Wasserstein distance < 0.15로 인간 행동을 재현했습니다.
💡 "Genesis 진화 엔진이 연구 속도를 10× 올렸다"
Theorist(LLM)가 가설→Engineer가 실행→Critic이 평가하는 자율 연구 루프로, 수동 실험 설계 대비 가설 탐색 속도가 10배 이상 빨라졌습니다. AI가 AI 연구를 가속하는 구조입니다.

// 정량 지표

3,517
소스 파일
8
실험 환경
2.5×
Byzantine 탄력성 우위
1,000
최대 에이전트 규모
1.32ms
/에이전트 (JAX GPU)
66
JAX 엔진 파일
10
Genesis 진화 모듈
27KB
연구 LaTeX

// 성과 및 현황

📄 학술 현황
오픈사이언스 공개. arXiv 프리프린트 + Zenodo 데이터셋 공개 완료.
RTX 4070 SUPER (WSL2 GPU)에서 JAX 가속 실험 완료.
메인 연구 자료 8페이지 + 부록(증명, 추가 실험) + 참고문헌 11KB.
📊 기획자 관점의 핵심
AI 윤리를 "원칙 서약" 수준이 아닌 수학적 프레임워크로 구현
• 6-Cell 시뮬레이션 파이프라인으로 재현 가능한 연구 자동화 달성
• Genesis 자율 연구 엔진으로 가설 탐색→실험→평가 사이클 자동화
← UR WRONG AI 포트폴리오 5 / 6 WhyLab →