EVIDENCE

주장하지 않고 증명합니다

20개 공개 데이터셋에서 의사결정 복원력을 측정하고 그 결과로 모든 평결의 신뢰 등급을 보정합니다.

아래 수치는 공개 데이터셋 백테스트 실측값입니다. 실제 고객 캠페인과의 예측·실결과 대조(paired-pilot)는 아직 수집 전이며 완료 전까지 증거 등급은 directional입니다.

01What We Measure

척도 불변 의사결정 복원

절대 수치가 아니라 운영자가 실제로 내리는 결정을 채점합니다.

winner

이기는 안을 맞힌 비율

directional

쌍별 비교 방향의 정확도

control-sign

처치가 대조군을 이기는지의 정확도

ρ̄ (Spearman)

그룹 내 순위 상관

02Measured Results

시장 결정 복원 성적

대조 11그룹, 샘플 3회, 동일 모델 조건의 실측값입니다.

예측기winnerdirctrl-signρ̄
무모델 베이스라인0.000.000.00−1.00
단일 표본 패널0.6360.7840.8570.461
페르소나 패널제품 탑재0.7270.8300.9290.625
구조 prior (인코딩 가능 대조)1.0000.8980.9290.961
  • 멀티도메인 일반화: 마케팅 밖 전자상거래·소득 도메인에서도 winner 0.750을 유지합니다.
  • 가격·선택 레인(ModeCanada)은 구조 prior가 LLM 패널을 능가해 그쪽으로 라우팅합니다.
03Cross-Industry Breadth

20개 산업에서 실제 시장 결정을 복원합니다

방향성 방법론이 마케팅 밖으로도 일반화되는지 검증합니다. 누출 없는 구조 prior — 패널의 방향성 믿음을 감사 가능하게 대리하는 예측기 — 를 20개 공개 데이터셋(37 대조 그룹, 118 케이스)에 걸쳐 척도 불변 의사결정 복원으로 채점합니다.

예측기winnerdirctrl-signρ̄
무모델 베이스라인0.000.010.00−1.00
구조 방향성 prior0.9460.8990.9080.876
커버 산업 (20개 데이터셋)
Email marketingBank telemarketingE-commerce sessionsCensus / incomeRetail promotionTelecom churnTravel pricingPolitical GOTVNonprofit fundraisingBehavioural pricingHospitalityFintech / retirementHealthcareTax / governmentRetail merchandisingPricing psychologyPersuasion / copyEnergy / utilitySales / commitmentNonprofit asks

구조 prior가 floor를 이긴다는 것은 방향이 옳다는 뜻이지, LLM이 특정 정확도를 낸다는 증명은 아닙니다. 2건의 miss는 의도적으로 안 맞춘 반직관 반전(광케이블 이탈·신규 방문자 전환)입니다.

04Failure-Mode QA

합성 패널의 1번 실패 모드를 측정합니다

0그룹
분산 붕괴

예측 분포가 현실만큼 분산됩니다. 합성 응답의 대표적 결함인 분산 축소가 관측되지 않았습니다.

0.21 vs 0.04
부호 뒤집힘 (패널 vs 구조)

두 예측 경로의 부호 뒤집힘 비율입니다. 대조 유형에 따라 더 강한 경로로 라우팅하는 근거입니다.

73.1%
감성 판정 (NSMC)

임계 보정 후 100% 커버리지 기준 정확도입니다.

05Trust Gate

모든 평결에 등급이 붙습니다

백테스트로 보정한 규칙이 각 평결을 세 등급으로 분류합니다.

decision grade

반복 측정에서 승자가 유지되고 검증된 대조 유형일 때만 부여합니다.

directional only

방향은 신뢰할 수 있으나 실제 A/B로 확정해야 하는 평결입니다.

inconclusive

근소차와 검정력 부족은 판정을 유보합니다.

believe what repeats샘플 간 승자가 흔들리면 격차가 커도 decision grade를 박탈합니다.
paired-pilot예측과 실제 결과를 짝지어 축적합니다. human_calibrated 등급으로 가는 유일한 경로입니다.

paired-pilot 실측 수집은 시작 단계입니다. 완료 전까지 전체 증거 등급은 directional로 유지합니다.

06Published Boundaries

측정의 경계까지 공개합니다

경계를 공개하기 때문에 등급이 붙은 평결을 믿을 수 있습니다.

  • 거의 동등한 두 크리에이티브의 승자 판별은 우연 수준입니다. 신뢰 게이트가 자동으로 캡합니다.
  • 반직관 미세효과(예: 신규 방문자가 재방문자를 이기는 대조)는 구조 prior와 LLM 모두 놓칩니다.
  • 절대 전환율·지출 수치는 인구·시대 불일치로 검증하지 않습니다. 순서 기반 결정만 채점합니다.
  • 행동 코호트 인기 세그먼트는 winner 0.222 수준이라 세그먼트 레인 전체를 directional로 캡했습니다.
기각한 자사 가설도 공개합니다

cross-framing 합의 게이트 가설을 사전 등록 조건으로 검증한 결과 agree 부분집합 winner 0.308 vs disagree 0.667로 정반대였습니다. 같은 모델의 프레이밍 간 합의는 공유 편향의 일관성을 측정할 뿐이라 판단해 게이트를 downgrade 전용으로 제한했습니다.

07Reproduce It

직접 재현하세요

API 키 없이 아래 명령으로 전체 결과를 재현할 수 있습니다.

$npm run backtest:panel -- --config panel_persona_v1 --samples 3# decision recovery
$npm run backtest:distribution# variance / sign-flip QA
$npm run backtest:ssr# sentiment (SSR)
$npm run backtest:market-realism# structural prior
$npm run backtest:cross# cross-industry (20 datasets)
$npm run backtest:segments -- --samples 3# segments lane cap
$npm run backtest:segments -- --samples 3 --framings 2# cross-framing falsification
$npm run pilot:status# paired-pilot calibration
측정 데이터셋 (21)
Hillstrom Email A/BUCI Bank MarketingUCI Online ShoppersCensus IncomeNSMC (Korean sentiment)Starbucks Promotion A/BTelco ChurnModeCanada (pricing/choice)GOTV Social PressureCharity Match OfferZero-Price EffectHotel Social Proof401(k) DefaultVaccination PromptTax Social NormChoice Overload (Jam)Decoy EffectThe Word "Because"Home Energy ReportFoot-in-the-DoorEven-a-Penny Ask

검증된 방향으로 시작하세요

무료로 시작하기