Medical RWD Research · Advanced Biostatistics · Machine Learning02-706-3695 · 02-706-3698
Research & Statistical Services

연구 설계와 통계분석을
하나의 흐름으로.

업로드된 실제 임상 연구계획서에서 사용되는 분석 구조를 기준으로, RWD 연구에 필요한 기술통계부터 인과추론·생존분석·추이분석·비용분석·임상 예측모형·머신러닝까지 체계적으로 지원합니다.

Medical RWD

RWD 연구설계 · 코호트 구축

분석 전에 임상 질문과 데이터 구조가 정확히 맞물리도록 연구의 시간축과 조작적 정의를 설계합니다.

Research Question

PICO/PECO, primary/secondary outcome, target population과 estimand를 연구목적에 맞게 명확히 합니다.

Cohort Definition

Inclusion/exclusion, incident case, comparator, washout과 대상자 flow를 정의합니다.

Time Architecture

Index date, baseline, landmark, exposure window, follow-up, event, censoring을 시간 순서에 맞게 설계합니다.

Operational Definition

진단코드·행위수가·수술·약제·검진변수·CCI 등 임상 개념을 데이터 규칙으로 변환합니다.

Bias Control

Immortal-time, time-lag, selection bias 가능성을 점검하고 필요 시 landmark·time-dependent 전략을 검토합니다.

Analysis Plan

주분석, subgroup, sensitivity, missing data 처리와 보고지표를 분석 전 일관된 계획으로 정리합니다.

NHIS Low-risk Sample Dataset

국민건강보험공단 저위험 표본데이터셋 분석

100만 명 표본 코호트를 활용해 의료이용·건강검진·건강행태 중심의 RWD 연구를 설계합니다.

100만 명무작위 표본 코호트
2014–202310년 종단자료
37개 변수의료이용·건강검진
67.8만 명건강검진 자료 대상자
MEDICAL UTILIZATION

의료이용·질환 추이

주상병, 입원·외래 이용, 사망연도, 지역·보험자격·보험료 수준을 활용한 연도별 분석

만성질환의료이용지역 격차
HEALTH EXAM

건강검진·건강행태

비만·혈압·혈당·지질·간·신장 지표와 흡연·음주·신체활동을 이용한 연관성 분석

대사건강흡연·음주신체활동
LONGITUDINAL

종단·추이 분석

개인 단위 반복관찰을 활용해 연도 단위 장기 변화, 질환 첫 관찰과 의료이용 패턴을 분석

LongitudinalTrendRepeated measures
R&D FEASIBILITY

민간기업 R&D 사전검토

제약·바이오·디지털헬스 연구질문이 제공변수 범위에서 구현 가능한지 먼저 확인

제약·바이오디지털헬스의료AI
RECOMMENDED METHODS

저위험 표본데이터셋에 맞는 분석방법

연도별 추이기술통계 · 연령/성별 표준화 · Joinpoint/APC · segmented trend
반복 건강검진GEE · mixed-effects model을 이용한 개인 내 반복측정 분석
질환·의료이용Logistic · Poisson · Negative Binomial · GLM을 결과변수 특성에 맞게 적용
연도 단위 발생첫 관찰연도 기반 incidence 분석 · 정확한 일자 기반 생존분석은 별도 RWD 자료 검토
DATA FIT CHECK

연구질문에 따라 자료원을 구분합니다.

저위험 표본데이터셋에 적합
  • 만성질환·의료이용의 연도별 추이
  • 건강검진 지표와 질환의 연관성
  • 흡연·음주·신체활동 연구
  • 지역·보험료 수준별 건강 차이
맞춤형 RWD 자료 검토 필요
  • 세부 수술·행위·처방 코드가 핵심인 연구
  • 정확한 진료일·처방일·사건시점이 필요한 연구
  • 민감상병의 세부 진단코드가 필요한 연구
  • 정밀한 조작적 정의가 필요한 연구
ADVANTAGE

대규모 표본·장기 추적

100만 명을 10년간 개인 단위로 추적하며, 건강검진·문진을 함께 활용할 수 있습니다.

ADVANTAGE

연구 시작의 접근성

표본 기반 RWD 연구, 파일럿 분석, 연구 가능성 사전검토에 적합합니다.

LIMITATION

상병 세분화 제한

주상병은 중분류 중심이며 일부 민감상병은 대분류로 마스킹됩니다.

LIMITATION

정밀 사건정보 제한

세부 수술·행위·약제 또는 정확한 일자 단위 사건시점이 필요한 연구는 별도 맞춤형 RWD 자료 검토가 필요합니다.

PRIVATE-SECTOR R&D대학·병원 연구뿐 아니라 민간기업 R&D도 데이터 적합성부터 검토합니다.
연구질문→필요변수→데이터 적합성→분석설계
※ 제공범위와 변수 구조는 국민건강보험공단 「저위험 표본데이터셋 사용자 매뉴얼」 기준입니다. 실제 이용자격·신청·보안 조건은 적용 시점의 공단 기준을 확인해야 합니다.
RESEARCH FEASIBILITY CHECK

이 데이터셋으로 연구가 가능한지 먼저 검토합니다.

연구질문과 필요한 exposure/outcome을 알려주시면 저위험 표본데이터셋으로 구현 가능한지, 더 세부적인 RWD 자료가 필요한지 구분합니다.

연구 가능성 문의
Causal Inference

성향점수 · 교란 통제

관찰연구에서 목표 estimand(예: ATT/ATE)를 먼저 정하고, 관측된 교란요인을 균형화한 뒤 효과를 추정합니다.

Propensity Score

PSM

로지스틱 회귀 등으로 propensity score를 추정하고 nearest-neighbor matching, caliper와 common support를 적용합니다.

MatchingCaliperCommon support
Weighting

IPTW · Overlap

IPTW 또는 overlap weighting을 검토하고 stabilized weight, trimming과 positivity를 함께 점검합니다.

ATE / ATTStabilized weightPositivity
Balance Diagnostics

SMD · Love plot

매칭·가중 전후 SMD, 분산비와 분포를 확인해 공변량 균형을 평가하며 p-value만으로 balance를 판단하지 않습니다.

SMDVariance ratioLove plot
Outcome Model

Effect Estimation

자료구조와 estimand에 맞춰 matched/weighted outcome model과 적절한 표준오차를 사용해 효과크기와 95% CI를 제시합니다.

OR / RR / HR95% CIRobust SE
Robustness

Subgroup · Sensitivity

대상군, 기간, 정의, censoring과 분석방법을 달리한 민감도 분석으로 결론의 일관성을 점검합니다.

SubgroupAlternative definitionRestriction
Missingness

Missing Data

결측 규모와 발생기전을 확인하고 complete-case, multiple imputation 등 연구에 적합한 처리전략을 선택합니다.

Missing patternMISensitivity
Time-to-event

생존분석 · 경쟁위험 분석

정확한 사건시점과 censoring 구조를 반영하고, competing event가 존재할 때 연구질문에 맞는 위험함수를 구분해 분석합니다.

Kaplan–Meier생존/무사건 확률 추정 · KM curve
Log-rank test군 간 생존곡선 차이 비교
Cox PH model보정 HR 및 95% CI · 다변량 위험요인 분석
PH diagnosticsSchoenfeld residuals와 time interaction 등 비례위험 가정 점검
Cause-specific Cox경쟁사건이 있을 때 event-specific instantaneous hazard 분석
Fine–Gray경쟁위험을 반영한 subdistribution hazard와 CIF 관련 효과 추정
Cumulative Incidence경쟁위험 상황에서 사건별 누적발생확률 제시
RMST · LandmarkPH 위반 또는 landmark 설계가 필요한 연구에서 대안적 시간효과 평가
Advanced Statistics

기술통계부터 반복측정·비용·회귀모형까지

결과변수의 척도, 반복측정 구조, zero inflation/overdispersion과 연구목적을 확인한 뒤 분석모형을 선택합니다.

DESCRIPTIVE

기술통계 · 군간 비교

Mean±SD, median[IQR], n(%), t-test/Mann–Whitney, χ²/Fisher, ANOVA/Kruskal–Wallis

EPIDEMIOLOGY

발생률 · Person-time

Crude/standardized incidence, person-year 기반 발생률, 연령·성별 표준화

TREND

Joinpoint · APC

연도별 추이의 변곡점과 Annual Percent Change, segmented trend를 이용한 시간적 변화 분석

REGRESSION

Linear · Logistic · Poisson

연속형·이분형·발생률 결과에 맞는 회귀모형과 공변량 보정, 효과추정치와 95% CI 제시

REPEATED MEASURES

GEE · Mixed-effects

반복 건강검진이나 종단자료에서 개인 내 상관을 반영한 population-averaged 또는 subject-specific 분석

COUNT DATA

Poisson · Negative Binomial

의료이용 횟수·발생건수 등 count outcome에서 overdispersion과 exposure time을 고려한 분석

COST

Gamma GLM · Two-part

양의 우측 치우친 비용에는 Gamma GLM을, zero cost가 많은 경우 two-part model과 bootstrap CI를 검토

MISSING DATA

Multiple Imputation

결측패턴과 분석모형을 고려해 complete-case 또는 multiple imputation, 민감도 분석을 구성

ECONOMIC EVALUATION

ICER · Sensitivity

비용-효과성 비교와 discount rate, time horizon, cost component 변화에 따른 민감도 분석

REPORTING

Table · Figure

효과추정치, 95% CI, forest/KM/CIF/추이 그래프 및 논문용 표 작성

Clinical Prediction

임상 예측모형

위험요인 설명모형과 개인 예측모형의 목적을 구분하고, 과적합을 통제한 검증과 calibration을 함께 평가합니다.

Clinical prediction workflow

Outcome과 candidate predictors를 사전에 정의하고, 모델 개발·내부검증·성능평가를 하나의 파이프라인으로 진행합니다.

Outcome definition→Predictor preparation→Model development→Internal validation→Performance & utility
Discrimination · AUROC / C-indexCalibration · plot / slopeOverall performance · Brier scoreClinical utility · Decision Curve
※ 표본수와 사건수, 결측 구조에 따라 bootstrap 또는 cross-validation을 적용하며, 가능하면 외부검증을 별도로 수행합니다.
Machine Learning

의료 데이터 머신러닝

임상·RWD 자료의 비선형 관계와 상호작용을 탐색하되, data leakage와 과적합을 통제하면서 재현 가능한 예측 성능을 평가합니다.

Feature Engineering

임상변수·검진·약제·청구정보를 정리하고 결측, 범주화, 스케일링을 학습자료 내부에서 수행해 leakage를 방지합니다.

Model Development

Random Forest, Gradient Boosting, XGBoost 등 후보 알고리즘과 규제모형을 연구목적에 맞춰 비교합니다.

Validation

교차검증, nested cross-validation 또는 독립 test set을 이용해 모델 선택·튜닝과 성능평가를 분리합니다.

Performance

AUROC, AUPRC, sensitivity, specificity뿐 아니라 calibration과 Brier score를 함께 평가합니다.

Model Interpretation

Feature importance, SHAP 등을 사용하되 예측기여와 인과효과를 구분해 임상적으로 해석합니다.

Reporting

분석 파이프라인, 데이터 분할, 튜닝, 검증방법, 성능표·그래프와 논문 Methods/Results를 투명하게 정리합니다.

머신러닝은 알고리즘 자체보다 연구목적, 표본수·사건수, class imbalance, 결측 구조, data leakage와 검증전략을 먼저 고려해 적용합니다.
Publication Support

분석 이후 논문 단계까지

통계 결과가 원고의 Methods/Results와 정확히 연결되도록 지원합니다.

Baseline TableBaseline characteristics · SMD
Effect estimatesOR / HR / aHR · 95% CI
FiguresKM · CIF · Forest · Trend
Reviewer response추가분석 · sensitivity · 통계 질의 대응
DISCUSS YOUR STUDY

연구계획서나 아이디어가 있다면
분석전략부터 검토해보세요.

자료원, 연구질문, 예상 outcome과 필요한 산출물을 알려주시면 상담이 빨라집니다.