Research Question
PICO/PECO, primary/secondary outcome, target population과 estimand를 연구목적에 맞게 명확히 합니다.
업로드된 실제 임상 연구계획서에서 사용되는 분석 구조를 기준으로, RWD 연구에 필요한 기술통계부터 인과추론·생존분석·추이분석·비용분석·임상 예측모형·머신러닝까지 체계적으로 지원합니다.
분석 전에 임상 질문과 데이터 구조가 정확히 맞물리도록 연구의 시간축과 조작적 정의를 설계합니다.
PICO/PECO, primary/secondary outcome, target population과 estimand를 연구목적에 맞게 명확히 합니다.
Inclusion/exclusion, incident case, comparator, washout과 대상자 flow를 정의합니다.
Index date, baseline, landmark, exposure window, follow-up, event, censoring을 시간 순서에 맞게 설계합니다.
진단코드·행위수가·수술·약제·검진변수·CCI 등 임상 개념을 데이터 규칙으로 변환합니다.
Immortal-time, time-lag, selection bias 가능성을 점검하고 필요 시 landmark·time-dependent 전략을 검토합니다.
주분석, subgroup, sensitivity, missing data 처리와 보고지표를 분석 전 일관된 계획으로 정리합니다.
100만 명 표본 코호트를 활용해 의료이용·건강검진·건강행태 중심의 RWD 연구를 설계합니다.
주상병, 입원·외래 이용, 사망연도, 지역·보험자격·보험료 수준을 활용한 연도별 분석
비만·혈압·혈당·지질·간·신장 지표와 흡연·음주·신체활동을 이용한 연관성 분석
개인 단위 반복관찰을 활용해 연도 단위 장기 변화, 질환 첫 관찰과 의료이용 패턴을 분석
제약·바이오·디지털헬스 연구질문이 제공변수 범위에서 구현 가능한지 먼저 확인
100만 명을 10년간 개인 단위로 추적하며, 건강검진·문진을 함께 활용할 수 있습니다.
표본 기반 RWD 연구, 파일럿 분석, 연구 가능성 사전검토에 적합합니다.
주상병은 중분류 중심이며 일부 민감상병은 대분류로 마스킹됩니다.
세부 수술·행위·약제 또는 정확한 일자 단위 사건시점이 필요한 연구는 별도 맞춤형 RWD 자료 검토가 필요합니다.
연구질문과 필요한 exposure/outcome을 알려주시면 저위험 표본데이터셋으로 구현 가능한지, 더 세부적인 RWD 자료가 필요한지 구분합니다.
관찰연구에서 목표 estimand(예: ATT/ATE)를 먼저 정하고, 관측된 교란요인을 균형화한 뒤 효과를 추정합니다.
로지스틱 회귀 등으로 propensity score를 추정하고 nearest-neighbor matching, caliper와 common support를 적용합니다.
IPTW 또는 overlap weighting을 검토하고 stabilized weight, trimming과 positivity를 함께 점검합니다.
매칭·가중 전후 SMD, 분산비와 분포를 확인해 공변량 균형을 평가하며 p-value만으로 balance를 판단하지 않습니다.
자료구조와 estimand에 맞춰 matched/weighted outcome model과 적절한 표준오차를 사용해 효과크기와 95% CI를 제시합니다.
대상군, 기간, 정의, censoring과 분석방법을 달리한 민감도 분석으로 결론의 일관성을 점검합니다.
결측 규모와 발생기전을 확인하고 complete-case, multiple imputation 등 연구에 적합한 처리전략을 선택합니다.
정확한 사건시점과 censoring 구조를 반영하고, competing event가 존재할 때 연구질문에 맞는 위험함수를 구분해 분석합니다.
결과변수의 척도, 반복측정 구조, zero inflation/overdispersion과 연구목적을 확인한 뒤 분석모형을 선택합니다.
Mean±SD, median[IQR], n(%), t-test/Mann–Whitney, χ²/Fisher, ANOVA/Kruskal–Wallis
Crude/standardized incidence, person-year 기반 발생률, 연령·성별 표준화
연도별 추이의 변곡점과 Annual Percent Change, segmented trend를 이용한 시간적 변화 분석
연속형·이분형·발생률 결과에 맞는 회귀모형과 공변량 보정, 효과추정치와 95% CI 제시
반복 건강검진이나 종단자료에서 개인 내 상관을 반영한 population-averaged 또는 subject-specific 분석
의료이용 횟수·발생건수 등 count outcome에서 overdispersion과 exposure time을 고려한 분석
양의 우측 치우친 비용에는 Gamma GLM을, zero cost가 많은 경우 two-part model과 bootstrap CI를 검토
결측패턴과 분석모형을 고려해 complete-case 또는 multiple imputation, 민감도 분석을 구성
비용-효과성 비교와 discount rate, time horizon, cost component 변화에 따른 민감도 분석
효과추정치, 95% CI, forest/KM/CIF/추이 그래프 및 논문용 표 작성
위험요인 설명모형과 개인 예측모형의 목적을 구분하고, 과적합을 통제한 검증과 calibration을 함께 평가합니다.
Outcome과 candidate predictors를 사전에 정의하고, 모델 개발·내부검증·성능평가를 하나의 파이프라인으로 진행합니다.
임상·RWD 자료의 비선형 관계와 상호작용을 탐색하되, data leakage와 과적합을 통제하면서 재현 가능한 예측 성능을 평가합니다.
통계 결과가 원고의 Methods/Results와 정확히 연결되도록 지원합니다.
자료원, 연구질문, 예상 outcome과 필요한 산출물을 알려주시면 상담이 빨라집니다.