장수 연구의 여러 지표 중 하나만 좋아졌다면: 다중검정과 사전 계획 읽기

🌿 편하게 읽으세요

어떤 장수 연구에서 여러 혈액 지표와 기능 검사를 측정했는데 그중 한 항목이 좋아졌다는 보도를 보았다고 해 보겠습니다. 유용한 발견일 수 있지만 그 한 항목만으로 연구 전체의 성공을 판단하기는 어렵습니다. 무엇을 주된 결과로 정했는지, 몇 개의 가설을 검정했는지, 여러 분석에 따른 오류를 어떻게 관리했는지 확인해야 합니다.

확인할 기회가 늘면 우연히 기준을 넘는 결과도 생길 수 있다

FDA의 다중 평가변수 지침은 한 시험에서 여러 결과를 분석할 때 적절한 조정이 없으면 효과에 대한 잘못된 결론의 가능성이 커질 수 있다고 설명합니다. 많은 지표를 측정하는 것 자체가 문제라기보다, 그 결과로 어떤 주장을 할지와 오류 관리 계획이 맞아야 합니다. [S1]

장수 연구는 신체 기능, 생화학적 지표, 생활 평가 등 여러 측면을 다룰 수 있습니다. 기사에서 가장 눈에 띄는 숫자 하나만 가져오면 그 숫자가 원래 핵심 질문이었는지, 많은 후보 중 나중에 선택되었는지 알기 어렵습니다.

독립적인 20번의 검정을 가정해 계산하기

이해를 위해 모든 가설에서 실제 차이가 없고, 각 검정이 서로 독립이며, 각 검정의 잘못된 기각 확률이 5%라고 가정하겠습니다. 한 번에 잘못 기각하지 않을 확률은 0.95입니다. 20번 모두 잘못 기각하지 않을 확률은 0.95를 20번 곱한 값입니다.

따라서 적어도 한 번 잘못 기각할 확률은 1 − 0.95의 20제곱으로 약 64.2%가 됩니다. 5%를 20번 더해 100%라고 계산하지 않는 이유는 ‘적어도 한 번’의 확률을 구하기 때문입니다. 잘못된 기각이 여러 번 생기는 경우도 겹쳐 포함됩니다.

모두 차이가 없고 검정이 독립이라는 가상 조건
검정 횟수 적어도 한 번 오류가 날 확률 해석 범위
1번 5.0% 한 검정의 가정
5번 약 22.6% 1 − 0.95의 5제곱
20번 약 64.2% 1 − 0.95의 20제곱

이 계산은 특정 논문의 오류 확률을 추정한 것이 아닙니다. 실제 연구 지표는 서로 연관될 수 있고 분석 계획도 다릅니다. 또한 어떤 논문에서 유의한 결과를 보았을 때 ‘그 결과가 틀릴 확률이 64.2%’라는 뜻도 아닙니다. 가정한 반복 절차의 성질을 설명하는 예시입니다.

주된 지표와 탐색 지표의 역할

FDA는 주된 평가변수, 추가 효과를 설명하는 부차적 평가변수, 새로운 가설을 만드는 탐색적 평가변수를 구분합니다. 탐색 결과는 후속 연구를 준비하는 데 유용하지만 확인적 결론과 같은 확실성을 붙이면 안 됩니다. 결과가 나온 뒤 지표의 역할을 바꾸어 읽지 않는 것이 중요합니다. [S1]

장수 연구의 여러 지표 중 꼭 필요한 정보만 담은 정보 카드 디자인 이미지 - 본문 내용과 연관된 이미지

가상 연구가 처음에는 보행 기능을 핵심 결과로 정하고 혈액 지표를 탐색 목적으로 측정했다고 하겠습니다. 보행 결과에서 차이를 뒷받침하지 못했는데 탐색 지표 한 개가 기준을 넘었다면, 요약에는 두 사실이 함께 들어가야 합니다. ‘핵심 기능 개선은 확인하지 못했고 일부 탐색 지표에서 후속 확인이 필요한 신호가 있었다’는 식으로 구분할 수 있습니다.

여러 지표면 무조건 같은 보정을 할까

그렇지는 않습니다. FDA는 평가변수를 묶고 순서를 정하는 여러 전략을 다룹니다. 예를 들어 모든 공동 주평가변수가 성공해야만 전체 성공으로 보는 구조와, 여러 항목 중 하나만 성공하면 되는 구조는 오류의 문제가 다릅니다. 지표 수만 세어 공식을 기계적으로 적용하지 않습니다. [S1]

장수 연구의 여러 지표 중 심플하고 명확하게 정리한 스마트 정보 카드 - 본문 내용과 연관된 이미지

독자가 직접 원자료를 재분석할 필요는 없습니다. 논문 방법에서 사전에 정한 검정 순서나 다중성 조정이 무엇인지 확인하고, 결과가 그 계획을 따라 보고되었는지 살펴보면 됩니다. 방법을 이해하지 못했다면 단순히 ‘보정됨’이라는 단어만으로 모든 의문이 해결되었다고 하지는 않습니다.

측정 시점과 하위집단도 함께 보기

한 지표를 여러 시점에서 보거나 여러 집단으로 나누면 기사에서 선택할 수 있는 결과가 늘어납니다. 가상으로 기능 점수를 1·3·6개월에 각각 보고했다면, 3개월 수치만 강조한 이유와 원래 정한 평가 시점을 확인할 수 있습니다. 여러 시점을 하나의 모형으로 분석한 경우와 시점마다 별도 검정한 경우도 구분해야 합니다.

이때 중요한 질문은 ‘분석을 몇 번 했으니 틀렸다’가 아닙니다. 무엇을 확인하려 했고, 전체 분석 구조를 고려한 결론인지입니다. 결과를 많이 제시한 투명한 연구를 무조건 낮게 평가하기보다 계획과 해석의 일치 여부를 봅니다.

표에 없는 결과를 0으로 채우지 않기

계획서에는 지표가 열 개 있는데 기사에는 두 개만 나왔다면 나머지 여덟 개가 모두 변화 없었다고 추정하지 않습니다. 논문 본문과 보충 자료에 결과가 있는지 먼저 찾습니다. 찾지 못한 상태는 ‘결과 미확인’이며, 측정하지 않았다는 사실이나 효과가 없다는 결론과 다릅니다. 긍정적인 결과만 선택했는지 판단할 때도 원래 계획과 전체 보고 범위를 대조해야 합니다.

기사 한 문장을 더 정확하게 바꾸기

“여러 지표 중 하나가 유의해 항노화 효과 입증”이라는 문장이 있다면, 실제 논문의 주된 결과와 분석 계획을 찾은 뒤 표현을 구체화합니다. 확인되지 않은 부분은 ‘주평가변수 여부 미확인’, ‘다중성 조정 여부 미확인’으로 남기면 됩니다.

장수 연구를 읽는 메모에는 주된 질문, 사전에 정한 시점, 지표의 역할, 다중검정 처리, 효과의 크기를 적어 보세요. 유의한 숫자 하나를 발견하는 것보다 그 숫자가 연구 전체에서 어떤 자리를 차지하는지 아는 것이 더 풍부한 해석으로 이어집니다.

The Color of Your Tongue That Reveals Your Biological Age After 50 | Feynman’s Chilling Explanation

확인한 공식 자료

🔗
공식 자료 [S1] 미국 FDA — Multiple Endpoints in Clinical Trials: Guidance for Industry (2026년 9월 14일 확인)