
통계적 유의성: 표본 크기 및 통계적 검정력
Quoc Minh Lai
업데이트됨

통계적 유의성: 표본 크기 및 통계적 검정력
Quoc Minh Lai
업데이트됨

통계적 유의성: 표본 크기 및 통계적 검정력
Quoc Minh Lai
업데이트됨
통계적 유의성: 표본 크기 및 통계적 검정력 - 우리 주변의 세상을 이해하기 위해, 연구자들은 추정된 진실과 거짓을 구분하기 위한 방법으로 공식적으로 과학적 방법론을 사용합니다. 인지 신경과학은 유전적, 신경학적, 그리고 행동적 시스템이 유기체가 주변 세상을 감지하고, 상호작용하고, 탐색하고, 이에 대해 생각하는 능력을 어떻게 지원하는지 이해하는 것을 목표로 합니다.
이는 인지 신경과학이 모든 분석 수준에서 실험을 설계하고 데이터를 수집한다는 것을 의미합니다. 자연계에 대한 우리의 이해를 넓히고자 하는 전 세계의 연구 프로그램들은 잘 계획된 일련의 소규모 실험을 통해 가정이나 가설을 정기적으로 테스트하고 있습니다. 이러한 실험들은 환경, 성적 지향, 인종 또는 사회경제적 지위와 같은 외부 요인의 영향을 최소화하면서 결과에 영향을 미칠 수 있거나 미치지 않을 수 있는 특정 요인들을 조사하는 경향이 있습니다.
시나리오 1: 도파민 분비 연구
인지 신경과학에서 도파민은 일반적으로 "기분 좋은" 화합물로 여겨집니다. 측좌핵(NuAc)에서의 도파민 분비는 우리가 행동하도록 동기를 부여하는 행동이나 자극에 의해 촉발됩니다. 여기에는 다음과 같은 것들이 포함될 수 있습니다.
맛있는 식사하기
사랑하는 사람들과의 시간
성관계
설탕
측좌핵(NuAc)에서 도파민 수치의 정점이 원하는 또는 친숙한 시각적 자극에 노출되기 전, 도중, 또는 후에 발생하는지 알아보고 싶다고 가정해 봅시다. 우리는 Amatya Johanna Mackintosh의 연구에서 채택한 EEG 실험 설계를 사용할 수 있습니다. 우리는 도파민 분비가 친숙하거나 원하는 시각적 자극에 노출되는 동안 발생하며, 노출된 직후에 정점에 도달한다는 가설을 세울 수 있습니다.
이제 가장 중요한 질문은, 테스트 대상자를 어디서 구해야 할까요?
실험 상황에서 "모집단(population)"이란 연구 대상이 되는 더 크고 전체적인 집단을 뜻합니다. 수십만 또는 수백만 명의 사람들을 모집하고 이들의 도파민 분비 데이터를 수집하는 기술을 연구실에서 고안해 내는 것은 비현실적이며 불가능에 가깝습니다.
따라서 우리는 모집단을 이해하기 위해 더 작고 대표성이 있는 그룹, 즉 표본(sample)으로부터 데이터를 수집하려고 시도할 것입니다. 이를 위해 두 가지 주요 질문에 답해야 합니다.
표본에 몇 명의 개인이 포함되어야 할까요?
이것은 실질적 유의성 및 통계적 검정력과 어떤 관련이 있을까요?
아래에서 자세히 살펴보겠습니다.
통계적 검정력과 실제 효과
통계적 검정력(Statistical power)은 통계적으로 유의미한 차이가 실제로 존재할 때, 테스트가 이를 감지해 낼 확률로 정의됩니다. 이를 실제 효과(true effect)라고도 합니다.
실제 효과는 실험 설계의 초석입니다. 과학적 방법론에 크게 기여한 Cohen의 1988년 보고서는 연구가 실제 효과를 감지할 확률을 80%로 가지도록 설계되어야 한다고 판단했습니다. 이 80%는 높은 검정력(HP)의 테스트 설계를 나타내며, 20%에 가까운 값은 낮은 검정력(LP)의 테스트 설계입니다.
Cohen은 연구가 위음성(false negative)으로 알려진 제2종 오류를 범할 확률이 항상 20% 미만이어야 한다고 제안했습니다. 또한 그는 연구자가 실제로 차이가 존재함에도 불구하고 유의미한 효과가 없다고 잘못 보고하는 오류인 누락된 발견(missed discoveries)에 대해서도 동일한 가이드라인 범위를 사용합니다.
통계적 검정력이 왜 중요할까요?
이러한 시나리오를 생각해 보십시오. 80%의 검정력을 가진 100개의 서로 다른 연구에 실제 효과가 존재한다면, 통계 테스트는 100개 중 80개에서 실제 효과를 감지할 것입니다. 그러나 연구 검정력이 20%인 경우, 결과에 100개의 진짜 비영(non-null) 효과가 있더라도 이 연구들은 그중 20개만 발견할 것으로 예상됩니다.
신경과학 연구에서 통계적 검정력의 한계
많은 자원이 필요한 신경과학 연구의 특성상, 이 분야의 통계적 검정력 중간값은 약 21%이며, 평균적으로 8%~31%의 넓은 범위에 걸쳐 있습니다. 신경과학 연구에서 통계적 검정력이 낮으면 다음과 같은 문제가 발생합니다.
연구 결과의 재현성에 의문을 제기합니다.
과장된 효과 크기를 초래합니다.
실제 효과를 정확하게 나타내는 통계적으로 유의미한 결과가 도출될 가능성을 낮춥니다.
이처럼 현재의 신경과학 연구 상태는 통계적 검정력 문제에 갇혀 있는데, 이러한 값들이 Cohen의 이론적 임계치에 훨씬 못 미치기 때문입니다.
대표 표본 집단 구성하기
시나리오 1의 목표: 포괄적이고 큰 표본 추출을 통해 테스트에서 표본 추출 오류와 제1종 및 제2종 오류를 방지합니다.
실험이 실질적으로 유의미해지기를 원한다면 표본 세트에 얼마나 많은 인간 뇌 스캔이 포함되어야 할까요? 실질적 유의성(Practical significance)은 실험 결과가 실제 세상에 적용될 수 있는지 여부를 의미합니다.
신경과학자 실험의 효과 판별 능력(통계적 검정력)은 표본 크기와 밀접한 관련이 있습니다. 시나리오 1의 매개변수를 계속 적용하면, 목표는 감정을 자극하는 시각적 자극을 보여준 후 도파민이 분비되는 타이밍에 실제 효과가 있는지 통계적으로 평가할 수 있을 만큼 충분한 데이터를 수집하는 것입니다. 또한 표본 추출 오류의 가능성을 최소화하는 표본 포함 기준을 수립해야 합니다.
표본 추출 오류를 방지하는 방법
더 진행하기 전에 두 가지 개념을 이해하는 것이 중요합니다.
표본 추출 오류(Sampling error): 표본을 추출할 때, 선택된 개인들로부터 수집한 데이터가 모집단을 대표하지 못할 가능성은 항상 존재합니다.
통계적 유의성(Statistical Significance): 통계적 유의성은 우리의 데이터와 관찰된 효과가 실제 효과일 가능성이 높음을 의미합니다. 대부분의 생물의학 분야에서 통계적 유의성은 .05의 유의 수준 또는 p-값으로 설정됩니다. 본질적으로 이는 과학자들이 자신들의 실험에서 관찰된 효과에 대해 95% 확신한다는 것을 의미합니다.
데이터가 어떤 관계(예: 도파민 분비)를 보여주는 상황을 가정해 보겠습니다. 그 효과가 우연에 의한 것이고 변수(시각적 자극)와는 무관할 가능성이 5% 존재합니다. 이것이 제1종 오류가 됩니다. 반대로, 실제 효과가 있음에도 불구하고 수집된 데이터가 도파민 분비와 시각적 자극 사이에 아무런 관계가 없음을 보여줄 확률이 5% 존재합니다. 이는 위음성, 즉 제2종 오류입니다.
특정 표본 크기를 넘어설 경우 수확 체감의 법칙이 적용되기 때문에, 포함 기준을 신중하게 설정하는 것이 훨씬 더 큰 영향을 미칩니다.
우리는 모든 인류를 대표하는 데이터를 수집하고자 하며, 우리의 결론이 실질적으로나 통계적으로 모두 유의미하기를 바랍니다. 표본 세트를 성공적으로 설계하려면 표본 추출 오류, 제1종 오류(위양성), 또는 제2종 오류(위음성)를 고려하고 방지해야 합니다.
우리의 실험은 다음과 같은 가설을 테스트하고 있습니다.
귀무가설(Null hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 아무런 관계나 효과가 없다.
대립가설(Hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재하며, 도파민 분비의 정점은 시각적 자극을 본 후에 발생한다.
측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재합니다. 데이터가 통계적으로 유의미하지 않은 경우:
우리의 가설은 기각됩니다.
실제 효과나 차이가 발견되지 않습니다.
우리가 관찰한 효과는 단지 우연에 의해 발생했을 확률이 높습니다.
모집단 이해하기?
실험 설계의 실질적 한계.
신경과학 연구에서 공식적인 표본 포함 기준은 일반적으로 표본 추출 오류를 방지하기 위해 모집단 전체에서 표본으로 포함될 확률을 무작위화하거나 균등하게 만드려고 시도합니다. 단지 수집하기 가장 가깝거나 접근하기 쉽다는 이유로 개인을 선택하는 것은 피해야 합니다. 이는 표본 추출 오류를 자초하는 지름길이기 때문입니다.
표본 세트를 구성하는 가장 좋은 방법은 전체 모집단에서 선택될 확률을 무작위로 균등하게 만드는 포함 기준을 사용하는 것입니다. 예를 들어, 인구 조사 데이터를 사용하여 오하이오주의 각 카운티에서 무작위로 선택된 50명의 연락처 정보를 얻을 수 있습니다. 이렇게 하면 모든 지리적 영역에서 무작위로 고르게 이름을 선택하므로 선택 편향이 최소화될 것입니다.
실험 설계를 수립하고, 표본 크기를 늘리며, 편향되지 않고 무작위화된 동시에 균등하게 적용되는 포함 기준을 완전히 실현하는 것은 실질적인 한계에 빠르게 부딪힐 수 있습니다. 이는 학술적 과제부터 본격적인 연구 대학에 이르기까지 모든 수준의 과학 연구에서 겪는 문제입니다. 대개 예산과 일정의 한계로 인해 가장 먼저 타협을 하게 됩니다. 통계적 유의성을 둘러싼 이러한 문제들은 현재 활발히 연구되고 있는 분야입니다.
진짜 실제 효과 크기는 얼마인가?
신경과학 연구의 낮은 통계적 검정력 때문에, 우리는 실제 효과 크기를 과대평가하는 경향이 있으며 이는 많은 연구의 낮은 재현성으로 이어집니다. 나아가 신경과학 연구 본연의 복잡성 때문에 통계적 검정력은 매우 중요합니다.
이 분야에서 채택할 수 있는 한 가지 방법은 표본 크기를 늘려 연구의 검정력을 높이는 것입니다. 이는 실제 효과를 감지할 확률을 높여줍니다. 적절한 표본 크기를 선택하는 것은 다음과 같은 연구를 설계하는 데 필수적입니다.
실질적인 발견을 해냅니다.
뇌의 수많은 과정에 대한 우리의 이해를 발전시킵니다.
효과적인 치료법을 개발합니다.
현대 신경과학 연구의 장벽 극복하기: EmotivLAB 플랫폼
신경과학 연구의 실험 설계는 신뢰할 수 있는 통계적 유의성을 달성하기 위해 더 큰 표본 집단 크기와 더 나은 포함 기준을 설정하도록 밀어붙여야 합니다. 크라우드 소싱 기반 플랫폼인 EmotivLAB을 활용하면, 연구자들은 잠재적으로 훨씬 더 다양하고 더 대표성 있는 대상 개인들에게 접근할 수 있습니다. 이를 통해 연구 그룹의 추가적인 물류적 노력을 최소화하면서 표본 크기를 개선하고 모든 인구 통계학적 특성의 포용성을 높일 수 있습니다.
현대 신경과학 연구는 실험 표본 세트를 위한 다양한 그룹을 모집하는 데 사용할 수 있는 자원이 제한되어 있어 표본 추출 오류에 취약해질 수 있습니다. "WEIRD 그룹" 개념이 이 문제를 잘 보여줍니다. 대부분의 대학 연구는 일반적으로 서구의(Western), 교육 수준이 높고(Educated), 산업화되고(Industrialized), 부유하며(Rich), 민주적인(Democratic) 국가 출신의 실험 대상자들을 대상으로 아주 적은 예산으로 진행됩니다. 그러나 EmotivLAB의 EEG 플랫폼과 같은 원격 데이터 수집 장비를 사용하면 연구자들이 대학 캠퍼스를 넘어 모집단을 더 잘 반영하는 표본 그룹을 모집할 수 있습니다.

EmotivLAB의 플랫폼과 원격 EEG 장비는 연구자들이 실험 표본 그룹에 포함되는 개인의 다양성을 확장하는 데 도움을 줄 뿐만 아니라, 목표 모집단에 대한 전반적인 표본 크기 및 지리적 도달 범위와 관련된 문제도 중재합니다.
EmotivLAB 플랫폼은 연구자들을 현재의 제약에서 벗어나게 하여 실험을 설계하고 결과를 분석하는 데 에너지를 집중할 수 있도록 돕습니다. 당사의 플랫폼은 실험을 피험자 풀에서 가장 적합한 개인들과 매칭해 줍니다. 참가자를 모집하고, 일정을 조율하며, 실험실 내에서 데이터를 수집하는 데 시간을 허비할 필요가 없습니다. 온라인 플랫폼에 원하는 인구 통계학적 특성만 지정하면, EmotivLAB이 원하는 매개변수와 가장 잘 부합하는 기여자들에게 실험을 제공할 것입니다. 참가자들은 본인의 장비를 사용하여 집에서 편안하게 실험에 임할 수 있습니다. 헤드셋 사용법에 이미 익숙하기 때문에 연구자가 사용법을 설명할 필요도 없습니다.
그뿐만 아니라, EmotivLAB 플랫폼은 자동화된 EEG 기록 데이터 품질 관리 및 평가 기능을 제공합니다. 대량의 저품질 데이터는 실험 설계에서 표본 추출 오류나 통계적 오류를 극복하는 데 도움이 되지 않습니다. 하지만 더 많은 고품질 데이터에 접근할 수 있다면 다음과 같은 영역에서 오류를 방지하는 대안이 될 것입니다.
표본 추출
모집단
통계적 유의성
EmotivLAB 플랫폼이 귀하의 연구를 위해 무엇을 할 수 있는지 더 자세히 알아보고 싶으신가요?
EmotivLAB을 사용하면 하나의 플랫폼에서 실험을 구성하고, 안전하고 확실하게 실험을 배치하며, 검증된 참가자로 구성된 글로벌 패널로부터 모집하고, 고품질 EEG 데이터를 수집할 수 있습니다. 더 자세히 알아보거나 데모를 요청하려면 여기를 클릭하세요.
통계적 유의성: 표본 크기 및 통계적 검정력 - 우리 주변의 세상을 이해하기 위해, 연구자들은 추정된 진실과 거짓을 구분하기 위한 방법으로 공식적으로 과학적 방법론을 사용합니다. 인지 신경과학은 유전적, 신경학적, 그리고 행동적 시스템이 유기체가 주변 세상을 감지하고, 상호작용하고, 탐색하고, 이에 대해 생각하는 능력을 어떻게 지원하는지 이해하는 것을 목표로 합니다.
이는 인지 신경과학이 모든 분석 수준에서 실험을 설계하고 데이터를 수집한다는 것을 의미합니다. 자연계에 대한 우리의 이해를 넓히고자 하는 전 세계의 연구 프로그램들은 잘 계획된 일련의 소규모 실험을 통해 가정이나 가설을 정기적으로 테스트하고 있습니다. 이러한 실험들은 환경, 성적 지향, 인종 또는 사회경제적 지위와 같은 외부 요인의 영향을 최소화하면서 결과에 영향을 미칠 수 있거나 미치지 않을 수 있는 특정 요인들을 조사하는 경향이 있습니다.
시나리오 1: 도파민 분비 연구
인지 신경과학에서 도파민은 일반적으로 "기분 좋은" 화합물로 여겨집니다. 측좌핵(NuAc)에서의 도파민 분비는 우리가 행동하도록 동기를 부여하는 행동이나 자극에 의해 촉발됩니다. 여기에는 다음과 같은 것들이 포함될 수 있습니다.
맛있는 식사하기
사랑하는 사람들과의 시간
성관계
설탕
측좌핵(NuAc)에서 도파민 수치의 정점이 원하는 또는 친숙한 시각적 자극에 노출되기 전, 도중, 또는 후에 발생하는지 알아보고 싶다고 가정해 봅시다. 우리는 Amatya Johanna Mackintosh의 연구에서 채택한 EEG 실험 설계를 사용할 수 있습니다. 우리는 도파민 분비가 친숙하거나 원하는 시각적 자극에 노출되는 동안 발생하며, 노출된 직후에 정점에 도달한다는 가설을 세울 수 있습니다.
이제 가장 중요한 질문은, 테스트 대상자를 어디서 구해야 할까요?
실험 상황에서 "모집단(population)"이란 연구 대상이 되는 더 크고 전체적인 집단을 뜻합니다. 수십만 또는 수백만 명의 사람들을 모집하고 이들의 도파민 분비 데이터를 수집하는 기술을 연구실에서 고안해 내는 것은 비현실적이며 불가능에 가깝습니다.
따라서 우리는 모집단을 이해하기 위해 더 작고 대표성이 있는 그룹, 즉 표본(sample)으로부터 데이터를 수집하려고 시도할 것입니다. 이를 위해 두 가지 주요 질문에 답해야 합니다.
표본에 몇 명의 개인이 포함되어야 할까요?
이것은 실질적 유의성 및 통계적 검정력과 어떤 관련이 있을까요?
아래에서 자세히 살펴보겠습니다.
통계적 검정력과 실제 효과
통계적 검정력(Statistical power)은 통계적으로 유의미한 차이가 실제로 존재할 때, 테스트가 이를 감지해 낼 확률로 정의됩니다. 이를 실제 효과(true effect)라고도 합니다.
실제 효과는 실험 설계의 초석입니다. 과학적 방법론에 크게 기여한 Cohen의 1988년 보고서는 연구가 실제 효과를 감지할 확률을 80%로 가지도록 설계되어야 한다고 판단했습니다. 이 80%는 높은 검정력(HP)의 테스트 설계를 나타내며, 20%에 가까운 값은 낮은 검정력(LP)의 테스트 설계입니다.
Cohen은 연구가 위음성(false negative)으로 알려진 제2종 오류를 범할 확률이 항상 20% 미만이어야 한다고 제안했습니다. 또한 그는 연구자가 실제로 차이가 존재함에도 불구하고 유의미한 효과가 없다고 잘못 보고하는 오류인 누락된 발견(missed discoveries)에 대해서도 동일한 가이드라인 범위를 사용합니다.
통계적 검정력이 왜 중요할까요?
이러한 시나리오를 생각해 보십시오. 80%의 검정력을 가진 100개의 서로 다른 연구에 실제 효과가 존재한다면, 통계 테스트는 100개 중 80개에서 실제 효과를 감지할 것입니다. 그러나 연구 검정력이 20%인 경우, 결과에 100개의 진짜 비영(non-null) 효과가 있더라도 이 연구들은 그중 20개만 발견할 것으로 예상됩니다.
신경과학 연구에서 통계적 검정력의 한계
많은 자원이 필요한 신경과학 연구의 특성상, 이 분야의 통계적 검정력 중간값은 약 21%이며, 평균적으로 8%~31%의 넓은 범위에 걸쳐 있습니다. 신경과학 연구에서 통계적 검정력이 낮으면 다음과 같은 문제가 발생합니다.
연구 결과의 재현성에 의문을 제기합니다.
과장된 효과 크기를 초래합니다.
실제 효과를 정확하게 나타내는 통계적으로 유의미한 결과가 도출될 가능성을 낮춥니다.
이처럼 현재의 신경과학 연구 상태는 통계적 검정력 문제에 갇혀 있는데, 이러한 값들이 Cohen의 이론적 임계치에 훨씬 못 미치기 때문입니다.
대표 표본 집단 구성하기
시나리오 1의 목표: 포괄적이고 큰 표본 추출을 통해 테스트에서 표본 추출 오류와 제1종 및 제2종 오류를 방지합니다.
실험이 실질적으로 유의미해지기를 원한다면 표본 세트에 얼마나 많은 인간 뇌 스캔이 포함되어야 할까요? 실질적 유의성(Practical significance)은 실험 결과가 실제 세상에 적용될 수 있는지 여부를 의미합니다.
신경과학자 실험의 효과 판별 능력(통계적 검정력)은 표본 크기와 밀접한 관련이 있습니다. 시나리오 1의 매개변수를 계속 적용하면, 목표는 감정을 자극하는 시각적 자극을 보여준 후 도파민이 분비되는 타이밍에 실제 효과가 있는지 통계적으로 평가할 수 있을 만큼 충분한 데이터를 수집하는 것입니다. 또한 표본 추출 오류의 가능성을 최소화하는 표본 포함 기준을 수립해야 합니다.
표본 추출 오류를 방지하는 방법
더 진행하기 전에 두 가지 개념을 이해하는 것이 중요합니다.
표본 추출 오류(Sampling error): 표본을 추출할 때, 선택된 개인들로부터 수집한 데이터가 모집단을 대표하지 못할 가능성은 항상 존재합니다.
통계적 유의성(Statistical Significance): 통계적 유의성은 우리의 데이터와 관찰된 효과가 실제 효과일 가능성이 높음을 의미합니다. 대부분의 생물의학 분야에서 통계적 유의성은 .05의 유의 수준 또는 p-값으로 설정됩니다. 본질적으로 이는 과학자들이 자신들의 실험에서 관찰된 효과에 대해 95% 확신한다는 것을 의미합니다.
데이터가 어떤 관계(예: 도파민 분비)를 보여주는 상황을 가정해 보겠습니다. 그 효과가 우연에 의한 것이고 변수(시각적 자극)와는 무관할 가능성이 5% 존재합니다. 이것이 제1종 오류가 됩니다. 반대로, 실제 효과가 있음에도 불구하고 수집된 데이터가 도파민 분비와 시각적 자극 사이에 아무런 관계가 없음을 보여줄 확률이 5% 존재합니다. 이는 위음성, 즉 제2종 오류입니다.
특정 표본 크기를 넘어설 경우 수확 체감의 법칙이 적용되기 때문에, 포함 기준을 신중하게 설정하는 것이 훨씬 더 큰 영향을 미칩니다.
우리는 모든 인류를 대표하는 데이터를 수집하고자 하며, 우리의 결론이 실질적으로나 통계적으로 모두 유의미하기를 바랍니다. 표본 세트를 성공적으로 설계하려면 표본 추출 오류, 제1종 오류(위양성), 또는 제2종 오류(위음성)를 고려하고 방지해야 합니다.
우리의 실험은 다음과 같은 가설을 테스트하고 있습니다.
귀무가설(Null hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 아무런 관계나 효과가 없다.
대립가설(Hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재하며, 도파민 분비의 정점은 시각적 자극을 본 후에 발생한다.
측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재합니다. 데이터가 통계적으로 유의미하지 않은 경우:
우리의 가설은 기각됩니다.
실제 효과나 차이가 발견되지 않습니다.
우리가 관찰한 효과는 단지 우연에 의해 발생했을 확률이 높습니다.
모집단 이해하기?
실험 설계의 실질적 한계.
신경과학 연구에서 공식적인 표본 포함 기준은 일반적으로 표본 추출 오류를 방지하기 위해 모집단 전체에서 표본으로 포함될 확률을 무작위화하거나 균등하게 만드려고 시도합니다. 단지 수집하기 가장 가깝거나 접근하기 쉽다는 이유로 개인을 선택하는 것은 피해야 합니다. 이는 표본 추출 오류를 자초하는 지름길이기 때문입니다.
표본 세트를 구성하는 가장 좋은 방법은 전체 모집단에서 선택될 확률을 무작위로 균등하게 만드는 포함 기준을 사용하는 것입니다. 예를 들어, 인구 조사 데이터를 사용하여 오하이오주의 각 카운티에서 무작위로 선택된 50명의 연락처 정보를 얻을 수 있습니다. 이렇게 하면 모든 지리적 영역에서 무작위로 고르게 이름을 선택하므로 선택 편향이 최소화될 것입니다.
실험 설계를 수립하고, 표본 크기를 늘리며, 편향되지 않고 무작위화된 동시에 균등하게 적용되는 포함 기준을 완전히 실현하는 것은 실질적인 한계에 빠르게 부딪힐 수 있습니다. 이는 학술적 과제부터 본격적인 연구 대학에 이르기까지 모든 수준의 과학 연구에서 겪는 문제입니다. 대개 예산과 일정의 한계로 인해 가장 먼저 타협을 하게 됩니다. 통계적 유의성을 둘러싼 이러한 문제들은 현재 활발히 연구되고 있는 분야입니다.
진짜 실제 효과 크기는 얼마인가?
신경과학 연구의 낮은 통계적 검정력 때문에, 우리는 실제 효과 크기를 과대평가하는 경향이 있으며 이는 많은 연구의 낮은 재현성으로 이어집니다. 나아가 신경과학 연구 본연의 복잡성 때문에 통계적 검정력은 매우 중요합니다.
이 분야에서 채택할 수 있는 한 가지 방법은 표본 크기를 늘려 연구의 검정력을 높이는 것입니다. 이는 실제 효과를 감지할 확률을 높여줍니다. 적절한 표본 크기를 선택하는 것은 다음과 같은 연구를 설계하는 데 필수적입니다.
실질적인 발견을 해냅니다.
뇌의 수많은 과정에 대한 우리의 이해를 발전시킵니다.
효과적인 치료법을 개발합니다.
현대 신경과학 연구의 장벽 극복하기: EmotivLAB 플랫폼
신경과학 연구의 실험 설계는 신뢰할 수 있는 통계적 유의성을 달성하기 위해 더 큰 표본 집단 크기와 더 나은 포함 기준을 설정하도록 밀어붙여야 합니다. 크라우드 소싱 기반 플랫폼인 EmotivLAB을 활용하면, 연구자들은 잠재적으로 훨씬 더 다양하고 더 대표성 있는 대상 개인들에게 접근할 수 있습니다. 이를 통해 연구 그룹의 추가적인 물류적 노력을 최소화하면서 표본 크기를 개선하고 모든 인구 통계학적 특성의 포용성을 높일 수 있습니다.
현대 신경과학 연구는 실험 표본 세트를 위한 다양한 그룹을 모집하는 데 사용할 수 있는 자원이 제한되어 있어 표본 추출 오류에 취약해질 수 있습니다. "WEIRD 그룹" 개념이 이 문제를 잘 보여줍니다. 대부분의 대학 연구는 일반적으로 서구의(Western), 교육 수준이 높고(Educated), 산업화되고(Industrialized), 부유하며(Rich), 민주적인(Democratic) 국가 출신의 실험 대상자들을 대상으로 아주 적은 예산으로 진행됩니다. 그러나 EmotivLAB의 EEG 플랫폼과 같은 원격 데이터 수집 장비를 사용하면 연구자들이 대학 캠퍼스를 넘어 모집단을 더 잘 반영하는 표본 그룹을 모집할 수 있습니다.

EmotivLAB의 플랫폼과 원격 EEG 장비는 연구자들이 실험 표본 그룹에 포함되는 개인의 다양성을 확장하는 데 도움을 줄 뿐만 아니라, 목표 모집단에 대한 전반적인 표본 크기 및 지리적 도달 범위와 관련된 문제도 중재합니다.
EmotivLAB 플랫폼은 연구자들을 현재의 제약에서 벗어나게 하여 실험을 설계하고 결과를 분석하는 데 에너지를 집중할 수 있도록 돕습니다. 당사의 플랫폼은 실험을 피험자 풀에서 가장 적합한 개인들과 매칭해 줍니다. 참가자를 모집하고, 일정을 조율하며, 실험실 내에서 데이터를 수집하는 데 시간을 허비할 필요가 없습니다. 온라인 플랫폼에 원하는 인구 통계학적 특성만 지정하면, EmotivLAB이 원하는 매개변수와 가장 잘 부합하는 기여자들에게 실험을 제공할 것입니다. 참가자들은 본인의 장비를 사용하여 집에서 편안하게 실험에 임할 수 있습니다. 헤드셋 사용법에 이미 익숙하기 때문에 연구자가 사용법을 설명할 필요도 없습니다.
그뿐만 아니라, EmotivLAB 플랫폼은 자동화된 EEG 기록 데이터 품질 관리 및 평가 기능을 제공합니다. 대량의 저품질 데이터는 실험 설계에서 표본 추출 오류나 통계적 오류를 극복하는 데 도움이 되지 않습니다. 하지만 더 많은 고품질 데이터에 접근할 수 있다면 다음과 같은 영역에서 오류를 방지하는 대안이 될 것입니다.
표본 추출
모집단
통계적 유의성
EmotivLAB 플랫폼이 귀하의 연구를 위해 무엇을 할 수 있는지 더 자세히 알아보고 싶으신가요?
EmotivLAB을 사용하면 하나의 플랫폼에서 실험을 구성하고, 안전하고 확실하게 실험을 배치하며, 검증된 참가자로 구성된 글로벌 패널로부터 모집하고, 고품질 EEG 데이터를 수집할 수 있습니다. 더 자세히 알아보거나 데모를 요청하려면 여기를 클릭하세요.
통계적 유의성: 표본 크기 및 통계적 검정력 - 우리 주변의 세상을 이해하기 위해, 연구자들은 추정된 진실과 거짓을 구분하기 위한 방법으로 공식적으로 과학적 방법론을 사용합니다. 인지 신경과학은 유전적, 신경학적, 그리고 행동적 시스템이 유기체가 주변 세상을 감지하고, 상호작용하고, 탐색하고, 이에 대해 생각하는 능력을 어떻게 지원하는지 이해하는 것을 목표로 합니다.
이는 인지 신경과학이 모든 분석 수준에서 실험을 설계하고 데이터를 수집한다는 것을 의미합니다. 자연계에 대한 우리의 이해를 넓히고자 하는 전 세계의 연구 프로그램들은 잘 계획된 일련의 소규모 실험을 통해 가정이나 가설을 정기적으로 테스트하고 있습니다. 이러한 실험들은 환경, 성적 지향, 인종 또는 사회경제적 지위와 같은 외부 요인의 영향을 최소화하면서 결과에 영향을 미칠 수 있거나 미치지 않을 수 있는 특정 요인들을 조사하는 경향이 있습니다.
시나리오 1: 도파민 분비 연구
인지 신경과학에서 도파민은 일반적으로 "기분 좋은" 화합물로 여겨집니다. 측좌핵(NuAc)에서의 도파민 분비는 우리가 행동하도록 동기를 부여하는 행동이나 자극에 의해 촉발됩니다. 여기에는 다음과 같은 것들이 포함될 수 있습니다.
맛있는 식사하기
사랑하는 사람들과의 시간
성관계
설탕
측좌핵(NuAc)에서 도파민 수치의 정점이 원하는 또는 친숙한 시각적 자극에 노출되기 전, 도중, 또는 후에 발생하는지 알아보고 싶다고 가정해 봅시다. 우리는 Amatya Johanna Mackintosh의 연구에서 채택한 EEG 실험 설계를 사용할 수 있습니다. 우리는 도파민 분비가 친숙하거나 원하는 시각적 자극에 노출되는 동안 발생하며, 노출된 직후에 정점에 도달한다는 가설을 세울 수 있습니다.
이제 가장 중요한 질문은, 테스트 대상자를 어디서 구해야 할까요?
실험 상황에서 "모집단(population)"이란 연구 대상이 되는 더 크고 전체적인 집단을 뜻합니다. 수십만 또는 수백만 명의 사람들을 모집하고 이들의 도파민 분비 데이터를 수집하는 기술을 연구실에서 고안해 내는 것은 비현실적이며 불가능에 가깝습니다.
따라서 우리는 모집단을 이해하기 위해 더 작고 대표성이 있는 그룹, 즉 표본(sample)으로부터 데이터를 수집하려고 시도할 것입니다. 이를 위해 두 가지 주요 질문에 답해야 합니다.
표본에 몇 명의 개인이 포함되어야 할까요?
이것은 실질적 유의성 및 통계적 검정력과 어떤 관련이 있을까요?
아래에서 자세히 살펴보겠습니다.
통계적 검정력과 실제 효과
통계적 검정력(Statistical power)은 통계적으로 유의미한 차이가 실제로 존재할 때, 테스트가 이를 감지해 낼 확률로 정의됩니다. 이를 실제 효과(true effect)라고도 합니다.
실제 효과는 실험 설계의 초석입니다. 과학적 방법론에 크게 기여한 Cohen의 1988년 보고서는 연구가 실제 효과를 감지할 확률을 80%로 가지도록 설계되어야 한다고 판단했습니다. 이 80%는 높은 검정력(HP)의 테스트 설계를 나타내며, 20%에 가까운 값은 낮은 검정력(LP)의 테스트 설계입니다.
Cohen은 연구가 위음성(false negative)으로 알려진 제2종 오류를 범할 확률이 항상 20% 미만이어야 한다고 제안했습니다. 또한 그는 연구자가 실제로 차이가 존재함에도 불구하고 유의미한 효과가 없다고 잘못 보고하는 오류인 누락된 발견(missed discoveries)에 대해서도 동일한 가이드라인 범위를 사용합니다.
통계적 검정력이 왜 중요할까요?
이러한 시나리오를 생각해 보십시오. 80%의 검정력을 가진 100개의 서로 다른 연구에 실제 효과가 존재한다면, 통계 테스트는 100개 중 80개에서 실제 효과를 감지할 것입니다. 그러나 연구 검정력이 20%인 경우, 결과에 100개의 진짜 비영(non-null) 효과가 있더라도 이 연구들은 그중 20개만 발견할 것으로 예상됩니다.
신경과학 연구에서 통계적 검정력의 한계
많은 자원이 필요한 신경과학 연구의 특성상, 이 분야의 통계적 검정력 중간값은 약 21%이며, 평균적으로 8%~31%의 넓은 범위에 걸쳐 있습니다. 신경과학 연구에서 통계적 검정력이 낮으면 다음과 같은 문제가 발생합니다.
연구 결과의 재현성에 의문을 제기합니다.
과장된 효과 크기를 초래합니다.
실제 효과를 정확하게 나타내는 통계적으로 유의미한 결과가 도출될 가능성을 낮춥니다.
이처럼 현재의 신경과학 연구 상태는 통계적 검정력 문제에 갇혀 있는데, 이러한 값들이 Cohen의 이론적 임계치에 훨씬 못 미치기 때문입니다.
대표 표본 집단 구성하기
시나리오 1의 목표: 포괄적이고 큰 표본 추출을 통해 테스트에서 표본 추출 오류와 제1종 및 제2종 오류를 방지합니다.
실험이 실질적으로 유의미해지기를 원한다면 표본 세트에 얼마나 많은 인간 뇌 스캔이 포함되어야 할까요? 실질적 유의성(Practical significance)은 실험 결과가 실제 세상에 적용될 수 있는지 여부를 의미합니다.
신경과학자 실험의 효과 판별 능력(통계적 검정력)은 표본 크기와 밀접한 관련이 있습니다. 시나리오 1의 매개변수를 계속 적용하면, 목표는 감정을 자극하는 시각적 자극을 보여준 후 도파민이 분비되는 타이밍에 실제 효과가 있는지 통계적으로 평가할 수 있을 만큼 충분한 데이터를 수집하는 것입니다. 또한 표본 추출 오류의 가능성을 최소화하는 표본 포함 기준을 수립해야 합니다.
표본 추출 오류를 방지하는 방법
더 진행하기 전에 두 가지 개념을 이해하는 것이 중요합니다.
표본 추출 오류(Sampling error): 표본을 추출할 때, 선택된 개인들로부터 수집한 데이터가 모집단을 대표하지 못할 가능성은 항상 존재합니다.
통계적 유의성(Statistical Significance): 통계적 유의성은 우리의 데이터와 관찰된 효과가 실제 효과일 가능성이 높음을 의미합니다. 대부분의 생물의학 분야에서 통계적 유의성은 .05의 유의 수준 또는 p-값으로 설정됩니다. 본질적으로 이는 과학자들이 자신들의 실험에서 관찰된 효과에 대해 95% 확신한다는 것을 의미합니다.
데이터가 어떤 관계(예: 도파민 분비)를 보여주는 상황을 가정해 보겠습니다. 그 효과가 우연에 의한 것이고 변수(시각적 자극)와는 무관할 가능성이 5% 존재합니다. 이것이 제1종 오류가 됩니다. 반대로, 실제 효과가 있음에도 불구하고 수집된 데이터가 도파민 분비와 시각적 자극 사이에 아무런 관계가 없음을 보여줄 확률이 5% 존재합니다. 이는 위음성, 즉 제2종 오류입니다.
특정 표본 크기를 넘어설 경우 수확 체감의 법칙이 적용되기 때문에, 포함 기준을 신중하게 설정하는 것이 훨씬 더 큰 영향을 미칩니다.
우리는 모든 인류를 대표하는 데이터를 수집하고자 하며, 우리의 결론이 실질적으로나 통계적으로 모두 유의미하기를 바랍니다. 표본 세트를 성공적으로 설계하려면 표본 추출 오류, 제1종 오류(위양성), 또는 제2종 오류(위음성)를 고려하고 방지해야 합니다.
우리의 실험은 다음과 같은 가설을 테스트하고 있습니다.
귀무가설(Null hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 아무런 관계나 효과가 없다.
대립가설(Hypothesis) - 측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재하며, 도파민 분비의 정점은 시각적 자극을 본 후에 발생한다.
측좌핵(NAc) 내 도파민 분비 타이밍과 감정적 가치가 있는 시각적 자극 사이에는 관계가 존재합니다. 데이터가 통계적으로 유의미하지 않은 경우:
우리의 가설은 기각됩니다.
실제 효과나 차이가 발견되지 않습니다.
우리가 관찰한 효과는 단지 우연에 의해 발생했을 확률이 높습니다.
모집단 이해하기?
실험 설계의 실질적 한계.
신경과학 연구에서 공식적인 표본 포함 기준은 일반적으로 표본 추출 오류를 방지하기 위해 모집단 전체에서 표본으로 포함될 확률을 무작위화하거나 균등하게 만드려고 시도합니다. 단지 수집하기 가장 가깝거나 접근하기 쉽다는 이유로 개인을 선택하는 것은 피해야 합니다. 이는 표본 추출 오류를 자초하는 지름길이기 때문입니다.
표본 세트를 구성하는 가장 좋은 방법은 전체 모집단에서 선택될 확률을 무작위로 균등하게 만드는 포함 기준을 사용하는 것입니다. 예를 들어, 인구 조사 데이터를 사용하여 오하이오주의 각 카운티에서 무작위로 선택된 50명의 연락처 정보를 얻을 수 있습니다. 이렇게 하면 모든 지리적 영역에서 무작위로 고르게 이름을 선택하므로 선택 편향이 최소화될 것입니다.
실험 설계를 수립하고, 표본 크기를 늘리며, 편향되지 않고 무작위화된 동시에 균등하게 적용되는 포함 기준을 완전히 실현하는 것은 실질적인 한계에 빠르게 부딪힐 수 있습니다. 이는 학술적 과제부터 본격적인 연구 대학에 이르기까지 모든 수준의 과학 연구에서 겪는 문제입니다. 대개 예산과 일정의 한계로 인해 가장 먼저 타협을 하게 됩니다. 통계적 유의성을 둘러싼 이러한 문제들은 현재 활발히 연구되고 있는 분야입니다.
진짜 실제 효과 크기는 얼마인가?
신경과학 연구의 낮은 통계적 검정력 때문에, 우리는 실제 효과 크기를 과대평가하는 경향이 있으며 이는 많은 연구의 낮은 재현성으로 이어집니다. 나아가 신경과학 연구 본연의 복잡성 때문에 통계적 검정력은 매우 중요합니다.
이 분야에서 채택할 수 있는 한 가지 방법은 표본 크기를 늘려 연구의 검정력을 높이는 것입니다. 이는 실제 효과를 감지할 확률을 높여줍니다. 적절한 표본 크기를 선택하는 것은 다음과 같은 연구를 설계하는 데 필수적입니다.
실질적인 발견을 해냅니다.
뇌의 수많은 과정에 대한 우리의 이해를 발전시킵니다.
효과적인 치료법을 개발합니다.
현대 신경과학 연구의 장벽 극복하기: EmotivLAB 플랫폼
신경과학 연구의 실험 설계는 신뢰할 수 있는 통계적 유의성을 달성하기 위해 더 큰 표본 집단 크기와 더 나은 포함 기준을 설정하도록 밀어붙여야 합니다. 크라우드 소싱 기반 플랫폼인 EmotivLAB을 활용하면, 연구자들은 잠재적으로 훨씬 더 다양하고 더 대표성 있는 대상 개인들에게 접근할 수 있습니다. 이를 통해 연구 그룹의 추가적인 물류적 노력을 최소화하면서 표본 크기를 개선하고 모든 인구 통계학적 특성의 포용성을 높일 수 있습니다.
현대 신경과학 연구는 실험 표본 세트를 위한 다양한 그룹을 모집하는 데 사용할 수 있는 자원이 제한되어 있어 표본 추출 오류에 취약해질 수 있습니다. "WEIRD 그룹" 개념이 이 문제를 잘 보여줍니다. 대부분의 대학 연구는 일반적으로 서구의(Western), 교육 수준이 높고(Educated), 산업화되고(Industrialized), 부유하며(Rich), 민주적인(Democratic) 국가 출신의 실험 대상자들을 대상으로 아주 적은 예산으로 진행됩니다. 그러나 EmotivLAB의 EEG 플랫폼과 같은 원격 데이터 수집 장비를 사용하면 연구자들이 대학 캠퍼스를 넘어 모집단을 더 잘 반영하는 표본 그룹을 모집할 수 있습니다.

EmotivLAB의 플랫폼과 원격 EEG 장비는 연구자들이 실험 표본 그룹에 포함되는 개인의 다양성을 확장하는 데 도움을 줄 뿐만 아니라, 목표 모집단에 대한 전반적인 표본 크기 및 지리적 도달 범위와 관련된 문제도 중재합니다.
EmotivLAB 플랫폼은 연구자들을 현재의 제약에서 벗어나게 하여 실험을 설계하고 결과를 분석하는 데 에너지를 집중할 수 있도록 돕습니다. 당사의 플랫폼은 실험을 피험자 풀에서 가장 적합한 개인들과 매칭해 줍니다. 참가자를 모집하고, 일정을 조율하며, 실험실 내에서 데이터를 수집하는 데 시간을 허비할 필요가 없습니다. 온라인 플랫폼에 원하는 인구 통계학적 특성만 지정하면, EmotivLAB이 원하는 매개변수와 가장 잘 부합하는 기여자들에게 실험을 제공할 것입니다. 참가자들은 본인의 장비를 사용하여 집에서 편안하게 실험에 임할 수 있습니다. 헤드셋 사용법에 이미 익숙하기 때문에 연구자가 사용법을 설명할 필요도 없습니다.
그뿐만 아니라, EmotivLAB 플랫폼은 자동화된 EEG 기록 데이터 품질 관리 및 평가 기능을 제공합니다. 대량의 저품질 데이터는 실험 설계에서 표본 추출 오류나 통계적 오류를 극복하는 데 도움이 되지 않습니다. 하지만 더 많은 고품질 데이터에 접근할 수 있다면 다음과 같은 영역에서 오류를 방지하는 대안이 될 것입니다.
표본 추출
모집단
통계적 유의성
EmotivLAB 플랫폼이 귀하의 연구를 위해 무엇을 할 수 있는지 더 자세히 알아보고 싶으신가요?
EmotivLAB을 사용하면 하나의 플랫폼에서 실험을 구성하고, 안전하고 확실하게 실험을 배치하며, 검증된 참가자로 구성된 글로벌 패널로부터 모집하고, 고품질 EEG 데이터를 수집할 수 있습니다. 더 자세히 알아보거나 데모를 요청하려면 여기를 클릭하세요.

계속 읽기