과학 논문은 흔히 결과에 통계적 표지를 붙인다. 시그마 수준, p 값, 신뢰구간이다. 그것은 확실성의 도장처럼 보일 수 있다. 하지만 그렇지 않다.

그러한 표지들은 더 좁은 질문을 던진다. 시그마는 예상된 잡음만 있었다면 어떤 신호가 얼마나 놀라울지를 묻는다. 신뢰구간은 사용된 모형 아래에서 어떤 효과 크기가 여전히 데이터와 양립하는지를 묻는다. 둘 다 유용하다. 어느 쪽도 과학적 해석이 참인지를 묻는 것과 같지 않다.

짧은 판본

많은 분야에서, 특히 물리학과 천문학에서, 시그마는 관측된 신호가 연구자들이 예상한 잡음이나 배경으로부터 얼마나 멀리 떨어져 있는지를 잰다.

  • 낮은 시그마는 신호가 보통의 잡음에서 멀지 않다는 뜻이다.
  • 더 높은 시그마는 신호를 무작위 요동으로 설명하기가 더 어렵다는 뜻이다.
  • 5 시그마는 매우 강한 관례적 문턱값이다. 사용되는 통계 모형 아래에서, 그만큼 큰 무작위 요동은 매우 드물 것이다.

그 마지막 어구가 중요하다. 사용되는 통계 모형 아래에서. 높은 시그마 신호도 여전히 보정, 전경 오염, 모형 선택, 선택 효과, 또는 잘못된 물리적 해석에 영향을 받을 수 있다. 시그마는 "여기에 아마도 무언가가 있는가?"에 답하는 것을 돕는다. 그것은 "그것이 무엇인가?"에는 답하지 않는다.

잡음이 먼저

어두운 하늘을 사진 찍는다고 상상해 보라. 실제 광원이 하나도 없더라도, 그 영상은 완벽하게 비어 있지 않다. 검출기에는 잡음이 있다. 하늘에는 배경이 있다. 데이터 처리는 작은 흔들림을 남긴다. 빈 조각을 충분히 많이 측정하면, 그중 일부는 순전히 우연으로 조금 밝아 보일 것이다.

그래서 첫 번째 할 일은 밝은 점이 흥미로운지를 묻는 것이 아니다. 보통의 빈 하늘이 어떻게 보이는지를 묻는 것이다. 연구자들은 그 배경을 추정하고, 그것이 얼마나 변동하는지를 측정한 다음, 후보 신호가 그 위로 얼마나 높이 솟아오르는지를 묻는다.

그 거리가 바로 시그마가 세는 것이다.

시그마가 재는 것

1 시그마는 1 표준편차, 곧 잡음에서 변동의 한 전형적 단위다. 5σ 신호는 그러한 단위의 다섯 배만큼 예상된 배경에서 떨어져 있다.

정확한 확률은 잡음에 관한 가정과, 검정이 단측인지 양측인지에 달려 있지만, 실용적인 해석은 충분히 단순하다. 5σ 신호는 예사로운 봉우리가 아니다. 배경 모형이 옳다면, 잡음만으로 그렇게 극단적인 것을 만드는 일은 거의 결코 없어야 한다.

이 때문에 논문은 어떤 광원이 5.2–5.3σ에서 검출되었다고 말할 수 있다. 이는 측정된 신호가 저자들이 배경 요동에서 예상하는 것보다 약 다섯 표준편차 위에 있다는 뜻이다. 그것은 저자들의 설명이 참일 확률이 99.9999%라는 뜻이 아니다. 그것이 흔한 실수다.

신뢰구간이 말하는 것

다른 분야들은 흔히 시그마 대신 신뢰구간을 보고한다. "베타 = 0.66, 95% 신뢰구간 0.35에서 0.97"과 같은 문장은 추정된 효과와, 사용된 모형 아래에서 데이터와 양립하는 값의 범위를 함께 제시한다.

빠른 해석은 이렇다. 저자들의 최선의 추정치는 0.66이지만, 데이터는 여전히 0.35만큼 낮거나 0.97만큼 높은 효과와도 부합한다. 어떤 효과에 대한 95% 신뢰구간이 여기서처럼 전부 0보다 위에 머물러 있다면, 그것은 이 모형에서 효과가 양(陽)이라는 증거다. 그것은 참된 효과가 바로 그 구간 안에 있을 확률이 95%라는 뜻이 아니며, 그 결과가 실제로 중요하다는 것을 증명하지도 않는다. 그것은 추정치가 얼마나 정밀한지를 알려 준다.

왜 5 시그마가 하나의 경계선이 되었는가

분야마다 서로 다른 관례를 쓴다. 입자물리학과 천문학의 많은 부분에서, 3σ는 흔히 증거로 읽힌다. 흥미롭고, 주목할 만하지만, 그 자체로는 충분치 않다. 5σ 결과는 흔히 발견 수준의 검출로 취급된다.

그 높은 기준이 존재하는 것은 무딘 이유 때문이다. 과학자들은 잡음이 많은 것을 많이 들여다본다. 충분히 많은 곳을 뒤지면, 무언가가 결국 우연으로 유별나 보일 것이다. 더 엄격한 문턱값은 무작위 봉우리를 축하할 위험을 줄인다.

문턱값은 관례이지, 자연의 법칙이 아니다. 4.9σ 결과가 쓸모없는 것도 아니고, 5.1σ 결과가 마법처럼 오류에 면역인 것도 아니다. 그 숫자는 규율의 도구이지, 성사(聖事)가 아니다. 통계학에는 이미 예복이 넉넉하다.

국소 대 전역

함정이 하나 더 있다. 어디를 보았는가?

연구자들이 미리 지정된 한 곳 — 하나의 파장, 하나의 위치, 하나의 신호 모양 — 을 검정한다면, 그 시그마는 국소 유의성으로 읽힐 수 있다. 곧, 바로 그 자리에서 신호가 얼마나 놀라운지다.

하지만 수천 곳, 여러 파장, 데이터의 여러 절단, 또는 가능한 여러 신호 모양을 훑는다면, 질문이 달라진다. 그 탐색의 어딘가에서, 잡음이 요행을 만들어 낼 가능성이 더 크다. 속을 그 모든 기회를 감안하고 나면, 그 결과는 더 낮은 전역 유의성을 가질 수 있다.

이것이 **다른 곳 살펴보기 효과(look-elsewhere effect)**다. 이것은 사소한 형식적 문제가 아니다. 이것은 "내가 보겠다고 말한 바로 그 자리에서 이상한 자국을 찾았다"와 "얼룩 하나가 얼굴처럼 보일 때까지 벽 전체를 뒤졌다"의 차이다.

시그마가 증명하지 못하는 것

높은 시그마 검출은 실재하면서도 여전히 잘못 읽힐 수 있다.

그것은 데이터에 신호가 있음을 보여 줄 수 있지만, 다음은 열어 둔 채로 남긴다.

  • 신호가 저자들이 생각하는 그 천체에서 오는지;
  • 전경 광원이나 오염원이 관여하는지;
  • 기기 보정이 완전히 통제되고 있는지;
  • 배경 모형이 옳은 것이었는지;
  • 물리적 해석이 유일한지.

이 때문에 신중한 논문은 시그마를 인용하는 것 이상을 한다. 하늘의 빈 영역을 점검한다. 전경 침입자를 검사한다. 기기나 필터를 비교한다. 서로 다른 가정 아래에서도 같은 결과가 나타나는지를 묻는다. 시그마는 입학시험이다. 그것은 학위 전체가 아니다.

시그마 주장을 읽는 법

어떤 기사가 결과가 5σ라고 말할 때, 그것을 이야기에 대한 최종 평결이 아니라 데이터에 관한 강한 진술로 읽어라.

네 가지 질문을 던져라.

  1. 잡음 모형은 무엇인가? 저자들은 무엇을 보통의 배경으로 셈했는가?
  2. 검정은 국소였는가, 전역이었는가? 한 곳을 보았는가, 아니면 여러 곳을 뒤졌는가?
  3. 어떤 점검이 오염이나 인공물을 배제하는가? 높은 숫자만으로는 그것을 할 수 없다.
  4. 신호에 어떤 해석이 붙어 있는가? 검출과 설명은 별개의 단계다.

그 답들이 좋다면, 높은 시그마 결과는 신뢰를 받을 만하다. 그것들이 빠져 있다면, 그 숫자는 여전히 인상적일 수 있지만 — 마땅히 해야 할 것보다 더 많은 일을 하고 있는 것이다.

이 가이드에 대하여

이것은 단일 논문에 대한 보도가 아니라 상시 설명 자료입니다. AI의 도움과 사람의 편집 검토를 거쳐 작성되며 시간이 지나면서 개정됩니다. 위의 날짜는 마지막으로 확인한 날짜입니다. 이 자료는 숫자를 읽는 방법을 알려줄 뿐, 의학적 또는 통계적 조언이 아닙니다.