varSamp

varSamp

데이터 집합의 표본 분산(sample variance)을 계산하는 집계 함수예요. 입력 데이터가 더 큰 모집단에서 추출한 표본이라고 가정해요.

출처: 문서

본문

varSamp은 데이터 집합의 표본 분산(sample variance) 을 계산해요. 표본 분산은 다음 공식으로 계산돼요:

$$\frac{\Sigma{(x - \bar{x})^2}}{n-1}$$

여기서:

  • x는 데이터 집합의 각 데이터 포인트
  • 는 데이터 집합의 산술 평균
  • n은 데이터 집합의 데이터 포인트 수

이 함수는 입력 데이터 집합이 더 큰 모집단에서 추출한 표본이라고 가정해요. 전체 모집단의 분산을 계산하려면(완전한 데이터 집합을 가지고 있다면) 대신 varPop을 사용해야 해요.

이 함수는 수치적으로 불안정한 알고리즘을 사용해요. 계산에서 수치적 안정성이 필요하다면 varSampStable 함수를 사용하는 게 좋아요. 더 느리게 동작하지만 계산 오차가 더 작아요.

구문 (Syntax)

varSamp(x)

별칭 (Aliases): VAR_SAMP

인자 (Arguments)

반환 값 (Returned value)

입력 데이터 집합 x의 표본 분산. Float64

예제 (Examples)

표본 분산 계산하기

쿼리:

DROP TABLE IF EXISTS test_data;
CREATE TABLE test_data
(
    x Float64
)
ENGINE = Memory;

INSERT INTO test_data VALUES (10.5), (12.3), (9.8), (11.2), (10.7);

SELECT round(varSamp(x),3) AS var_samp FROM test_data;

응답:

┌─var_samp─┐
│    0.865 │
└──────────┘

더 알아보기 (Learn more)

  • varPop — 모집단 전체 분산 계산
  • varSampStable — 수치적으로 안정한 표본 분산 계산