varSamp
varSamp
데이터 집합의 표본 분산(sample variance)을 계산하는 집계 함수예요. 입력 데이터가 더 큰 모집단에서 추출한 표본이라고 가정해요.
출처: 문서
본문
varSamp은 데이터 집합의 표본 분산(sample variance) 을 계산해요. 표본 분산은 다음 공식으로 계산돼요:
$$\frac{\Sigma{(x - \bar{x})^2}}{n-1}$$
여기서:
x는 데이터 집합의 각 데이터 포인트x̄는 데이터 집합의 산술 평균n은 데이터 집합의 데이터 포인트 수
이 함수는 입력 데이터 집합이 더 큰 모집단에서 추출한 표본이라고 가정해요. 전체 모집단의 분산을 계산하려면(완전한 데이터 집합을 가지고 있다면) 대신 varPop을 사용해야 해요.
이 함수는 수치적으로 불안정한 알고리즘을 사용해요. 계산에서 수치적 안정성이 필요하다면 varSampStable 함수를 사용하는 게 좋아요. 더 느리게 동작하지만 계산 오차가 더 작아요.
구문 (Syntax)
varSamp(x)
별칭 (Aliases): VAR_SAMP
인자 (Arguments)
반환 값 (Returned value)
입력 데이터 집합 x의 표본 분산. Float64
예제 (Examples)
표본 분산 계산하기
쿼리:
DROP TABLE IF EXISTS test_data;
CREATE TABLE test_data
(
x Float64
)
ENGINE = Memory;
INSERT INTO test_data VALUES (10.5), (12.3), (9.8), (11.2), (10.7);
SELECT round(varSamp(x),3) AS var_samp FROM test_data;
응답:
┌─var_samp─┐
│ 0.865 │
└──────────┘
더 알아보기 (Learn more)
varPop— 모집단 전체 분산 계산varSampStable— 수치적으로 안정한 표본 분산 계산