INTERSECT 절

INTERSECT 절

INTERSECT 절은 첫 번째 쿼리와 두 번째 쿼리 양쪽에 모두 존재하는 행만 반환해요. 두 쿼리는 열의 개수, 순서, 타입이 일치해야 하며, INTERSECT 결과에는 중복 행이 포함될 수 있어요. 괄호를 쓰지 않으면 여러 INTERSECT 구문은 왼쪽에서 오른쪽 순서로 실행되며, INTERSECT 연산자는 UNIONEXCEPT 절보다 우선순위가 높아요.

출처: 문서

본문

INTERSECT 절은 첫 번째 쿼리와 두 번째 쿼리 양쪽 모두에서 나온 행만 반환해요. 두 쿼리는 열의 개수, 순서, 타입이 일치해야 해요. INTERSECT의 결과에는 중복 행이 포함될 수 있어요. 괄호를 지정하지 않으면 여러 INTERSECT 구문은 왼쪽에서 오른쪽으로 실행돼요. INTERSECT 연산자는 UNIONEXCEPT 절보다 우선순위가 더 높아요.

SELECT column1 [, column2 ]
FROM table1
[WHERE condition]

INTERSECT

SELECT column1 [, column2 ]
FROM table2
[WHERE condition]

조건(condition)은 요구사항에 기반한 어떤 표현식이든 될 수 있어요.

Examples (예제)

다음은 1부터 10까지의 숫자와 3부터 8까지의 숫자를 교집합하는 간단한 예제예요.

Query (쿼리)

SELECT number FROM numbers(1,10) INTERSECT SELECT number FROM numbers(3,8);

Response (응답)

┌─number─┐
│      3 │
│      4 │
│      5 │
│      6 │
│      7 │
│      8 │
└────────┘

INTERSECT는 공통 열(또는 열들)을 공유하는 두 테이블이 있을 때 유용해요. 결과에 같은 열이 포함되어 있기만 하면 두 쿼리의 결과를 교집합할 수 있어요. 예를 들어, 거래 가격과 거래량이 담긴 수백만 행의 과거 암호화폐 데이터가 있다고 가정해 볼게요.

Query (쿼리)

CREATE TABLE crypto_prices
(
    trade_date Date,
    crypto_name String,
    volume Float32,
    price Float32,
    market_cap Float32,
    change_1_day Float32
)
ENGINE = MergeTree
PRIMARY KEY (crypto_name, trade_date);

INSERT INTO crypto_prices
   SELECT *
   FROM s3(
    'https://learn-clickhouse.s3.us-east-2.amazonaws.com/crypto_prices.csv',
    'CSVWithNames'
);

SELECT * FROM crypto_prices
WHERE crypto_name = 'Bitcoin'
ORDER BY trade_date DESC
LIMIT 10;

Response (응답)

┌─trade_date─┬─crypto_name─┬──────volume─┬────price─┬───market_cap─┬──change_1_day─┐
│ 2020-11-02 │ Bitcoin     │ 30771456000 │ 13550.49 │ 251119860000 │  -0.013585099 │
│ 2020-11-01 │ Bitcoin     │ 24453857000 │ 13737.11 │ 254569760000 │ -0.0031840964 │
│ 2020-10-31 │ Bitcoin     │ 30306464000 │ 13780.99 │ 255372070000 │   0.017308505 │
│ 2020-10-30 │ Bitcoin     │ 30581486000 │ 13546.52 │ 251018150000 │   0.008084608 │
│ 2020-10-29 │ Bitcoin     │ 56499500000 │ 13437.88 │ 248995320000 │   0.012552661 │
│ 2020-10-28 │ Bitcoin     │ 35867320000 │ 13271.29 │ 245899820000 │   -0.02804481 │
│ 2020-10-27 │ Bitcoin     │ 33749879000 │ 13654.22 │ 252985950000 │    0.04427984 │
│ 2020-10-26 │ Bitcoin     │ 29461459000 │ 13075.25 │ 242251000000 │  0.0033826586 │
│ 2020-10-25 │ Bitcoin     │ 24406921000 │ 13031.17 │ 241425220000 │ -0.0058658565 │
│ 2020-10-24 │ Bitcoin     │ 24542319000 │ 13108.06 │ 242839880000 │   0.013650347 │
└────────────┴─────────────┴─────────────┴──────────┴──────────────┴───────────────┘

이제 우리가 보유한 암호화폐 목록과 보유 수량이 담긴 holdings 테이블이 있다고 가정해 볼게요.

Query (쿼리)

CREATE TABLE holdings
(
    crypto_name String,
    quantity UInt64
)
ENGINE = MergeTree
PRIMARY KEY (crypto_name);

INSERT INTO holdings VALUES
   ('Bitcoin', 1000),
   ('Bitcoin', 200),
   ('Ethereum', 250),
   ('Ethereum', 5000),
   ('DOGEFI', 10);
   ('Bitcoin Diamond', 5000);

INTERSECT를 사용하면 “가격이 $100보다 높게 거래된 적이 있는데 우리가 보유한 코인은 무엇일까?” 같은 질문에 답할 수 있어요.

Query (쿼리)

SELECT crypto_name FROM holdings
INTERSECT
SELECT crypto_name FROM crypto_prices
WHERE price > 100

Response (응답)

┌─crypto_name─┐
│ Bitcoin     │
│ Bitcoin     │
│ Ethereum    │
│ Ethereum    │
└─────────────┘

이 결과는 어떤 시점에 비트코인과 이더리움이 100 이상으로 거래된 적이 있고, DOGEFI와 Bitcoin Diamond는 100 이상으로 거래된 적이 없다는 뜻이에요 (적어도 이 예제에서 사용한 데이터 기준으로는요).

INTERSECT DISTINCT

앞선 쿼리에서 가격이 $100보다 높게 거래된 비트코인과 이더리움 보유가 여러 건 있었다는 점을 확인할 수 있었어요. 이미 아는 내용을 반복할 뿐인 중복 행을 없애는 것이 좋을 수도 있어요. INTERSECTDISTINCT를 추가하면 결과에서 중복 행을 제거할 수 있어요.

Query (쿼리)

SELECT crypto_name FROM holdings
INTERSECT DISTINCT
SELECT crypto_name FROM crypto_prices
WHERE price > 100;

Response (응답)

┌─crypto_name─┐
│ Bitcoin     │
│ Ethereum    │
└─────────────┘

더 알아보기 (Learn more)