Pathway 실전·API — 커넥터 총람

Pathway 실전·API

Pathway Live Data Framework를 쓰려면 가장 먼저 다룰 데이터에 접근해야 해요. 데이터 접근은 커넥터로 이뤄져요. 입력 커넥터와 출력 커넥터가 있고, 스트리밍 모드와 정적 모드에 따라 다르다는 점을 먼저 알아두면 좋아요.

스트리밍 모드 입력 커넥터

  • Airbyte, Amazon S3, CSV, Debezium(CDC), Delta Lake
  • Elastic Search, File System, Google Drive, http, Iceberg
  • JSON Lines, Kafka, Kinesis, MinIO
  • MongoDB (Debezium), MongoDB (oplog replication), MongoDB Atlas
  • MQTT, MS SQL Server, NATS, NeonDB, Plain text
  • PostgreSQL (WAL 읽기), Pulsar, Python, RabbitMQ, Redpanda, SharePoint, SQLite

정적 모드 입력 커넥터

  • Amazon S3, CSV, Delta Lake, File System
  • Google Drive, JSON Lines, Kafka, Markdown, MinIO
  • Pandas, Redpanda

스트리밍 모드 출력 커넥터

  • BigQuery, Chroma, ClickHouse, CSV, Delta Lake, DuckDB
  • DynamoDB, Elastic Search, File System, Google PubSub, http
  • Iceberg, JSON Lines, Kafka, Kinesis, Logstash
  • Milvus, MongoDB, MongoDB Atlas, MQTT, MS SQL Server, MySQL
  • NATS, NeonDB, pgvector, Pinecone, PostgreSQL, Pulsar
  • Qdrant, QuestDB, RabbitMQ, Redpanda, ...

커넥터 사용 요령

일반적으로 커넥터는 세 가지를 설정해요.

  1. 대상 데이터 원본/목적지 (파일 경로, 토픽, 버킷 등)
  2. 스키마 (데이터 포맷 이해)
  3. 시리얼라이제이션 포맷 (json, csv 등)

예를 들어 Kafka에서 JSON을 읽으려면 스키마와 format="json", topic="..."을 넘겨요.

input_table = pw.io.kafka.read(rdkafka_settings, schema=InputSchema, topic="topic1", format="json")

출력 커넥터는 변경을 외부 시스템으로 스트림으로 전달해요. 예를 들어 벡터 스토어(Chroma, Milvus, Qdrant, Pinecone, pgvector)로 보내면 실시간 RAG 인덱스를 만들 수 있어요.

더 알아보기