분류 및 회귀 - RDD 기반 API
분류 및 회귀 - RDD 기반 API (Classification and Regression – RDD-based API)
spark.mllib 패키지는 이진 분류, 다중 클래스 분류, 회귀 분석을 위한 다양한 방법을 지원해요. 아래 표는 각 문제 유형별로 지원되는 알고리즘을 정리한 것이니, 어떤 알고리즘을 써야 할지 빠르게 파악하는 데 도움이 될 거예요.
출처: 문서
본문
spark.mllib 패키지는 이진 분류, 다중 클래스 분류, 회귀 분석을 위한 다양한 방법을 지원합니다. 아래 표는 각 문제 유형에 대해 지원되는 알고리즘을 요약해요.
| 문제 유형 | 지원되는 방법 |
|---|---|
| 이진 분류 | linear SVMs, logistic regression, decision trees, random forests, gradient-boosted trees, naive Bayes |
| 다중 클래스 분류 | logistic regression, decision trees, random forests, naive Bayes |
| 회귀 | linear least squares, Lasso, ridge regression, decision trees, random forests, gradient-boosted trees, isotonic regression |
이 방법들에 대한 자세한 내용은 여기에서 확인할 수 있어요:
- 선형 모델 (Linear models)
- 결정 트리 (Decision trees)
- 결정 트리의 앙상블 (Ensembles of decision trees)
- 나이브 베이즈 (Naive Bayes)
- 등장 회귀 (Isotonic regression)
더 알아보기 (Learn more)
- 선형 방법 (Linear methods): SVM, 로지스틱 회귀, 선형 회귀를 자세히 다뤄요.
- 결정 트리 (Decision trees): 분류와 회귀 모두에서 쓸 수 있는 기본 트리 모델을 살펴봐요.
- 앙상블 (Ensembles): 랜덤 포레스트와 그래디언트 부스팅 트리에 대해 알아봐요.