네. Orange Data Mining은 무료입니다. 공식적으로 오픈소스(Open Source) 무료 소프트웨어이며 GNU GPL 라이선스로 제공됩니다. 개인 학습뿐 아니라 대학 수업·연구 목적으로도 무료로 설치해서 사용할 수 있습니다.
특히 데이터 분석 수업에서는 꽤 좋습니다. 코딩을 거의 하지 않고 위젯을 연결하는 방식으로 다음과 같은 분석을 할 수 있습니다.
| 할 수 있는 것 | Orange |
|---|---|
| CSV·Excel 데이터 불러오기 | ✅ |
| 기술통계·데이터 탐색 | ✅ |
| 시각화 | ✅ |
| 상관관계 분석 | ✅ |
| PCA 주성분분석 | ✅ |
| 군집분석 | ✅ |
| 의사결정나무 | ✅ |
| Random Forest | ✅ |
| 회귀분석 | ✅ |
| 머신러닝 모델 비교 | ✅ |
| 텍스트 마이닝 | ✅ Add-on 활용 |
| 코딩 필요 | 거의 없음 |
Windows에서는 공식 사이트에서 설치 프로그램을 바로 받을 수 있고, 설치가 필요 없는 Portable 버전도 제공됩니다.
SPSS → Orange → Python
이 순서로 가르치면 학생들에게 데이터 분석 개념을 이해시키기 좋습니다. 예를 들어 PCA도 Orange에서는 대략 다음처럼 위젯을 연결해서 결과를 바로 볼 수 있습니다.
File → Select Columns → PCA → Scatter Plot
따라서 PC1·PC2·PC3와 차원축소 개념을 수업에서 보여주기에도 상당히 좋습니다.
출처: Orange License · Getting Started · Download
Orange는 무료로 사용할 수 있는 오픈소스 데이터 분석·머신러닝 프로그램입니다.
슬로베니아 류블랴나 대학교(University of Ljubljana)를 중심으로 개발되었으며, 데이터를 분석하고 머신러닝을 실습할 때 복잡한 Python 코드를 직접 작성하지 않아도 된다는 장점이 있습니다.
공식 사이트: https://orangedatamining.com/
GitHub: https://github.com/biolab/orange3
Orange에서는 프로그램 코드를 길게 입력하는 대신 위젯(Widget)을 화면에 놓고 서로 연결합니다.
데이터 불러오기 → 데이터 확인 → 분석 → 결과 평가 → 시각화
| 영역 | Orange에서 할 수 있는 것 |
|---|---|
| 데이터 불러오기 | CSV, Excel 등 |
| 데이터 전처리 | 변수 선택, 필터링, 결측치 처리 |
| 기초 시각화 | 히스토그램, Box Plot, Scatter Plot |
| 차원축소 | PCA 주성분분석, MDS |
| 군집분석 | K-means, 계층적 군집분석 |
| 분류 | 의사결정나무, Random Forest, Logistic Regression 등 |
| 회귀 | 선형회귀 및 머신러닝 회귀모델 |
| 모델 평가 | 교차검증, 정확도 등 비교 |
| 텍스트 분석 | Text Mining Add-on |
| 지도 분석 | Geo Add-on |
| 시계열 분석 | Time Series Add-on |
| AI 설명 | Explain, SHAP 등 |
| 네트워크 분석 | Network Add-on |
지도학습 Supervised Learning은 정답이 있는 데이터를 이용하여 예측합니다.
데이터 → 모델 학습 → 새로운 데이터 예측
예:
Orange에서는 Tree / Random Forest / Logistic Regression / Neural Network 등의 위젯을 사용할 수 있습니다.
비지도학습 Unsupervised Learning은 정답이 없는 데이터에서 패턴을 찾습니다.
관광객 데이터 → K-means → 관광객 유형 발견
많은 변수 → PCA → 핵심 차원으로 축소
따라서 우리가 공부한 PCA와 군집분석을 직접 실습하기에 매우 좋은 프로그램입니다.
File → Select Columns → ★ PCA → Scatter Plot
그러면 여러 개의 원래 변수를 X1 · X2 · X3 · X4 · X5 · …에서 PC1 · PC2 · PC3 · …와 같은 새로운 주성분으로 바꿔볼 수 있습니다.
Scatter Plot에서 보통 PC1 × PC2를 이용하여 데이터를 2차원으로 시각화합니다.
① 무료 Free & Open Source — 별도의 유료 라이선스 없이 사용할 수 있습니다.
② 코딩 부담이 적음 Python 문법을 먼저 외우지 않아도 데이터 분석의 원리를 배울 수 있습니다.
③ 분석과정을 눈으로 볼 수 있음 데이터 → 전처리 → 분석 → 평가 → 시각화 과정이 한눈에 보입니다.
④ 머신러닝 입문에 적합 같은 데이터에 여러 모델을 적용하고 성능을 비교할 수 있습니다.
| Add-on | 활용 |
|---|---|
| Text Mining | 뉴스, 리뷰, SNS 텍스트 분석 |
| Geo | 지도·공간 데이터 분석 |
| Network | 네트워크 분석 |
| Time Series | 시계열 분석 |
| Explain | SHAP 등 AI 예측 설명 |
| Image Analytics | 이미지 분석 |
| Fairness | AI 편향·공정성 평가 |
| Educational | 머신러닝 교육 |
| World Happiness | 국가별 사회경제 데이터 분석 |
관광 분야에서는 Text Mining + Geo + Machine Learning 조합이 상당히 유용합니다.
관광객 리뷰 → Text Mining → 감성·키워드 분석
관광지 위치 데이터 → Geo → 공간적 분포 확인
관광객 설문 → PCA → K-means → 관광객 세분시장 발견
| 구분 | 소프트웨어 | 주요 성격·용도 |
|---|---|---|
| 머신러닝 | Accord.NET | .NET 기반 머신러닝·통계 |
| 머신러닝 | Apache Mahout | 대규모 분산 머신러닝 |
| 머신러닝 | Apache SystemDS | 대규모 데이터 분석·ML |
| 머신러닝 | CatBoost | 부스팅 기반 분류·회귀 |
| 머신러닝 | Dlib | 머신러닝·컴퓨터비전 |
| 머신러닝 | ELKI | 군집분석·데이터마이닝 |
| 머신러닝 | FastText | 텍스트 분류·단어 임베딩 |
| 머신러닝 | Gensim | 자연어처리·토픽모델링 |
| 머신러닝 | H2O | AutoML·머신러닝 |
| 머신러닝 | Infer.NET | 확률적 머신러닝 |
| 머신러닝 | Jubatus | 온라인 머신러닝 |
| 머신러닝 | KNIME | GUI 기반 데이터 분석·ML |
| 머신러닝 | LIBSVM | SVM 분석 |
| 머신러닝 | LightGBM | Gradient Boosting |
| 머신러닝 | MOA | 스트리밍 데이터 분석 |
| 머신러닝 | MATLAB | 수치분석·통계·ML |
| 머신러닝 | ML.NET | .NET 머신러닝 |
| 머신러닝 | mlpack | C++ 머신러닝 라이브러리 |
| ★ 머신러닝 | Orange | GUI 기반 데이터 분석·시각화·머신러닝 |
| 머신러닝 | PyMC | 베이지안 통계모형 |
| 머신러닝 | RapidMiner | GUI 기반 데이터마이닝·ML |
| 머신러닝 | scikit-learn | Python 대표 머신러닝 라이브러리 |
| 머신러닝 | Scikit-multiflow | 스트리밍 머신러닝 |
| 머신러닝 | Shogun | 머신러닝 알고리즘 라이브러리 |
| 머신러닝 | Spark MLlib | 빅데이터 분산 머신러닝 |
| 머신러닝 | Vowpal Wabbit | 대규모 온라인 학습 |
| 머신러닝 | Weka | GUI 기반 교육용 머신러닝 |
| 머신러닝 | Wolfram Mathematica | 수학·통계·ML |
| 머신러닝 | XGBoost | Gradient Boosting 대표 알고리즘 |
| 구분 | 소프트웨어 | 주요 성격·용도 |
|---|---|---|
| 딥러닝 | Apache SINGA | 분산 딥러닝 |
| 딥러닝 | BigDL | Spark 기반 딥러닝 |
| 딥러닝 | Caffe | 이미지 중심 딥러닝 |
| 딥러닝 | Chainer | 신경망 프레임워크 |
| 딥러닝 | Deeplearning4j | Java 기반 딥러닝 |
| 딥러닝 | Deep Learning Studio | GUI 기반 딥러닝 |
| 딥러닝 | DeepSpeed | 대규모 딥러닝 학습 |
| 딥러닝 | fast.ai | PyTorch 기반 딥러닝 교육·개발 |
| 딥러닝 | Flux | Julia 기반 머신러닝 |
| 딥러닝 | Horovod | 분산 딥러닝 학습 |
| 딥러닝 | JAX | 고성능 수치계산·딥러닝 |
| 딥러닝 | Keras | 쉽게 사용할 수 있는 신경망 API |
| 딥러닝 | Microsoft Cognitive Toolkit | Microsoft 딥러닝 프레임워크 |
| 딥러닝 | MindSpore | AI·딥러닝 프레임워크 |
| 딥러닝 | MXNet | 분산 딥러닝 |
| 딥러닝 | Neural Designer | GUI 기반 신경망 분석 |
| 딥러닝 | OpenNN | 신경망 라이브러리 |
| 딥러닝 | OpenVINO | AI 모델 추론·최적화 |
| 딥러닝 | PlaidML | 딥러닝 계산 엔진 |
| 딥러닝 | PyTorch | 대표적인 딥러닝 프레임워크 |
| 딥러닝 | PyTorch Lightning | PyTorch 학습 구조화 |
| 딥러닝 | TensorFlow | 대표적인 딥러닝 프레임워크 |
| 딥러닝 | TensorRT | NVIDIA 딥러닝 추론 최적화 |
| 딥러닝 | Theano | 초기 딥러닝·수치계산 프레임워크 |
| 딥러닝 | Torch | 초기 딥러닝 프레임워크 |
| 프로그램 | 난이도 | 코딩 | 추천 용도 |
|---|---|---|---|
| ★ Orange | ★ | 거의 없음 | 머신러닝 입문·수업 실습 |
| Weka | ★★ | 거의 없음 | 머신러닝 알고리즘 학습 |
| KNIME | ★★ | 적음 | 데이터 분석 워크플로 |
| RapidMiner | ★★ | 적음 | 데이터마이닝·머신러닝 |
| scikit-learn | ★★★ | Python 필요 | 머신러닝 실무·연구 |
| XGBoost | ★★★ | Python/R 필요 | 예측모델·부스팅 |
| PyTorch | ★★★★ | Python 필요 | 딥러닝 |
| TensorFlow/Keras | ★★★★ | Python 필요 | 딥러닝 |
| 프로그램(설명) | 비용 절약 | 코딩 부담 | 한눈에 보기 | 난이도 |
|---|---|---|---|---|
| Orange — 위젯 연결형 머신러닝 | ●●●●● | ● | ●●●●● | ★ |
| Weka — 교육용 머신러닝 | ●●●●● | ● | ●●●● | ★★ |
| KNIME — 시각적 데이터 분석 | ●●●● | ●● | ●●●●● | ★★ |
| RapidMiner — 데이터마이닝·ML | ●●● | ●● | ●●●● | ★★ |
| scikit-learn — Python 머신러닝 | ●●●●● | ●●●● | ●● | ★★★ |
| XGBoost — 고성능 예측모델 | ●●●●● | ●●●● | ● | ★★★ |
| PyTorch — 딥러닝 | ●●●●● | ●●●●● | ● | ★★★★ |
| TensorFlow/Keras — 딥러닝 | ●●●●● | ●●●● | ●● | ★★★★ |
● 많을수록 해당 장점이 큼. 단, ‘코딩 부담’은 ●가 많을수록 부담이 큰 것으로 해석.
비용 절약적: Orange · Weka · scikit-learn · PyTorch · TensorFlow
한눈에 보이는 프로그램: Orange ●●●●● → KNIME ●●●●● → Weka ●●●● → Python 계열 ●●
SAS를 “구 모델”이라고만 부르기는 정확하지 않습니다. 다만 학생들에게 설명할 때는 전통적·기업형 분석 도구라고 보면 가장 이해하기 쉽습니다.
SAS는 오래된 역사를 가진 통계·데이터 분석 소프트웨어이지만 지금도 개발되고 있습니다. 기존의 SAS 9.4와 함께, 현재는 클라우드 기반의 최신 플랫폼인 SAS Viya가 중심입니다.
| 프로그램(설명) | 비용 절약 | 한눈에 보기 | 코딩 부담 | 현재 성격 |
|---|---|---|---|---|
| SAS 9.4 — 전통적 통계·기업 분석 | ● | ●● | ●●●● | 전통적·기존 SAS 환경 |
| SAS Viya — 클라우드·AI 분석 | ● | ●●●● | ●●● | 최신 SAS 플랫폼 |
| SPSS — GUI 중심 통계분석 | ●● | ●●●● | ● | 전통적 통계분석 |
| ★ Orange — 시각적 ML·데이터마이닝 | ●●●●● | ●●●●● | ● | 무료·교육용 ML 입문에 유리 |
| Python — 범용 데이터분석·AI | ●●●●● | ●● | ●●●●● | 현대 ML·AI 중심 |
학생들에게 머신러닝 입문을 가르친다는 목적이라면 SAS보다는 Orange → Python 흐름이 비용과 접근성 면에서 훨씬 직관적입니다.
맞습니다. PCA와 군집분석 자체는 SPSS에서도 할 수 있습니다. 차이는 분석기법 그 자체보다 분석을 수행하고 이해하는 방식에 있습니다.
| 구분 | SPSS | Orange |
|---|---|---|
| PCA | 가능 | 가능 |
| K-means 군집 | 가능 | 가능 |
| 계층적 군집 | 가능 | 가능 |
| 기본 성격 | 통계분석 중심 | 시각적 데이터분석·머신러닝 중심 |
| 분석 방식 | 메뉴 선택 → 옵션 설정 → 결과표 | 위젯 연결 → 분석 흐름을 화면에서 확인 |
| 결과 확인 | 표·통계량 중심 | 그래프·데이터 흐름 중심 |
| 통계적 검정 | 강함 | 상대적으로 약함 |
| 머신러닝 모델 비교 | 제한적 | 여러 모델을 연결·비교하기 편리 |
| 학생 입문 | 통계 해석 학습에 좋음 | 분석 과정 이해에 좋음 |
| 코딩 | 거의 필요 없음 | 거의 필요 없음 |
SPSS와 Orange 모두 PCA를 수행할 수 있습니다. 다만 결과를 보는 방식이 다릅니다.
SPSS에서는 보통 다음과 같은 흐름으로 이해할 수 있습니다.
데이터 → 차원축소/요인분석 → PCA 선택 → 고유값·설명분산·성분행렬 확인
Orange에서는 위젯을 연결하여 분석 흐름을 직접 확인합니다.
File → PCA → Scatter Plot
즉, Orange에서는 원래 변수 → PC1·PC2 생성 → 2차원으로 투영된 데이터의 흐름을 눈으로 확인하기 쉽습니다.
SPSS에서는 K-means를 실행한 뒤 군집 중심값, 각 사례의 군집번호, 관련 통계표 등을 중심으로 결과를 해석하는 성격이 강합니다.
Orange에서는 다음처럼 위젯을 연결할 수 있습니다.
Data → K-Means → Scatter Plot
그리고 각 관측치가 어느 군집에 속했는지 시각적으로 확인하기가 편합니다.
따라서 PCA와 군집분석을 이미 SPSS로 할 수 있는데 Orange를 또 배우는 이유는 새로운 분석법을 배우기 위해서라기보다 머신러닝의 전체 흐름을 시각적으로 이해하기 위해서라고 설명하는 것이 정확합니다.
| SPSS에서 주로 강조하기 좋은 것 | Orange에서 주로 강조하기 좋은 것 |
|---|---|
|
기술통계 t-test / ANOVA 회귀분석 요인분석·PCA 설문조사 연구 |
데이터 불러오기 전처리 PCA·군집 분류·예측 여러 머신러닝 모델 비교 시각화 |
Orange의 시각적 프로그래밍, 위젯 기반 워크플로, 머신러닝·데이터마이닝·시각화 기능에 대한 기본 설명은 위 두 자료를 참고해 정리했습니다.