Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more

Ensemble learning dapat menggabungkan beberapa model untuk mengklasifikasikan tumor sebagai benign (jinak) atau malignant (ganas), sementara optimasi model membantu memilih fitur, menyetel parameter, dan menangani ketidakseimbangan kelas. Pada dataset Wisconsin, sejumlah studi melaporkan akurasi benchmark yang sangat tinggi. Namun, hasil tersebut bukan bukti bahwa model siap digunakan untuk mendiagnosis pasien: hasil hanya bermakna bersama dataset dan protokol evaluasinya, dan akurasi saja tidak menunjukkan seberapa sering kasus ganas terlewat.

Dataset Wisconsin yang digunakan dalam studi

UCI Machine Learning Repository mencatat dataset Breast Cancer Wisconsin (Diagnostic), atau WDBC, memiliki 569 kasus, 30 fitur real-valued, dan target diagnosis benign (B) atau malignant (M). Fiturnya dihitung dari citra yang didigitalkan dari aspirasi jarum halus (fine needle aspirate/FNA) massa payudara. Seperti dijelaskan UCI, “Features are computed from a digitized image of a fine needle aspirate (FNA) of a breast mass.”

Fitur mencakup ukuran dan karakteristik tekstur nukleus, antara lain radius, texture, perimeter, area, smoothness, compactness, concavity, concave points, symmetry, dan fractal dimension. UCI menyatakan dataset ini tidak memiliki nilai hilang. Ini adalah data fitur terstruktur yang berasal dari citra FNA, bukan kumpulan citra mamografi atau citra histopatologi untuk melatih model visi komputer. Lihat metadata dataset WDBC di UCI.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Nama WDBC dan WBCD (Wisconsin Breast Cancer Database) tidak boleh dianggap otomatis menunjuk data atau protokol yang sama. Studi dapat memakai varian dataset, pemrosesan, pembagian data, dan definisi metrik yang berbeda. Karena itu, angka hasil hanya layak dibandingkan setelah dataset dan cara evaluasinya jelas.

Bagaimana ensemble learning bekerja?

Ensemble menggabungkan keluaran beberapa classifier untuk menghasilkan prediksi akhir. Pada hard atau majority voting, setiap model memberikan kelas pilihannya dan kelas dengan suara terbanyak menang. Pada soft voting, keluaran probabilitas model digabungkan untuk menentukan kelas. Stacking memakai prediksi atau keluaran model dasar sebagai masukan bagi model tingkat berikutnya.

Keuntungan potensialnya adalah keputusan akhir tidak bergantung pada satu classifier saja. Tetapi penggabungan model tidak dengan sendirinya menjamin prediksi lebih baik. Hasil bergantung pada model yang dipilih, cara menggabungkan prediksi, data pelatihan, dan protokol validasi.

Hasil studi: baca angka bersama protokolnya

Angka berikut berasal dari eksperimen yang berbeda. Perbedaan dataset, pembagian data, validasi, dan optimasi berarti angka-angka ini bukan peringkat head-to-head.

Free tools Windows power users keep installed

One-click scans. No signup required.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
Studi dan dataset Metode dan evaluasi yang dilaporkan Hasil yang dilaporkan
Alickovic dan rekan, 2020; WBCD Memilih regresi logistik sederhana, SVM dengan stochastic gradient descent (SVM-SGD), dan multilayer perceptron (MLP) berdasarkan F3; membandingkan majority voting dengan beberapa soft-voting. Evaluasi mencakup split 70:30 dan 10-fold cross-validation. Majority voting mencapai akurasi 99.42% pada split 70:30 dan 98.77% pada 10-fold cross-validation. Kedua angka merupakan hasil eksperimen tersebut.
Studi ensemble multi-model, 2023; WDBC Stacking; abstrak melaporkan rata-rata akurasi. Akurasi rata-rata 99.89% menurut abstrak. Nilai sensitivitas di abstrak tampak tidak konsisten dengan rentang yang lazim, sehingga tidak digunakan di sini.
Studi FS-WOA-Stacking, 2024; WBCD dan WDBC Seleksi fitur dan whale optimization untuk penyetelan hyperparameter sebelum stacking. Akurasi skenario terbaik yang dilaporkan penulis: 99.56% pada WBCD dan 99.65% pada WDBC. Ini hasil studi tersebut, bukan bukti keunggulan umum terhadap metode lain.
Studi imbalance-aware, 2026; WDBC Baseline, SMOTE, ADASYN, dan cost-sensitive learning diuji pada beberapa model tunggal dan ensemble. Menggunakan stratified 10-fold cross-validation; resampling dibatasi pada train fold. Pada distribusi asli dataset, soft-voting ensemble dengan classifier yang diseimbangkan SMOTE melaporkan F1 0.9880 dan MCC 0.9812.

Untuk membaca hasil majority voting 2020 dan rincian metode, lihat artikel Alickovic dan rekan di Journal of Imaging. Untuk angka stacking 2023, lihat studi ensemble multi-model di PubMed Central. Rincian studi imbalance-aware 2026 tersedia di artikel Intelligence-Based Medicine. Hasil FS-WOA-Stacking dibahas dalam studi tahun 2024.

Apa yang dimaksud optimasi model?

Optimasi bukan satu langkah tunggal. Dalam klasifikasi ini, istilah tersebut dapat mencakup pemilihan fitur, penyetelan hyperparameter, dan penanganan ketidakseimbangan kelas. Tiap langkah mengubah pertanyaan evaluasi dan harus dilakukan tanpa menggunakan informasi dari data uji.

Pemilihan fitur

Seleksi fitur mengurangi atau memilih variabel masukan yang digunakan model. Studi FS-WOA-Stacking menggabungkan seleksi fitur dengan whale optimization untuk penyetelan parameter sebelum stacking. Untuk menilai pendekatan semacam ini, laporkan fitur yang dipilih, metode seleksi, dan apakah seleksi dilakukan hanya pada data pelatihan dalam setiap fold. Jika fitur dipilih memakai seluruh dataset sebelum validasi, informasi dari fold uji dapat bocor ke proses pemodelan.

Dalam studi imbalance-aware 2026, worst area, perimeter, dan concave points disebut sebagai indikator penting berdasarkan SHAP dan permutation analysis. Interpretasi ini menjelaskan kontribusi fitur pada model dan dataset studi tersebut; bukan bukti bahwa ketiga fitur dapat menggantikan penilaian klinis.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Penyetelan hyperparameter

Hyperparameter mengendalikan perilaku pelatihan model. Supaya hasil dapat ditafsirkan, laporan perlu menyebutkan ruang parameter, metode pencarian, protokol validasi, serta pemisahan data yang digunakan untuk memilih konfigurasi. Data uji akhir sebaiknya tidak dipakai untuk memilih parameter atau memutuskan model mana yang dilaporkan sebagai pemenang.

Penanganan ketidakseimbangan kelas

Jika jumlah kasus pada tiap kelas berbeda, model dapat tampak baik pada akurasi sambil kurang mengenali kelas yang lebih jarang. Metode seperti SMOTE, ADASYN, atau cost-sensitive learning menangani masalah ini dengan cara berbeda. Pada oversampling, sampel sintetis hanya boleh dibuat dari bagian training di dalam tiap fold setelah pemisahan fold; membuat sampel sebelum train/test split berisiko membocorkan informasi ke data evaluasi.

Studi imbalance-aware 2026 menggunakan stratified 10-fold cross-validation dan membatasi resampling pada train fold. Protokol ini penting ketika menafsirkan hasil F1 dan MCC yang dilaporkan, bukan sekadar detail implementasi.

Metrik apa yang perlu dilaporkan selain akurasi?

Akurasi adalah proporsi seluruh prediksi yang benar, tetapi tidak menjelaskan jenis kesalahan. Dalam konteks klasifikasi tumor, false negative berarti kasus malignant diklasifikasikan sebagai benign. Sensitivitas atau recall mengukur proporsi kasus positif yang berhasil ditemukan; karena itu, angka ini membantu menjawab seberapa banyak kasus ganas yang mungkin terlewat dalam evaluasi.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
  • Sensitivitas/recall: proporsi kasus malignant yang terdeteksi. Laporkan bersama jumlah atau proporsi false negative.
  • Specificity: proporsi kasus benign yang dikenali sebagai benign.
  • Precision: proporsi prediksi malignant yang memang malignant.
  • F1, F2, dan F3: ukuran gabungan precision dan recall; F2 dan terutama F3 memberi bobot lebih besar pada recall.
  • ROC-AUC atau PR-AUC: dapat membantu menilai pemisahan kelas di berbagai ambang, dengan PR-AUC khususnya relevan ketika kelas tidak seimbang.
  • MCC, balanced accuracy, dan kalibrasi: memberi sudut pandang tambahan tentang kualitas klasifikasi dan probabilitas yang dihasilkan. Studi imbalance-aware 2026 memasukkan Brier score dalam sepuluh ukuran evaluasinya.

Alickovic dan rekan menulis bahwa “it is important to evaluate the performance based on f-measures (e.g., F2, F3) that weigh recall more than precision.” Pemilihan metrik tetap harus mengikuti tujuan dan konsekuensi kesalahan: ambang yang mengutamakan sensitivitas dapat menghasilkan lebih banyak false positive, sementara ambang yang lebih ketat dapat melewatkan lebih banyak kasus positif. Ambang keputusan dan biaya kesalahan perlu ditetapkan sesuai konteks penggunaan, bukan dipilih hanya untuk memaksimalkan satu skor.

Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Support on Ko-Fi

Bagaimana mengevaluasi model tanpa membuat perbandingan menyesatkan?

  1. Tetapkan dataset dan target. Sebutkan apakah yang digunakan WDBC atau WBCD, jumlah kasus, fitur, definisi kelas positif, serta pemrosesan yang diterapkan.
  2. Tentukan protokol sebelum melihat hasil. Nyatakan holdout atau cross-validation, jumlah fold, stratifikasi, dan ukuran tiap kelas. Pada dataset berisi 569 kasus, hasil dapat sensitif terhadap kasus yang masuk ke tiap bagian.
  3. Masukkan seluruh optimasi ke dalam data training. Seleksi fitur, pencarian hyperparameter, dan resampling harus dilakukan tanpa menyentuh fold uji. Jika memungkinkan, gunakan validasi bertingkat agar pemilihan model dan estimasi akhir terpisah.
  4. Laporkan kesalahan dan beberapa metrik. Sertakan confusion matrix, sensitivitas, specificity, precision, F1/F2/F3, serta metrik tambahan yang sesuai seperti MCC, AUC, balanced accuracy, dan kalibrasi.
  5. Bandingkan kandidat pada fold yang sama. Jangan menyimpulkan bahwa model dengan angka tertinggi dari makalah berbeda adalah pemenang jika dataset, split, tuning, atau metriknya berbeda.

Apakah akurasi benchmark membuktikan model siap untuk klinik?

Tidak. Akurasi yang tinggi pada dataset publik berukuran 569 kasus menunjukkan performa pada benchmark dan protokol studi tersebut. Sumber yang dibahas di sini tidak menetapkan validasi prospektif atau generalisasi klinis. Skor benchmark juga tidak menunjukkan dengan sendirinya bagaimana model bekerja pada populasi, prosedur pengambilan sampel, atau alur kerja yang berbeda.

Karena itu, hasil klasifikasi WDBC/WBCD tidak membuktikan manfaat bagi pasien dan tidak menggantikan diagnosis dokter. Klaim kesiapan klinis memerlukan bukti evaluasi yang sesuai dengan penggunaan nyata, termasuk penilaian kesalahan dan ambang keputusan pada konteks tersebut.

Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.