Anda perlu konsultan machine learning saat tiga hal ada bersamaan: data berlabel dari masa lalu, satu keputusan yang Anda ulang terus-menerus, dan biaya yang terukur ketika keputusan itu salah.

Kondisi: ketiga hal itu harus ada sekaligus. Dua dari tiga belum membuat proyek model masuk akal.

Batas: kalau masalah Anda adalah proses manual yang lambat, Anda butuh konsultan alur kerja AI, bukan model baru. Saya menulis artikel ini karena separuh permintaan yang masuk ke meja saya bukan masalah machine learning. Itu pengamatan saya, bukan angka terukur.

Ringkas: gejala Anda dan apa yang Anda butuhkan

Mulai dari gejala, bukan dari teknologi. Cari baris yang paling mirip dengan keadaan Anda sekarang.

GejalaYang Anda butuhkanKenapa
Tim menyalin data antar aplikasi setiap hariAudit alur kerja AITidak ada prediksi di sini. Hanya pekerjaan pindah tangan.
Anda menebak stok minggu depan dari catatan 3 tahunKonsultan machine learningAda label, keputusan berulang, dan biaya salah yang jelas.
Balasan chat pelanggan lambat di luar jam kerjaAgen AI dengan skrip jawabanJawabannya sudah ada. Yang kurang kecepatan.
Data pesanan tersebar di 5 berkas ExcelPembenahan pipa dataModel apa pun gagal tanpa satu sumber angka.
Anda ingin tahu pelanggan mana akan berhentiKonsultan machine learningRiwayat pelanggan bisa diberi label berhenti atau bertahan.
Formulir pesanan salah isi terusPerbaikan formulir dan aturan validasiAturan sederhana menutup kasus ini tanpa model.

Kapan Anda perlu konsultan machine learning

Machine learning adalah program yang belajar pola dari contoh. Anda tidak menulis aturannya. Anda menyodorkan ribuan contoh masa lalu, lalu program menyusun aturannya sendiri.

Analoginya begini. Kasir baru bisa Anda ajari dengan dua cara. Cara pertama, Anda tulis buku aturan harga. Cara kedua, Anda tunjukkan 5.000 struk lama dan biarkan dia menangkap polanya. Machine learning adalah cara kedua.

Dari cara kerja itu muncul satu syarat keras. Dokumentasi scikit-learn menjelaskan bahwa metode fit menerima dua masukan: matriks contoh X dan nilai target y. Untuk tugas tanpa pengawasan, y tidak perlu diisi. Artinya, prediksi memerlukan kolom jawaban yang sudah terjadi. Kolom itu yang disebut label.

Diagram keputusan tiga pertanyaan: ada data berlabel, ada keputusan berulang, ada biaya kesalahan, berakhir di kotak konsultan ML atau kotak audit alur kerja AI
Diagram keputusan yang saya pakai di rapat awal. Tiga syarat disusun dari cara kerja fit(X, y) pada dokumentasi scikit-learn.

Tiga syarat itu saya urutkan begini:

  • Data berlabel. Anda punya kolom hasil untuk kejadian masa lalu. Contoh: pesanan ini akhirnya batal, pelanggan ini akhirnya berhenti.
  • Keputusan berulang. Keputusan yang sama muncul harian atau mingguan. Keputusan sekali setahun tidak layak dilatih.
  • Biaya kesalahan terukur. Anda bisa menyebut satuan ruginya: rupiah, jam kerja, atau pelanggan hilang.

Jika satu syarat kosong, hentikan dulu. Isi syarat itu lebih dahulu, dan biayanya lebih kecil daripada proyek model.

Kapan masalah Anda sebenarnya soal alur kerja

Banyak permintaan yang datang dengan kata machine learning sebenarnya minta tiga hal lain. Saya sebut ketiganya begini.

Agen. Program yang membaca pesan masuk, mengambil data dari satu tempat, lalu menulis balasan atau catatan. Tidak ada prediksi baru di dalamnya.

Aturan. Satu logika if-then yang ditulis manusia. Kalau nilai pesanan di atas batas, minta persetujuan. Aturan menang saat polanya sudah Anda ketahui.

Formulir yang lebih baik. Data kotor sering lahir di titik masuknya. Perbaiki isian, validasi, dan pilihan tetap, lalu separuh keluhan hilang.

Kalau Anda belum yakin masuk kategori mana, mulai dari audit alur kerja AI. Langkah itu lebih murah daripada proyek model, dan hasilnya memberi tahu Anda apakah model memang diperlukan. Untuk menghitung beban biaya per pekerjaan, baca biaya AI per task operasional.

Biaya nyata proyek machine learning: waktu dan data

Pelatihan model bukan bagian terlama. Bagian terlama adalah menyiapkan data dan memastikan labelnya benar. Tabel di bawah adalah perkiraan kasar untuk menata harapan, bukan hasil pengukuran.

TahapPerkiraan porsi waktuYang Anda siapkan
Definisi keputusan dan label15 persenSatu kalimat keputusan dan definisi label
Pengumpulan dan pembersihan data45 persenAkses sistem sumber dan orang yang paham datanya
Pelatihan dan pengujian model15 persenAngka dasar dan data uji terpisah
Pemasangan ke alur kerja15 persenOrang yang memakai hasil prediksi
Pemantauan setelah hidup10 persenPemilik yang membaca laporan bulanan
Dua kartu garis waktu berdampingan: proyek model dengan 5 tahap dari definisi label sampai pantau, dan proyek alur kerja dengan 3 tahap petakan, bangun, serah
Urutan tahap proyek model dibanding proyek alur kerja. Kartu menandai dirinya sebagai perkiraan untuk menata harapan, bukan hasil pengukuran.

Perbedaan pentingnya bukan panjang waktunya saja. Proyek alur kerja berhenti saat pekerjaan selesai. Proyek model tidak pernah benar-benar berhenti, karena data baru terus masuk.

Empat pertanyaan sebelum Anda tanda tangan

Ajukan empat pertanyaan ini pada pertemuan pertama. Jawabannya memisahkan orang yang pernah memasang model di produksi dari orang yang baru membaca tentangnya.

Pertama: angka dasar mana yang akan kita kalahkan? Panduan evaluasi model scikit-learn menyebut dummy estimator berguna untuk mendapat nilai dasar dari prediksi acak. Tanpa angka dasar, akurasi 85 persen tidak berarti apa pun.

Kedua: data uji mana yang tidak pernah dipakai melatih? Dokumentasi cross-validation scikit-learn menyatakan bahwa melatih dan menguji pada data yang sama adalah kekeliruan metode, dan kondisi itu disebut overfitting. Praktik umumnya menyisihkan sebagian data sebagai data uji.

Ketiga: bagaimana kita tahu model melemah enam bulan nanti? Panduan MLOps Google Cloud menulis bahwa model bisa turun kinerjanya karena profil data terus berubah, sehingga Anda perlu melacak statistik ringkas data dan memantau kinerja daring untuk mengirim notifikasi atau melakukan rollback.

Keempat: siapa memegang data, model, dan kodenya setelah proyek selesai? Tulis jawabannya di kontrak, bukan di catatan rapat.

Tanda bahaya yang layak membatalkan kontrak

Empat tanda ini muncul sebelum uang berpindah. Semuanya bisa Anda deteksi tanpa latar belakang teknis.

Tanda bahayaArtinyaKalimat balasan Anda
Menjanjikan akurasi sebelum melihat dataAngka itu tebakan penjualanLihat data dulu, lalu beri kisaran
Tidak menyebut angka dasarHasil model tidak bisa dinilaiBerapa nilai dari tebakan acak?
Tidak memisahkan data ujiSkor latihan dilaporkan sebagai hasilTunjukkan skor pada data yang belum pernah dilihat
Tidak ada rencana pemantauanModel dianggap selesai saat dikirimSiapa yang membaca laporan bulan ketujuh?

Pemantauan itu bukan gagasan saya sendiri. Layanan Amazon SageMaker Model Monitor menyebut empat jenis pemantauan: drift kualitas data, drift kualitas model, drift bias, dan drift atribusi fitur. Penyedia besar membangun alat khusus untuk masalah ini. Konsultan yang melewatinya sedang melewati bagian yang mahal.

Simulasi dengan data karangan: 5.000 baris pesanan

Angka di bawah adalah simulasi dengan data karangan. Tujuannya menunjukkan urutan kerja, bukan hasil klien.

Kondisi awal. Sebuah toko onderdil daring menerima 40 pesanan per hari. Dari pengalaman pemiliknya, sebagian pesanan berakhir batal setelah barang dikemas.

Masukan. 5.000 baris pesanan dua tahun terakhir. Setiap baris punya kolom status akhir: selesai atau batal. Kolom itu labelnya.

Langkah. Pertama, hitung angka dasar: tebak semua pesanan selesai, lalu catat berapa persen benar. Kedua, sisihkan 1.000 baris terakhir sebagai data uji dan jangan sentuh. Ketiga, latih model pada 4.000 baris sisanya. Keempat, uji pada 1.000 baris yang disisihkan.

Keluaran yang bisa dilihat. Dua angka berdampingan pada satu tabel: skor angka dasar dan skor model pada data uji. Selisihnya yang Anda beli.

Keputusan. Kalau selisihnya kecil, batalkan proyek model dan perbaiki formulir pemesanan. Kalau selisihnya besar, hitung nilainya: berapa pengemasan yang bisa ditunda sebelum barang keluar gudang. Hanya setelah hitungan itu, bicarakan pemasangan.

Checklist sebelum Anda menghubungi konsultan

  1. Tulis keputusan yang mau Anda otomatiskan dalam satu kalimat.
  2. Sebut berapa kali keputusan itu muncul per minggu.
  3. Tunjuk kolom label pada data Anda, lengkap dengan nama berkasnya.
  4. Hitung biaya satu kesalahan dalam satuan yang Anda pakai sehari-hari.
  5. Catat di mana data itu tinggal sekarang dan siapa yang bisa membukanya.
  6. Tetapkan angka dasar hari ini, walaupun angka dasar itu tebakan manual staf Anda.
  7. Tentukan siapa yang akan memakai hasil prediksi pada pekerjaannya.
  8. Siapkan satu pertanyaan penutup: apa yang membuat proyek ini dinyatakan gagal?

Batas kami, ditulis terus terang

Rama Digital tidak menjual riset machine learning dan tidak melatih model. Pekerjaan kami ada di tiga area: AI terapan, operasi agen, dan pembenahan pipa data.

Artinya begini. Kalau kasus Anda memang butuh model terlatih, saya katakan apa adanya pada pertemuan pertama. Setelah itu saya bantu Anda menyusun lingkupnya: definisi label, syarat data, angka dasar, dan pertanyaan untuk calon tim pemodelan. Anda tetap merekrut tim itu dari pihak lain.

Banyak kasus berhenti sebelum tahap itu, dan itu kabar baik untuk anggaran Anda. Kalau Anda ingin urutan langkah tiga bulan pertama, baca rencana transformasi AI perusahaan 90 hari.

Siap membedah kasus Anda sendiri? Bawa satu keputusan dan satu berkas data ke layanan konsultasi AI. Kami mulai dari gejala, lalu menentukan apakah Anda perlu model atau tidak.

Tanya jawab

Apa bedanya konsultan machine learning dan konsultan AI? Konsultan machine learning membangun model prediksi dari data berlabel Anda. Konsultan AI memasang alat yang sudah ada pada alur kerja Anda, termasuk model bahasa dan agen.

Berapa banyak data yang saya perlukan sebelum melatih model? Jumlahnya bergantung pada jumlah kolom dan seberapa jarang kejadian yang Anda prediksi. Minta calon konsultan melihat data Anda lebih dahulu, lalu memberi kisaran, bukan angka pasti.

Apakah saya bisa memakai model bahasa saja tanpa melatih model? Sering bisa, khususnya untuk membaca teks, merangkum, dan mengarahkan pesan. Model bahasa lemah untuk prediksi angka yang bergantung pada data internal Anda.

Apa itu drift dan kenapa saya perlu peduli? Drift adalah perubahan pola data setelah model hidup, misalnya harga naik atau pelanggan berganti. Panduan MLOps Google Cloud menyebut kinerja model bisa turun karena profil data terus berubah, jadi pemantauan harus masuk anggaran.

Kenapa konsultan menolak menjanjikan akurasi di awal? Akurasi bergantung pada isi data yang belum dia lihat. Janji angka sebelum peninjauan data adalah janji penjualan, bukan perkiraan teknis.

Langkah pertama apa yang paling murah? Tetapkan angka dasar manual minggu ini. Catat seberapa sering tebakan staf Anda benar, lalu pakai angka itu sebagai pembanding pada setiap penawaran.

Sumber

  • scikit-learn, Getting Started - menjelaskan bahwa fit menerima matriks contoh X dan nilai target y, dan y tidak diperlukan pada tugas tanpa pengawasan.
  • scikit-learn, Cross-validation - menyatakan melatih dan menguji pada data yang sama adalah kekeliruan metode, dan menyarankan menyisihkan data uji.
  • scikit-learn, Metrics and scoring - menyebut dummy estimator berguna untuk mendapat nilai dasar dari prediksi acak.
  • Google Cloud, MLOps - menulis bahwa model bisa turun kinerjanya karena profil data berubah, sehingga statistik data dan kinerja daring perlu dipantau.
  • Amazon SageMaker Model Monitor - menyebut empat jenis pemantauan: drift kualitas data, drift kualitas model, drift bias, dan drift atribusi fitur.