AI
Mengapa agen AI yang berhadapan dengan pelanggan membutuhkan model fallback
Penyedia model mengalami gangguan selama satu jam dan agen WhatsApp Anda terdiam saat pelanggan menunggu. Model fallback adalah asuransi termurah untuk situasi itu. Berikut cara kerja fallback, cara memilihnya, dan bagaimana ia berpadu dengan model cepat dan anggaran.
Tim MonoChat Diperbarui: 5 menit baca
Di halaman ini
- Mengapa kegagalan model lebih merugikan dalam percakapan pelanggan
- Apa saja yang dapat salah
- Cara kerja fallback dalam agen
- Cara memilih model fallback
- Model cepat: separuh lainnya dari keandalan
- Anggaran: jaring pengaman di bawah jaring pengaman
- Fallback bukan serah terima
- Daftar periksa sederhana
- Siapkan sekali, untuk setiap kanal
Agen AI yang berhadapan dengan pelanggan membutuhkan model fallback karena setiap model pada akhirnya akan gagal di saat yang paling tidak tepat: penyedia mengalami gangguan, akun Anda mencapai rate limit, sebuah permintaan habis waktu, atau satu percakapan yang tidak biasa menghabiskan token lebih banyak dari rencana. Tanpa fallback, agen terdiam dan pelanggan menunggu. Dengan fallback, model kedua mengambil alih dan percakapan berlanjut. Di Agent Harness MonoChat, setiap node AI Agent memiliki model utama, model fallback, dan model cepat, ditambah batas anggaran per proses.
Artikel ini menjelaskan mengapa kegagalan model lebih berdampak pada pesan pelanggan dibanding di tempat lain, bagaimana fallback bekerja, cara memilih model fallback, dan bagaimana ia berpadu dengan model cepat, anggaran, dan serah terima ke petugas.
Mengapa kegagalan model lebih merugikan dalam percakapan pelanggan
Pada alat internal, permintaan AI yang gagal hanyalah gangguan kecil: Anda tinggal klik ulang. Dalam percakapan pelanggan di WhatsApp, itu adalah janji yang diingkari. Pelanggan sudah bertanya, melihat centang biru, dan menunggu jawaban.
Beberapa hal membuat pesan pelanggan sangat sensitif:
- Pelanggan tidak mencoba ulang. Mereka menulis lagi dengan lebih kesal, atau pergi.
- Lalu lintas berfluktuasi tajam. Kampanye, keterlambatan pengiriman, atau promo dapat melipatgandakan percakapan dalam hitungan menit, dan saat itulah rate limit terasa.
- Agen melakukan banyak panggilan. Agent harness menjalankan model dalam siklus, sering kali beberapa kali per pesan pelanggan. Satu panggilan yang gagal dapat menghentikan seluruh proses.
- Waktu penting di WhatsApp. Balasan bebas hanya diizinkan dalam 24 jam setelah pesan terakhir pelanggan. Hambatan yang lama dapat mendorong balasan keluar dari jendela tersebut, sehingga Anda memerlukan template yang disetujui.
Semua ini bukan soal penyedia tertentu yang tidak andal. Setiap penyedia mengalami insiden, pemeliharaan, dan batas kapasitas. Pertanyaannya hanya apakah agen Anda punya rencana untuk menghadapinya.
Apa saja yang dapat salah
Gangguan penyedia. Sebagian atau total, singkat atau lama. Bahkan ketersediaan bulanan 99,9% masih memungkinkan lebih dari 40 menit downtime.
Rate limit. Akun Anda mungkin hanya mengizinkan sejumlah permintaan atau token per menit. Satu jam yang sibuk dapat mencapai batas itu meskipun penyedianya sendiri baik-baik saja.
Timeout dan respons lambat. Model yang biasanya menjawab dalam dua detik bisa memerlukan dua puluh detik saat beban tinggi. Bagi pelanggan di ponsel, rasanya seperti tidak ada yang terjadi.
Proses yang lepas kendali. Agen yang berputar-putar pada permintaan yang membingungkan, atau percakapan yang terus memanjang, dapat memakai jauh lebih banyak dari proses normal.
Perubahan model. Penyedia memperbarui dan menghentikan model. Perilaku yang Anda andalkan dapat berubah tanpa banyak peringatan.
Cara kerja fallback dalam agen
Idenya sederhana: saat model utama tidak dapat menyelesaikan tugas, model kedua mengambil alih. Di MonoChat, model fallback mengambil alih setelah batas lunak tercapai atau saat model utama gagal. Percakapan, alat, dan instruksi tetap sama; hanya model yang mengerjakannya yang berganti.
Tiga peran bekerja bersama di setiap node AI Agent:
| Peran | Fungsi |
|---|---|
| Model utama | Bernalar, memutuskan, dan menulis balasan |
| Model fallback | Mengambil alih setelah batas lunak atau kegagalan |
| Model cepat | Menangani pekerjaan latar belakang |
Selain peran tersebut, batas anggaran per proses membatasi pengeluaran satu percakapan.
Cara memilih model fallback
Pilih penyedia yang berbeda
Fallback dari penyedia yang sama melindungi Anda dari satu model yang bermasalah, tetapi tidak dari insiden di seluruh penyedia atau rate limit pada akun Anda di penyedia tersebut. Model dari penyedia kedua mencakup keduanya. MonoChat memungkinkan Anda menghubungkan beberapa penyedia melalui LLM kustom, sehingga ini hanya soal konfigurasi, bukan proyek.
Cukup baik, tidak harus identik
Fallback tidak perlu menjadi model terbaik yang tersedia. Ia perlu mengikuti instruksi Anda, memanggil alat dengan benar, dan menulis balasan yang layak. Uji sendiri dengan percakapan nyata Anda, seolah-olah ia model utama, sebelum Anda mengandalkannya.
Pastikan ia menangani alat Anda
Agen bergantung pada pemanggilan alat: mencari pesanan, memeriksa slot, membuat tiket. Sebagian model jauh lebih baik dalam pemanggilan alat terstruktur dibanding yang lain. Fallback yang menulis teks indah tetapi memanggil alat dengan salah lebih buruk daripada tanpa fallback.
Perhatikan bahasa yang Anda layani
Jika pelanggan Anda menulis dalam bahasa Turki, Arab, atau Spanyol, pastikan fallback menulis bahasa tersebut sebaik model utama. Perubahan kualitas atau nada yang mendadak akan terasa.
Pertimbangkan biaya di kedua arah
Fallback yang lebih murah mengurangi biaya proses panjang atau tidak biasa yang melewati batas lunak. Fallback yang lebih mahal bisa saja tidak masalah jika hanya menangani kegagalan yang jarang. Tentukan tugas apa yang Anda inginkan dari fallback.
Model cepat: separuh lainnya dari keandalan
Tidak setiap langkah membutuhkan model terbaik Anda. Pekerjaan latar belakang, yaitu tugas di sekitar percakapan dan bukan balasan itu sendiri, dapat berjalan di model yang lebih kecil dan lebih cepat. Dengan begitu kapasitas dan anggaran model utama disimpan untuk apa yang benar-benar dilihat pelanggan, dan peluang terkena rate limit pada model utama di jam sibuk berkurang.
Dalam praktiknya: tempatkan model penalaran terkuat Anda sebagai model utama, model andal dari penyedia kedua sebagai fallback, dan model cepat yang murah untuk pekerjaan latar belakang.
Anggaran: jaring pengaman di bawah jaring pengaman
Fallback menjaga agen tetap bekerja. Anggaran menjaganya tetap terjangkau. Batas anggaran per proses berarti tidak ada satu pun percakapan, seaneh apa pun, yang dapat menghabiskan lebih dari yang Anda rencanakan. Dipadukan dengan batas lunak yang setelahnya fallback mengambil alih, Anda mendapatkan pola yang dapat diprediksi: percakapan normal berjalan di model utama, yang panjang berlanjut di fallback, dan tidak ada yang lepas kendali.
Dengan key penyedia Anda sendiri, MonoChat tidak menambahkan markup AI, sehingga yang Anda anggarkan adalah yang ditagih penyedia Anda.
Fallback bukan serah terima
Memang menggoda untuk menganggap model fallback sebagai jawaban untuk semua masalah. Bukan begitu. Fallback menyelesaikan kegagalan teknis: model mati, lambat, atau kehabisan anggaran. Serah terima menyelesaikan masalah penilaian: keluhan, pertanyaan hukum, pengembalian dana di atas batas Anda, atau pelanggan yang memang meminta petugas.
Di MonoChat, agen berjalan di dalam alur, sehingga serah terima ke inbox tim bersama Anda dengan riwayat lengkap selalu tersedia. WhatsApp juga mengharapkan balasan otomatis menyediakan jalur yang jelas ke petugas. Rancang kedua jalur:
- Model utama gagal atau mencapai batas lunak → model fallback melanjutkan.
- Kasus membutuhkan petugas → serah terima ke tim yang tepat beserta riwayat percakapan.
- Keduanya gagal → alur memberi tahu pelanggan bahwa petugas akan membalas, dan mengarahkan percakapan ke inbox.
Daftar periksa sederhana
- Model utama dipilih berdasarkan kualitas pada percakapan nyata Anda.
- Model fallback dari penyedia kedua, diuji sendiri dengan alat dan bahasa Anda.
- Model cepat untuk pekerjaan latar belakang.
- Batas anggaran per proses yang sesuai dengan biaya percakapan normal Anda dengan sedikit ruang cadangan.
- Aturan serah terima yang jelas dalam instruksi agen dan dalam alur.
- Tinjauan terhadap sampel percakapan setelah minggu pertama, termasuk yang berjalan di fallback.
Siapkan sekali, untuk setiap kanal
Karena node AI Agent berada di dalam alur MonoChat, model utama, fallback, dan cepat yang sama melindungi agen Anda di WhatsApp, Instagram, Messenger, TikTok, Telegram, web chat, SMS, dan suara. Dan karena Agent Harness memungkinkan Anda memilih framework, pendekatan yang sama berlaku baik agen Anda berjalan di harness bawaan MonoChat, Claude Agent SDK, OpenAI Agents SDK, Pi, maupun framework Anda sendiri.
Lihat bagaimana peran-peran model saling melengkapi di halaman Agent Harness.
Terapkan dengan MonoChat