Langsung ke konten utama

AI

Mengapa agen AI yang berhadapan dengan pelanggan membutuhkan model fallback

Penyedia model mengalami gangguan selama satu jam dan agen WhatsApp Anda terdiam saat pelanggan menunggu. Model fallback adalah asuransi termurah untuk situasi itu. Berikut cara kerja fallback, cara memilihnya, dan bagaimana ia berpadu dengan model cepat dan anggaran.

Tim MonoChat Diperbarui: 5 menit baca

Di halaman ini
  1. Mengapa kegagalan model lebih merugikan dalam percakapan pelanggan
  2. Apa saja yang dapat salah
  3. Cara kerja fallback dalam agen
  4. Cara memilih model fallback
  5. Model cepat: separuh lainnya dari keandalan
  6. Anggaran: jaring pengaman di bawah jaring pengaman
  7. Fallback bukan serah terima
  8. Daftar periksa sederhana
  9. Siapkan sekali, untuk setiap kanal

Agen AI yang berhadapan dengan pelanggan membutuhkan model fallback karena setiap model pada akhirnya akan gagal di saat yang paling tidak tepat: penyedia mengalami gangguan, akun Anda mencapai rate limit, sebuah permintaan habis waktu, atau satu percakapan yang tidak biasa menghabiskan token lebih banyak dari rencana. Tanpa fallback, agen terdiam dan pelanggan menunggu. Dengan fallback, model kedua mengambil alih dan percakapan berlanjut. Di Agent Harness MonoChat, setiap node AI Agent memiliki model utama, model fallback, dan model cepat, ditambah batas anggaran per proses.

Artikel ini menjelaskan mengapa kegagalan model lebih berdampak pada pesan pelanggan dibanding di tempat lain, bagaimana fallback bekerja, cara memilih model fallback, dan bagaimana ia berpadu dengan model cepat, anggaran, dan serah terima ke petugas.

Mengapa kegagalan model lebih merugikan dalam percakapan pelanggan

Pada alat internal, permintaan AI yang gagal hanyalah gangguan kecil: Anda tinggal klik ulang. Dalam percakapan pelanggan di WhatsApp, itu adalah janji yang diingkari. Pelanggan sudah bertanya, melihat centang biru, dan menunggu jawaban.

Beberapa hal membuat pesan pelanggan sangat sensitif:

  • Pelanggan tidak mencoba ulang. Mereka menulis lagi dengan lebih kesal, atau pergi.
  • Lalu lintas berfluktuasi tajam. Kampanye, keterlambatan pengiriman, atau promo dapat melipatgandakan percakapan dalam hitungan menit, dan saat itulah rate limit terasa.
  • Agen melakukan banyak panggilan. Agent harness menjalankan model dalam siklus, sering kali beberapa kali per pesan pelanggan. Satu panggilan yang gagal dapat menghentikan seluruh proses.
  • Waktu penting di WhatsApp. Balasan bebas hanya diizinkan dalam 24 jam setelah pesan terakhir pelanggan. Hambatan yang lama dapat mendorong balasan keluar dari jendela tersebut, sehingga Anda memerlukan template yang disetujui.

Semua ini bukan soal penyedia tertentu yang tidak andal. Setiap penyedia mengalami insiden, pemeliharaan, dan batas kapasitas. Pertanyaannya hanya apakah agen Anda punya rencana untuk menghadapinya.

Apa saja yang dapat salah

Gangguan penyedia. Sebagian atau total, singkat atau lama. Bahkan ketersediaan bulanan 99,9% masih memungkinkan lebih dari 40 menit downtime.

Rate limit. Akun Anda mungkin hanya mengizinkan sejumlah permintaan atau token per menit. Satu jam yang sibuk dapat mencapai batas itu meskipun penyedianya sendiri baik-baik saja.

Timeout dan respons lambat. Model yang biasanya menjawab dalam dua detik bisa memerlukan dua puluh detik saat beban tinggi. Bagi pelanggan di ponsel, rasanya seperti tidak ada yang terjadi.

Proses yang lepas kendali. Agen yang berputar-putar pada permintaan yang membingungkan, atau percakapan yang terus memanjang, dapat memakai jauh lebih banyak dari proses normal.

Perubahan model. Penyedia memperbarui dan menghentikan model. Perilaku yang Anda andalkan dapat berubah tanpa banyak peringatan.

Cara kerja fallback dalam agen

Idenya sederhana: saat model utama tidak dapat menyelesaikan tugas, model kedua mengambil alih. Di MonoChat, model fallback mengambil alih setelah batas lunak tercapai atau saat model utama gagal. Percakapan, alat, dan instruksi tetap sama; hanya model yang mengerjakannya yang berganti.

Tiga peran bekerja bersama di setiap node AI Agent:

PeranFungsi
Model utamaBernalar, memutuskan, dan menulis balasan
Model fallbackMengambil alih setelah batas lunak atau kegagalan
Model cepatMenangani pekerjaan latar belakang

Selain peran tersebut, batas anggaran per proses membatasi pengeluaran satu percakapan.

Cara memilih model fallback

Pilih penyedia yang berbeda

Fallback dari penyedia yang sama melindungi Anda dari satu model yang bermasalah, tetapi tidak dari insiden di seluruh penyedia atau rate limit pada akun Anda di penyedia tersebut. Model dari penyedia kedua mencakup keduanya. MonoChat memungkinkan Anda menghubungkan beberapa penyedia melalui LLM kustom, sehingga ini hanya soal konfigurasi, bukan proyek.

Cukup baik, tidak harus identik

Fallback tidak perlu menjadi model terbaik yang tersedia. Ia perlu mengikuti instruksi Anda, memanggil alat dengan benar, dan menulis balasan yang layak. Uji sendiri dengan percakapan nyata Anda, seolah-olah ia model utama, sebelum Anda mengandalkannya.

Pastikan ia menangani alat Anda

Agen bergantung pada pemanggilan alat: mencari pesanan, memeriksa slot, membuat tiket. Sebagian model jauh lebih baik dalam pemanggilan alat terstruktur dibanding yang lain. Fallback yang menulis teks indah tetapi memanggil alat dengan salah lebih buruk daripada tanpa fallback.

Perhatikan bahasa yang Anda layani

Jika pelanggan Anda menulis dalam bahasa Turki, Arab, atau Spanyol, pastikan fallback menulis bahasa tersebut sebaik model utama. Perubahan kualitas atau nada yang mendadak akan terasa.

Pertimbangkan biaya di kedua arah

Fallback yang lebih murah mengurangi biaya proses panjang atau tidak biasa yang melewati batas lunak. Fallback yang lebih mahal bisa saja tidak masalah jika hanya menangani kegagalan yang jarang. Tentukan tugas apa yang Anda inginkan dari fallback.

Model cepat: separuh lainnya dari keandalan

Tidak setiap langkah membutuhkan model terbaik Anda. Pekerjaan latar belakang, yaitu tugas di sekitar percakapan dan bukan balasan itu sendiri, dapat berjalan di model yang lebih kecil dan lebih cepat. Dengan begitu kapasitas dan anggaran model utama disimpan untuk apa yang benar-benar dilihat pelanggan, dan peluang terkena rate limit pada model utama di jam sibuk berkurang.

Dalam praktiknya: tempatkan model penalaran terkuat Anda sebagai model utama, model andal dari penyedia kedua sebagai fallback, dan model cepat yang murah untuk pekerjaan latar belakang.

Anggaran: jaring pengaman di bawah jaring pengaman

Fallback menjaga agen tetap bekerja. Anggaran menjaganya tetap terjangkau. Batas anggaran per proses berarti tidak ada satu pun percakapan, seaneh apa pun, yang dapat menghabiskan lebih dari yang Anda rencanakan. Dipadukan dengan batas lunak yang setelahnya fallback mengambil alih, Anda mendapatkan pola yang dapat diprediksi: percakapan normal berjalan di model utama, yang panjang berlanjut di fallback, dan tidak ada yang lepas kendali.

Dengan key penyedia Anda sendiri, MonoChat tidak menambahkan markup AI, sehingga yang Anda anggarkan adalah yang ditagih penyedia Anda.

Fallback bukan serah terima

Memang menggoda untuk menganggap model fallback sebagai jawaban untuk semua masalah. Bukan begitu. Fallback menyelesaikan kegagalan teknis: model mati, lambat, atau kehabisan anggaran. Serah terima menyelesaikan masalah penilaian: keluhan, pertanyaan hukum, pengembalian dana di atas batas Anda, atau pelanggan yang memang meminta petugas.

Di MonoChat, agen berjalan di dalam alur, sehingga serah terima ke inbox tim bersama Anda dengan riwayat lengkap selalu tersedia. WhatsApp juga mengharapkan balasan otomatis menyediakan jalur yang jelas ke petugas. Rancang kedua jalur:

  1. Model utama gagal atau mencapai batas lunak → model fallback melanjutkan.
  2. Kasus membutuhkan petugas → serah terima ke tim yang tepat beserta riwayat percakapan.
  3. Keduanya gagal → alur memberi tahu pelanggan bahwa petugas akan membalas, dan mengarahkan percakapan ke inbox.

Daftar periksa sederhana

  • Model utama dipilih berdasarkan kualitas pada percakapan nyata Anda.
  • Model fallback dari penyedia kedua, diuji sendiri dengan alat dan bahasa Anda.
  • Model cepat untuk pekerjaan latar belakang.
  • Batas anggaran per proses yang sesuai dengan biaya percakapan normal Anda dengan sedikit ruang cadangan.
  • Aturan serah terima yang jelas dalam instruksi agen dan dalam alur.
  • Tinjauan terhadap sampel percakapan setelah minggu pertama, termasuk yang berjalan di fallback.

Siapkan sekali, untuk setiap kanal

Karena node AI Agent berada di dalam alur MonoChat, model utama, fallback, dan cepat yang sama melindungi agen Anda di WhatsApp, Instagram, Messenger, TikTok, Telegram, web chat, SMS, dan suara. Dan karena Agent Harness memungkinkan Anda memilih framework, pendekatan yang sama berlaku baik agen Anda berjalan di harness bawaan MonoChat, Claude Agent SDK, OpenAI Agents SDK, Pi, maupun framework Anda sendiri.

Lihat bagaimana peran-peran model saling melengkapi di halaman Agent Harness.

FAQ

Pertanyaan yang sering diajukan

Apa itu model fallback dalam agen AI?

Model fallback adalah model kedua yang mengambil alih saat model utama tidak dapat menyelesaikan tugas, misalnya karena penyedia mengembalikan error, rate limit tercapai, atau batas lunak pada proses terlampaui. Model ini menjaga percakapan tetap berjalan sehingga pelanggan tidak dibiarkan tanpa balasan.

Haruskah model fallback berasal dari penyedia yang berbeda?

Sering kali, ya. Fallback dari penyedia yang sama melindungi dari masalah pada satu model, tetapi tidak dari gangguan di seluruh penyedia atau rate limit pada akun Anda. Model dari penyedia kedua mencakup keduanya, selama cukup baik untuk tugas agen Anda.

Apa perbedaan antara model fallback dan model cepat?

Model fallback menggantikan model utama saat model utama gagal atau mencapai batas lunak. Model cepat berjalan berdampingan dan menangani pekerjaan latar belakang, sehingga model utama dapat fokus pada percakapan. Di MonoChat, setiap node AI Agent memiliki model utama, fallback, dan cepat.

Apakah model fallback menggantikan serah terima ke petugas?

Tidak. Fallback menjaga agen tetap bekerja saat model gagal. Serah terima memindahkan percakapan ke petugas saat agen sebaiknya tidak menanganinya. Pengaturan yang baik memiliki keduanya: fallback untuk kegagalan teknis, serah terima untuk kasus yang membutuhkan penilaian.

Bagaimana batas anggaran berkaitan dengan model fallback?

Batas anggaran membatasi pengeluaran satu proses. Di MonoChat, model fallback dapat mengambil alih setelah batas lunak, sehingga percakapan yang panjang atau tidak biasa dapat berlanjut di model lain, tidak berhenti dan tidak menumpuk biaya di model utama.

Bulan pertama Growth gratis dari kami

Kelola WhatsApp, Instagram, dan Messenger dari satu inbox

Mulai gratis dengan MonoChat: inbox tim bersama, asisten AI, template, dan kampanye di API resmi Meta.

Satu kode per bisnis • 30 hari untuk menukarkan • Tanpa kartu kredit

$150 untuk memulai.

Klaim