Yapay zekâ
Müşteriyle konuşan yapay zekâ ajanınızın neden yedek modele ihtiyacı var
Bir model sağlayıcısı kötü bir saat geçirir ve müşteriler beklerken WhatsApp ajanınız susar. Yedek model, buna karşı en ucuz sigortadır. İşte yedeğin nasıl çalıştığı, nasıl seçileceği ve hızlı modeller ile bütçelerle nasıl bir arada çalıştığı.
MonoChat Ekibi Güncellendi: 5 dk okuma
Bu sayfada
- Model arızaları müşteri konuşmalarında neden daha çok can yakar?
- Neler ters gidebilir?
- Bir ajanda yedek nasıl çalışır?
- Yedek model nasıl seçilir?
- Hızlı model: güvenilirliğin diğer yarısı
- Bütçeler: güvenlik ağının altındaki güvenlik ağı
- Yedek, devir değildir
- Basit bir kontrol listesi
- Bir kez kurun, her kanal için çalışsın
Müşteriyle konuşan bir yapay zekâ ajanının yedek modele ihtiyacı vardır; çünkü her model eninde sonunda en kötü anda başarısız olur: sağlayıcıda kesinti yaşanır, hesabınız bir hız sınırına takılır, bir istek zaman aşımına uğrar ya da sıra dışı tek bir konuşma planlanandan çok daha fazla token harcar. Yedek olmadan ajan susar ve müşteri bekler. Yedek varsa ikinci bir model devralır ve konuşma sürer. MonoChat’in Agent Harness yapısında her AI Agent düğümünün bir ana modeli, bir yedek modeli ve bir hızlı modeli ile çalıştırma başına bir bütçe sınırı vardır.
Bu makale, model arızalarının müşteri mesajlaşmasında neden başka her yerden daha önemli olduğunu, yedeğin nasıl çalıştığını, yedek modelin nasıl seçileceğini ve hızlı modeller, bütçeler ve insana devirle nasıl bir arada çalıştığını anlatıyor.
Model arızaları müşteri konuşmalarında neden daha çok can yakar?
Şirket içi bir araçta başarısız bir yapay zekâ isteği can sıkıcıdır: yeniden dene’ye tıklarsınız. WhatsApp’taki bir müşteri konuşmasında ise tutulmamış bir sözdür. Müşteri bir şey sordu, mavi tikleri gördü ve yanıt bekliyor.
Birkaç şey müşteri mesajlaşmasını özellikle hassas kılar:
- Müşteriler yeniden denemez. Daha da sinirlenerek tekrar yazarlar ya da çekip giderler.
- Trafik dalgalıdır. Bir kampanya, bir teslimat gecikmesi veya bir indirim konuşmaları dakikalar içinde katlayabilir; hız sınırları tam da bu anda devreye girer.
- Ajanlar çok sayıda çağrı yapar. Agent harness modeli bir döngüde, çoğu zaman müşteri mesajı başına birkaç kez çalıştırır. Tek bir başarısız çağrı tüm çalıştırmayı durdurabilir.
- WhatsApp’ta zamanlama önemlidir. Serbest biçimli yanıtlara yalnızca müşterinin son mesajından sonraki 24 saat içinde izin verilir. Uzun bir duraksama yanıtı pencerenin dışına itebilir; o zaman onaylı bir şablon gerekir.
Bunların hiçbiri belirli bir sağlayıcının güvenilmez olmasıyla ilgili değildir. Her sağlayıcının olayları, bakımları ve kapasite sınırları vardır. Asıl soru, ajanınızın bunlar için bir planı olup olmadığıdır.
Neler ters gidebilir?
Sağlayıcı kesintileri. Kısmi veya tam, kısa veya uzun. Aylık %99,9 erişilebilirlik bile 40 dakikadan fazla kesintiye izin verir.
Hız sınırları. Hesabınız dakika başına belirli sayıda istek veya token’a izin verebilir. Yoğun bir saat, sağlayıcının kendisi sorunsuz olsa bile bu tavana ulaşabilir.
Zaman aşımları ve yavaş yanıtlar. Normalde iki saniyede yanıt veren bir model yük altında yirmi saniye sürebilir. Telefondaki bir müşteriye bu, hiçbir şey olmuyormuş gibi gelir.
Kontrolden çıkan çalıştırmalar. Kafa karıştırıcı bir talepte döngüye giren bir ajan veya sürekli büyüyen bir konuşma, normal bir çalıştırmadan çok daha fazlasını tüketebilir.
Model değişiklikleri. Sağlayıcılar modelleri günceller ve kullanımdan kaldırır. Güvendiğiniz bir davranış çok az haber verilerek değişebilir.
Bir ajanda yedek nasıl çalışır?
Fikir basittir: ana model işi tamamlayamadığında ikinci bir model devralır. MonoChat’te yedek model, bir esnek sınırdan sonra veya ana model başarısız olduğunda devralır. Konuşma, araçlar ve talimatlar aynı kalır; yalnızca işi yapan model değişir.
Her AI Agent düğümünde üç rol birlikte çalışır:
| Rol | Ne yapar |
|---|---|
| Ana model | Akıl yürütür, karar verir ve yanıtları yazar |
| Yedek model | Esnek bir sınırdan veya bir arızadan sonra devralır |
| Hızlı model | Arka plan işlerini üstlenir |
Rollerin üzerine, çalıştırma başına bir bütçe sınırı tek bir konuşmanın harcayabileceği tutarı sınırlar.
Yedek model nasıl seçilir?
Farklı bir sağlayıcıyı tercih edin
Aynı sağlayıcıdan bir yedek, tek bir modelin hatalı davranmasına karşı sizi korur; ancak sağlayıcı genelindeki bir olaya veya o sağlayıcıdaki hesabınızın hız sınırına karşı korumaz. İkinci bir sağlayıcının modeli her ikisini de karşılar. MonoChat, özel LLM’ler aracılığıyla birden fazla sağlayıcıyı bağlamanıza izin verir; bu bir proje değil, bir yapılandırma tercihidir.
Yeterince iyi olsun, birebir aynı olması gerekmez
Yedeğin mevcut en iyi model olması gerekmez. Talimatlarınızı izlemesi, araçlarınızı doğru çağırması ve düzgün bir yanıt yazması gerekir. Güvenmeden önce onu gerçek konuşmalarınızla, sanki ana model gibi tek başına test edin.
Araçlarınızı kullanabildiğinden emin olun
Ajanlar araç çağrılarına bağlıdır: bir siparişi sorgulamak, bir saati kontrol etmek, bir talep oluşturmak. Bazı modeller yapılandırılmış araç çağrılarında diğerlerinden çok daha iyidir. Güzel metin yazan ama araçları yanlış çağıran bir yedek, hiç yedek olmamasından kötüdür.
Hizmet verdiğiniz dilleri düşünün
Müşterileriniz Türkçe, Arapça veya İspanyolca yazıyorsa, yedeğin bu dilleri ana model kadar iyi yazdığından emin olun. Kalite veya üslupta ani bir değişim fark edilir.
Maliyeti iki yönde değerlendirin
Daha ucuz bir yedek, esnek bir sınırı aşan uzun veya sıra dışı çalıştırmaların maliyetini düşürür. Yalnızca nadir arızaları ele alacaksa daha pahalı bir yedek de sorun olmayabilir. Yedekten hangi işi yapmasını istediğinize karar verin.
Hızlı model: güvenilirliğin diğer yarısı
Her adım en iyi modelinizi gerektirmez. Arka plan işleri, yani yanıtın kendisi değil konuşmanın çevresindeki işler, daha küçük ve daha hızlı bir modelde çalışabilir. Bu, ana modelin kapasitesini ve bütçesini müşterinin gerçekten gördüğü şey için korur ve yoğun saatlerde ana modelde hız sınırına takılma ihtimalini azaltır.
Uygulamada: ana model olarak en güçlü akıl yürütme modelinizi, yedek olarak ikinci bir sağlayıcıdan sağlam bir modeli, arka plan işleri için de hızlı ve ucuz bir modeli koyun.
Bütçeler: güvenlik ağının altındaki güvenlik ağı
Yedek, ajanın çalışmaya devam etmesini sağlar. Bütçeler ise onu uygun maliyetli tutar. Çalıştırma başına bütçe sınırı, hiçbir tekil konuşmanın, ne kadar tuhaf olursa olsun, planladığınızdan fazlasını harcayamaması demektir. Yedeğin devraldığı bir esnek sınırla birleştiğinde öngörülebilir bir düzen elde edersiniz: normal konuşmalar ana modelde çalışır, uzun olanlar yedekte devam eder ve hiçbir şey kontrolden çıkmaz.
Kendi sağlayıcı anahtarlarınızla MonoChat yapay zekâ için ek ücret almaz; yani bütçelediğiniz tutar, sağlayıcılarınızın ücretlendirdiği tutardır.
Yedek, devir değildir
Yedek modeli her sorunun yanıtı olarak görmek cazip gelebilir. Öyle değildir. Yedek teknik arızaları çözer: model kapalı, yavaş veya bütçesi tükenmiş. Devir ise muhakeme sorunlarını çözer: bir şikâyet, bir hukuki soru, limitinizin üzerinde bir iade veya sadece bir kişi isteyen bir müşteri.
MonoChat’te ajan bir akışın içinde çalışır; bu nedenle tüm geçmişiyle ortak ekip gelen kutunuza devir her zaman mümkündür. WhatsApp ayrıca otomatik yanıtların bir insana net bir yol sunmasını bekler. Her iki yolu da tasarlayın:
- Ana model başarısız olur veya esnek bir sınıra ulaşır → yedek model devam eder.
- Vaka bir kişi gerektirir → konuşma geçmişiyle birlikte doğru ekibe devir.
- İkisi de başarısız olur → akış müşteriye bir kişinin yanıt vereceğini söyler ve konuşmayı gelen kutusuna yönlendirir.
Basit bir kontrol listesi
- Ana model, gerçek konuşmalarınızdaki kalite açısından seçilmiş.
- Yedek model ikinci bir sağlayıcıdan, araçlarınız ve dilleriniz üzerinde tek başına test edilmiş.
- Arka plan işleri için hızlı model.
- Normal konuşma maliyetinize biraz pay bırakacak şekilde çalıştırma başına bütçe sınırı.
- Ajanın talimatlarında ve akışta net devir kuralları.
- İlk haftadan sonra, yedekte çalışanlar dahil, konuşma örneklerinin gözden geçirilmesi.
Bir kez kurun, her kanal için çalışsın
AI Agent düğümü bir MonoChat akışında yer aldığından, aynı ana, yedek ve hızlı modeller ajanınızı WhatsApp’ta, Instagram’da, Messenger’da, TikTok’ta, Telegram’da, web sohbetinde, SMS’te ve sesli kanalda korur. Agent Harness çerçeveyi seçmenize izin verdiği için aynı yaklaşım, ajanınız MonoChat’in yerleşik harness’inde, Claude Agent SDK üzerinde, OpenAI Agents SDK üzerinde, Pi üzerinde veya kendi çerçevenizde çalışsa da geçerlidir.
Model rollerinin nasıl bir araya geldiğini Agent Harness sayfasında görün.
Bunu MonoChat ile uygulayın