رفتن به محتوای اصلی

هوش مصنوعی

چرا عامل هوش مصنوعی رو‌در‌رو با مشتری شما به مدل جایگزین نیاز دارد

ارائه‌دهنده مدل یک ساعت بد دارد و عامل واتس‌اپ شما ساکت می‌شود، در حالی که مشتریان منتظرند. مدل جایگزین ارزان‌ترین بیمه در برابر این وضعیت است. در اینجا می‌بینید جایگزین چگونه کار می‌کند، چگونه یکی را انتخاب کنید و چگونه با مدل‌های سریع و بودجه‌ها هماهنگ می‌شود.

تیم MonoChat به‌روزرسانی: 6 دقیقه مطالعه

در این صفحه
  1. چرا خطای مدل در گفتگوهای مشتری بیشتر آسیب می‌زند
  2. چه چیزهایی ممکن است خراب شود
  3. جایگزین در یک عامل چگونه کار می‌کند
  4. مدل جایگزین را چگونه انتخاب کنیم
  5. مدل سریع: نیمه دیگر پایداری
  6. بودجه‌ها: تور ایمنی زیر تور ایمنی
  7. جایگزین واگذاری نیست
  8. یک فهرست بررسی ساده
  9. یک بار راه‌اندازی کنید، برای هر کانال

یک عامل هوش مصنوعی رو‌در‌رو با مشتری به مدل جایگزین نیاز دارد، چون هر مدلی سرانجام در بدترین لحظه خطا می‌دهد: ارائه‌دهنده دچار قطعی می‌شود، حساب شما به محدودیت نرخ می‌رسد، یک درخواست با تایم‌اوت روبه‌رو می‌شود، یا یک گفتگوی غیرمعمول بیش از برنامه توکن مصرف می‌کند. بدون جایگزین، عامل ساکت می‌شود و مشتری منتظر می‌ماند. با جایگزین، مدل دوم کار را به دست می‌گیرد و گفتگو ادامه می‌یابد. در Agent Harness MonoChat، هر نود AI Agent یک مدل اصلی، یک مدل جایگزین و یک مدل سریع دارد، به‌علاوه یک حد بودجه برای هر اجرا.

این مقاله توضیح می‌دهد چرا خطای مدل در پیام‌رسانی مشتری از هر جای دیگر مهم‌تر است، جایگزین چگونه کار می‌کند، مدل جایگزین را چگونه انتخاب کنیم و چگونه با مدل‌های سریع، بودجه‌ها و واگذاری به انسان هماهنگ می‌شود.

چرا خطای مدل در گفتگوهای مشتری بیشتر آسیب می‌زند

در یک ابزار داخلی، یک درخواست ناموفق هوش مصنوعی مایه دردسر است: دوباره امتحان می‌کنید. در یک گفتگوی مشتری در واتس‌اپ، نقض یک قول است. مشتری چیزی پرسیده، تیک‌های آبی را دیده و منتظر پاسخ است.

چند چیز پیام‌رسانی مشتری را به‌ویژه حساس می‌کند:

  • مشتریان دوباره تلاش نمی‌کنند. آن‌ها دوباره و عصبانی‌تر می‌نویسند، یا می‌روند.
  • ترافیک ناگهانی است. یک کمپین، یک تأخیر در تحویل یا یک حراج می‌تواند گفتگوها را در چند دقیقه چند برابر کند، که دقیقاً زمانی است که محدودیت‌های نرخ اثر می‌گذارند.
  • عامل‌ها فراخوانی‌های زیادی انجام می‌دهند. یک agent harness مدل را در یک حلقه اجرا می‌کند، اغلب چند بار برای هر پیام مشتری. یک فراخوانی ناموفق می‌تواند کل اجرا را متوقف کند.
  • زمان‌بندی در واتس‌اپ اهمیت دارد. پاسخ آزاد فقط تا 24 ساعت پس از آخرین پیام مشتری مجاز است. یک توقف طولانی می‌تواند پاسخ را به خارج از این پنجره ببرد، جایی که به تمپلیت تأییدشده نیاز دارید.

هیچ‌یک از این‌ها درباره نامطمئن‌بودن یک ارائه‌دهنده خاص نیست. هر ارائه‌دهنده‌ای حادثه، نگهداری و محدودیت ظرفیت دارد. پرسش فقط این است که عامل شما برای آن‌ها برنامه دارد یا نه.

چه چیزهایی ممکن است خراب شود

قطعی ارائه‌دهنده. جزئی یا کامل، کوتاه یا بلند. حتی دسترس‌پذیری ماهانه 99.9% بیش از 40 دقیقه توقف را مجاز می‌داند.

محدودیت‌های نرخ. حساب شما ممکن است تعداد مشخصی درخواست یا توکن در دقیقه را مجاز بداند. یک ساعت شلوغ می‌تواند به این سقف برسد، حتی وقتی خود ارائه‌دهنده سالم است.

تایم‌اوت و پاسخ‌های کند. مدلی که معمولاً در دو ثانیه پاسخ می‌دهد ممکن است زیر بار بیست ثانیه طول بکشد. برای مشتری‌ای که پشت تلفن است، این حس را می‌دهد که هیچ اتفاقی نمی‌افتد.

اجراهای از کنترل خارج‌شده. عاملی که روی یک درخواست گیج‌کننده در حلقه می‌افتد، یا گفتگویی که مدام بزرگ‌تر می‌شود، می‌تواند بسیار بیش از یک اجرای عادی مصرف کند.

تغییر مدل‌ها. ارائه‌دهندگان مدل‌ها را به‌روز و بازنشسته می‌کنند. رفتاری که به آن تکیه کرده بودید می‌تواند با اخطار اندک تغییر کند.

جایگزین در یک عامل چگونه کار می‌کند

ایده ساده است: وقتی مدل اصلی نمی‌تواند کار را تمام کند، مدل دوم آن را به دست می‌گیرد. در MonoChat، مدل جایگزین پس از یک حد نرم یا وقتی مدل اصلی خطا می‌دهد کار را به دست می‌گیرد. گفتگو، ابزارها و دستورالعمل‌ها یکسان می‌مانند؛ فقط مدلی که کار را انجام می‌دهد تغییر می‌کند.

سه نقش در هر نود AI Agent با هم کار می‌کنند:

نقشچه کار می‌کند
مدل اصلیاستدلال می‌کند، تصمیم می‌گیرد و پاسخ‌ها را می‌نویسد
مدل جایگزینپس از حد نرم یا خطا کار را به دست می‌گیرد
مدل سریعکارهای پس‌زمینه را انجام می‌دهد

علاوه بر نقش‌ها، یک حد بودجه برای هر اجرا سقف هزینه یک گفتگو را تعیین می‌کند.

مدل جایگزین را چگونه انتخاب کنیم

ارائه‌دهنده متفاوت را ترجیح دهید

جایگزینی از همان ارائه‌دهنده شما را در برابر بدرفتاری یک مدل محافظت می‌کند، اما در برابر حادثه کل ارائه‌دهنده یا محدودیت نرخ حساب شما نزد آن ارائه‌دهنده نه. مدلی از ارائه‌دهنده دوم هر دو را پوشش می‌دهد. MonoChat به شما امکان می‌دهد چند ارائه‌دهنده را از طریق LLMهای سفارشی متصل کنید، بنابراین این یک انتخاب پیکربندی است، نه یک پروژه.

به‌اندازه کافی خوب باشد، نه یکسان

جایگزین لازم نیست بهترین مدل موجود باشد. باید دستورالعمل‌های شما را دنبال کند، ابزارهایتان را درست فراخوانی کند و پاسخی درخور بنویسد. پیش از تکیه بر آن، به‌تنهایی و انگار مدل اصلی است روی گفتگوهای واقعی خود آزمایشش کنید.

بررسی کنید ابزارهای شما را مدیریت می‌کند

عامل‌ها به فراخوانی ابزار وابسته‌اند: جستجوی سفارش، بررسی یک بازه زمانی، ایجاد تیکت. بعضی مدل‌ها در فراخوانی ساختاریافته ابزار بسیار بهتر از بقیه‌اند. جایگزینی که متن زیبا می‌نویسد اما ابزارها را اشتباه فراخوانی می‌کند از نداشتن جایگزین بدتر است.

به زبان‌هایی که پشتیبانی می‌کنید توجه کنید

اگر مشتریان شما به ترکی، عربی یا اسپانیایی می‌نویسند، مطمئن شوید جایگزین آن زبان‌ها را به همان خوبی مدل اصلی می‌نویسد. تغییر ناگهانی در کیفیت یا لحن محسوس است.

هزینه را در هر دو جهت در نظر بگیرید

جایگزین ارزان‌تر هزینه اجراهای طولانی یا غیرمعمولی را که از حد نرم می‌گذرند کاهش می‌دهد. جایگزین گران‌تر می‌تواند مشکلی نداشته باشد اگر فقط خطاهای نادر را مدیریت کند. تصمیم بگیرید می‌خواهید جایگزین کدام کار را انجام دهد.

مدل سریع: نیمه دیگر پایداری

هر گام به بهترین مدل شما نیاز ندارد. کارهای پس‌زمینه، یعنی کارهای پیرامون گفتگو و نه خود پاسخ، می‌توانند روی مدلی کوچک‌تر و سریع‌تر اجرا شوند. این کار ظرفیت و بودجه مدل اصلی را برای آنچه مشتری واقعاً می‌بیند نگه می‌دارد و احتمال رسیدن به محدودیت نرخ در مدل اصلی را در ساعات شلوغ کم می‌کند.

در عمل: قوی‌ترین مدل استدلال خود را به‌عنوان اصلی، یک مدل مطمئن از ارائه‌دهنده دوم را به‌عنوان جایگزین و یک مدل سریع و ارزان را برای کارهای پس‌زمینه بگذارید.

بودجه‌ها: تور ایمنی زیر تور ایمنی

جایگزین عامل را در حال کار نگه می‌دارد. بودجه‌ها آن را مقرون‌به‌صرفه نگه می‌دارند. حد بودجه برای هر اجرا یعنی هیچ گفتگویی، هرچقدر عجیب، نمی‌تواند بیش از برنامه شما هزینه کند. همراه با یک حد نرم که پس از آن جایگزین کار را به دست می‌گیرد، الگویی قابل پیش‌بینی می‌گیرید: گفتگوهای عادی روی مدل اصلی اجرا می‌شوند، گفتگوهای طولانی روی جایگزین ادامه می‌یابند و هیچ چیز از کنترل خارج نمی‌شود.

با کلیدهای ارائه‌دهنده خودتان، MonoChat هیچ سربار هوش مصنوعی اضافه نمی‌کند، بنابراین آنچه بودجه می‌گذارید همان چیزی است که ارائه‌دهندگانتان دریافت می‌کنند.

جایگزین واگذاری نیست

وسوسه‌انگیز است که مدل جایگزین را پاسخ هر مشکلی بدانیم. این‌طور نیست. جایگزین مشکلات فنی را حل می‌کند: مدل از کار افتاده، کند است یا بودجه‌اش تمام شده. واگذاری مشکلات قضاوتی را حل می‌کند: یک شکایت، یک پرسش حقوقی، بازپرداختی بالاتر از سقف شما، یا مشتری‌ای که صرفاً یک نفر را می‌خواهد.

در MonoChat، عامل درون یک جریان اجرا می‌شود، بنابراین واگذاری به صندوق ورودی مشترک تیم شما با تاریخچه کامل همیشه در دسترس است. واتس‌اپ همچنین انتظار دارد پاسخ‌های خودکار راهی روشن به سوی انسان ارائه دهند. هر دو مسیر را طراحی کنید:

  1. مدل اصلی خطا می‌دهد یا به حد نرم می‌رسد ← مدل جایگزین ادامه می‌دهد.
  2. پرونده به یک نفر نیاز دارد ← واگذاری به تیم مناسب همراه با تاریخچه گفتگو.
  3. هر دو خطا می‌دهند ← جریان به مشتری می‌گوید یک نفر پاسخ خواهد داد و گفتگو را به صندوق ورودی هدایت می‌کند.

یک فهرست بررسی ساده

  • مدل اصلی بر اساس کیفیت روی گفتگوهای واقعی شما انتخاب شده است.
  • مدل جایگزین از ارائه‌دهنده دوم، به‌تنهایی با ابزارها و زبان‌های شما آزمایش شده است.
  • مدل سریع برای کارهای پس‌زمینه.
  • حد بودجه برای هر اجرا که با هزینه گفتگوی عادی شما به‌علاوه کمی حاشیه برابری کند.
  • قوانین روشن واگذاری در دستورالعمل‌های عامل و در جریان.
  • بازبینی نمونه‌ای از گفتگوها پس از هفته اول، از جمله هر گفتگویی که روی جایگزین اجرا شده است.

یک بار راه‌اندازی کنید، برای هر کانال

چون نود AI Agent در یک جریان MonoChat قرار دارد، همان مدل‌های اصلی، جایگزین و سریع عامل شما را در واتس‌اپ، Instagram، Messenger، TikTok، Telegram، چت وب، پیامک و تماس صوتی محافظت می‌کنند. و چون Agent Harness به شما امکان انتخاب چارچوب را می‌دهد، همین رویکرد چه عامل شما روی Harness داخلی MonoChat اجرا شود، چه روی Claude Agent SDK، OpenAI Agents SDK، Pi یا چارچوب خودتان کار می‌کند.

ببینید نقش‌های مدل چگونه کنار هم قرار می‌گیرند در صفحه Agent Harness.

سؤالات متداول

پرسش‌های متداول

مدل جایگزین در یک عامل هوش مصنوعی چیست؟

مدل جایگزین مدل دومی است که وقتی مدل اصلی نمی‌تواند کار را تمام کند، کار را به دست می‌گیرد؛ مثلاً وقتی ارائه‌دهنده خطا برمی‌گرداند، به محدودیت نرخ می‌رسید یا به حد نرم اجرا می‌رسید. گفتگو را ادامه می‌دهد تا مشتری بدون پاسخ نماند.

آیا مدل جایگزین باید از ارائه‌دهنده‌ای متفاوت باشد؟

اغلب بله. جایگزینی از همان ارائه‌دهنده در برابر مشکل یک مدل محافظت می‌کند، اما در برابر قطعی کل ارائه‌دهنده یا محدودیت نرخ حساب شما نه. مدلی از ارائه‌دهنده دوم هر دو را پوشش می‌دهد، به شرط اینکه برای کار عامل شما به‌اندازه کافی خوب باشد.

تفاوت مدل جایگزین و مدل سریع چیست؟

مدل جایگزین وقتی مدل اصلی خطا می‌دهد یا به حد نرم می‌رسد جای آن را می‌گیرد. مدل سریع در کنار آن اجرا می‌شود و کارهای پس‌زمینه را انجام می‌دهد تا مدل اصلی بتواند روی گفتگو تمرکز کند. در MonoChat هر نود AI Agent یک مدل اصلی، یک مدل جایگزین و یک مدل سریع دارد.

آیا مدل جایگزین جای واگذاری به انسان را می‌گیرد؟

خیر. مدل جایگزین وقتی یک مدل خطا می‌دهد عامل را در حال کار نگه می‌دارد. واگذاری گفتگو را وقتی عامل نباید آن را مدیریت کند به یک نفر منتقل می‌کند. یک راه‌اندازی خوب هر دو را دارد: جایگزین برای خطاهای فنی، واگذاری برای موارد نیازمند قضاوت.

حدود بودجه چه ارتباطی با مدل‌های جایگزین دارند؟

حد بودجه سقف هزینه یک اجرا را تعیین می‌کند. در MonoChat مدل جایگزین می‌تواند پس از حد نرم کار را به دست بگیرد، بنابراین یک گفتگوی طولانی یا غیرمعمول می‌تواند روی مدلی دیگر ادامه یابد، به‌جای اینکه متوقف شود یا هزینه مدل اصلی را بالا ببرد.

راهنماهای مرتبط

مطالعه درباره همین موضوع را ادامه دهید.

ماه اول پلن Growth با ما

WhatsApp، Instagram و Messenger را از یک صندوق ورودی اداره کنید

رایگان با MonoChat شروع کنید: صندوق ورودی مشترک تیم، دستیارهای هوش مصنوعی، قالب‌ها و کمپین‌ها روی APIهای رسمی Meta.

یک کد برای هر کسب‌وکار • 30 روز مهلت استفاده • بدون نیاز به کارت

$150 برای شروع.

دریافت