בניית סוכן AI לעסק - עובד שלא ישן

שלב הפיקוח - Human-in-the-loop ל-100 שיחות ראשונות

שיעור 11 מתוך 16

התשובה הקצרה

תעצרו רגע לפני שאתם נושמים לרווחה אחרי ה-go-live. 5 תרחישי הבדיקה משיעור 10 בודקים איך הסוכן מתנהג במעבדה - מה שקורה עכשיו הוא המבחן האמיתי, מול לקוחות אמיתיים, בכסף אמיתי. ל-2-3 השבועות הבאים אתם עוברים לשלב Human-in-the-loop - אתם (או מישהו מטעמכם) בודקים ידנית את 100 השיחות הראשונות של הסוכן, אחת-אחת, תוך 24 שעות מכל שיחה. בלי השלב הזה סוכן חדש מייצר בממוצע 8-12 'כשלים שקטים' - לקוח קיבל תשובה לא מדויקת, לא התלונן, ופשוט לא חזר. השיטה - לוג של 6 עמודות, דירוג 1-5 לכל שיחה, ותיקון מיידי ב-System Prompt בכל פעם שאותו כשל חוזר. חשוב לקרוא נכון את מספרי ה-Escalation Rate כבר בשבוע הראשון - טווח היעד הבריא (25%-40% העברה לאדם, כלומר 60%-75% שהסוכן סוגר לבד) תקף מהיום הראשון, לא רק אחרי חודשים של כיוונון. אם אתם רואים 32% - זה בתוך הטווח, לא דגל אדום. השיעור נותן את מערכת הלוג, את קו הגבול המדויק בין 'תקין' ל'צריך תיקון', ואת ההחלטה מתי לעבור מבדיקה מלאה ל-Spot Check.

מערכת הלוג של 100 השיחות הראשונות

צריך לוג מסודר - לא 'בודקים מתי שזוכרים'. הפורמט - Google Sheet עם 6 עמודות. עמודה 1 - תאריך + שעה. עמודה 2 - שם לקוח (אם יש). עמודה 3 - נושא השיחה. עמודה 4 - תוצאה (תואם פגישה / נכשל / הועבר לאדם). עמודה 5 - דירוג איכות 1-5 שהאדם נותן. עמודה 6 - הערה ספציפית אם היה כשל. בסוף כל יום מסתכלים על הלוג של היום ועושים תיקונים. אם רואים שיחה עם דירוג 1-2 - תיקון מיידי. אם רואים אותו כשל 2-3 פעמים - תיקון מערכתי ב-System Prompt. המערכת לוקחת 15-20 דקות ליום, אבל היא ההבדל בין סוכן שעובד לסוכן שמכשיל את העסק.

טוען את המשך השיעור...