GPT
מגזין · חדשנות · 4 דקות קריאה ·

הסוכן שלכם יקרוס בפרודקשן למרות ציון גבוה בבנצ'מרק

ב-IBM גילו שסוכן עם 77 אחוזי הצלחה פותר את אותה משימה בעקביות רק בחצי מהמקרים, ושחררו כלי קוד פתוח שמייצב החלטות תנודתיות.

יד רובוטית מנסה לייצב קוביות זכוכית שנוטות ליפול על שולחן עבודה
הצלחה של סוכן בריצה אחת אינה מבטיחה התנהגות זהה בריצה הבאה מול משתמש אמיתי. איור: GPT.org.il
מה לעשות עכשיו
  • מדדו את אחוז ההצלחה העקבי של הסוכן בכל הריצות (Pass^k) במקום להסתפק בממוצע, וייצבו החלטות תנודתיות באמצעות הנחיות ייעודיות.

כל מפתח שבנה סוכן אוטונומי מכיר את הרגע הזה: הדגמתם לצוות תרחיש שעבד מושלם חמש פעמים ברצף, אבל מול המשתמש הראשון הסוכן בחר בנתיב אחר והתרסק. מחקר שפרסמו אתמול חוקרי IBM Research, ובהם Evelyn Duesterwald ו-Vatche Isahagian, מוכיח שהבעיה הזאת אינה עניין של חוסר מזל. הבנצ'מרקים המקובלים בודקים הצלחה ממוצעת, אבל בפועל מודל יכול להציג שיעור דיוק של 77.4% ועדיין לפעול כמו רולטה רוסית על אותה משימה בדיוק.

מה שבאמת מעניין כאן הוא שהתעשייה כולה מודדת כרגע את המספר הלא נכון.

הממוצע מסתיר את הנפילות

המדד המקובל בתעשייה להערכת סוכנים הוא Mean@k, כלומר ממוצע ההצלחות על פני k ריצות שונות. הוא עונה על השאלה עד כמה הסוכן מוצלח בממוצע, אבל מסתיר את מדד Pass^k, שבודק באיזה חלק מהמשימות הסוכן הצליח בכל k הריצות שלו. המדד הזה הוא המראה הפסימית של Pass@k המוכר מעולמות הקוד, שדורש רק הצלחה בודדת אחת מתוך k ניסיונות. עבור משימות קריטיות בעסק שלכם, כמו בדיקת התחייבויות בחוזה משפטי או התאמת עסקאות פיננסיות, הצלחה חלקית שווה לכישלון.

בבדיקה שערכו החוקרים על 168 משימות במבחן AppWorld עם סוכן ReAct מבוסס GPT-4.1, המודל השיג ציון Mean@5 של 77.4%. על הנייר מדובר בתוצאה חזקה ויציבה. כשבדקו באיזה חלק מהמשימות הסוכן הצליח בכל חמש הריצות, הנתון צנח ל-53.0%. כמעט רבע מכלל המשימות במבחן הן משימות שהסוכן פותר לפעמים ולפעמים נכשל בהן, למרות שהקלט לא השתנה בין הריצות. את ההבדל הזה, שעומד על 24.4 נקודות אחוז, מגדירים החוקרים כפער העקביות. במשימות הקשות הפער מטפס ל-30 נקודות אחוז.

סוכן יכול להיות בעל יכולות גבוהות ולא עקבי בעת ובעונה אחת.חוקרי IBM Research
תרשים מופשט המציג נקודת החלטה שממנה מתפצלים שני נתיבים שונים
התפלגות הסתברות שטוחה של טוקנים גורמת לסוכן להתפצל בין שתי החלטות שונות לחלוטין. איור: GPT.org.il

טמפרטורה אפס לא תציל

האינסטינקט הראשון של רוב המהנדסים הוא לקבע את הטמפרטורה לאפס כדי להבטיח דטרמיניזם. זה לא עובד. כל החלטה של סוכן, מבחירת כלי ועד שליחת ערך ספציפי בתוך פרמטר, נשענת על התפלגות הסתברויות של הטוקן הבא. כשההתפלגות חדה, יש טוקן אחד שמוביל בפער ניכר, וההחלטה יציבה. הבעיה מתחילה כשההתפלגות שטוחה, וכמה אפשרויות מתחרות על אותה הסתברות כמעט בתיקו.

במצב של התפלגות שטוחה, די ברעש חישובי זעיר בשרת המארח, כמו חוסר אסוציאטיביות של חישובי נקודה צפה במעבדים גרפיים או אצוות בקשות משתנות בענן, כדי להפוך את סדר הטוקנים המובילים. פענוח חמדני וקביעת סיד רק קובעים כיצד התפלגות הופכת לטוקן, אך אינם משנים דבר לגבי ההתפלגות עצמה. מכיוון שמסלול ריצה של סוכן כולל עשרות החלטות עוקבות, סיכוי קטן להתהפכות בכל צעד מצטבר לוודאות כמעט מלאה שהסוכן יסטה מהנתיב באחת הריצות. כל הבדיקות במאמר נערכו בטמפרטורה 0.0, כך שהתנודתיות הזו לא נבעה מדגימה אקראית רגילה.

מציאת הסדקים בריצה בודדת

כדי לאתר את נקודות השבר האלה בלי להריץ את המשימה מחדש מקצה לקצה, פיתחו ב-IBM רכיב דיאגנוסטי בשם Consistency Analyzer כחלק מערכת הקוד הפתוח ALTK-Evolve. הרכיב לוקח מסלול ריצה מתועד יחיד של הסוכן, ובודק מחדש רק את צעדי ההחלטה הבודדים. בכל נקודת החלטה כזו הוא שולח קריאת מודל יחידה באופליין שמבקשת חמש השלמות במקביל, כשהקלט הוא ההקשר שכבר תועד ונשמר בריצה המקורית.

הדגימה הזו חוסכת אינטראקציות חוזרות עם סביבת ההרצה או קריאות יקרות לממשקי API חיצוניים. הכלי מפיק ציון עקביות ייעודי לכל צעד שנבדק, ורושם אותו בכרטיס ניקוד שמצביע בדיוק על ההחלטות שנמצאות בסיכון להתהפך בריצה הבאה. הבדיקה פועלת כקופסה שחורה: אין צורך בגישה למשקלי המודל, לוגיטים פנימיים או מכשור מיוחד מעבר לטרייס הקיים. התהליך אינו דורש תשובה נכונה מראש כדי לדעת היכן המודל טעה. הוא לא מחפש שגיאות מול בוחן חיצוני, אלא מזהה חוסר יציבות פנימי בהחלטות הסוכן.

מסך מחשב בחדר עבודה המציג קוד ודיאגרמות של קבלת החלטות
דגימה מקומית של צעד החלטה קריטי חוסכת את הצורך להריץ את המשימה כולה מחדש. איור: GPT.org.il

הנחיות שנשארות למשימות הבאות

לאחר איתור הצעדים התנודתיים, המערכת מזקקת מהם קווי הנחיה ממוקדים שמוזרקים ישירות לפרומפט המערכת של הסוכן בזמן הריצה. במשימה שבדקה כמה פעילויות הושלמו בפתק ברשימת SimpleNote, חמש ריצות של הסוכן התפצלו בתוצאה של 3 מול 2 בגלל אי-ודאות לגבי אופן ספירת הסימונים. GPT-4.1 ייצר שתי הנחיות: שימוש בביטוי רגולרי מעוגן לשורה במקום ספירת מחרוזות רגילה כדי לא לספור סימונים שמופיעים במקרא הכותרת, ואימות תוצאות חיפוש מרובות לפני שממשיכים בביצוע המשימה.

ההנחיות אינן מוגבלות למשימה הבודדת שממנה נלקחו, אלא מנוסחות ככללי עבודה רחבים שמונעים התלבטות חוזרת במקרים מקבילים.

לפי ממצאי החוקרים, השימוש בהנחיות חתך את פער העקביות הכללי ביותר מחצי, מ-24.4 ל-12.0 נקודות אחוז. מדד ההצלחה העקבי Pass^5 עלה מ-53.0% ל-69.0%, בעוד שהדיוק הממוצע לא נפגע כלל ואף טיפס מ-77.4% ל-81.0%. במשימות ברמת קושי בינונית נרשם זינוק של 22.9 נקודות אחוז ב-Pass^5 (עלייה יחסית של 44%), ובמשימות קשות נרשמה תוספת של 14.3 נקודות (עלייה יחסית של 45%). במשימות שונות אך קשורות באותו תרחיש של AppWorld, ההנחיות הובילו לעלייה של 13.0 נקודות במדד העקביות. במודל הפתוח gpt-oss-120b, העלייה במשימות דומות הגיעה ל-8.7 נקודות אחוז.

ביצועי סוכן GPT-4.1 במבחן AppWorld לפני ואחרי שימוש בהנחיות עקביות
רמת קושי המשימההצלחה עקבית בכל הריצות (Pass^5) לפניהצלחה עקבית בכל הריצות (Pass^5) אחריפער עקביות שנשאר
קלהלא פורסם+12.2 נקודות אחוזלא פורסם
בינוניתלא פורסם+22.9 נקודות אחוזלא פורסם
קשהלא פורסם+14.3 נקודות אחוזלא פורסם
ממוצע כולל53.0%69.0%12.0 נקודות אחוז

מה עושים מחר בבוקר

אם אתם מפתחים סוכנים, הצעד הראשון הוא להפסיק להסתמך על ממוצעים בדיווחים שלכם. הוספת בדיקת Pass^k אפילו עם שלוש ריצות בלבד (k=3) תחשוף מיד פערים בהתנהגות המערכת. פנייה למודל גדול יותר לא תפתור את הבעיה באופן אוטומטי, מפני שעקביות אינה בעיית יכולת אלא ציר נפרד לחלוטין. מודל חזק יותר אמנם מעלה את ממוצע ההצלחות, אך אינו מבטל בהכרח את פער העקביות ברגעי הכרעה קשים.

לא הייתי ממהר להניח שהפתרון הזה מכסה תקלות רשת או קריסות של ממשקי API חיצוניים. הבדיקות של IBM נערכו בסביבת AppWorld ועל סוכן ReAct בלבד, ללא רעשים של שרתי פרודקשן אמיתיים, ויעילות הכלים בעברית כלל לא נבדקה. הערכה ALTK-Evolve זמינה כעת בחינם ברישיון קוד פתוח Apache-2.0, ללא מגבלות גיאוגרפיות בישראל. עכשיו רק נשאר לקוות שהסוכן שלכם יחליט לקרוא את ההנחיות.

שאלות ותשובות

מה שואלים על זה

טמפרטורה אפס קובעת בחירה חמדנית בטוקן בעל ההסתברות הגבוהה ביותר, אך אינה משנה את צורת ההתפלגות. כשיש שוויון כמעט מוחלט בין כמה טוקנים, שינויי חישוב זעירים בחומרת השרת הופכים את הסדר ומשנים את ההחלטה.

הכלי אינו מחפש שגיאות אלא חוסר עקביות. הוא דוגם מחדש את אותה נקודת החלטה מתוך טרייס קיים, ואם המודל מציע פעולות שונות לאותו קלט בדיוק, הצעד מסומן כנקודה תנודתית שדורשת הנחיה מייצבת.

לפי תוצאות הניסויים של IBM, הדיוק הממוצע לא נפגע כלל ואף עלה מ-77.4% ל-81.0%. ההנחיות מנוסחות ככללי עבודה רוחביים שמסייעים למודל להכריע במצבי אי-ודאות דומים.
מקורות
  1. Your Agent Aced the Task. Will It Do It Again?huggingface.co · המקור
  2. AgentToolkit/altk-evolve on GitHubgithub.com · קריאה נוספת
  3. ALTK Documentationagenttoolkit.github.io · קריאה נוספת
איך בדקנו

30 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ומול חיפוש ברשת ב־16 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.