GPT
מגזין · חדשנות · 3 דקות קריאה ·

סוכני ה-AI נכשלים כשהם צריכים להעתיק פיצ'ר מאפליקציה עובדת

בנצ'מרק חדש בדק איך מודלים מובילים מתמודדים עם שחזור יכולות מתוך תוכנה חיה במקום הנחיות טקסט, וגילה שהעומק מפיל אותם כמעט לחלוטין.

מסכי מחשב המציגים תרשימי תלויות מורכבים של קוד תוכנה
ככל שהתלויות בתוך האפליקציה מעמיקות, היכולת של הסוכנים יורדת במהירות. איור: GPT.org.il
מה לעשות עכשיו
  • אל תבנו על סוכני AI לשחזור או הנדוס לאחור של פיצ'רים שלמים; השתמשו בהם למשימות רדודות וממוקדות בלבד.

הבטחות לחוד וקוד שעובד לחוד. ברוב הבנצ'מרקים המוכרים, מודל שמקבל תיאור בעיה מסודר יודע להחזיר פאץ' סביר, וכולם ממהרים להכריז על סוף עבודת התכנות. במציאות, מפתח כמעט אף פעם לא מקבל פרומפט נקי עם מפרט יציב ובדיקות מוכנות. הוא מקבל מערכת קיימת, פותח דפדפן, לוחץ על כפתורים באפליקציה שעובדת, ומנסה להבין איך להעתיק את ההתנהגות הזו לתוך בסיס קוד חסר. מחקר חדש של Jeonghye Kim ושותפיו מעמיד את סוכני הקוד בדיוק במבחן הזה, ומראה שהפער בין תיאוריה למעשה עמוק בהרבה ממה שסיפרו לנו.

זה בדיוק מה שהחוקרים ניסו לבדוק מול תוכנה חיה.

החוקרים הציגו את ProgramDistill, מאגר שמודד יכולת של סוכני קוד לפעול בסביבה מונחית התייחסות, כפי שמוסבר בפירוט במסמך שפורסם ב-arXiv. במקום לקרוא גיליון באגים, הסוכן מקבל גישה לאפליקציית ווב מתפקדת במלואה, חוקר את ההתנהגות שלה דרך ממשק המשתמש, ונדרש לממש את אותה פונקציונליות באפליקציית יעד שבה הרכיב חסר. הצינור האוטומטי שהחוקרים בנו, שנקרא mine-craft-patch, חילץ 1,975 התנהגויות מאומתות מתוך 26 אפליקציות ווב שונות, ויצר מהן 4,063 משימות שחזור בלי מגע יד אדם. מדובר במשימות שנשענות על התנהגויות שניתנות להרצה מחדש ומאומתות באמצעות פאץ' ייחוס (gold patch) של האפליקציה.

מבחן המציאות של הקוד

בבנצ'מרקים קלאסיים כמו SWE-bench, הסוכן מתמודד עם תיאור טקסטואלי של תקלה. זה מייצר סביבה סטרילית שבה המודל נשען על מילים ועל רמזים מתוך דיונים ב-GitHub. אבל בפיתוח ווב אמיתי, המפרט הוא התוכנה עצמה. אם אתם בונים פיצ'ר חדש שמחקה מוצר קיים, אתם לא מקבלים קבצי בדיקה מוכנים, אלא מקליקים, בודקים קריאות רשת ומנסים לחלץ את הלוגיקה.

ממשק משתמש אינטראקטיבי שנחקר על ידי גורם אוטומטי
חקר התנהגות במקום קריאת הוראות: הסוכן נדרש לתפעל את המערכת כדי להבין מה לבנות. איור: GPT.org.il

הגישה של ProgramDistill מאלצת את הסוכן לפעול כמשתמש אנושי: לתפעל את המערכת החיה, לחלץ את הפלט הרצוי, ואז לכתוב את הקוד שיוביל בדיוק לאותה תוצאה. מתוך 4,063 המשימות, החוקרים בודדו תת-ערכה של 300 משימות שנועדה לאפשר הרצה מעשית של מודלים מובילים בלי לשרוף תקציבי עתק על זמן שרת. המאגר בודק פירוק של אפליקציות לרכיבים ברמות פירוט שונות, כך שכל התנהגות מוגדרת היטב מול אפליקציית הייחוס. הממצאים הראו שברגע שמוציאים את הסוכן מהבועה הטקסטואלית, החיים שלו נהיים קשים בהרבה. לא הייתי ממהר להפקיד בידיהם משימות של שחזור מערכות.

צניחה חופשית בעומק המערכת

כדי להבין איפה בדיוק המודלים מאבדים את הצפון, החוקרים הגדירו מדד שנקרא restoration depth. המדד מדרג את המשימות מדרגה 1, שבה השינוי נקודתי וכמעט עצמאי, ועד דרגה 8, שבה הפיצ'ר תלוי בשרשרת עמוקה של מודולים, מחלקות ותלויות פנימיות. התוצאות חשפו את נקודת התורפה האמיתית של הכלים הללו.

בשחזור אפליקציה חלקית, שיעור ההצלחה צונח מ-100% ל-64.0% ומ-96% ל-32% ככל שעומק השחזור גדל מ-1 ל-8.המאמר ProgramDistill

הבדיקה כללה תשעה סוכנים מובילים, כולל GPT-6 Astra ו-Claude Opus 5 של Anthropic. כשהמשימה הייתה ברמה 1, כלומר תיקון שטחי ללא תלויות עמוקות, המודלים כיכבו. GPT-6 Astra השיג 100% הצלחה, ו-Claude Opus 5 סיפק 96%. אבל כשהעומק עלה לדרגה 8, שיעור ההצלחה צנח ל-64.0% ב-GPT-6 Astra ול-32% בלבד ב-Claude Opus 5. בשחזור אפליקציה שלמה מתחילתה ועד סופה, המצב גרוע בהרבה: GPT-6 Astra השלים רק 49.2% מתזרימי העבודה המצטברים, ו-Claude Opus 5 נעצר על 28.8% בלבד מתוך תהליכי העבודה שנבדקו.

העומק מכריע אותם בכל פעם מחדש.

השוואת ביצועי מודלים מובילים לפי עומק תלויות ושחזור מלא
מודל / מדדהצלחה בעומק רדוד (דרגה 1)הצלחה בעומק עמוק (דרגה 8)שחזור אפליקציה מלאה
GPT-6 Astra100%64.0%49.2%
Claude Opus 596%32%28.8%
קוביות מבנה תוכנה רבודות עם חלקים חסרים בשכבות העמוקות
שחזור פיצ'ר בעומק המערכת דורש יותר מרק לכתוב פונקציה שעובדת לבד. איור: GPT.org.il

מה שהחוקרים לא בדקו

למרות המספרים המרשימים של המאגר, כדאי לצנן מעט את ההתלהבות מהמתודולוגיה עצמה. כל 4,063 המשימות נוצרו באוטומציה מוחלטת מתוך 26 אפליקציות בלבד, בלי בדיקה ידנית אנושית של כל מקרה ומקרה. כשמייצרים משימות ובדיקות ללא מגע יד אדם באמצעות צינור כמו mine-craft-patch, קיים תמיד סיכון ליצירת בדיקות שבירות או דרישות מלאכותיות שאינן משקפות תרחישי קצה אמיתיים בייצור. תוכנות ווב מורכבות יותר בעולם האמיתי מכילות אינטראקציות סבוכות בהרבה מאותן 26 יישומי בסיס שנבדקו.

בנוסף, נשארת השאלה כיצד המנגנון הזה יתמודד עם אפליקציות ווב מודרניות מורכבות יותר בעולם האמיתי, מעבר לאותם 26 יישומים שנבחנו בבסיס המאגר. הרצת בדיקות מול דפדפנים חיים ומערכות מרובות רכיבים מציבה אתגרים תפעוליים משמעותיים, ומורכבות כזו עלולה להגביל את היכולת להרחיב את המאגר בקלות למערכות גדולות בהרבה.

לחכות עם ההנדוס לאחור

אם אתם ארכיטקטים או מובילים טכנולוגיים ששקלו להטמיע סוכן אוטונומי כדי להעביר פיצ'רים שלמים ממערכת לגאסי או לשחזר יכולות של מתחרים, הנתונים האלה מסמנים תמרור עצור ברור. הכלים האלה מתפקדים יפה כהשלמת קוד נקודתית, בכתיבת בדיקות יחידה או במימוש פונקציות מבודדות עם חתימה מוגדרת מראש. הם פשוט מתקשים להבין איך עשרות רכיבים תלויים זה בזה לאורך זמן, וצונחים ככל ששרשרת התלויות מעמיקה.

נכון לחצי השנה הקרובה, כדאי להשאיר את הנדוס המערכות ושחזור היכולות למפתחים שלכם. בינתיים, המודלים עדיין צריכים שיחזיקו להם את היד בכל קריאת קומפוננטה.

שאלות ותשובות

מה שואלים על זה

בעוד שבנצ'מרקים קודמים מספקים למודל תיאור טקסטואלי של הבעיה או באג ספציפי מתוך GitHub, ב-ProgramDistill הסוכן נדרש לחקור אפליקציית ווב חיה ומתפקדת, להסיק ממנה את ההתנהגות הרצויה ולשחזר אותה בקוד היעד ללא קוד מקור זמין.

מדד עומק השחזור מייצג את מידת התלות של הפיצ'ר החסר בחלקים אחרים של המערכת, בסולם מ-1 עד 8. ככל שהעומק עולה, הפיצ'ר תלוי ביותר מחלקות ורכיבים, והמודלים מתקשים לשמור על עקביות, מה שמוביל לקריסה בשיעורי ההצלחה מ-100% ל-32%.

המחקר כולל תת-ערכה של 300 משימות שנועדה לאפשר הערכה מעשית יותר, אך הרצת הבנצ'מרק במלואו דורשת תשתית של דפדפנים מנוהלים ומשאבי חישוב משמעותיים להתמודדות עם אפליקציות חיות.
מקורות
  1. ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasksarxiv.org · המקור
  2. What is MathJax? - arXiv infoinfo.arxiv.org · דוקומנטציה
  3. View PDFarxiv.org · מקושר מההודעה
איך בדקנו

30 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ומול חיפוש ברשת ב־17 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.