GPT
מגזין · חדשנות · 4 דקות קריאה ·

אפל מוכיחה שהיסטוריית שיחה מלאה פוגעת בביצועי סוכני קוד

חוקרי אפל מציעים מודל זיכרון סלקטיבי שמשמר ארבע קטגוריות חיוניות, מציג יצירה מונחית תקצירים שמפחיתה טוקנים פי 97 ומקפיץ השלמת משימות.

אבני בניין דיגיטליות מסודרות בקפידה על משטח כהה כשמסביבן מתפוגג אבק דיגיטלי
סינון קפדני של מידע: שמירה של מה שחשוב וסילוק שאריות חשיבה שמבלבלות את המודל איור: GPT.org.il
מה לעשות עכשיו
  • סננו משכבת המצב של הסוכן את היסטוריית החשיבה, ושמרו רק סכמות, כלים ואילוצים.

כל מפתח שבנה סוכן לקוד מכיר את הרגע שבו הסוכן מתחיל להמציא דברים כי הוא נחנק מטוקנים. התגובה האוטומטית בתעשייה היא בדרך כלל לשפוך עוד זיכרון לתוך הפרומפט, בתקווה שהמודל יבין לבד מה חשוב ומה זבל. עכשיו מגיעים חוקרי אפל Sanjana Pedada, Aditya Dhavala ו-Neelraj Patil עם מאמר מחקר חדש שהוצג בוועידת EMNLP, ומציגים מספרים שקשה להתווכח איתם על המחיר של היסטוריה מלאה. סוכני LLM שמייצרים קוד דרך שימוש רב שלבי בכלים מתמודדים עם בעיה בסיסית של חוסר הקשר, שבה כל הפעלה מתחילה מאפס ומשליכה את בחירות התצורה, אילוצי התחום, סכמות הנתונים ודפוסי השימוש בכלים שהפכו הפעלות קודמות למוצלחות. הפתרון הנאיבי של שמירת כל השיחה מתברר כעת כבזבזני, וכמכשול של ממש.

יותר היסטוריה, פחות דיוק

האינסטינקט לשמור את כל היסטוריית השיחה מזיק ישירות לתוצאות. לפי החוקרים במאמר שפורסם ב-arXiv, סוכן שרץ בלי שום זיכרון ומקבל כל משימה מאפס הגיע ל-79 אחוזי השלמת משימות. ברגע שהזריקו לו את כל היסטוריית השיחה הקודמת, שיעור ההצלחה צנח ל-71 אחוז בלבד. החוקרים מציינים מפורשות שהתמדה נאיבית של היסטוריה מלאה אינה יעילה מבחינת טוקנים ומשיגה תוצאה הפוכה, מכיוון שהקשר לא רלוונטי פוגע באיכות התוצרים שנוצרים. המודל מוטה על ידי עקבות חשיבה ישנים וזיהום של ההקשר במקום להתמקד במשימה שלפניו.

זה מחיר כבד על זיכרון.

הסיבה לנפילה הזאת היא לא רק עלות. כשהסוכן מקבל את כל ההיסטוריה הגולמית, הוא נגרר אחרי עקבות חשיבה ישנים, טעויות ביניים וניסיונות סרק שכבר לא רלוונטיים לשלב הנוכחי. ההקשר המלא פשוט מטעה אותו, משום שהמודל מתקשה להבחין בין מסקנה סופית לבין השערה שנפסלה כמה שלבים קודם לכן. במקום להתרכז בלוגיקה החדשה, הוא משחזר שגיאות עבר שנראות סמכותיות בתוך הפרומפט. החוקרים מדגישים כי זיהום ההקשר הזה פוגע ישירות ביכולת הפקת הקוד והבנת הדרישות העדכניות לאורך תהליך העבודה.

ארבעה מכלים שקופים המכילים שרטוטים טכניים וסכמות נתונים מסודרות
ארבע קטגוריות בלבד: מפרט, סכמה, כלים ואילוצים במקום היסטוריית שיחה אינסופית איור: GPT.org.il

ארבעת הדברים ששווה לשמור

במקום לזרוק את כל הטקסט להקשר, הארכיטקטורה של אפל מגדירה זיכרון סלקטיבי שנשמר בסביבת עבודה משותפת. המערכת מזהה ומשמרת ארבע קטגוריות בלבד של הקשר הניתן לשימוש חוזר: מפרטי משימה, סכמות נתונים, תצורות כלים ואילוצי פלט. כל עקבות החשיבה הספציפיים להפעלה מסוימת נזרקים מיד. החוקרים מדגישים כי הזיכרון הזה הוא משותף, כך שסביבות עבודה המכילות זיכרון סלקטיבי ניתנות להעברה בין משתמשים עם בקרת גישה מבוססת תפקידים. מנגנון זה מיועד לשימוש חוזר שיתופי בהקשר שנצבר מבלי להגדיר אותו מחדש בכל פעם.

התוצאה של הסינון הזה דרמטית. סוכן שמקבל רק ארבע קטגוריות של הקשר מזוקק מגיע ל-96 אחוזי הצלחה במשימות מורכבות, לעומת אותם 71 אחוז בהזרקה עיוורת ו-79 אחוז ללא זיכרון כלל. לפי הנתונים במאמר, יצירה מונחית תקצירים הפחיתה את עלות הטוקנים לכל הפעלה פי 97 בהשוואה להזרקת נתונים גולמיים. המערכת שנבדקה מייצרת, עורכת ומתחזקת תוצרים המנוהלים בגרסאות Git, כולל לוחות מחוונים אינטראקטיביים, דוחות מובנים ומסמכים מונחי נתונים. התוצרים האלה נבנים ממקורות נתונים הטרוגניים הנגישים דרך מחברים שונים כמו קובצי CSV, מסדי SQL, ממשקי REST APIs ושרתי MCP.

שימור נאיבי של כל היסטוריית השיחה פוגע באופן פעיל בהשלמת המשימות על ידי הטיית הסוכן עם עקבות חשיבה ישנים.מתוך מאמר המחקר של אפל

עדכון נתונים באפס טוקנים

החידוש המעשי השני במערכת נוגע למה שקורה כשהנתונים מתעדכנים. סוכנים רגילים נאלצים לקרוא ל-LLM מחדש בכל פעם שמסד הנתונים משתנה כדי לעדכן דוחות ושאילתות. המנגנון של אפל מפריד בין קוד התוכנה שנוצר לבין הנתונים בזמן ריצה, ומבטיח שימוש חוזר בתוצרים ללא קריאה חוזרת למודל. ניהול הגרסאות מבוסס ה-Git כולל בידוד טיוטות, וכך אתם יכולים לחקור שינויים ללא סיכון ולשחזר כל מצב קודם מבלי להפעיל מחדש את ה-LLM.

המנגנון המשלים של רענון נתונים באפס טוקנים מבטל לחלוטין את הצורך בהפעלת המודל עבור עדכוני נתונים חוזרים. לפי נתוני החוקרים, הדבר הוביל לקיצור זמן ביצוע המשימה פי 14. שחזור של הניסוי בארבעה מאגרי מידע ציבוריים אימת את יכולת ההכללה של השיטה, כאשר רענון הנתונים באפס טוקנים הצליח בכל 12 הניסיונות שנבדקו. מנקודת המבט של המערכת, תוכנית שכבר הוכחה כנכונה אינה דורשת שיקול דעת חדש של מודל שפה רק בגלל שהשורות בטבלה או בשרת ה-MCP התעדכנו.

השוואת ביצועים ועלויות בין שלוש גישות ניהול הזיכרון שנבדקו במחקר של אפל
ארכיטקטורת זיכרוןשיעור השלמת משימותעלות טוקנים יחסיתהשפעה על הקשר הסוכן
ללא זיכרון (אפס הקשר)79%רגילה ללא היסטוריהאיבוד מלא של סכמות וכלים בין הפעלות
היסטוריית שיחה מלאה71%גבוהה ומצטברתהטיה של המודל בעקבות חשיבה ישנים וזיהום הקשר
זיכרון סלקטיבי משותף96%נמוכה פי 97 ביצירה מונחית תקצירשימור מפרט, סכמות, כלים ואילוצים בלבד
נתיבי גרסאות קוד מוארים באור עדין המציגים נקודות שמירה נקיות
עדכון נתונים ללא הפעלת המודל מחדש, מבוסס בידוד גרסאות וסכמות קבועות איור: GPT.org.il

מאמר בכיס, לא ב-Xcode

לפני שרצים לחפש את הכפתור במערכת ההפעלה, כדאי להירגע. מדובר במאמר מחקרי בלבד שפורסם באתר Apple Machine Learning Research. בפרסום לא מופיע מידע על הפצה מסחרית, לא צוין האם קיים קוד פתוח להורדה, ולא ידוע מתי או אם הטכנולוגיה הזאת תוטמע במוצרים עתידיים. לא הייתי ממהר לבנות על זה כפתרון מוכן מהמדף.

זה עדיין רק מאמר.

החוקרים הציגו יישום שנבדק בשלושה תרחישי פריסה ארגוניים ובארבעה מאגרי מידע ציבוריים, תוך התמקדות בתוצרים מוגדרים כמו מסמכים מונחי נתונים, דוחות ולוחות מחוונים. המחקר אינו מפרט נתונים לגבי שימוש בטקסט חופשי לחלוטין או משימות שאינן נשענות על מקורות נתונים מובנים כמו SQL, קובצי CSV או שרתי כלים. כשיש מבנה ברור של סכמות ומפרטים קל יחסית להגדיר מה שייך למבנה הנתונים ומה שייך לחשיבה הארעית, אך לא ידוע כיצד המנגנון מתמודד עם תחומים ללא גבולות מוגדרים.

איך ליישם את זה מחר

מי שבונה סוכנים לא חייב להמתין לעדכוני מערכת רשמיים כדי לנצל את התובנות של אפל. הלקח מהמחקר פשוט ליישום כבר עכשיו: תפסיקו לשרשר את כל מערך ההודעות אל תוך המודל בכל סיבוב. במקום זה, נהלו שכבת מצב נפרדת שמבודדת אך ורק את הגדרות הכלים, הסכמה, אילוצי הפלט והמפרט המבוקש של המשימה.

מה שבאמת מעניין כאן הוא שהמחקר מוכיח ששימור עיוור הוא יקר, וממש מזיק לאיכות הפלט. עקבות החשיבה של הסוכן צריכים להישאר בריצה שבה הם נוצרו ולהימחק מיד אחריה. המודל שלכם יודה לכם, והחשבון החודשי שלכם יודה לכם עוד יותר.

שאלות ותשובות

מה שואלים על זה

בפרסום המחקרי של אפל לא צוינה זמינות של ספריית קוד פתוח או כלי להורדה, ומדובר כעת במאמר מחקר שהוצג בוועידת EMNLP.

היסטוריה מלאה מזריקה להקשר עקבות חשיבה ישנים, טעויות ביניים ונתונים לא רלוונטיים שמבלבלים את המודל וגורמים לו לסטות מהמשימה הנוכחית.

המערכת נבדקה בשלושה תרחישי פריסה ארגוניים ובארבעה מאגרי מידע ציבוריים, תוך חיבור למקורות נתונים מגוונים שכללו קובצי CSV, מסדי SQL, ממשקי REST APIs ושרתי MCP.
מקורות
  1. Shared Selective Persistent Memory for Agentic LLM Systemsmachinelearning.apple.com · המקור
  2. עמוד הפרה-פרינט הרשמי של המאמר ב-arXivarxiv.org · קריאה נוספת
  3. conferenceEMNLPmachinelearning.apple.com · מקושר מההודעה
  4. content type papermachinelearning.apple.com · מקושר מההודעה
איך בדקנו

21 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ב־16 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.