GPT
מגזין · חדשות · 3 דקות קריאה ·

SageMaker מפסיקה להפיל אימונים בגלל מחסור בשרתים

רשימת עדיפויות חדשה מאפשרת לעבודות אימון לדלג אוטומטית בין חמישה סוגי מופעים בלי סקריפטים שבירים, אבל מחירי ה-On-Demand והתאמת הזיכרון נשארים בידיים שלכם.

ארונות שרתים בחוות שרתים מודרנית עם נוריות חיווי ירוקות
חיפוש אוטומטי אחר חומרה פנויה: סיום עידן סקריפטי ההמתנה ב-SageMaker. איור: GPT.org.il
מה לעשות עכשיו
  • הגדירו רשימת עדיפויות עם כמויות מופעים שקולות ב-ModelTrainer, וקבעו מגבלת MaxPendingTimeInSeconds קשיחה כדי למנוע גלישה לעלויות On-Demand מיותרות.

אין דרך נעימה להתעורר בשתיים בלילה משגיאת InsufficientCapacityError, במיוחד כשרצתה פקודה קריטית לאימון שחיכה ימים בתור. ב-15 בספטמבר 2026, AWS הכריזה על פיצ'ר שמטפל בנקודת החיכוך הזאת: הגדרת רשימת עדיפויות של מופעים (Instance preference lists). היכולת נתמכת ב-Amazon SageMaker AI Training Jobs ובעבודות Amazon SageMaker Processing Jobs. במקום לנעול משימה לשרת בודד, מגדירים עד 5 סוגי מופעים בקריאת API אחת. המערכת סורקת בזיכרון, מקצה את המופע הפנוי הראשון, ומתחילה בריצה.

אם אתם מנהלים פייפליינים מורכבים, השינוי הזה פותר כאב ראש מתמשך. עם זאת, הוא דורש היערכות טכנולוגית ותקציבית.

סוף לסקריפטים שקורסים בלילה

מערך כרטיסי עיבוד גרפי מותקנים בתוך מארז שרת ייעודי
מערך של כרטיסי GPU: המעבר בין ארכיטקטורות שונות מחייב תאימות קוד מלאה מצד המפתח. איור: GPT.org.il

עד העדכון הנוכחי, מהנדסים שרצו להבטיח רציפות עבודה נאלצו לבנות סקריפטים שבירים של ניסיונות חוזרים (retries) שבדקו סטטוסים, ביטלו בקשות תקועות וניסו להרים שרתים אחרים. כעת, מנגנון התזמון של Amazon SageMaker AI מריץ סריקה אחת של רשימת ההעדפות ומקצה מיד את המשאב הפנוי הראשון. אם אף אחד מחמשת המופעים אינו זמין, העבודה אינה נכשלת מיד אלא מועברת לתור אירועים יעיל, שממתין להתפנות משאבים ומבצע ניסיון הקצאה אוטומטי.

חלון ההמתנה בתור תחום באמצעות הפרמטר MaxPendingTimeInSeconds, שקובע כמה שניות המערכת תמשיך לנסות להשיג חומרה לפני שתפסיק את הריצה. לפי הדוקומנטציה של AWS, פרמטר MaxPendingTimeInSeconds מגדיר את סך כל זמן ההמתנה עבור רשימת העדיפויות כולה ולא לכל מופע בנפרד. המערכת מתאמצת למצוא שרת, והחשבון מגיע אליכם.

שילוב בין שמור לחופשי

היכולת החדשה מתחברת ישירות למנגנון Flexible Training Plans, שמאפשר לארגונים לשריין מראש קיבולת מעבדי GPU לתקופות קבועות ובתעריף מוזל. מעכשיו תוכלו להגדיר את המכסה השמורה בראש רשימת העדיפויות באמצעות שיוך ה-TrainingPlanArn שלה, ולהגדיר חלופות מבוססות On-Demand בהמשך הרשימה. התזמון יבדוק קודם את המכסה המוזלת השמורה, ואם היא תפוסה לחלוטין, יגלוש אוטומטית למופעים חופשיים כדי לא לעכב את הפייפליין.

המלכודת הכלכלית ברורה: מעבר אוטומטי ממופע מוזל ושמור למופע On-Demand במחיר מלא מתבצע ללא עצירה וללא בקשת אישור נוספת. מי שמריץ אימונים כבדים של מודלי שפה עלול לגלות שריצה ארוכה התבצעה על שרתים יקרים משמעותית מהתקציב המתוכנן.

התאמת שקילות חומרה בקוד

מסך מחשב נייד המציג מדדי ריצה וביצועים של מערכות ענן
הגדרת רשימת חלופות מונעת קריסה של משימות לילה, אך דורשת מעקב הדוק אחר עלויות On-Demand. איור: GPT.org.il

תכונה שימושית ברשימת העדיפויות היא היכולת לקבוע כמות שונה של מופעים עבור כל שורה ברשימה כדי לשמור על כוח עיבוד מאוזן. בדוקומנטציה של AWS מציגים דוגמה שבה עבודה מקבלת בעדיפות ראשונה 2 מופעי ml.g6.48xlarge (עם 8 כרטיסי L40S בכל מופע, 16 בסך הכל). אם הם אינם זמינים, היא עוברת להקצאה של 4 מופעי ml.g5.48xlarge (עם 8 כרטיסי A10G בכל מופע, 32 בסך הכל) כדי לפצות על ביצועים נמוכים יותר לכל כרטיס בודד.

חישוב שקילות המשאבים והתאמת הקוד מוטלים במלואם על כתפי צוות הפיתוח. תמונת הקונטיינר חייבת לכלול מנהלי התקנים של CUDA שמתאימים לכל הארכיטקטורות ברשימה, וסקריפט האימון חייב להסתגל עצמאית לשינויים בכמות הכרטיסים ובנפח הזיכרון (VRAM). סקריפט שלא יוכל להתאים את גודל ה-Batch בזמן ריצה עלול לקרוס על שגיאות זיכרון (OOM) מיד כשהמערכת תבחר בחלופה בעלת זיכרון מצומצם יותר.

המלכודת של מופעי מעבד

האותיות הקטנות של AWS כוללות הגבלה מהותית במנגנון התור. פרמטר MaxPendingTimeInSeconds עובד רק אם רשימת העדיפויות כוללת לפחות מופע מחשוב מואץ אחד, כגון משפחות ml.p, ml.g או שבבי Trainium של AWS (משפחת ml.trn). אם תגדירו עבודת אימון או עיבוד שמבוססת כולה על שרתי CPU רגילים (כמו מופעי ml.c או ml.m), המערכת תסרוק את הרשימה פעם אחת בלבד. במצב כזה, אם אף שרת לא יימצא פנוי באותו רגע, העבודה לא תיכנס לתור המתנה אלא תיכשל מיד, ללא תלות בערך הזמן שהוגדר.

התנהגות עבודות אימון ועיבוד ב-SageMaker לפני ואחרי עדכון רשימות העדיפויות
מצב קיבולתהתנהגות ישנההתנהגות חדשה ברשימת עדיפויותמשמעות תפעולית וכספית
מחסור מיידי במופע המועדףקריסה מיידית עם שגיאת InsufficientCapacityErrorדילוג אוטומטי למופע החלופי הבא ברשימה (עד 5)רציפות עבודה ללא צורך בסקריפטי ניסיונות חוזרים
מיצוי מכסת Flexible Training Planעצירה או כתיבת לוגיקת סקריפטים לעקיפהגלישה אוטומטית למופעי On-Demand לפי הסדר שהוגדרמניעת צווארי בקבוק, אך סכנת תשלום תעריף שעתי מלא
חוסר זמינות מוחלט בכל הרשימהקריסה של הריצהכניסה לתור אירועים תחום בזמן (MaxPendingTime)המתנה מנוהלת לחומרה מואצת בלבד, לא עובד על CPU

מה לבדוק לפני שמגדירים

לפני שמטמיעים את הרשימות החדשות ב-Python SDK v3, בדקו את מגבלות הזמינות הגיאוגרפית. באזור ישראל (il-central-1), היצע המופעים המואצים מוגבל לעיתים ביחס לאזורים מרכזיים בארצות הברית ובאירופה. צוותים ישראליים שמחויבים לרגולציה מקומית ולריבונות מידע אינם יכולים להפנות עומסים למחוזות אחרים. עליכם לוודא שהמופעים המוגדרים ברשימה אכן קיימים פיזית באזור וב-Subnet שהוקצו לעבודה. בנוסף, מומלץ לוודא שסקריפטי האימון מופעלים עם כלי דוגמת torchrun התומך בהקצאת תהליכים דינמית לפי כמות הכרטיסים הזמינה.

החומרה אולי מחכה בתור, אבל החשבון בסוף החודש יגיע בזמן.

שאלות ותשובות

מה שואלים על זה

אם הרשימה כוללת לפחות מופע מואץ אחד (GPU או Trainium), העבודה תיכנס לתור אירועים ותמתין להתפנות משאבים עד למגבלת הזמן שהוגדרה בפרמטר MaxPendingTimeInSeconds. אם המגבלה תפוג לפני שיתפנה שרת מתאים, העבודה תיכשל.

לא. SageMaker אינה מתערבת בקוד המודל או בניהול הזיכרון. האחריות על התאמת תמונת הקונטיינר, דרייברים של CUDA, ופרמטרי ריצה שמתאימים למופע שנבחר מוטלת במלואה על המשתמש.

ניתן להגדיר רשימה כזו לבדיקה ראשונית, אך מנגנון ההמתנה בתור אינו פעיל עליה. אם אף מופע CPU אינו זמין בסריקה הראשונית, העבודה תיכשל מיד והפרמטר MaxPendingTimeInSeconds יתעלם מהבקשה.

ניתן לשייך את המכסה השמורה כעדיפות ראשונה ברשימה. המערכת תנצל קודם את המכסה המוזלת והשמורה, ורק אם היא תפוסה לחלוטין, תגלוש אוטומטית לסוגי מופעים מבוססי On-Demand המופיעים בהמשך הרשימה.
מקורות
  1. Announcing instance preference lists for Amazon SageMaker AI training jobsaws.amazon.com · המקור
  2. Reserve Flexible Training Plans for ML workloads - Amazon SageMaker AIdocs.aws.amazon.com · מחירים
  3. Announcing instance preference lists for Amazon SageMaker AI training jobsaws.amazon.com · דוקומנטציה
  4. SageMaker AI Training Jobs - Amazon SageMaker AIdocs.aws.amazon.com · דוקומנטציה
  5. Data transformation workloads with SageMaker Processing - Amazon SageMaker AIdocs.aws.amazon.com · דוקומנטציה
  6. Amazon SageMaker AIaws.amazon.com · מקושר מההודעה
  7. MaxPendingTimeInSecondsdocs.aws.amazon.com · מקושר מההודעה
איך בדקנו

27 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ומול חיפוש ברשת ב־15 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.