GPT
מגזין · חדשנות · 4 דקות קריאה ·

אנבידיה קופצת בהסקה אבל לא מגלה כמה חשמל זה עולה

תוצאות MLPerf הראשונות של ארכיטקטורת Vera Rubin מבטיחות לחתוך את עלויות הריצה של מודלי ענק, אך מסתירות את המחיר האמיתי של 200 קילו-ואט למסד בודד.

מסד שרתים מתקדם מקורר נוזל בחוות שרתים מודרנית
מערכות מחשוב צפופות מקוררות נוזל דורשות תכנון מחדש של תשתיות החשמל והקירור איור: GPT.org.il
מה לעשות עכשיו
  • השאירו את תקציבי הרכש ללא שינוי עד לפרסום נתוני צריכת החשמל הרשמיים ומחירי המדף של מערכות הייצור.

גרפים של ביצועי חומרה הם סוג של שירה, אם מתעלמים מחשבון החשמל. בפרסום הרשמי של NVIDIA Vera Rubin NVL72 במבחני MLPerf Inference v6.1 יש שפע של קווים ירוקים שמטפסים גבוה למעלה. לפי החברה, הדור החדש מציג קפיצה עצומה בתפוקת טוקנים מול דור ה-GB300 הקודם. למי שמנהל תקציב ענן שמורכב ברובו משרתי הסקה למודלי שפה, זה נראה כמו כרטיס יציאה מהבוץ. עכשיו רק צריך לבדוק מה המפרט הטכני השאיר מחוץ לטבלאות החגיגיות.

המספרים בהחלט מפתים.

זינוק של פי שלושה על הנייר

התוצאות שהגישה אנבידיה למבחני MLPerf Inference v6.1 בחלוקה הסגורה מציגות תוספת כוח רצינית. במודל הוויזואלי Qwen3-VL, פלטפורמת Vera Rubin NVL72 הגיעה לתפוקה גבוהה פי 3.7 בהשוואה ל-GB300 NVL72, בתרחישי שרת ובתרחישי אופליין. הריצה הזו נעשתה באמצעות vLLM יחד עם שלד התוכנה NVIDIA Dynamo בקוד פתוח. במודל DeepSeek מדגם DeepSeek-R1, השיפור הגיע לפי 2.5 בשימוש בספריית TensorRT-LLM. מדובר בשניים מהמודלים הכבדים ביותר שרצים כיום בפרודקשן, כך שהבדיקה בהחלט פוגעת בנקודות הכואבות של ארכיטקטי תשתיות. לפי הניתוח ב-StorageReview, המספרים האלה מציבים רף ביצועים חדש לגמרי במבחני העמיתים של הארגון.

אבל כאן מגיע הצינון ההכרחי מתוך אותיות הפירוט הקטנות: התוצאות הללו נרשמו תחת קטגוריית Preview (רשומות 6.1-0106 ו-6.1-0074). בקטלוג של MLCommons, קטגוריית תצוגה מקדימה מייצגת חומרה שאינה זמינה כרגע לרכישה מדף מסחרית, אלא מערכות מעבדה מוקדמות שמכווננות בידי היצרן. במקביל, אנבידיה הציגה נתוני סקיילינג למערכות GB300 NVL72, שם אשכול של 288 מעבדים בארבעה מסדים שמר על 99 אחוזי יעילות בהרצת DeepSeek-R1. השרתים שקיימים היום בשוק אכן עובדים נפלא, אבל השרתים שמבטיחים לקרוע את הרף עדיין יושבים בסביבה מבוקרת. גם שותפות ענן מוקדמות כמו Nebius הגישו תוצאות תצוגה מקדימה דומות על אותה חומרה.

תקריב על חיבורי תקשורת ורכיבי מיתוג מהירים במסד שרתים
רוחב הפס בין המעבדים מכריע את היכולת לפצל את שלבי החישוב בין יחידות שונות איור: GPT.org.il

הטריק שמאחורי המספרים

הקפיצה במספרים אינה נס הנדסי אלא שילוב בין שינוי פיזי במבנה המחשוב לבין כיווץ אגרסיבי של נתונים. המערכת כוללת 72 מעבדי Rubin ו-36 מעבדי Vera, הפועלים כיחידה אחת. אנבידיה נעזרה בטכניקת disaggregated serving, שמפרידה לחלוטין בין שלב הטעינה הראשוני (prefill) לבין שלב יצירת הטוקנים (decode). החלוקה הזו מונעת מצווארי בקבוק להשבית מעבדים שלמים בזמן שהם מחכים להשלמת חישובי הקלט, במיוחד במודלים שמבוססים על ארכיטקטורת תערובת מומחים שבה מנותבות שכבות שונות של המודל בזמן אמת.

רובד נוסף מגיע מדיוק החישוב. שימוש בפורמט NVFP4 מכווץ את משקלי המודל ואת זיכרון ה-KV, מה שמפחית את נפח התעבורה הנדרש ומאפשר דחיסה של מנות עבודה גדולות בהרבה. כדי שכל זה יעבוד בלי שהשרת ייחנק מעיכובי סנכרון, המערכת נשענת על מיתוג NVLink דור 6 שמספק רוחב פס פנימי של 260 טרה-בייט לשנייה. רכיבי הקישוריות המהירים האלה פותחו במרכזי המו"פ של אנבידיה בישראל, ומספקים קצב חבילות גבוה פי 10 וזמן השהיה נמוך פי 3 בהשוואה לרשת אתרנט רגילה. בלי המיתוג הישראלי, כל החלוקה הזו הייתה קורסת בעומס.

לא הייתי ממהר לפתוח את הארנק.

Vera Rubin submissions heavily used disaggregated serving, separating prefill and decode along with large-scale expert parallelism for maximum efficiency.ההודעה הרשמית של NVIDIA

החשבון שלא מופיע בגרפים

ההודעה לעיתונות מלאה בנתוני תפוקה, אבל יש נתון אחד שנעדר לחלוטין: יעילות אנרגטית רשמית. בדיקות MLPerf v6.1 לא כללו מדידת אנרגיה מאומתת של טוקנים לוואט עבור מסד ה-Rubin NVL72. קל מאוד להציג מהירות מסחררת כשלא מודדים את שעון החשמל שרץ מאחור. מסד מחשוב כזה צפוי לדרוש תשתית הזנה וקירור של כ-200 קילו-ואט ליחידה בודדת, תצורה שמחייבת מעבר מלא לקירור נוזלי ישיר לרכיב. בהשוואה לכך, במבחני וידאו של הדור הקודם נרשם קצב של 0.65 סרטוני 720p לשנייה, תוך שמירה על יציבות תפעולית מוכרת.

תוספת תפוקה של פי שלושה מאבדת מהר מאוד את ההיגיון הכלכלי שלה אם צריכת החשמל ועלויות המסד מתנפחות באותו היחס בדיוק.

אם תרצו להתקין מסד כזה בישראל, תגלו מהר מאוד שרוב מתקני השרתים המקומיים פשוט לא בנויים לעמוד בהספקים כאלה לכל מטר רבוע. כשמחשבים החזר השקעה לתשתיות AI, מחיר הרכישה של החומרה, שמוערך במיליוני דולרים למסד בודד, הוא רק חלק מהמשוואה. כפי שמציינים במדריך המערכות של Powercon, מחירי הדורות הקודמים כבר דרשו תקציבי עתק. עלויות השדרוג של מערכות הצנרת, ממירי המתח וחוזי אספקת החשמל עלולות למחוק את החיסכון בעלות לטוקן.

השוואת ביצועים וארכיטקטורה בין מסדי שרתים להסקה
פרמטרGB300 NVL72Vera Rubin NVL72
סטטוס במבחני MLPerf v6.1זמין מסחרית (Available)תצוגה מקדימה (Preview)
יחס שיפור תפוקה ב-Qwen3-VLבסיס השוואה (1.0x)עד פי 3.7
יחס שיפור תפוקה ב-DeepSeek-R1בסיס השוואה (1.0x)עד פי 2.5
פורמט דיוק זיכרון ומשקליםFP8 / FP4NVFP4 מלא
צריכת חשמל ויעילות לוואטלא פורסם בבדיקהלא פורסם בבדיקה
רוחב פס מיתוג פנימיNVLink 5NVLink 6 (260TB/s)
תשתיות קירור תעשייתיות וצנרת חלוקת נוזלים במרכז נתונים
הספק של כ-200 קילו-ואט למסד מחייב היערכות פיזית שמעט מאוד חוות שרתים תומכות בה כיום איור: GPT.org.il

לא למהר להזמין מקום בחוות השרתים

אם אתם יושבים כעת על תקציבי התשתית לשנה הבאה, אין שום סיבה לעדכן הערכות רכש על בסיס הודעות יחסי הציבור של אתמול. הצעד ההגיוני הוא להמתין למבחני MLPerf הבאים, שבהם המערכות ייבחנו בקטגוריה המסחרית ותחת עומסי ייצור אמיתיים. ספקיות כמו CoreWeave כבר מקימות אשכולות בריבוי מסדים לבדיקות, אך עדיין מדובר בפריסות ייעודיות בלבד. במקביל, כדאי לעקוב אחרי המענה של AMD עם סדרת מאיצי MI355X, שעשויה להציע חלופת עלות מעניינת בהרצת מודלי קוד פתוח ללא תלות מלאה בציוד התקשורת הייעודי של אנבידיה.

בדיקה מעשית שכן אפשר להתחיל לבצע כבר עכשיו בארגון היא מיפוי חוזי האחסון ומוכנות מרכז הנתונים שלכם לקירור נוזלי ישיר. אם חוות השרתים שלכם מתקשה לספק 40 קילו-ואט למסד, הדיון על Rubin הוא תיאורטי בלבד. בינתיים, השרתים הקיימים עושים את העבודה, וחשבון החשמל של חודש הבא לפחות צפוי מראש.

שאלות ותשובות

מה שואלים על זה

קטגוריית Preview מציגה ביצועים של מערכות פיתוח והנדסה שטרם הגיעו לייצור המוני מסחרי. תוצאות אלו משקפות פוטנציאל מעבדתי מיטבי, אך הן אינן מבטיחות זמינות מיידית לרכישה או מחירים סופיים בשוק החופשי.

השיפור הגבוה ביותר נרשם במודל הראייה והשפה Qwen3-VL, שבו נרשמה תפוקה של עד פי 3.7 לעומת GB300 NVL72. במודל החשיבה DeepSeek-R1 נרשם שיפור של עד פי 2.5.

תשתית הקישוריות המרכזית, הכוללת את מיתוג ה-NVLink דור 6 ורשתות התקשורת המהירות בקצב 260 טרה-בייט לשנייה, מפותחת במרכזי הפיתוח של אנבידיה בישראל, על בסיס הידע של חברת מלאנוקס שנרכשה בעבר.

לפי אנבידיה, השימוש בדיוק נמוך של NVFP4 מקטין משמעותית את נפח הזיכרון הנדרש למשקלים ול-KV Cache תוך פגיעה מזערית באיכות הפלט של המודלים, אם כי מידת ההשפעה המדויקת תלויה ברגישות המשימה הספציפית.
מקורות
  1. NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debutblogs.nvidia.com · המקור
  2. MLPerf Inference v6.1 and Vera Rubin Peer-Reviewed Numbersstoragereview.com · קריאה נוספת
  3. מדריך שרתי בינה מלאכותית וניתוח מעבר ל-Vera Rubin NVL72powercon.co.il · קריאה נוספת
  4. CoreWeave Brings Up Multi-Rack NVIDIA Vera Rubin NVL72 Clusterinvestors.coreweave.com · קריאה נוספת
  5. mixture-of-expertsnvidia.com · מקושר מההודעה
איך בדקנו

29 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ומול חיפוש ברשת ב־16 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.