GPT
N

NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF

קוד פתוח

unslothother2026-06-04

  • transformers
  • gguf
  • nemotron_h
  • text-generation
  • unsloth

מודל ענק שמיועד למערכות סוכנים, חשיבה רב-שלבית ועיבוד מסמכים ארוכים מאוד. הוא מפעיל רק 55 מיליארד פרמטרים בכל שלב, מה שמאפשר ביצועים גבוהים בלי לשלם את מלוא עלות החישוב.

  • 262,144טוקנים בהקשר
  • 7.5 TBמשקל הקבצים
  • 7,078הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורה היברידית של Mamba-2 יחד עם Mixture of Experts ושכבות תשומת לב. הסך הכולל עומד על 550 מיליארד פרמטרים, אבל מנגנון הניתוב מעיר רק 55 מיליארד בכל טוקן, כך שמקבלים רוחב ידע עצום עם מהירות של מודל קטן בהרבה. המודל מייצר קודם שרשרת חשיבה ורק אחר כך פולט את התשובה הסופית, ואת מנגנון החשיבה הזה אפשר להדליק או לכבות ישירות בבקשה.

במבחני הביצועים הוא מציג תוצאות מעורבות ביחס לגודל שלו. בפתרון בעיות קוד מעשיות ב־SWE-Bench הוא מגיע ל־71.9 אחוז, תוצאה חזקה שמציבה אותו קרוב למודלים המובילים בעולם, וב־GPQA בלי כלים הוא משיג 87 אחוז. מצד שני, במשימות גלישה ברשת ב־BrowseComp הוא מקבל רק 44.4 אחוז, ובמשימות בנקאות מורכבות ב־TauBench הוא נופל ל־22.6 אחוז בלבד, מה שמראה שסוכנים אוטונומיים עדיין דורשים הגבלה הדוקה כדי לא לטעות.

המודל כולל תמיכה מובנית בריבוי טוקנים לחיזוי קדימה, מה שמאיץ את קצב הפליטה ומאפשר פענוח ספקולטיבי טבעי. חלון ההקשר שלו מגיע עד מיליון טוקנים, ובמבחן RULER לשליפה מתוך מיליון טוקנים הוא שומר על דיוק של 94.7 אחוז.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של עד מיליון טוקנים עם דיוק של 94.7 אחוז ב־RULER מאפשר סריקת ספריות קוד ומסמכים שלמים.

  • פתרון בעיות קוד מורכבות

    עם ציון של 71.9 אחוז ב־SWE-Bench Verified, הוא מתאים לתיקון באגים אמיתיים במאגרי תוכנה.

  • חישוב ומדע עם כלים

    במבחן IMOAnswerBench עם כלי עזר הוא מגיע ל־92.3 אחוז, מה שמספק דיוק גבוה בהסקה כמותית.

איפה זה נופל

המודל חלש מאוד במשימות שדורשות הבנה מעמיקה של עולם הבנקאות, שם הוא צנח ל־22.6 אחוז ב־TauBench. הוא גם מתקשה במחקר מבוסס גלישה ברשת עם 44.4 אחוז בלבד ב־BrowseComp. בנוסף, רשימת השפות הנתמכות לא כוללת עברית, והיא מוגבלת לאנגלית, צרפתית, ספרדית, איטלקית, גרמנית, פורטוגזית, יפנית, קוריאנית, הינדי וסינית. אם אתם בונים מוצר לשוק המקומי בישראל, תצטרכו לבדוק את איכות הפלט בעברית בעצמכם לפני כל שילוב במערכת ייצור.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי GPU חזקים?

לא. המודל דורש לפחות שמונה מעבדי B200 בשרת יחיד או לפחות שמונה מעבדי H200 באשכול מקושר. הזיכרון המצרפי הנדרש להחזקת המשקלים וההקשר מגיע ל־1.5 טרה-בייט.

האם המודל מתאים ליישומי שירות לקוחות בעברית?

הכרטיס מפרט תמיכה בשפות ספציפיות ועברית אינה מופיעה ביניהן. בנוסף, המודל הציג ציונים נמוכים במיוחד בתרחישי שירות לקוחות בנקאיים, ולכן הוא לא מתאים למשימות כאלה ללא בדיקה מעמיקה.

איך מריצים

אי אפשר להריץ את המודל הזה על שרת פשוט. החומרה המינימלית דורשת שרת ייעודי עם שמונה כרטיסי B200 בעלי זיכרון מצרפי של 1.5 טרה-בייט, או אשכול של לפחות שמונה כרטיסי H200 או 16 כרטיסי H100 שמחוברים יחד ברשת מהירה עם Ray. ההרצה נעשית בסביבת לינוקס דרך מנועים כמו vLLM או SGLang.

מאגר ה־GGUF הזה כולל עשרות קבצים שמגיעים יחד לנפח של 7.5 טרה-בייט. אם אין לכם גישה למערך מחשוב ארגוני כזה, עדיף בהרבה להשתמש ב־API של NVIDIA במקום לנסות להחזיק את המודל בעצמכם.

ollama run hf.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

206 קבצים במאגר, 7.5 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון OpenMDW גרסה 1.1, שלפי כרטיס המודל מתיר שימוש מסחרי וגם שימוש שאינו מסחרי. עם זאת, Hugging Face מסמן את הרישיון כ־other, ולכן מומלץ לקרוא את נוסח ההסכם המלא של OpenMDW לפני הטמעה במוצר מסחרי כדי לוודא שאין בו הגבלות הפצה או חובות דיווח ספציפיות.

הרישיון המלא בעמוד המודל ↗