GPT
L

Llama-3_3-Nemotron-Super-49B-v1_5

קוד פתוח

nvidiaother2025-07-25

  • transformers
  • safetensors
  • nemotron-nas
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה דחוסה של לאמה 70B שעברה אופטימיזציה של אנבידיה כדי להגיע לביצועי חשיבה וקריאת כלים גבוהים, אבל עם דרישות זיכרון שמאפשרות להריץ אותה על חומרה צנועה יותר.

  • 50Bפרמטרים
  • 131,072טוקנים בהקשר
  • 92.9 GBמשקל הקבצים
  • 15,408הורדות בחודש

מה זה

אנבידיה לקחה את Llama-3.3-70B-Instruct וגילפה ממנה מודל של כמעט 50 מיליארד פרמטרים בעזרת חיפוש ארכיטקטורה. בחלק מהשכבות הוסר מנגנון הקשב לחלוטין ובאחרות שונה גודל השכבות הפנימיות, כך שהמשקל ירד בלי לרסק את היכולות. הדגש כאן הוא על משימות חשיבה מורכבות, מתמטיקה, קוד והפעלת סוכנים ופונקציות חיצוניות.

במדדים של חשיבה כבדה המודל מציג 97.4 ב־MATH500 ו־87.5 ב־AIME 2024, שהם ציונים חזקים מאוד לגודל הזה. עם זאת, במבחן הקשה במיוחד Humanity's Last Exam הוא מגרד רק 7.64, מה שמבהיר שלא מדובר במודל ענק שמבין הכול, אלא בכלי שמכוון בעיקר לפתרון בעיות טכניות, מעקב אחר הוראות מדויקות וחיבור לכלים חיצוניים.

מתאים ל

  • סוכני קוד וקריאה לכלים

    אימון ייעודי על קריאת פונקציות וביצועי LiveCodeBench הופכים אותו למנוע טוב לסוכנים אוטונומיים.

  • מערכות RAG מורכבות

    תמיכה בחלון הקשר של 128k טוקנים מאפשרת לו לנתח מסמכים טכניים ארוכים באנגלית ולחלץ תשובות מדויקות.

  • פתרון בעיות מתמטיות

    מצב החשיבה המובנה מביא תוצאות גבוהות במיוחד ב־MATH500 עבור ארגונים שצריכים חישוב והיגיון לוגי.

איפה זה נופל

עברית לא נכללת ברשימת השפות הנתמכות, שכוללת אנגלית ומספר שפות אירופיות לצד הינדי ותאי, כך שכל טקסט מקומי ידרוש בדיקה מחמירה. נתוני האימון הבסיסיים נעצרים בשנת 2023, בדיוק כמו במודל המקור. ברירת המחדל מפעילה מצב חשיבה ארוך שמעלה את זמן התגובה, ואם רוצים תשובה מהירה צריך לנטרל אותו במפורש עם no_think בהנחיית המערכת.

שאלות
נפוצות

האם המודל תומך בעברית לפיתוח יישומים מקומיים?

הכרטיס מציין רשמית רק אנגלית, שפות אירופיות בודדות, תאי והינדי. המודל אולי יזהה מילים בעברית בזכות משקלי הבסיס של לאמה, אך הביצועים והדיוק לא מובטחים ולא הייתי בונה עליו למוצר בעברית.

איך מבטלים את החשיבה הארוכה כדי לקבל תשובות מהירות?

ברירת המחדל מפעילה תהליך חשיבה לפני כל פלט. כדי לבטל אותו ולהאיץ את המענה, צריך להוסיף את המחרוזת no_think להנחיית המערכת ולהשתמש בפענוח מסוג greedy.

איך מריצים

כדי להריץ אותו במשקל המקורי של bfloat16 צריך להתמודד עם כמעט 93 ג'יגה־בייט של משקולות. אנבידיה בדקה אותו על שני כרטיסי A100 או H100 של 80GB, ובתיעוד של vLLM הם מדגימים פריסה על שמונה כרטיסים במקביל עם חלון הקשר של 64k. אם יש לכם כרטיס בודד של H200 המודל אמור להידחס אליו גם בעומסים גבוהים.

למי שאין שרת ייעודי כזה בחצר או בענן, הרצה מקומית תהיה יקרה וכבדה מאוד. במצב כזה עדיף לקרוא לו דרך ה־API של אנבידיה ב־build.nvidia.com במקום לשלם על שרת מרובה כרטיסים שעומד ללא שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3_3-Nemotron-Super-49B-v1_5")
print(pipe("שלום"))

הקבצים

47 קבצים במאגר, 92.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הדגמים הפתוח של אנבידיה ובנוסף לרישיון הקהילתי של Llama 3.3. המודל מוגדר כמוכן לשימוש מסחרי, אך הוא דורש עמידה בתנאים המגבילים של שני ההסכמים הללו לפני שילוב שלו במוצר פעיל.

הרישיון המלא בעמוד המודל ↗