GPT
L

Llama-3_3-Nemotron-Super-49B-v1

קוד פתוח

nvidiaother2025-03-16

  • transformers
  • safetensors
  • nemotron-nas
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל הדגל מבית מטא שנועדה לתת יכולות חשיבה ופתרון בעיות בלי לדרוש אשכול שרתים שלם. הוא מתאים למי שחייב מודל לוגיקה חזק שיכול להיכנס לחומרה קטנה יותר.

  • 50Bפרמטרים
  • 131,072טוקנים בהקשר
  • 92.9 GBמשקל הקבצים
  • 134,026הורדות בחודש

מה זה

מדובר במודל שנגזר ישירות מ־Llama-3.3-70B-Instruct באמצעות חיפוש ארכיטקטורה עצבית ששינה את מבנה השכבות, דילג על חלק מפעולות הקשב ושינה את גודל שכבות ה־FFN. המטרה היתה לחתוך את המשקל ל־50 מיליארד פרמטרים בלי לשבור את הביצועים, תוך שילוב זיקוק ידע ואימון ייעודי למתמטיקה, קוד והפעלת כלים.

התוצאות בכרטיס מראות שהכיווץ הצליח בעיקר כשתכונת החשיבה מופעלת. במבחן AIME25 המודל מזנק מציון נמוך של 13.33 במצב רגיל ל־58.4 כשהוא חושב, וב־MATH500 הוא עולה מ־74 ל־96.6. עם זאת, ב־BFCL V2 שבודק הפעלת כלים הוא מקבל 73.7, כך שמדובר בביצוע סביר אך לא מוביל במשימות אוטומציה מורכבות.

מתאים ל

  • פתרון בעיות מתמטיות

    מצב החשיבה המובנה מקפיץ את הדיוק ל־96.6 אחוז במבחן MATH500 ומאפשר ניתוח חישובים שלב אחר שלב.

  • כתיבת קוד ובדיקות

    מגיע לתוצאה של 91.3 אחוז ב־MBPP במצב חשיבה, ועבר כוונון ייעודי למשימות תכנות.

  • יישום סוכני AI ו־RAG

    כולל תמיכה בהקשר של 128 אלף טוקנים ואימון ייעודי לפענוח כלים וקריאות פונקציה.

איפה זה נופל

הנתונים ששימשו לאימון הראשוני שלו נעצרים בשנת 2023, בדיוק כמו במודל המקורי שעליו הוא נשען. בנוסף, הוא אומן בעיקר באנגלית ולשפות כמו צרפתית, גרמנית או תאילנדית יש רק תמיכה משנית, כשעברית כלל אינה מופיעה ברשימת השפות הרשמיות של הכרטיס. אם המערכת שלכם נשענת על שליפת עובדות עדכניות או תקשורת בעברית, צפויה ירידה באיכות. כדאי גם לשים לב שהפעלת החשיבה מוסיפה בלוק של think לתשובה, מה שמייקר את כמות הטוקנים שנוצרים בכל קריאה.

שאלות
נפוצות

האם המודל מתאים לעבודה שוטפת בעברית?

הכרטיס מצהיר על תמיכה באנגלית ועוד כמה שפות נבחרות כמו ספרדית וצרפתית, אך עברית לא מוזכרת. המודל עשוי לייצר עברית סבירה בזכות הירושה ממטא, אבל הוא לא עבר אופטימיזציה לשפה הזו.

איך שולטים במצב החשיבה בזמן קריאה למודל?

השליטה נעשית ישירות דרך פרומפט המערכת באמצעות המחרוזת detailed thinking on או off. במצב פעיל המודל יוסיף תגיות think לפני התשובה הסופית, ודורש הגדרות טמפרטורה שונות מאשר במצב כבוי.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 תצטרכו שני כרטיסי H100 או שני A100 של 80 גיגה בייט, שכן המשקל לבדו תופס כ־93 גיגה בייט לפני שחישבתם את זיכרון ההקשר. החברה מציינת שתמיכה בכרטיס H100 בודד ב־FP8 תגיע בהמשך, אך כרגע הרצה מקומית דורשת שרת ייעודי ויקר.

אם אין לכם גישה לחומרה כזו, אנבידיה מספקת גישה למודל דרך ממשק ה־API שלה. במצב חשיבה יש לשלוח בהוראת המערכת detailed thinking on ולהגדיר טמפרטורה של 0.6, בעוד שבמצב רגיל מומלץ לכבות את החשיבה ולדגום בצורה דטרמיניסטית לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3_3-Nemotron-Super-49B-v1")
print(pipe("שלום"))

הקבצים

47 קבצים במאגר, 92.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model ובנוסף לתנאי הקהילה של Llama 3.3. הכרטיס מציין שהמודל מאושר לשימוש מסחרי, אך יש לקרוא את התנאים המשולבים של שני ההסכמים לפני הפצה בתוך מוצר.

הרישיון המלא בעמוד המודל ↗