GPT
L

Llama-3_1-Nemotron-Ultra-253B-v1

קוד פתוח

nvidiaother2025-04-07

  • transformers
  • safetensors
  • nemotron-nas
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה דחוסה של לאמה 405B שנועדה לתת יכולות חשיבה עמוקות על שרת בודד. היא מתאימה למי שצריך ביצועים חזקים במתמטיקה וקוד בלי להחזיק אשכול של עשרות כרטיסים.

  • 253Bפרמטרים
  • 131,072טוקנים בהקשר
  • 472 GBמשקל הקבצים
  • 1,617הורדות בחודש

מה זה

מדובר במודל שנגזר ישירות מלאמה 3.1 405B באמצעות חיפוש ארכיטקטורה עצבי, שדילג על שכבות קשב ואיחד שכבות הזנה קדימה. התוצאה היא מבנה פנימי לא אחיד שמכווץ את הדרישות אבל שומר על היכולות של המקור בזכות זיקוק ידע ואימון המשך. הוא כולל מצב חשיבה מובנה שניתן להדליק ולכבות דרך הפרומפט של המערכת.

המדידות מראות הבדל עצום בין המצבים. בבדיקת המתמטיקה של AIME25 המודל מזנק מתוצאה של 16.67 כשהחשיבה כבויה ל־72.50 כשהיא פעילה, ובמבחן הקוד של לייבקודבנץ' מ־29.03 ל־66.31. לעומת זאת, במשימות של קריאת כלים ובדיקת מעקב אחר הוראות, ההבדל בין המצבים כמעט לא קיים ועומד על פחות מאחוז בודד.

מתאים ל

  • פתרון בעיות קוד מורכבות

    מצב החשיבה מגיע לציון 66.31 בלייבקודבנץ', מה שמאפשר לו לכתוב אלגוריתמים מורכבים במעבר יחיד.

  • סוכני אוטונומיה וקריאת כלים

    הוא מגיע עם דיוק של מעל 74 נקודות במבחן BFCL V2 ומיועד להפעלת פונקציות בפורמט מוגדר מראש.

  • מערכות RAG עם הקשר ארוך

    תמיכה בחלון של 131,072 טוקנים מאפשרת לנתח מסמכים טכניים כבדים בלי לאבד פרטים בדרך.

איפה זה נופל

הנתונים שעליהם המודל אומן נעצרים בשנת 2023, בדיוק כמו מודל המקור של מטא. חוץ מזה, אין כאן תמיכה מובנית בעברית, והתיעוד מציין במפורש רק אנגלית, שפות תכנות ומספר שפות אירופיות ואסיאתיות נבחרות.

המגבלה הכי חשובה היא ההתנהגות של מצב החשיבה. ללא הדלקת המצב הזה דרך הפרומפט, היכולות האלגוריתמיות והלוגיות שלו צונחות לרמה בסיסית מאוד, והפעלת המצב מייצרת תגיות חשיבה שצריך לנקות בצד הלקוח אם המודל החליט שלא נדרש עיבוד מעמיק.

שאלות
נפוצות

איך שולטים במצב החשיבה של המודל?

מעבירים בפרומפט המערכת את המחרוזת detailed thinking on או detailed thinking off. אנבידיה ממליצה שלא להוסיף הוראות מערכת נוספות מעבר לזה, אלא לכתוב את כל ההנחיות בתוך פרומפט המשתמש.

האם המודל יודע לעבוד בעברית?

התיעוד הרשמי מציין אנגלית, שפות קוד ושבע שפות נוספות כמו גרמנית, צרפתית והינדי, אך עברית אינה מופיעה ברשימה. מומלץ לבדוק את איכות הפלט לפני שמייעדים אותו לעיבוד טקסטים מקומיים.

איך מריצים

כדי להריץ אותו בפורמט ביפלוט16 מלא תצטרכו שרת עם שמונה כרטיסי H100 של 80 גיגה, או ארבעה כרטיסי B100. אם תמירו אותו לפורמט FP8, אפשר לרדת לארבעה כרטיסי H100. מריצים אותו ישירות מעל vLLM עם פרלליזם של 8 או דרך ספריית טרנספורמרס בגרסה 4.48.3 ומעלה עם התאמת קוד מרוחק.

אם אין לכם שרת כזה שזמין עכשיו בענן, אין מה לנסות להוריד 472 גיגה של משקלים לסביבה מקומית. במקרה כזה עדיף לפנות ישירות ל־API של אנבידיה בבילד כדי לבדוק אם הוא בכלל פותר את הבעיה שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3_1-Nemotron-Ultra-253B-v1")
print(pipe("שלום"))

הקבצים

79 קבצים במאגר, 472 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הפתוח של אנבידיה יחד עם תנאי הקהילה של לאמה 3.1. מותר להשתמש בו לצרכים מסחריים בתוך מוצרים, אבל חובה לעמוד בהגבלות השימוש והבטיחות שהוגדרו במסמכי המקור של שתי החברות.

הרישיון המלא בעמוד המודל ↗