GPT
N

Nemotron-Labs-Diffusion-14B

קוד פתוח

nvidiaother2026-04-22

  • transformers
  • safetensors
  • nemotron_labs_diffusion
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שפה של אנבידיה שמשלב פענוח רגיל עם פענוח מקבילי מבוסס דיפיוז'ן. הוא מיועד למי שרוצה קצב יצירת טוקנים גבוה בלי להחזיק מודל עזר נפרד לניחוש טיוטות.

  • 14Bפרמטרים
  • 262,144טוקנים בהקשר
  • 25.4 GBמשקל הקבצים
  • 17,146הורדות בחודש

מה זה

הארכיטקטורה כאן שונה ממודלי שפה רגילים. במקום לבחור בין יצירה רציפה איטית של טוקן אחרי טוקן לבין שיטות ניחוש שדורשות שני מודלים שונים, אותו מודל פועל בשלושה מצבים על ידי שינוי תבנית תשומת הלב בזמן הריצה. המצב המעניין ביותר הוא ספקולציה עצמית, שבה המודל מייצר טיוטת טוקנים במקביל באמצעות דיפיוז'ן ובודק אותה בעצמו בריצה רגילה עם זיכרון משותף.

בפועל המטרה היא להזיז את צוואר הבקבוק ממהירות הגישה לזיכרון אל כוח החישוב של המעבד הגרפי. המשקלים נטענים פעם אחת ומחשבים כמה טוקנים במקביל. לפי הנתונים שאנבידיה מציגה על גרסת השמונה מיליארד באותה משפחה, השיטה הזו משיגה אורך קבלה גבוה פי שלושה ומהירות כפולה בהשוואה לפתרונות ניחוש קיימים, תוך שמירה על אותה רמת דיוק של ריצה רגילה.

מתאים ל

  • שרתי הסקה עם שיהוי נמוך

    יצירת טוקנים מהירה במיוחד בפנייה בודדת בזכות ניחוש מקבילי מבוסס דיפיוז'ן.

  • עיבוד מסמכים ארוכים

    תמיכה בחלון הקשר ענק של 262,144 טוקנים לניתוח טקסטים מקיפים.

  • הסקה חסכונית במודל בודד

    ניחוש ואימות טיוטות באותו המודל עם זיכרון משותף, בלי להחזיק מודל טיוטה נפרד.

איפה זה נופל

הכרטיס מדגיש תוצאות מהירות בעיקר על מודל ה־8B בחומרה ייעודית כמו GB200 או DGX Spark, ולא מפרט תוצאות ביצועים מלאות עבור גרסת ה־14B עצמה. מעבר לכך, מיצוי הפוטנציאל של הפענוח המקבילי דורש תמיכה מותאמת בתוכנת ההרצה, כמו קרנלים ייעודיים של קודה או תמיכה ב־SGLang. ללא התאמה כזו, המודל פשוט ירוץ במצב רגיל ואיטי בלי יתרון מורגש.

אותה משפחה

Nemotron-Labs-Diffusion יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים מודל עזר קטן יותר כדי להריץ ספקולציה?

לא. המודל מייצר את הטיוטה בעצמו באמצעות מצב דיפיוז'ן ומאמת אותה בעצמו, תוך שימוש באותו זיכרון מטמון קיים.

כמה זיכרון כרטיס מסך נדרש להרצה שלו?

המשקלים תופסים כ־25.4 גיגה בייט בפורמט bfloat16. להרצה בסיסית דרוש כרטיס של 32 גיגה בייט לפחות, ועבור חלונות הקשר גדולים תידרש חומרה מקצועית נוספת.

איך מריצים

כדי להריץ אותו צריך ספריית transformers בגרסה 5.0.0 לפחות. קובצי המשקלים לבדם שוקלים 25.4 גיגה בייט בפורמט bfloat16, כך שצריך כרטיס עם לפחות 32 גיגה בייט זיכרון כדי להעלות אותו, ועוד זיכרון נוסף בשביל חלון הקשר ארוך.

המפרט מציע אפשרות להוסיף מתאם LoRA מיוחד לשיפור שלב הדיפיוז'ן, מה שמגדיל עוד יותר את מספר הטוקנים שמתקבלים בכל מחזור חישוב. אם אין לכם חומרה ייעודית של אנבידיה עם קרנלים מותאמים שמנצלים את שיטת הפענוח הזו, ריצה מקומית על כרטיס ביתי פשוט תאבד את כל יתרון המהירות שלשמו המודל נבנה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-Diffusion-14B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Nemotron Open Model License. זהו אינו רישיון קוד פתוח סטנדרטי מסוג MIT או Apache, אלא הסכם ייעודי של אנבידיה שמכיל תנאים והגבלות משפטיות משלו. מי שמתכנן לשלב אותו במוצר מסחרי חייב לקרוא את נוסח הרישיון המלא ולוודא שהשימוש המיועד מותר תחת תנאי החברה.

הרישיון המלא בעמוד המודל ↗