GPT
N

Nemotron-Labs-Diffusion-8B

קוד פתוח

nvidiaother2026-03-18

  • transformers
  • safetensors
  • nemotron_labs_diffusion
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שפה בגודל שמונה וחצי מיליארד פרמטרים שמחליף בין פענוח רגיל לפענוח מקבילי מבוסס דיפיוז'ן. הוא מציע האצה משמעותית ביצירת טקסט בלי להחזיק מודל עזר נפרד לחיזוי.

  • 8.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 107,476הורדות בחודש

מה זה

במקום לפלוט טוקן בודד בכל צעד, המודל הזה מציע שלושה מצבי עבודה שונים לחלוטין באותו משקל: פענוח רגיל צעד אחר צעד, פענוח מקבילי בדיפיוז'ן, ומצב משולב שבו הוא מנחש טוקנים בדיפיוז'ן ובודק את עצמו מיד בפענוח רגיל עם אותו זיכרון עבודה. החלפת המצבים בזמן ריצה נעשית רק על ידי שינוי תבנית תשומת הלב של השכבות.

במבחני ביצועים בסביבת SGLang מול Qwen3-8B-Eagle3, המצב המשולב הציג אורך קבלה גבוה פי שלושה ומהירות כפולה פי 2.2. בהשוואה למודל רגיל בלי מנגנון חיזוי מקבילי, הוא מייצר פי 5.9 יותר טוקנים בכל מעבר חישובי קדימה, מה שמעביר את צוואר הבקבוק מרוחב הפס של הזיכרון אל כוח החישוב של המעבד הגרפי.

מתאים ל

  • האצת שרתים מקומיים

    מתאים לשרתים שבהם נדרשת מהירות פליטה גבוהה למשתמש יחיד בלי להריץ מודל טיוטה נפרד ברקע.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 262,144 טוקנים מתאים לניתוח טקסטים כבדים תוך שמירה על זיכרון מטמון משותף.

  • הרצה חסכונית במשאבים

    מעבר לכימות w4a16 מאפשר להגיע לקצבים של מעל 100 טוקנים לשנייה גם בחומרה מוגבלת יחסית.

איפה זה נופל

הארכיטקטורה חדשה ודורשת ספריות תשתית עדכניות מאוד שתומכות בהחלפת תבניות תשומת הלב בזמן אמת, מה שעלול להקשות על הטמעה מהירה במערכות קיימות. בנוסף, המסמך הטכני מציין שדרוש מחקר עתידי על שיטות דגימה כדי למצות את מלוא פוטנציאל המהירות שלו, וכרטיס המודל אינו מפרט תוצאות מבחני בנצ'מרק על משימות שפה ספציפיות או רמת תמיכה בעברית.

אותה משפחה

Nemotron-Labs-Diffusion יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד מודל נוסף כדי להשתמש במצב הניחוש המהיר?

לא. המודל מייצר טיוטות בדיפיוז'ן ובודק אותן בעצמו בפענוח רגיל דרך אותו זיכרון עבודה. ישנה רק אפשרות לתוסף LoRA אופציונלי להגדלת אורך הניחושים.

מה נדרש מבחינת תוכנה כדי להפעיל אותו?

יש צורך בהתקנת transformers מגרסה 5.0.0 לפחות. הרצה במהירויות המרביות של מעל 1000 טוקנים לשנייה דורשת קרנלים מותאמים של CUDA וחומרה ייעודית תואמת.

איך מריצים

המודל שוקל 16.0 גיגה בייט ומגיע בפורמט bfloat16 על פני 23 קבצים. כדי להריץ אותו צריך גרסת transformers מעודכנת של 5.0.0 ומעלה, וכרטיס שמסוגל להחזיק את כל המשקלים יחד עם זיכרון העבודה עבור חלון ההקשר הגדול שמגיע עד 262,144 טוקנים.

לפי נתוני היצרן, במערכת DGX Spark בהרצה בודדת עם כימות w4a16 המודל מייצר 112 טוקנים לשנייה, לעומת 41.8 במצב רגיל. במערכות חזקות כמו GB200 עם קרנלים ייעודיים של CUDA הוא מגיע לקצב של עד 1015 טוקנים לשנייה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-Diffusion-8B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הרשמי של אנבידיה המכונה NVIDIA Nemotron Open Model License, והוא מסווג תחת other. יש להיכנס לתנאי הרישיון המקוריים כדי לבדוק הגבלות שימוש מסחרי, הפצה או חובות דיווח לפני שילוב במוצר.

הרישיון המלא בעמוד המודל ↗