GPT
N

Nemotron-Labs-Diffusion-3B

קוד פתוח

nvidiaother2026-03-02

  • transformers
  • safetensors
  • nemotron_labs_diffusion
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שפה קטן שמשלב פענוח רגיל עם דיפיוז'ן מקבילי באותו משקל. הוא נותן ייצור טקסט מהיר בהרבה מהמקובל בלי להחזיק מודל עזר נפרד לניחוש טוקנים.

  • 3.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 64,318הורדות בחודש

מה זה

הארכיטקטורה כאן שונה ממה שרץ בדרך כלל בגודל הזה. במקום לפעול רק בשיטה הרגילה של טוקן אחרי טוקן, הוא מחליף תבניות תשומת לב ומאפשר שלושה מצבי עבודה: פענוח רגיל, פענוח דיפיוז'ן מקבילי, ומצב היברידי שבו המודל מנחש לעצמו רצף טוקנים ובודק אותם באותו זיכרון מטמון.

בבדיקות של אנבידיה על גרסת השמונה מיליארד באותה משפחה, השיטה הזו השיגה קצב קבלת טוקנים גבוה פי שלושה מפתרונות ספקולציה חיצוניים ומהירות כפולה לעומתם. הרעיון הוא להעביר את העומס מרוחב הפס של הזיכרון לכוח החישוב, כך שטעינה אחת של המשקלים מפיקה כמה טוקנים ברצף.

מתאים ל

  • הסקה מקומית בזמן תגובה נמוך

    הפענוח המקבילי מקצר את זמן ההמתנה לטוקן ראשון ורצף שלם בחומרה מקומית.

  • שרת שירות בעומס משתנה

    מעבר גמיש בין דיפיוז'ן לפענוח רגיל מאפשר התאמה למספר משתמשים שונה על אותו כרטיס.

  • מחקר של שיטות פענוח חדשות

    מבנה הזיכרון המשותף מאפשר לבחון ספקולציה עצמית בלי להחזיק מודל טיוטה נפרד.

איפה זה נופל

המודל הזה הוא גרסת מעבדה ומחקר. אין בכרטיס שום פירוט על נתוני האימון, רמת הבטיחות שלו, או התמיכה בשפות שאינן אנגלית, מה שאומר שבדיקות בעברית תצטרכו לעשות לגמרי לבד. מעבר לזה, ניצול מלא של המהירות דורש סביבות ריצה מתקדמות ותמיכה בארכיטקטורת Tri-Mode, כך שאינטגרציה למוצר קיים אינה מיידית.

אותה משפחה

Nemotron-Labs-Diffusion יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך כרטיס מסך מיוחד של אנבידיה כדי להריץ אותו?

הוא רץ על כרטיסי מסך סטנדרטיים עם מספיק זיכרון, אבל כדי לראות את מכפילי המהירות שהוצגו בדוחות צריך תמיכה בקרנלים ייעודיים ובגרסאות תוכנה עדכניות.

במה הוא עדיף על מודל שלוש מיליארד רגיל?

במודלים רגילים כל טוקן דורש קריאה נפרדת של המשקלים מהזיכרון. כאן המודל מייצר ובודק מספר טוקנים במעבר אחד, מה שמקצר את זמן הריצה.

איך מריצים

המשקלים תופסים 7.3 גיגה בייט בדיוק של bfloat16, כך שכרטיס מסך בודד עם 12 עד 16 גיגה זיכרון יריץ אותו בקלות. תצטרכו להתקין גרסה חדשה מאוד של transformers, ספציפית חמש ומעלה, אחרת הארכיטקטורה הזו פשוט לא תטען בסביבה שלכם.

אם אתם צריכים תפוקה יציבה של מודל קטן בלי להתעסק עם קרנלים ייעודיים של CUDA או הגדרות מיוחדות של ספקולציה עצמית, קריאה לשרת מנוהל תהיה פשוטה יותר. הרצה עצמית שווה את הטרחה רק כשאתם באמת מנצלים את הפענוח המקבילי שלו כדי לחתוך זמני תגובה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-Diffusion-3B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Nemotron Open Model License. זה אינו רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT, אלא הסכם קנייני של אנבידיה. הוא מתיר שימוש מסחרי תחת תנאי ההסכם שלהם, אך מחייב בדיקה של ההגבלות המשפטיות המדויקות לפני הטמעה במערכות מסחריות.

הרישיון המלא בעמוד המודל ↗