GPT
D

diffusiongemma-26B-A4B-it-NVFP4

קוד פתוח

nvidiaapache-2.02026-06-10

  • safetensors
  • diffusion_gemma
  • nvidia
  • ModelOpt
  • DiffusionGemma-26B-A4B-IT

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל מולטימודלי שמייצר טקסט במקביל דרך דיפוזיה, ולא טוקן אחרי טוקן. הוא מתאים למי שחייב מהירות תגובה קיצונית מקלט של טקסט, תמונה או וידאו.

  • 14Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.6 GBמשקל הקבצים
  • 108,438הורדות בחודש

מה זה

במקום הארכיטקטורה הרגילה שפולטת מילה אחר מילה, המודל הזה מבוסס על דיפוזיה שמייצרת בלוקים של 256 טוקנים במקביל. הבסיס הוא ארכיטקטורת תערובת מומחים עם 25.2 מיליארד פרמטרים בסך הכול, אבל רק 3.8 מיליארד מהם פעילים בכל רגע נתון. NVIDIA לקחה את המודל המקורי של גוגל ודחסה אותו לפורמט NVFP4 של 4 ביט כדי לחסוך זיכרון ולהאיץ את הריצה, כשהוא מגיע לקצב של מעל 1,100 טוקנים בשנייה בחומרה נתמכת.

מבחינת יכולות, הוא מקבל טקסט, תמונות ברזולוציות משתנות וסרטוני וידאו של עד 60 שניות בקצב של פריים לשנייה, ופולט טקסט. המדידות מראות שהדחיסה כמעט ולא פגעה ביכולת שלו, כשבמבחני חשיבה מתמטית כמו AIME 2025 הוא ירד מ־68.33% ל־67.33%, ובמבחני תכנות כמו HumanEval הוא אפילו רשם 95% לעומת 94.09% במקור.

מתאים ל

  • ניתוח מסמכים וטפסים

    הוא מטפל בתמונות וקבצי PDF ומחלץ נתונים מובנים בעזרת פלט JSON מובנה ותמיכה בהקשר ארוך.

  • תחקור קטעי וידאו קצרים

    הוא מנתח קבצי וידאו של עד דקה ומאפשר לתשאל אותם במהירות בלי צורך בחיתוך ידני של פריימים.

  • סוכני אוטומציה וקוד

    השילוב של תמיכה בקריאת פונקציות, מצב חשיבה וציון גבוה של 95% ב־HumanEval מתאים לביצוע משימות פיתוח.

איפה זה נופל

המודל פולט לפעמים טקסט לא מדויק, משמיט פרטים מהותיים ומייצר תוכן מיותר או פוגעני גם כשלא ביקשתם ממנו, בעקבות הטיות בנתוני האימון מהרשת. נוסף על כך, הוא מוגבל לווידאו של עד דקה בלבד, והכרטיס מציין במפורש שהוא לא מטשטש פנים או שומר על פרופורציות של דמויות שמופיעות בקלטים הוויזואליים. אם אתם בונים שירות שמעבד מסמכים רגישים או תמונות של אנשים, חובה להפעיל שכבות בדיקה וסינון לפני שהפלט מגיע למשתמש.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ביתיים מסדרת RTX?

לא מומלץ. הפורמט NVFP4 מותאם לחומרת Hopper ו־Blackwell של NVIDIA, וכרטיסים ללא תמיכה מתאימה בחומרה לא ינצלו את הדחיסה או לא יריצו אותו כלל.

במה שיטת הדיפוזיה שונה ממודלים רגילים כמו Llama?

מודל רגיל מייצר מילה אחת בכל צעד חישובי, בעוד שמודל דיפוזיה מייצר בלוק של 256 טוקנים במקביל, מה שמאפשר קצב ייצור מהיר משמעותית.

איך מריצים

כדי להריץ אותו צריך מנוע vLLM ומאיץ מהדורות החדשים של NVIDIA, ספציפית Hopper כמו H100 או Blackwell כמו B100 שתומכים בפורמט NVFP4. משקל הקבצים עומד על 17.6 גיגה בייט, כך שהוא נכנס בקלות לכרטיס בודד, אבל אי אפשר להריץ את הדיוק הזה ביעילות על חומרה ישנה יותר או על כרטיסים צרכניים רגילים.

אם אין לכם שרת ייעודי עם מעבדי Hopper או Blackwell בענן, אין טעם לנסות להרים אותו מקומית. במצב כזה עדיף לשלם לפי קריאה לספק ענן חיצוני שמחזיק את החומרה המתאימה, במיוחד בהתחשב בכך שפקודות ההרצה והאימג' של vLLM עדיין מוגדרים תחת בדיקה.

pip install -U huggingface_hub
hf download nvidia/diffusiongemma-26B-A4B-it-NVFP4

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי ושינוי קוד פתוח. יחד עם זאת, חלים עליו במקביל תנאי השימוש ומדיניות השימושים האסורים של Gemma מבית גוגל, מה שאומר שיש הגבלות על שימושים מזיקים מסוימים שחובה לבדוק לפני הטמעה במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗