GPT
D

diffusiongemma-26B-A4B-it

קוד פתוח

googleapache-2.02026-06-09

  • transformers
  • safetensors
  • diffusion_gemma
  • image-text-to-text
  • conversational

מודל מולטימודלי של גוגל שמייצר טקסט באמצעות דיפוזיה במקום חיזוי מילה אחר מילה. הוא מספק קצב יצירה מהיר במיוחד למי שמחפש אלטרנטיבה פתוחה לריצה עצמית.

  • 26Bפרמטרים
  • 262,144טוקנים בהקשר
  • 48.1 GBמשקל הקבצים
  • 989,859הורדות בחודש

מה זה

במקום לחזות טוקן בודד בכל צעד, הארכיטקטורה כאן מחזיקה בלוק של 256 טוקנים ומנקה מהם רעש במקביל. מתוך 25.2 מיליארד פרמטרים בסך הכול, רק 3.8 מיליארד פעילים בכל רגע נתון בזכות מבנה של 128 מומחים, שמתוכם המערכת מפעילה שמונה בלבד לצד מומחה משותף אחד. הוא מעבד טקסט, תמונות ברזולוציה גמישה וקטעי וידאו של עד דקה, ומחזיר טקסט.

בבנצ'מרקים המהירות באה על חשבון הדיוק. בהשוואה ישירה מול Gemma 4 הסטנדרטי באותו גודל, המודל מפסיד כמעט בכל מבחן. ב־MMLU Pro הוא עומד על 77.6% מול 82.6%, ב־AIME הוא צונח ל־69.1% לעומת 88.3%, ובמבחני ראייה כמו MMMU Pro הוא משיג 54.3% בלבד מול 73.8%. היוצא מן הכלל הוא מבחן HLE ללא כלים, שבו הוא רושם 11.0% מול 8.7%.

מתאים ל

  • יצירת טקסט בזמן אמת

    מייצר טקסט בקצב של מעל 1,100 טוקנים לשנייה על חומרה מתאימה, מה שמפחית זמני המתנה ביישומים אינטראקטיביים.

  • ניתוח מסמכים ותמונות

    תומך בתקציב טוקנים גמיש לתמונה, ומאפשר חילוץ מידע ויזואלי ברזולוציות משתנות לצד קלט טקסטואלי.

  • תמצות קטעי וידאו קצרים

    מעבד רצף פריימים של וידאו באורך של עד שישים שניות ומפיק תיאורים או ניתוחים טקסטואליים ישירים.

איפה זה נופל

המחיר של שיטת הדיפוזיה מורגש ישירות ברמת הביצועים. משימות ראייה מורכבות סובלות מירידה חדה לעומת מודלים סטנדרטיים, עם ציון מרחק עריכה חלש של 0.319 ב־OmniDocBench 1.5. בהקשרים ארוכים המודל מתקשה לאתר מידע, כפי שמעיד ציון של 32.0% בלבד בבדיקת מחט בערמת שחת של 128 אלף טוקנים. מעבר לכך, הכרטיס מזהיר מטעויות עובדתיות, קושי עם שפה צינית או עמומה, והיעדר היגיון בריא במצבים מורכבים.

שאלות
נפוצות

האם המודל מדבר עברית?

נתוני האימון כוללים מעל 140 שפות והמודל תומך ישירות ביותר מ־35 שפות. עם זאת, אין בתיעוד פירוט ספציפי על איכות הפלט בעברית או על ביצועיו מול שפות אחרות.

מה היתרון של שיטת הבלוקים לעומת מודל רגיל?

במקום לחכות שהמעבד הגרפי יחשב מילה אחר מילה בסדרה, המודל מייצר בין 15 ל־20 טוקנים בכל מעבר חישובי. המבנה הזה מקצר משמעותית את זמן ההמתנה לתשובה מלאה.

איך מפעילים את מצב החשיבה המובנה?

מצב החשיבה נשלט דרך שורת ההוראה למערכת באמצעות הטוקן המיועד לכך. כאשר הוא פעיל, התשובה כוללת בלוק של תהליך ההסקה הפנימי לפני הטקסט הסופי.

איך מריצים

המשקלים שוקלים 48.1 גיגה בייט ומחולקים ל־22 קבצים, מה שמחייב מאיץ גרפי חזק עם זיכרון וידאו משמעותי כדי לטעון אותם. לפי נתוני היצרן, קצב העבודה חוצה 1,100 טוקנים לשנייה תחת אצוות קטנות על כרטיס H100 בפורמט FP8. הרצה מקומית על כרטיסים צרכניים פשוטים לא באה בחשבון בלי קוונטיזציה כבדה.

ההרצה דורשת ספריות transformers, torch ו־accelerate עדכניות, לצד שימוש במחלקה הייעודית DiffusionGemmaForBlockDiffusion. תהליך הדגימה מצריך הגדרת דעיכת טמפרטורה ליניארית מ־0.8 ל־0.4, ועד 48 שלבי ניקוי רעש לכל בלוק. אם אין ברשותכם גישה לחומרה ברמת שרת, עדיף להמתין לממשקי API מנוהלים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="google/diffusiongemma-26B-A4B-it")
print(pipe("שלום"))

הרישיון

המודל מופץ ברישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי הקוד, הפצה מחדש ושילוב במוצרים סגורים ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית בכל עותק או נגזרת של התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗