GPT
D

diffusiongemma-26B-A4B-it-GGUF

קוד פתוח

unslothapache-2.02026-06-10

  • gguf
  • gemma4
  • unsloth
  • gemma
  • google

מודל מולטימודלי של גוגל שמייצר טקסט באמצעות דיפוזיה במקום חיזוי טוקן בודד. הוא מגיע למהירויות פליטה גבוהות במיוחד על חומרה מקומית בזכות ארכיטקטורת מומחים מקבילית.

  • 127 GBמשקל הקבצים
  • 17,577הורדות בחודש
  • 395לייקים

מה זה

במקום לפלוט טוקן אחרי טוקן ברצף אינסופי, המודל הזה מחשב בלוקים שלמים של 256 טוקנים במקביל ומנקה מהם רעש. מדובר בארכיטקטורת מומחים עם 25.2 מיליארד פרמטרים בסך הכול, אבל רק 3.8 מיליארד פעילים בכל רגע נתון. המבנה הזה מחלק את העבודה בין אנקודר ששומר את זיכרון הקשר לבין דקודר שרץ על הבלוק הנוכחי.

התוצאה היא מהירות חריגה, אבל יש לה מחיר ישיר ביכולות. בבנצ'מרקים הוא מפסיד כמעט בכל מבחן למודל המקביל הרגיל מאותה משפחה. בחידון היגיון כמו MMLU Pro הוא מקבל 77.6% לעומת 82.6%, ובמתמטיקה קשה של AIME הוא צונח מ־88.3% ל־69.1%. גם בראיית תמונה מורכבת הפער ניכר, כך שהרווחתם מהירות עיבוד על חשבון עומק החשיבה.

מתאים ל

  • הסקה מהירה במיוחד

    פליטת טקסט בנפח גבוה למשתמש יחיד, במקומות שבהם זמן התגובה הראשוני והמהירות קריטיים יותר מדיוק מוחלט.

  • ניתוח תמונות בסיסי

    חילוץ טקסט מתמונות, זיהוי אובייקטים וסריקת ממשקים כשרוצים להריץ הכול מקומית על כרטיס בודד של 24 גיגה.

  • סוכן עם שימוש בכלים

    קריאות לפונקציות וביצוע משימות קצרות ומובנות שדורשות מהירות ביצוע גבוהה ואינן מצריכות reasoning מתמטי עמוק.

איפה זה נופל

הפשרה העיקרית כאן היא ירידה חדה בדיוק ביחס לארכיטקטורה המקורית. מעבר לנפילה במבחני חשיבה וקוד, גם בראיית מחשב וקריאת מסמכים המרחק מהמודל הרגיל משמעותי, עם ציון של 54.3% בלבד ב־MMMU Pro לעומת 73.8%. המודל מתקשה יותר עם שפה מורכבת, סרקזם ומשימות פתוחות, ואי אפשר להסתמך עליו כמאגר ידע עובדתי. בנוסף, עיבוד הווידאו מוגבל לקליפים קצרים של עד 60 שניות בקצב של פריים אחד לשנייה.

שאלות
נפוצות

אפשר להשתמש בקובץ הזה ישירות בתוכנות כמו Ollama או LM Studio?

לא כרגע. המודל דורש גרסת פיתוח ספציפית של llama.cpp עם רץ ייעודי לפענוח בלוקים, ולכן תוכנות מעטפת סטנדרטיות שמבוססות על המנוע הרשמי ייכשלו בטעינה.

למה שהמודל יחשב טקסט בדיפוזיה במקום בשיטה הרגילה?

הרעיון הוא לעקוף את צוואר הבקבוק של חישוב טוקן אחרי טוקן. המודל מייצר בלוק של 256 טוקנים בבת אחת ומנקה מהם רעש בכמה צעדים מהירים, מה שמאפשר מהירות פליטה עצומה בחומרה מתאימה.

איזו גרסת קוונטיזציה כדאי להוריד למחשב מקומי?

אם יש לכם כרטיס מסך ביתי חזק של 24 גיגה, קחו את Q4_K_M ששוקל 16 גיגה ונכנס במלואו לזיכרון. לכרטיסים מקצועיים עם יותר זיכרון, Q8_0 שוקל 25 גיגה ושומר על איכות כמעט זהה למקור.

איך מריצים

אי אפשר להריץ את הקבצים האלה בסרבר הרגיל של llama.cpp. צריך לקמפל ענף ספציפי מקוד המקור ולהשתמש בכלי ייעודי בשם llama-diffusion-cli, כי מנוע ההסקה הרגיל פשוט לא יודע לעבוד עם דיפוזיה של טקסט.

גרסת Q4_K_M שוקלת 16 גיגה־בייט ונכנסת כולה בכרטיס מסך בודד של 24 גיגה־בייט. גרסת Q8_0 שוקלת 25 גיגה־בייט ותדרוש כרטיס מקצועי יותר או חלוקת שכבות למעבד, שתאט את כל העסק. אם אתם צריכים שרת יציב בפרודקשן בלי להסתבך עם קומפילציה של גרסאות פיתוח לא יציבות, עדיף להמתין שהתמיכה תיכנס למנועים הרשמיים או לצרוך אותו דרך שירות חיצוני.

ollama run hf.co/unsloth/diffusiongemma-26B-A4B-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון אפאצ'י 2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה של המוצר הלאה. אין חובה לפתוח את הקוד שלכם, וצריך רק לשמור על תנאי הרישיון המקורי והצהרת זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗