GPT
B

bonsai-image-ternary-4B-gemlite-2bit

קוד פתוח

prism-mlapache-2.02026-05-21

  • diffusers
  • safetensors
  • ternary
  • 1.58-bit
  • gemlite

גרסה מכווצת של מודל תמונה מבוסס שנאי, שמספקת תוצאות דומות למקור בנפח זיכרון זעיר. מתאימה למי שרוצה לייצר תמונות מקומית על כרטיסי מסך שולחניים בלי לשלם על שרתים יקרים.

  • 4.2 GBמשקל הקבצים
  • 314הורדות בחודש
  • 133לייקים

מה זה

מדובר במודל FLUX.2 Klein 4B שעבר כימות למשקולות טרנריות של מינוס אחת, אפס ופלוס אחת, ארוזות בשני ביטים דרך קרנלים של Gemlite. שנאי הדיפוזיה עצמו מכווץ לגודל של 1.21 גיגה בייט לעומת 7.75 גיגה בייט במקור בפורמט FP16. הפריסה הכוללת דורשת 4.55 גיגה בייט שכוללים גם מקודד טקסט Qwen3-4B בכימות HQQ של ארבעה ביטים ורכיב VAE.

במבחני GenEval המודל מגיע לציון 0.723 מול 0.819 במקור, ובמבחן DPG-Bench הוא רושם 0.851 שקרוב מאוד ל־0.853 של מודל המקור. המשמעות היא ירידה קלה ביכולת מעקב אחרי פרומפטים מורכבים תמורת צמצום של פי 6.4 בגודל השנאי. הוא רץ בארבעה צעדים בלבד עם סמפלר FlowMatchEuler, בלי צורך בפרומפט שלילי ובלי שרשרת הנחיה כבדה.

מתאים ל

  • ייצור תמונות בתחנת עבודה

    מאפשר יצירת תמונות ברזולוציית 1024 על כרטיסי מסך ביתיים בפחות מחמש שניות.

  • סביבות מקומיות ומאובטחות

    מתאים למערכות שאינן יכולות להוציא מידע לרשת ומחייבות שמירה על פרטיות הפרומפטים.

  • שרתי היסק בעלות נמוכה

    מאפשר הגשת שירותי תמונה על חומרת שרתים בסיסית וזולה בזכות נפח זיכרון של פחות משבעה גיגה בייט.

איפה זה נופל

המודל מוגבל מראש לעבודה בארבעה צעדים, והרצה של יותר צעדים לא משפרת את התמונה אלא מייצרת עיוותים. התוצאות אינן זהות למודל ה־FP16 המקורי, ויש חולשה מורגשת בפרטים קטנים, טקסט זעיר, ספירת עצמים וקומפוזיציות נוקשות. כרטיסי מסך עדיין לא מריצים חומרה טרנרית טבעית אלא סימולציה דרך קרנלים, וברגע שהשנאי מכווץ, דווקא רכיב ה־VAE ומקודד הטקסט הופכים לצוואר בקבוק של צריכת הזיכרון.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשבי מק עם שבבי אפל?

הקובץ הספציפי הזה מיועד לכרטיסי אנבידיה עם ספריות CUDA ו־gemlite. עבור מחשבי מק קיים מאגר נפרד שהותאם למערכת MLX בפורמט שני ביטים.

האם שימוש בפרומפט שלילי משפר את התוצאה?

לא. המודל מאומן לעבוד עם סמפלר FlowMatchEuler ביחס הנחיה קבוע של 1.0, ולכן הוא מתעלם משיטות הכוונה כפולות ואינו זקוק להגדרת פרומפט שלילי כלל.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה עם תמיכה ב־CUDA תחת חלונות או לינוקס. הריצה מתבססת על חבילת gemlite לביצוע כפל מטריצות מקוונטט, והטעינה מפנה את מקודד הטקסט מהזיכרון מיד בסיום עיבוד הפרומפט כדי לחסוך מקום.

כרטיס RTX 3080 עם עשרה גיגה בייט מייצר תמונה של 1024 על 1024 ב־4.5 שניות עם שיא צריכת זיכרון של כ־6.8 גיביבייט. לעומת זאת, בכרטיסי 6 גיגה בייט ניידים כמו RTX 3060 הזמן קופץ ל־17.5 שניות בגלל מגבלות רוחב פס וזיכרון. אם אין לכם לפחות שמונה גיגה בייט של זיכרון גרפי פנוי, עדיף להשתמש ב־API חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("prism-ml/bonsai-image-ternary-4B-gemlite-2bit")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי קוד והפצה מחדש. מותר לשלב אותו במוצרים פנימיים או מסחריים בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗