GPT
F

flash-sd3

קוד פתוח

jasperaicc-by-nc-4.02024-06-17

  • diffusers
  • safetensors
  • lora
  • text-to-image

מתאם LoRA שמזקק את המודל הגדול של SD3 ומייצר תמונות ב־4 צעדים בלבד במקום עשרות. הוא מיועד למי שרוצה לחתוך זמני ריצה של ייצור תמונות בלי לוותר על רזולוציה מלאה.

  • 385 MBמשקל הקבצים
  • 339הורדות בחודש
  • 112לייקים

מה זה

הפרויקט הזה מביא שיטת זיקוק בשם Flash Diffusion ומיישם אותה כמתאם LoRA קל של 90.4 מיליון פרמטרים על גבי Stable Diffusion 3 Medium. הוא לוקח פרומפט ומייצר תמונה ברזולוציית 1024x1024 ב־4 צעדי דגימה. כל הקבצים שלו תופסים רק 385 מגה-בייט, כי הוא מתלבש על המודל הבסיסי ולא מחליף את המשקלים המקוריים שלו.

הצוות אימן אותו כ־50 שעות על שני מעבדי H100. ההבדל המעשי מול שימוש רגיל ב־SD3 הוא קיצור ישיר של זמן הריצה פר תמונה, בלי להמציא מחדש ארכיטקטורת בסיס.

מתאים ל

  • ייצור תמונות בזמן אמת

    ארבעה צעדים מאפשרים לקבל תגובה מיידית יחסית ביישומים אינטראקטיביים למחקר.

  • ניסויי זיקוק עצמאיים

    בסיס מצוין לבדיקת שיטת Flash Diffusion ואימון המשך על דאטה-סטים ייעודיים.

  • פרוטוטייפים לא מסחריים

    בדיקת היתכנות מקומית של דור התמונות הבא של SD3 בחומרה מוגבלת.

איפה זה נופל

המפתחים מודים במפורש ברמז האימון שהמודל מתקשה ברינדור טקסט בתוך תמונות, ומציינים שהוא היה מציג תוצאות טובות יותר אם היו מזקקים אותו על מאגר ייעודי עם טקסט. מעבר לזה, כדי להפעיל אותו צריך להתקין פיצול לא רשמי של diffusers ממאגר גיטהאב חיצוני, שזה משהו שלא כיף להכניס למערכות פרודקשן יציבות.

שאלות
נפוצות

האם הקובץ של ה־385 מגה-בייט מספיק כדי לייצר תמונה?

לא. מדובר במשקלי LoRA בלבד של 90.4 מיליון פרמטרים. תצטרכו להוריד ולהחזיק בזיכרון גם את כל מודל הבסיס של SD3 Medium.

אפשר להשתמש בו בתוך גרסת diffusers רגילה שכבר מותקנת אצלי?

כרגע לא. התיעוד מחייב התקנה של ענף ספציפי מריפו גיטהאב חיצוני שתומך בהרצה של המתאם הזה.

איך מריצים

אתם לא מריצים את המשקלים האלה לבד, אלא טוענים אותם ישירות לתוך StableDiffusion3Pipeline של ספריית diffusers יחד עם מודל הבסיס. זה דורש התקנה של ענף ספציפי מה־GitHub שמופיע בתיעוד, ולא סתם את הספרייה הרגילה בגרסת הפיפ הנוכחית שלה.

מבחינת חומרה, צריך כרטיס מסך שיכול להחזיק את SD3 Medium כולו בזיכרון, כך שצוואר הבקבוק יהיה ה־VRAM של מודל הבסיס ולא ה־LoRA הקטן הזה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("jasperai/flash-sd3")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 385 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה וישירה, אסור להשתמש במודל הזה בשום צורה למטרות מסחריות, נקודה. אם אתם בונים מוצר בתשלום או כלי פנימי בעסק, אי אפשר לשלב אותו שם, אלא רק לצרכי מחקר, ניסויים אישיים ופיתוח פנימי שאינו מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗