GPT
S

shuttle-3-diffusion

קוד פתוח

shuttleaiapache-2.02024-11-12

  • diffusers
  • safetensors
  • text-to-image
  • image-generation
  • shuttle

מודל תמונה שמייצר תוצאות בארבעה צעדים בלבד, על בסיס פלאקס שנל. הוא נותן איכות שמתקרבת לגרסאות הכבדות יותר אבל מגיע ברישיון פתוח לחלוטין.

  • 12Bפרמטרים
  • 53.6 GBמשקל הקבצים
  • 3,358הורדות בחודש
  • 215לייקים

מה זה

מדובר במודל יצירת תמונות מטקסט של כמעט 12 מיליארד פרמטרים, שבנוי על גבי Flux.1 Schnell ועבר תהליך אימון מיוחד שפותח בחזרה חלק מהזיקוק שלו. המטרה כאן ברורה, לתת איכות וצבעים שמזכירים את Flux Dev או Pro, אבל בריצה מהירה מאוד של 4 צעדים ובלי הרישיון המגביל של דב.

היוצרים טוענים שהוא מתמודד טוב יותר עם טיפוגרפיה, מבין פרומפטים מורכבים ומפיק צבעים עשירים יותר מהמקור שעליו הוא מבוסס. טריק מעניין נוסף הוא שאם מושכים אותו מעבר ל־10 צעדים, הוא נכנס למצב שמשפר פרטים קטנים בלי לשנות את הקומפוזיציה של התמונה שכבר נבנתה.

מתאים ל

  • שילוב טקסט בתמונות

    יצירת גרפיקות עם כיתוב באנגלית, בזכות מודל הטיפוגרפיה המשופר ביחס לבסיס.

  • הפקה מהירה בכמויות

    ייצור תמונות ב־4 צעדים בלבד, כשחייבים זמני תגובה קצרים בלי שרתים ענקיים.

  • מוצרים מסחריים סגורים

    פיתוח אפליקציה שמייצרת תמונות תחת רישיון אפאצ'י שאינו מגביל שימוש עסקי.

איפה זה נופל

המודל תומך רשמית באנגלית בלבד. פרומפטים בעברית כנראה יניבו תוצאות עקומות או יתעלמו לחלוטין מההוראות, בטח בכל מה שקשור לטקסט מובנה בתוך התמונה. בנוסף, למרות ההבטחות לשיפור על פני שנל, מודלים שרצים ב־4 צעדים תמיד משלמים איפשהו על קיצורי הדרך באחידות של פרטים מורכבים.

אותה משפחה

shuttle-3-diffusion יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לרנדר טקסט בעברית בתוך התמונה?

לא. המודל אומן והוגדר רשמית עבור אנגלית בלבד. הוא יודע לשלב אותיות ומילים באנגלית טוב יותר מהגרסאות הקודמות, אבל אותיות בעברית ייצאו מרוחות או כג'יבריש מוחלט.

למה להריץ אותו ב־10 צעדים אם הוא מיועד ל־4?

היוצרים בנו אותו כך שמעבר ל־10 צעדים הוא מתפקד כמעין משביח תמונה. הוא לוקח את המבנה והקומפוזיציה שכבר נוצרו ומוסיף עליהם חדות, טקסטורות ופרטים בלי להרוס את התוצאה המקורית.

איך מריצים

המשקל המלא בגרסת bfloat16 שוקל 53.6 גיגה בייט, שזה חתיכת קובץ לפרוס מקומית. כדי להריץ אותו כמו שצריך דרך ספריית diffusers או ComfyUI תצטרכו כרטיס מסך רציני מאוד, אלא אם תפנו לגרסאות המכווצות יותר שהם מציעים, כמו fp8 או קובצי GGUF לחומרה ביתית.

אם אין לכם כרטיס עם זיכרון וידאו מפלצתי פנוי, או שאתם רק רוצים לבדוק איך הוא מגיב לפרומפטים שלכם, עדיף בהרבה לדגום אותו דרך ה־API שלהם או בממשק הווב שהם מעמידים. להחזיק שרת ייעודי למפלצת כזו שווה את זה רק בפסי ייצור עם עומס אמיתי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("shuttleai/shuttle-3-diffusion")
img = pipe("a photo").images[0]

הרישיון

רישיון Apache 2.0 מלא. זה אומר חופש כמעט מוחלט, אתם יכולים להריץ אותו, לשלב אותו במוצר מסחרי, לשנות אותו או למכור שירותים שמבוססים עליו, בלי לשלם תמלוגים ובלי לפחד מהגבלות שימוש מסחריות כמו שיש ב־Flux Dev.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗