GPT
T

tiny-sd

קוד פתוח

segmindcreativeml-openrail-m2023-07-27

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • endpoints_compatible

גרסה מזוקקת וקלה של מחולל תמונות ששוקלת כגיגהבייט אחד בלבד. היא מיועדת למי שרוצה לייצר תמונות מטקסט במהירות גבוהה ובמינימום משאבי חומרה.

  • 1014 MBמשקל הקבצים
  • 16,967הורדות בחודש
  • 95לייקים

מה זה

מדובר במודל ליצירת תמונות מטקסט שעבר תהליך זיקוק מתוך Realistic Vision V4.0, על בסיס תת קבוצה של מאגר LAION-art עם כיתובים משופרים באנגלית. הרעיון פה הוא לקחת ארכיטקטורה כבדה של דיפוזיה ולכווץ אותה לתוך קבצים שתופסים 1014 מגהבייט בלבד, כך שאפשר להריץ אותה בקלות עם ספריית diffusers הסטנדרטית.

המפתחים מדווחים על שיפור ביצועים שמגיע עד 80 אחוז מהירות ביחס למודלי הבסיס של SD 1.5 בבדיקות על חומרת A100. המשמעות המעשית היא חיתוך דרסטי בזמן ההמתנה לכל תמונה ובצריכת המשאבים של השרת, בזכות אימון שנעשה ברזולוציה של 512 על 512 פיקסלים עם דיוק של fp16 לאורך 125,000 צעדים.

מתאים ל

  • המחשה מהירה באפליקציות

    מתאים לשרתים חלשים שצריכים לספק למשתמשים סקיצות או הדמיות מיידיות בלי להמתין שניות ארוכות.

  • הרצה מקומית על מחשב אישי

    המשקל הנמוך, כגיגהבייט בודד, מאפשר בדיקות פיתוח מהירות על כרטיסי מסך בסיסיים בלי צורך בחומרת שרתים יקרה.

  • עיבוד תמונות ברקע בענן

    מהירות גבוהה בעד 80 אחוז מאפשרת לחסוך זמן עיבוד ועלויות תשתית במערכות שמייצרות נפח תמונות גדול ברצף.

איפה זה נופל

המודל אומן על רזולוציה קבועה של 512 פיקסלים, כך שכל ניסיון להוציא ממנו תמונות חדות או גדולות יותר ייצור מריחות או עיוותים. בגלל שמדובר בגרסה מזוקקת ומכווצת משמעותית, כמעט תמיד יש ירידה בפרטים עדינים לעומת מודל המקור, ואיכות הפלט תלויה לחלוטין בפרומפטים באנגלית כי המאגר שעליו הוא התחנך מבוסס רק עליהם.

שאלות
נפוצות

האם המודל תומך בהזנת הנחיות בעברית?

לא. האימון התבצע על מאגר תמונות עם כיתובים באנגלית בלבד. אם תזינו עברית המודל יחזיר פלט אקראי או משובש, ולכן חובה לתרגם את הפרומפט מראש.

האם איכות התמונה זהה למודל המקורי?

הזיקוק נועד לחתוך במשקל ולהאיץ את הריצה בעד 80 אחוז, אך הוא מגיע על חשבון דיוק. תמונות מורכבות יאבדו פרטים לעומת Realistic Vision המקורי.

באיזו רזולוציה כדאי לייצר איתו תמונות?

האימון נעשה ברזולוציה של 512 על 512 פיקסלים. מומלץ להישאר בממדים האלה בדיוק, שכן חריגה מהם תוביל לתוצאות פגומות.

איך מריצים

טוענים אותו ישירות דרך DiffusionPipeline של diffusers עם הגדרת torch.float16 ושולחים פרומפט טקסטואלי רגיל. בזכות משקל של גיגהבייט בודד אין צורך במפלצות עיבוד, וכל כרטיס מסך ביתי או שרת ענן פשוט יספיקו כדי לייצר תמונות בלי לחנוק את הזיכרון.

אם אתם צריכים ייצור תמונות בנפח נמוך מאוד, עדיף להשתמש בפתרונות ענן מנוהלים. הרצה עצמית מקומית משתלמת ברגע שרוצים שליטה מלאה בתהליך, חביון מינימלי בייצור או חיסכון בעלויות תשתית תחת עומס.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("segmind/tiny-sd")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m. הוא מתיר שימוש מסחרי ומאפשר להטמיע את המודל באפליקציות או שירותים, אבל מטיל מגבלות מפורשות נגד שימושים פוגעניים, הפצת מידע כוזב או הפרות חוק. אם אתם משלבים אותו במוצר שלכם, אתם מחויבים לכלול את תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗