GPT
S

stable-diffusion-v1-5

קוד פתוח

stable-diffusion-v1-5creativeml-openrail-m2024-08-30

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image

מודל תמונה קלאסי שמייצר פריימים מטקסט ישירות על חומרה ביתית. בוחרים בו בעיקר בגלל התמיכה הרחבה בכלי קהילה וצריכת זיכרון נמוכה.

  • 860Mפרמטרים
  • 44.0 GBמשקל הקבצים
  • 1,563,425הורדות בחודש
  • 1,266לייקים

מה זה

מדובר במודל דיפוזיה מסוג Latent Diffusion שממיר טקסט באנגלית לתמונות ברזולוציה מקורית של 512 על 512 פיקסלים. הוא אומן על בסיס משקולות v1-2 לאורך 595,000 צעדים נוספים, תוך שימוש במאגר תמונות מסונן איכות והשמטה מכוונת של עשרה אחוזים מהטקסט כדי לחדד את ההיענות להנחיות בזמן הדגימה.

הייחוד שלו טמון בגודל הקומפקטי. עם 860 מיליון פרמטרים, הוא רץ בקלות על כרטיסי מסך צרכניים ונתמך כמעט בכל כלי קוד פתוח מוכר, כולל ComfyUI, Automatic1111 וספריית diffusers. הוא אינו מפיק תוצאות חדות כמו מודלים חדשים וכבדים ממנו, אך הוא מהיר וגמיש במיוחד להתאמות אישיות.

מתאים ל

  • מחולל רעיונות למעצבים

    יצירה מהירה של סקיצות וקונספטים חזותיים בזכות מהירות הפקה גבוהה על מחשב אישי.

  • הרצה מקומית ב־ComfyUI

    שילוב בתהליכי עבודה קיימים שדורשים תאימות מושלמת ותמיכה בכלים ותוספים קהילתיים.

  • מחקר על מודלי יצירה

    בדיקת הטיות, סינון תוכן או פיתוח שיטות אימון חדשות על בסיס ארכיטקטורה קלה ומוכרת.

איפה זה נופל

הוא לא יודע לייצר טקסט קריא בתוך התמונה, ומסתבך מאוד עם הרכבים לוגיים מורכבים כמו קובייה אדומה על כדור כחול. פרצופים ואנשים עלולים לצאת מעוותים, והאיכות הכללית נופלת משמעותית אם חורגים מרזולוציית הבסיס של 512 פיקסלים.

מאגר האימון התבסס על אנגלית בלבד, כך שהבנת פקודות בעברית גרועה מאוד בלי תרגום מקדים. בנוסף, הדאטה־סט מכיל תכנים למבוגרים ורכיב הדחיסה סובל מאיבוד מידע, מה שמחייב הוספת שכבות סינון והגנה לפני שחושפים אותו ללקוחות.

שאלות
נפוצות

האם אפשר לשלוח אליו הנחיות בעברית?

עדיף שלא. המודל אומן על מאגר נתונים באנגלית, ובשפות אחרות התוצאות לא מדויקות. מומלץ לתרגם את הטקסט לאנגלית לפני שמעבירים אותו לעיבוד.

איזה קובץ משקולות צריך להוריד כדי סתם לייצר תמונות?

הקובץ v1-5-pruned-emaonly.safetensors הוא הבחירה הנכונה. הוא חוסך זיכרון גרפי ומיועד ספציפית להסקה, להבדיל מהגרסה הרגילה שמיועדת לאימון.

איך מריצים

קובץ משקולות בודד מסוג safetensors שוקל לרוב בין שניים לארבעה גיגה בייט, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה בייט זיכרון יספיק להרצה מקומית. לשימוש שוטף בתמונות בודדות עדיף להוריד את גרסת ה־ema-only שצורכת פחות זיכרון גרפי, בעוד שגרסת המשקולות המלאה שמורה בעיקר למי שמתכנן אימון נוסף.

אם אתם צריכים ייצור פשוט של תמונות ללא תשתית שרתים או התקנת ספריות CUDA, קריאה לשירות ענן מנוהל תחסוך תחזוקה. הרצה עצמית משתלמת ברגע שרוצים שליטה מלאה בפרמטרים, מהירות תגובה מקומית או שימוש בממשקים קיימים במחשב שלכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("stable-diffusion-v1-5/stable-diffusion-v1-5")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML OpenRAIL M, שמאפשר שימוש מסחרי ומחקר חופשי אבל כובל אתכם למגבלות שימוש נוקשות. אסור להשתמש בו לפגיעה באנשים, יצירת תוכן אלים או מיני ללא הסכמה, והפצת מידע כוזב. אם אתם משלבים אותו באפליקציה, חובה להעביר את תנאי הרישיון וההגבלות האלה למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗