GPT
S

stable-diffusion-2-1-base

קוד פתוח

Manojbopenrail++2025-06-13

  • diffusers
  • safetensors
  • stable-diffusion
  • text-to-image
  • endpoints_compatible

גרסת בסיס ותיקה ליצירת תמונות מטקסט ברזולוציית 512 פיקסלים. מתאימה למי שצריך מודל קומפקטי יחסית לאימון המשך או לשילוב בצנרת קיימת.

  • 866Mפרמטרים
  • 33.8 GBמשקל הקבצים
  • 39,578הורדות בחודש
  • 61לייקים

מה זה

מדובר בהעלאה מחדש של מודל הדיפוזיה המוכר ליצירת תמונות מטקסט. הוא משתמש במקודד טקסט מסוג OpenCLIP-ViT/H ופועל במרחב הלטנטי כדי לחסוך חישובים בזמן הריצה. גרסה 2.1 בבסיס עברה אימון המשך של 220 אלף צעדים מעבר לגרסה 2.0, תוך שינוי סף הסינון של תוכן לא בטוח לערך של 0.98 במקום 0.1 השמרני.

המשמעות של שינוי הסף היא חשיפה ליותר תמונות מגוונות באימון, מה שאמור לשפר את היכולת האסתטית לעומת גרסה 2.0 המקורית שסבלה מסינון יתר. המודל מייצר תמונות ברזולוציה מקורית של 512 על 512 פיקסלים ומשתמש בשיטת חיזוי רעש בסיסית.

מתאים ל

  • אימון מודלים מותאמים

    משמש נקודת מוצא זולה ומוכרת לכוונון עדין על סגנון אמנותי ספציפי.

  • מחקר על הטיות גנרטיביות

    מתאים לבדיקת כשלים ומגבלות של מודלי שפה ותמונה מבוססי OpenCLIP.

  • יצירת סקיצות מהירה

    מייצר רעיונות ויזואליים בסיסיים ברזולוציה של 512 פיקסלים ללא צורך בכרטיס מסך כבד.

איפה זה נופל

המודל מודה בגלוי בחוסר יכולת לייצר טקסט קריא בתוך תמונות, ומתקשה מאוד בהרכבה של מספר עצמים, למשל קובייה אדומה מעל כדור כחול. פרצופים ואנטומיה אנושית נוטים להיראות מעוותים או שבורים ללא עיבוד נוסף. הוא אומן בעיקר על טקסטים באנגלית, כך שהבנת פרומפטים בעברית כמעט לא קיימת והתוצאות בשפות אחרות ירודות משמעותית. בנוסף, קידוד התמונה הלטנטי מאבד פרטים עדינים מטבעו.

שאלות
נפוצות

האם המודל תומך בהנחיות בעברית?

המודל אומן על מאגר נתונים המבוסס ברובו על אנגלית. פרומפטים בעברית יניבו תוצאות לא מדויקות או שגויות לחלוטין. אם המוצר שלכם פונה לישראל, תצטרכו לתרגם את הקלט לאנגלית לפני שליחתו למודל.

למה המאגר שוקל מעל 33 גיגה בייט אם המודל קטן?

המאגר כולל עשרות קבצים, כולל משקולות בפורמטים שונים כמו ckpt ו־safetensors, ועותקים מרובים של שלבי אימון. בפועל, לצורך הרצה צריך להוריד רק את הקבצים הדרושים לצינור הספציפי ולא את כל התיקייה.

איך מריצים

טוענים את המשקולות דרך ספריית diffusers בפייתון עם צינור העבודה StableDiffusionPipeline ומעבירים לכרטיס מסך בפורמט float16. כדי לחסוך בזיכרון, אפשר להפעיל חלוקת קשב או להתקין את ספריית xformers. מומלץ להשתמש בדוגם EulerDiscreteScheduler במקום ברירת המחדל כדי לקבל תוצאות טובות בפחות צעדים.

אף שהמודל מכיל כ־866 מיליון פרמטרים ודורש מעט זיכרון עבודה בהרצה בודדת, המאגר הזה שוקל 33.8 גיגה בייט בגלל ריבוי קבצים וגרסאות צ'קפוינט. אם אתם רק צריכים תמונה פה ושם, קריאה ל־API חיצוני זולה בהרבה מתחזוקת שרת עם מעבד גרפי ייעודי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Manojb/stable-diffusion-2-1-base")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M. הוא מתיר שימוש מסחרי ומחקר, אך מטיל מגבלות שימוש נוקשות. אסור לייצר תוכן פוגעני, תמונות מיניות ללא הסכמה, מידע כוזב או הפרת זכויות יוצרים. אם אתם משלבים אותו במוצר, חובה להעביר את תנאי הרישיון וההגבלות הלאה למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗