GPT
J

Juggernaut-XI-v11

קוד פתוח

RunDiffusioncc-by-nc-nd-4.02024-07-11

  • diffusers
  • stable-diffusion
  • stable-diffusion-xl
  • sdxl
  • text-to-image

יש כאן גם סקירה על RunDiffusion עצמו.

גרסת SDXL מכוונת ליצירת תמונות פוטוריאליסטיות עם דיוק גבוה באנטומיה אנושית ורינדור טקסט. היא מתאימה למי שצריך תמונות ריאליסטיות בהרצה מקומית, בלי להיאבק שעות בפרומפטים מסובכים.

  • 19.5 GBמשקל הקבצים
  • 50,596הורדות בחודש
  • 153לייקים

מה זה

מדובר במודל מבוסס SDXL שאומן מחדש בעזרת תיוג תמונות מבוסס GPT-4 Vision, עם דגש על ניקוי הדאטה והפרדה חדה בין סוגי שוטים שונים. השינוי העיקרי מורגש באנטומיה, במיוחד באזורים המועדים לפורענות כמו כפות ידיים ועיניים, לצד יכולת טבעית יותר לשלב טקסט קצר וקריא בתוך התמונה.

הוא תומך בשני סגנונות עבודה שונים לחלוטין. אפשר לתת לו תיאור סצנה עשיר בשפה חופשית, או לעבוד בשיטה המוכרת של רשימת תגיות מופרדות בפסיקים. רכיב ה־VAE כבר מוטמע בפנים, כך שלא צריך להוריד רכיב חיצוני נוסף כדי לקבל צבעים נכונים וחדות טובה.

מתאים ל

  • הפקת פורטרטים ריאליסטיים

    האימון המחודש מתמקד בדיוק של עיניים, עור ומבנה פנים, מה שחוסך עבודת תיקונים ידנית.

  • יצירת שלטים ותוויות בסצנה

    יכולת רינדור הטקסט הפנימית מסוגלת לכתוב מילים קצרות בצורה קריאה ישירות על אובייקטים.

  • עבודה בתחנות קצה סגורות

    משקלי ה־safetensors רצים בספריות diffusers מקומיות ללא צורך בחיבור חיצוני בזמן הריצה.

איפה זה נופל

המודל מאומן רק על השפה האנגלית, כך שפרומפטים בעברית פשוט לא יעבדו בלי תרגום מוקדם. הרינדור של טקסט מוגבל למילים קצרות, תוויות ושלטים, ולא מתאים לפסקאות או טקסטים מורכבים. למרות השיפורים בכפות הידיים ובפנים, עדיין נדרשת תשומת לב בבחירת זווית הצילום, ובשוטים רחבים מאוד האנטומיה עלולה להישבר ללא עיבוד נוסף.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה בתשלום?

לא. הרישיון אוסר מפורשות כל שימוש מסחרי, כולל הקמת שירות API בתשלום או הטמעה במוצר מניב. כדי להשתמש בו באופן מסחרי צריך ליצור קשר ישיר עם היוצרים ולקנות רישיון מתאים.

האם יש צורך בהורדת קובץ VAE נפרד?

אין צורך בקובץ כזה. ה־VAE מובנה כבר בתוך משקלי המודל, מה שמונע טעויות של צבעים דהויים או שגיאות בהגדרת ה־pipeline.

איך מריצים

המודל שוקל 19.5 ג'יגה בייט על הדיסק ודורש חומרה שמחזיקה משקלי SDXL מלאים בזיכרון ה־VRAM. ברירת המחדל שלו דורשת בין 30 ל־40 צעדים עם דוגם DPM++ 2M Karras, ברזולוציות יעד של 832 על 1216 או להפך, וערכי CFG נמוכים יחסית של 3 עד 7 כדי לשמור על מראה ריאליסטי ולא שרוף.

מי שאין לו כרטיס מסך מתאים יכול לבחור בין הרצה מנוהלת בפלטפורמה של היוצרים, לבין גרסת ה־Lightning של המודל שמפיקה תוצאה ב־5 עד 7 צעדים בלבד. בנוסף, מדובר במודל סגור ברישום שמחייב אימות מול Hugging Face לפני ההורדה הראשונית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("RunDiffusion/Juggernaut-XI-v11")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CC BY-NC-ND 4.0, מה שאומר שאסור להשתמש במודל לשום מטרה מסחרית בלי לרכוש רישיון ייעודי מראש. אסור להפיץ שינויים, מיזוגים או פיין־טיונים שלו, ונאסר במפורש להרים סביבו שירות API מתחרה בתשלום. פרויקטים מסחריים חייבים לפנות ישירות ליוצרים במייל.

הרישיון המלא בעמוד המודל ↗