GPT
J

Juggernaut-XL-v9

קוד פתוח

RunDiffusioncreativeml-openrail-m2024-02-18

  • diffusers
  • stable-diffusion
  • stable-diffusion-xl
  • sdxl
  • text-to-image

יש כאן גם סקירה על RunDiffusion עצמו.

התאמה אישית פופולרית של SDXL שמכוונת כולה לתמונות פוטו-ריאליסטיות. בוחרים בו בעיקר כשרוצים טקסטורות עור ותאורה אמינות בלי לעבור לחומרה כבדה יותר.

  • 13.1 GBמשקל הקבצים
  • 766,250הורדות בחודש
  • 433לייקים

מה זה

מדובר בגרסה תשיעית למודל שפותח במשותף על ידי KandooAI ו־RunDiffusion, כשהבסיס שלו משלב את RunDiffusion Photo v2. הוא בנוי לחולל תמונות מטקסט עם דגש כבד על צילום ריאליסטי, כולל פורטרטים, ארכיטקטורה, רכבים וטבע. ההבדל המרכזי מול SDXL המקורי הוא כיול עדין של הניגודיות ופרטי מיקרו בעור, כך שהתוצאה דורשת פחות משחקים מורכבים בפרומפט כדי להיראות כמו צילום אמיתי.

היתרון הגדול שלו ברמת המערכת הוא השיוך לאקוסיסטם הוותיק של SDXL. הוא עובד ישר מהקופסה עם כלים קיימים כמו ControlNet, IP-Adapter ו־LoRAs, מה שמאפשר לשלב אותו בצינורות עיבוד קיימים בלי לפתח שכבות תמיכה מחדש.

מתאים ל

  • צילומי מוצר ואדריכלות

    המודל מכויל לתאורה טבעית ומרקמים של חללים ומבנים ישירות מתוך הנחיות טקסט באנגלית.

  • פורטרטים ריאליסטיים

    שילוב שכבת Photo v2 מספק רינדור מדויק של פרטי עור בלי מראה פלסטיקי אופייני.

  • צינורות עיבוד קיימים ב־SDXL

    התאמה מלאה לתוספי ControlNet ו־LoRA מאפשרת שילוב מיידי באוטומציות קיימות בסטודיו.

איפה זה נופל

המודל מוגדר ומכויל לשפה האנגלית בלבד, כך שפרומפטים בעברית לא יעבדו בצורה תקינה ללא תרגום מקדים. רגישות נוספת נוגעת להנחיות השליליות. שימוש במאגרי מילים שליליות כבדים פוגע באיכות התמונה במקום לעזור, והיוצרים מציינים במפורש שעדיף להתחיל בלי הנחיות שליליות בכלל. בנוסף, מי שמחפש סגנונות איור, גרפיקה מופשטת או עיצובים שאינם צילום ימצא שהוא נוקשה ומוטה מדי לכיוון המצלמה.

שאלות
נפוצות

האם כדאי להשתמש בו לייצור תמונות כלליות שאינן צילום?

לא. המשקלים כוונו באופן מובהק לתוצאות פוטו-ריאליסטיות כמו צילומי טבע, פורטרטים ורכב. לסגנונות של אנימציה או איור עדיף לבחור מודל בסיס אחר.

אפשר להטמיע את המודל במוצר SaaS מסחרי?

הרישיון מאפשר שימוש יצירתי, אבל אוסר להרים איתו שירות API מסחרי בתשלום ללא אישור והסכם נפרד מול החברה המפתחת. אם המוצר שלכם גובה כסף על קריאות ייצור תמונה, תצטרכו להסדיר רישוי מסחרי במייל.

כמה זיכרון כרטיס מסך נחוץ להרצה מקומית?

המודל רץ היטב על כרטיס עם 8 גיגה-בייט זיכרון גרפי בשימוש בגרסת safetensors יחידה. אין צורך לחבר קובץ VAE חיצוני כי הוא כבר מוטמע בתוך הקובץ.

איך מריצים

אתם יכולים למשוך את המשקלים דרך ספריית diffusers בפורמט FP16 או להוריד קובץ safetensors יחיד של 13.1 גיגה-בייט לממשקים כמו ComfyUI. בשונה מארכיטקטורות DiT שדורשות כרטיסים של 16 גיגה-בייט ומעלה, הוא רץ בצורה נוחה על כרטיס מסך עם 8 גיגה-בייט זיכרון גרפי, כשה-VAE כבר מוטמע בפנים.

ההרצה המומלצת דורשת 30 עד 40 צעדים בדוגם DPM++ 2M Karras, עם רזולוציות בסיס כמו 832 על 1216. אם אין לכם חומרה מקומית מתאימה או שאתם בודקים היתכנות מהירה, אפשר לגשת אליו ישירות בענן דרך RunDiffusion, שמציעים התנסות בחינם בלי לנהל תשתית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("RunDiffusion/Juggernaut-XL-v9")
img = pipe("a photo").images[0]

הרישיון

הפרויקט מבוסס על רישיון CreativeML Open RAIL-M ומאפשר שימוש אישי ויצירתי חופשי. עם זאת, היוצרים הוסיפו תנאי מגביל מפורש: חל איסור מוחלט להפעיל אותו מאחורי שירות API בתשלום בלי רישיון מסחרי ייעודי מראש מול RunDiffusion.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗