GPT
J

Juggernaut-X-v10

קוד פתוח

RunDiffusioncreativeml-openrail-m2024-04-19

  • diffusers
  • stable-diffusion
  • stable-diffusion-xl
  • sdxl
  • text-to-image

יש כאן גם סקירה על RunDiffusion עצמו.

גרסה עשירית למשפחת Juggernaut מבוססת SDXL שעברה אימון מחדש לחלוטין. היא מתאימה למי שצריך צילום ריאליסטי, הבנה טובה יותר של שפה טבעית ורינדור טקסט בסיסי בתוך התמונה.

  • 19.5 GBמשקל הקבצים
  • 17,497הורדות בחודש
  • 173לייקים

מה זה

המודל הזה הוא אימון מאפס של סדרת ה־SDXL ולא המשך כוונון ישיר של גרסה 9. המפתחים תייגו מחדש את כל הדאטה-סט בעזרת GPT-4 Vision, בנו סיווג חדש של זוויות צילום כמו צילום גוף מלא או פורטרט, והרחיבו את מאגר התמונות. השינוי המרכזי כאן מול גרסאות קודמות הוא היכולת לרנדר טקסט קצר וקריא על שלטים או תוויות, וירידה משמעותית בצורך להיאבק בפרומפטים מורכבים.

הוא תומך בשני סגנונות עבודה שונים לגמרי. אפשר לכתוב לו בפסקה תיאורית מלאה באנגלית, והוא מבין את הקשר הסצנה, או להמשיך להשתמש ברשימות של תגיות מופרדות בפסיקים כמו בגרסאות הישנות ובשילוב עם LoRA. בסיס המודל נשען על המנוע הצילומי של RunDiffusion, כך שהפלט שומר על אופי פוטו-ריאליסטי כברירת מחדל.

מתאים ל

  • הפקת צילומי מוצר ואופנה

    זיהוי זוויות צילום מדויק מאפשר להגדיר צילומי גוף מלא או פורטרטים ריאליסטיים בלי להילחם עם החיתוך.

  • עיצוב מוקאפים עם שלטים

    היכולת לייצר טקסט קצר וקריא מאפשרת להפיק תוויות ואותיות ברורות ישר לתוך שלטים ברקע.

  • יצירת תמונות מתיאור עלילתי

    האימון מבוסס GPT-4 Vision מפרש היטב פסקאות טבעיות באנגלית ומציב אלמנטים בסצנה לפי הסיפור.

איפה זה נופל

המודל מאומן על אנגלית בלבד ולא מיועד לפרומפטים בעברית. היכולת לכתוב טקסט מוגבלת לשלטים, תוויות וביטויים קצרים בלבד, ולא תתמודד עם פסקאות. בנוסף, מי שבונה שירות בתשלום לא יכול להשתמש בריפו הזה באופן חופשי עקב תנאי רישוי נוספים שהמפתחים הצמידו לו מעבר להגדרות הרגילות.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל הזה מקומית?

המודל שוקל 19.5 ג'יגה-בייט ומבוסס על SDXL ברזולוציות עבודה טיפוסיות של 832 על 1216. בפועל נדרש כרטיס מסך מודרני של Nvidia עם לפחות 12 עד 16 ג'יגה-בייט של VRAM כדי להפיק תמונות בקצב סביר ב־float16 בלי קריסות זיכרון.

האם אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

לא באופן ישיר דרך ההורדה מכאן. עמוד המודל אוסר במפורש על פריסה מאחורי שירותי API מסחריים בתשלום ללא רכישת רישיון מתאים ישירות מ־RunDiffusion.

האם המודל מבין פרומפטים בעברית?

לא. המודל אומן ותויג באנגלית באמצעות GPT-4 Vision. כתיבת תיאורים בעברית תניב תוצאות שגויות או אקראיות, ולכן יש לכתוב את הפרומפטים באנגלית בלבד.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד נפח של 19.5 ג'יגה-בייט. הקוד הרשמי רץ ישירות דרך ספריית diffusers בפייתון עם safetensors ב־float16 ודורש כרטיס מסך של Nvidia עם זיכרון וידאו מספק לעבודה עם SDXL ברזולוציות של 832 על 1216. המודל כולל VAE מוטמע בתוכו ואין צורך להגדיר אחד חיצוני.

ההגדרות המומלצות הן 30 עד 40 צעדים עם הדוגם DPM++ 2M Karras, ו־CFG scale שנע בין 3 ל־7 כאשר ערך נמוך מספק תוצאה ריאליסטית יותר. אם אין לכם חומרה ייעודית מקומית, RunDiffusion מציעים גישה בענן דרך ממשקים כמו ComfyUI, Forge או Fooocus, כולל גרסה מסוננת לתוכן בשם SAFE שלא זמינה להורדה פתוחה כאן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("RunDiffusion/Juggernaut-X-v10")
img = pipe("a photo").images[0]

הרישיון

הרישיון הבסיסי המדווח הוא CreativeML Open RAIL-M, שמאפשר שימוש יצירתי ואישי בכפוף למגבלות שימוש לרעה. עם זאת, היוצרים הוסיפו סייג מפורש: אסור להעלות את המודל מאחורי שירות API מסחרי בתשלום ללא רישיון ייעודי מראש במייל.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗