GPT
N

noobai-XL-Vpred-1.0

קוד פתוח

Laxharother2024-12-22

  • diffusers
  • safetensors
  • stable-diffusion
  • stable-diffusion-xl
  • art

מודל תמונה מסוג SDXL שאומן על דאטהבייסים ענקיים של אנימה עם ארכיטקטורת v-pred. אם אתם צריכים סגנון איור מבוסס תגיות מדויקות, בשביל זה בנו אותו.

  • 2.6Bפרמטרים
  • 13.1 GBמשקל הקבצים
  • 68,436הורדות בחודש
  • 71לייקים

מה זה

מדובר במודל מבוסס SDXL עם 2.6 מיליארד פרמטרים, שעבר אימון על בסיסי הנתונים Danbooru עד סוף אוקטובר 2024 ו־e621. הוא מאפשר הכוונה של התוצאה לא רק לפי תיאור חופשי באנגלית, אלא גם בעזרת תגיות מובנות של איכות, אסתטיקה וטווח שנות יצירה, מה שנותן שליטה טובה ברמת הגימור ובסגנון התקופתי של הציור.

ההבדל המשמעותי מול רוב המודלים מבוססי הדיפוזיה ברשת הוא המעבר מחיזוי רעש רגיל לשיטת v-prediction. זה אומר שהוא מגיב אחרת לחלוטין לפרמטרים של הדגימה, ומייצר תמונות חדות ונקיות יותר רק כאשר מזינים לו בדיוק את ההגדרות שהוא מצפה להן.

מתאים ל

  • איור דמויות אנימה

    שליטה מדויקת במראה הדמות לפי תגיות מקובלות של קהילות Danbooru וסגנונות אמנות ספציפיים.

  • הדמיות לפי תקופת זמן

    יכולת לשחזר סגנון ויזואלי של אנימה מתקופות מוגדרות בין 2005 ל־2024 בעזרת תגיות שנים.

  • אימון LoRA על v-pred

    בסיס מותאם ומיושר לאימוני המשך של מודלים קטנים שמשתמשים בשיטת החיזוי הזו.

איפה זה נופל

הבעיה העיקרית במודל היא חוסר הגמישות. דוגמים אחרים פרט ל־Euler פשוט לא עובדים כמו שצריך, ואי אפשר להשתמש בשיטות דגימה מהירות יותר כדי לקצר זמנים. בנוסף, הדאטהבייסים שעליהם הוא אומן מכילים תכנים בעייתיים רבים, והיוצרים מציינים במפורש שהמודל עלול לפלוט תוצאות לא צפויות או לא ראויות, כך שחובה להשתמש בפרומפט שלילי ארוך כדי לסנן תכנים לא רצויים, ידיים מעוותות וסגנונות פרוותיים.

שאלות
נפוצות

למה התמונות יוצאות לי כמו רעש מטושטש או כתמים?

זה כמעט תמיד קורה כי הגדרתם סאמפלר שאינו Euler או שהשארתם CFG גבוה מ־5. המודל עובד בארכיטקטורת v-prediction ולא יסלח על הגדרות של מודלי SDXL רגילים.

האם מותר לי למכור תמונות שיצרתי עם המודל?

לא. תנאי הרישיון אוסרים במפורש על כל מסחור, כולל מכירת תמונות שנוצרו על ידו, מוצרים שמבוססים עליהן או שירותים בתשלום.

האם המודל מבין הוראות בשפה חופשית?

הוא תומך בתיאורים באנגלית, אבל התוצאות הטובות ביותר מתקבלות בשילוב תגיות איכות קבועות בהתחלה ותגיות ספציפיות המופרדות בפסיקים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־13.1 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 12 עד 16 גיגה זיכרון כדי לעבוד איתו בצורה מקומית בלי חניקות זיכרון. אפשר להריץ אותו מקומית דרך ComfyUI, reForge או ממשק AUTOMATIC1111 אבל רק מענף הפיתוח, וכמובן ישירות בקוד דרך ספריית diffusers בפייתון.

ההרצה דורשת הקפדה על סאמפלר Euler בלבד, בטווח של 28 עד 35 צעדים, וערך CFG נמוך של 4 עד 5. רזולוציית הבסיס צריכה להישאר סביב שטח של 1024 על 1024, למשל 832 על 1216. סטיות מהפרמטרים האלה יגרמו לפלט שבור לחלוטין, מה שהופך את השילוב שלו במערכות אוטומטיות לפחות סלחני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Laxhar/noobai-XL-Vpred-1.0")
img = pipe("a photo").images[0]

הרישיון

הרישיון אוסר לחלוטין על כל שימוש מסחרי, ייצור רווח או מכירה של תוצרים ונגזרות. בנוסף יש חובת קוד פתוח מחמירה, שמחייבת אתכם לפרסם בפומבי כל מודל נגזר, מיזוג, LoRA, ואפילו את הפרומפטים ותהליכי העבודה המדויקים ששימשו ליצירה. למוצר מסחרי סגור הוא פשוט לא רלוונטי.

הרישיון המלא בעמוד המודל ↗