GPT
B

BPModel

קוד פתוח

Crosstyancreativeml-openrail-m2022-12-20

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-image
  • safetensors

מודל תמונה מסוג סטייבל דיפיוז'ן שמיועד לסגנון אנימה. הוא אומן ישירות על רזולוציות בסיס גבוהות של 768 ו־1024 פיקסלים במקום ברירת המחדל הישנה.

  • 17.1 GBמשקל הקבצים
  • 749הורדות בחודש
  • 150לייקים

מה זה

בסיס העבודה כאן נשען על ACertainty, מודל אנימה מוכר, שעבר כוונון עדין על מאגר של חמשת אלפים תמונות מתויגות מאתר סנקאקו קומפלקס. המטרה המרכזית של היוצר הייתה לבדוק אימון ברזולוציות טבעיות גבוהות של 768 ואף 1024, מהלך שדרש עשרות ומאות שעות חישוב על כרטיסי V100.

בפועל, תוצאות האימון מראות שהקפיצה לרזולוציית 768 סיפקה חדות ופירוט עדיפים משמעותית על פני בסיס ה־512 הרגיל. לעומת זאת, הניסיון לעלות ל־1024 דרש מאה שעות GPU נוספות עבור עשרה מחזורים בלבד עם גודל אצווה מינימלי של 1, ולא הניב שיפור נראה לעין שמצדיק את המשאבים האלה. המודל מתמקד ביצירת דמויות אנימה מורכבות, אך נשען על טעמו הספציפי של המפתח.

מתאים ל

  • איורי אנימה חדים

    יצירת דמויות בסגנון אנימה ברזולוציה מקורית של 768 פיקסלים ללא צורך בהגדלה מוקדמת.

  • המשך אימון וכוונון

    קובץ ה־EMA בדיוק fp32 מתאים למפתחים שרוצים להמשיך לאמן את הרשת על נתונים משלהם.

  • הפקת פוסטרים אנכיים

    יצירת קומפוזיציות צרות וארוכות בעזרת מנגנון הדליים המובנה לניהול יחסי גובה-רוחב.

איפה זה נופל

המודל נוטה להתאמת יתר בגלל גודל המאגר הקטן יחסית. קיימת בעיה מוכרת של שכפול חלקי מנתוני המקור, לצד קושי של טוקנייזר ה־CLIP בפענוח שמות אמנים ביפנית בתעתיק לטיני. נוסף על כך, בעיות האנטומיה הקלאסיות של הידיים והאצבעות עדיין מופיעות באופן קבוע.

שאלות
נפוצות

למה התמונה יוצאת מטושטשת או מלאה ברעש צבעוני?

זה קורה אם טוענים קובץ משקולות שלא כולל VAE פנימי. צריך להגדיר VAE חיצוני מתאים בממשק או להוריד את הגרסה שמכילה אותו מראש.

האם כדאי להשתמש בגרסת ה־1024 במקום ה־768?

לא בהכרח. בדיקות האימון הראו שגרסת ה־1024 לא הביאה שיפור מהותי באיכות אך דרשה משאבים כבדים בהרבה, ולכן גרסת ה־768 יציבה ומומלצת יותר.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־17.1 גיגה בייט בגלל פיצול למספר גרסאות ומשקולות. להרצה שוטפת ב־WebUI עדיף לקחת את גרסת הסייפטנסורס או את קובץ bp_1024_with_vae_te שמגיע בדיוק fp16 כולל המקודד, כי קבצים אחרים כמו bp_1024_e10 דורשים שתגדירו VAE חיצוני כדי לא לקבל תמונות שבורות.

כדי להריץ מקומית עם רזולוציות כאלה, כרטיס עם 12 גיגה בייט זיכרון גרפי ומעלה ימנע קריסות, במיוחד אם מפעילים xformers ו־Clip skip 2 כפי שמומלץ בהגדרות. למי שרוצה רק לבדוק תמונות בודדות ולא מחזיק חומרה מתאימה, עדיף לפנות ל־API חיצוני שמארח מודלי SD.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Crosstyan/BPModel")
img = pipe("a photo").images[0]

הקבצים

257 קבצים במאגר, 17.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CreativeML OpenRAIL-M. מותר להשתמש בו לצרכים מסחריים, למכור שירותים המבוססים עליו ולהפיץ את המשקולות, כל עוד מצרפים את תנאי הרישיון המקוריים ולא מייצרים תכנים לא חוקיים או מזיקים שמוגדרים בהסכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗