GPT
D

dreambooth-training

רץ בדפדפן

multimodalartmit2022-11-03

  • gradio

אימון מודל Stable Diffusion על חפץ או סגנון אישי באמצעות Dreambooth ישירות מהדפדפן. הכלי מיועד למי שרוצה מודל מותאם אישית בלי לכתוב סקריפטים של אימון בעצמו.

  • הורדות בחודש
  • 522לייקים

מה זה

אתם מעלים תמונות של מה שתרצו ללמד, בוחרים מודל בסיס, ומקבלים קובץ משקלים מאומן בפורמט diffusers או מודל שמועלה ישירות לחשבון שלכם. הממשק מציע שתי אפשרויות עבודה שונות: אימון על חפץ, שדורש בין חמש לעשר תמונות מזוויות שונות, או אימון על סגנון אומנותי, שדורש בין עשר לעשרים תמונות. בדוגמאות המובנות מוצגים צעצוע של חתול עבור חפץ ואיור בסגנון מסוים להמחשת סגנון.

מתחת למכסה המנוע רץ תהליך Dreambooth קלאסי בעזרת ספריית diffusers. אפשר לבחור כבסיס מודלים מותאמים כמו sd-fine-tunable או גרסאות רשמיות של Stable Diffusion 2.1, כולל גרסת הבסיס של 512 פיקסלים. התמונות שלכם נחתכות אוטומטית לפי המידות הנדרשות, ואתם מגדירים מילה ייחודית ומומצאת שתשמש לזיהוי המושג החדש.

מתאים ל

  • אימון על חפץ ספציפי

    מעלים בין 5 ל־10 תמונות של חפץ מזוויות שונות כדי לשלב אותו בהנחיות טקסט חדשות.

  • למידת סגנון עיצובי

    מזינים בין 10 ל־20 דוגמאות של איור או סגנון ציור כדי שהמודל יפיק תמונות במראה תואם.

  • העלאת מודל אישי למאגר

    בניית קובץ diffusers ושמירתו ישירות במאגר פרטי בחשבון שלכם בעזרת טוקן ייעודי.

איפה זה נופל

המגבלה הכי בולטת היא שהעמוד המקורי לא עובד בלחיצת כפתור אחת. אם תנסו להריץ שם בלי לשכפל ולשלם על כרטיס מסך, תקבלו שגיאה מיד. בנוסף, חובה לייצר טוקן כתיבה ידנית, ואי אפשר להתקדם בלי להמציא מילה חדשה עבור המושג. התהליך לא כולל ממשק עריכה גרפי לתמונות עצמן, אלא שולח אתכם לשירות חיצוני לחיתוך ידני אם החיתוך האוטומטי לא מתאים לכם.

שאלות
נפוצות

האם זה חינם?

הקוד עצמו חינמי, אבל אי אפשר להריץ אותו על המעבד הבסיסי של המרחב הציבורי. תצטרכו לשכפל אותו ולהפעיל חומרת כרטיס מסך כמו T4 או A10G, מה שדורש תשלום על זמן השימוש בחומרה.

מה קורה עם התמונות והקבצים שלי?

האימון דורש טוקן כתיבה לחשבון שלכם והקוד יוצר מאגר פרטי לשמירת המודל והתמונות. המידע לא מתפרסם ציבורית אלא אם תשנו את ההגדרות של המאגר שנוצר.

כמה זמן לוקח האימון?

משך הזמן המדויק תלוי במספר התמונות ובכרטיס המסך שתבחרו, כאשר המערכת מחשבת כמות צעדים לפי כמות הקבצים. בזמן הריצה יש סרגל התקדמות שמציג את הקצב בזמן אמת.

במה זה שונה מהרצת המודל הרגיל?

כאן לא מייצרים תמונות מטקסט קיים, אלא מאמנים מודל חדש על בסיס Stable Diffusion 2.1 או גרסת בסיס ייעודית. רק בסיום התהליך מקבלים מודל מותאם שמכיר את המילה והחפץ שהגדרתם.

איך משתמשים

אי אפשר להפעיל את האימון ישירות בחלון הציבורי שפתוח מולכם. הקוד בודק את הסביבה וחוסם את ההרצה, כי כרגע מוקצה לה מעבד בסיסי בלבד. כדי להשתמש בה בפועל, חייבים לשכפל את המרחב לחשבון האישי, להצמיד לו כרטיס מסך מסוג T4 או A10G, ולהזין טוקן של Hugging Face עם הרשאות כתיבה. אחרי שמגדירים את שם המודל ולוחצים על כפתור האימון, התהליך רץ לפי מספר התמונות והצעדים, מציג סרגל התקדמות, ובסוף מאפשר להוריד ארכיון tar או לדחוף את התוצאה למאגר פרטי.

הרישיון

הקוד מופץ תחת רישיון MIT שמאפשר שימוש חופשי, שינוי והפצה. התוצרים שנוצרים נשמרים כברירת מחדל במאגרים פרטיים תחת החשבון שלכם, כך שהשליטה בתמונות ובמודל המאומן נשארת אצלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗