GPT
S

sdxl-instructpix2pix-768

קוד פתוח

diffusersopenrail++2023-08-23

  • diffusers
  • safetensors
  • stable-diffusion-xl
  • stable-diffusion-xl-diffusers
  • text-to-image

הכלי הזה לוקח תמונה קיימת ועורך אותה לפי פקודה טקסטואלית פשוטה. הוא משלב את הבסיס החזק של SDXL עם היכולת לשנות רק מה שביקשתם בלי לבנות הכל מאפס.

  • 2.6Bפרמטרים
  • 11.8 GBמשקל הקבצים
  • 7,343הורדות בחודש
  • 56לייקים

מה זה

מדובר בהתאמה של SDXL שנועדה לעריכת תמונות מונחית הוראות, בשיטה של InstructPix2Pix. במקום לתאר מחדש סצנה שלמה ולקוות שהתוצאה תישאר קרובה למקור, אתם מעלים תמונה וכותבים הוראה קצרה, כמו להפוך את השמיים למעוננים או לשנות את סגנון הציור. המודל שומר על המבנה של התמונה המקורית ומעדכן רק את האלמנטים המבוקשים.

האימון נעשה ברזולוציה של 768 על 768 פיקסלים לאורך 15,000 צעדים, תוך שימוש במערך הנתונים המסונן של InstructPix2Pix. הבסיס של SDXL נותן לו הבנה טובה יותר של טקסט ופרטים ביחס למודלים מוקדמים יותר, אבל המפתחים מגדירים את נקודת הביקורת הזו כניסיונית, כך שעדיין יש פערים בביצועים לעומת מודלים מסחריים סגורים.

מתאים ל

  • עריכת תמונות לפי פקודה

    שינוי אלמנטים מוגדרים כמו שמיים או בגדים בלי לאבד את הקומפוזיציה המקורית.

  • החלפת סגנון אמנותי

    המרת תצלום רגיל לסגנון ציור מוגדר תוך שמירה על תווי הפנים או האובייקט.

  • התאמת מאפייני דמות

    שינוי גיל או הבעה של אדם בתמונה על בסיס הנחיה קצרה באנגלית.

איפה זה נופל

יוצרי המודל מצהירים בעצמם שמדובר בצ׳קפוינט ניסיוני עם הרבה מקום לשיפור. הוא אומן על רזולוציה קבועה של 768 פיקסלים, כך שתמונות ביחס גובה רוחב שונה או ברזולוציה גבוהה יותר ידרשו שינוי גודל שעלול לעוות את הקלט. לא מומלץ להכניס אותו ישירות למוצר קצה בלי לבדוק קודם איך הוא מתמודד עם פקודות מורכבות, כי הוא עלול לשנות חלקים בתמונה שלא התכוונתם לגעת בהם.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל?

הקבצים שוקלים כמעט 12 גיגה בייט והמודל כולל 2.6 מיליארד פרמטרים. בפועל, הרצה בפורמט float16 דורשת כרטיס מסך עם לפחות 16 גיגה בייט זיכרון וידאו כדי לעבוד בלי קריסות.

האם אפשר להשתמש בו בתוך מוצר פעיל כבר עכשיו?

המודל מוגדר כניסיוני על ידי היוצרים, כך שרמת היציבות של התוצאות משתנה. מומלץ לבצע בדיקות מקיפות על סוג התמונות וההנחיות שלכם לפני שחושפים אותו למשתמשי קצה.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך תומך CUDA עם מספיק זיכרון, בהתחשב במשקל קבצים של כמעט 12 גיגה בייט ובסיס של 2.6 מיליארד פרמטרים. מומלץ לטעון אותו בפורמט float16 דרך ספריית diffusers, בקוד פייתון פשוט שמגדיר את מספר הצעדים וערכי הליווי לתמונה ולטקסט.

אם אין לכם חומרה ייעודית עם זיכרון וידאו נדיב, הרצה מקומית תהיה איטית או תתרסק מחוסר זיכרון. במקרים כאלה עדיף להרים שרת מנוהל בענן או להשתמש בנקודת קצה מרוחקת במקום להסתבך עם התקנות מקומיות של סביבת הדרייברים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("diffusers/sdxl-instructpix2pix-768")
img = pipe("a photo").images[0]

הקבצים

620 קבצים במאגר, 11.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא openrail++, שמאפשר שימוש מסחרי ומחקרי תחת הגבלות שימוש אתיות מסוימות. אתם יכולים לשלב אותו בפרויקטים שלכם, אך נדרש להקפיד שלא להשתמש בו ליישומים פוגעניים או אסורים שמוגדרים בתנאי הרישיון, ולהעביר את תנאי השימוש הלאה אם אתם מפיצים את המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗