GPT
L

ldm-celebahq-256

קוד פתוח

CompVisapache-2.02022-07-15

  • diffusers
  • pytorch
  • unconditional-image-generation

זהו מודל דיפוזיה שמייצר תמונות פנים אקראיות ברזולוציה נמוכה בלי לקבל שום טקסט. הוא מתאים למי שחוקר את הארכיטקטורה של דיפוזיה במרחב לטנטי על משקל קל.

  • 1.2 GBמשקל הקבצים
  • 1,857הורדות בחודש
  • 51לייקים

מה זה

מדובר במודל היסטורי מבית קבוצת המחקר שפיתחה בהמשך את סטייבל דיפיוז'ן. הוא אומן על מאגר CelebA-HQ במטרה אחת בלבד, לייצר תמונות פנים בגודל 256 על 256 פיקסלים מרעש אקראי, ללא שום הנחיה טקסטואלית או תנאי מוקדם מצד המשתמש. מה שייחד אותו כשיצא היה המעבר מחישוב ישיר על מרחב הפיקסלים לעבודה בתוך מרחב לטנטי של מקודד ייעודי, גישה שחתכה משמעותית את עלויות החישוב וזמן הריצה ביחס למודלי דיפוזיה קודמים.

בפועל, הוא מייצר רק פרצופים שנראים כמו תמונות סטודיו של מפורסמים, בלי יכולת לשלוט בתווי הפנים, במין, בגיל או בסגנון. החוקרים הראו במאמר שמודלים מהסוג הזה מסוגלים לשמור על איכות ויזואלית גבוהה תוך צמצום משאבים, אך התוצר כאן מוגבל לחלוטין למשימה הצרה הזו.

מתאים ל

  • מחקר על מרחב לטנטי

    הוא קל משקל ונוח לבדיקות של דגימה ותהליכי דה-נויזינג בלי להעמיס על החומרה.

  • ייצור אווטארים אקראיים

    הוא מפיק תמונות פנים קטנות בגודל 256 פיקסלים כשלא נדרשת שליטה בתוצאה.

  • בדיקת צינורות עבודה

    משקלו 1.2 גיגהבייט בלבד, מה שמאפשר לוודא תקינות קוד של ספריות דיפוזיה במהירות.

איפה זה נופל

הוא לא מקבל פרומפטים ולא מבין הוראות, אלא פולט תמונת פנים אקראית בלבד. הרזולוציה נעולה על 256 על 256 פיקסלים, שזה גודל קטן מאוד שלא מתאים לשימוש מודרני בלי מודל הגדלה נוסף. בנוסף, האימון על CelebA-HQ מקבע הטיות חזקות לכיוון מראה של מפורסמים ואיפור כבד, כך שאי אפשר לבנות עליו לייצור מגוון רחב של פנים.

שאלות
נפוצות

אפשר לתת לו טקסט כדי שיצייר פנים לפי בקשה?

לא. המודל מוגדר למשימת יצירה לא מותנית בלבד. הוא מקבל רעש אקראי ופולט פנים לפי מה שהוא למד באימון, בלי שום ממשק לקבלת טקסט או הנחיות.

למה כדאי להריץ אותו ולא מודל מודרני יותר?

הסיבה היחידה היא חיסכון במשאבים ומחקר בסיסי. הוא דורש מעט מאוד מקום בזיכרון וממחיש את עקרון הפעולה של לטנט דיפיוז'ן, אך מבחינת איכות ורזולוציה הוא נשאר מאחור.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית diffusers בפייתון עם DiffusionPipeline ומריצים הסקה. הקבצים שוקלים בסך הכול 1.2 גיגהבייט, כך שהוא יורד מהר מאוד ורץ בקלות כמעט על כל מעבד גרפי ביתי בלי להעמיס על הזיכרון, ואפילו על מעבד רגיל אם מוכנים לחכות.

בקוד הדוגמה הרשמי מוגדרים 200 צעדי הסקה, שזה מספר גבוה יחסית שגוזל זמן חישוב לכל תמונה בודדת. אין פה אפשרויות שונות של גדלים או גרסאות קלות, ומכיוון שמדובר במשקל קטן ובריצה מקומית זולה, אין שום סיבה לחפש ספק חיצוני שיריץ את זה עבורכם בתשלום.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("CompVis/ldm-celebahq-256")
img = pipe("a photo").images[0]

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, צריך לזכור שהנתונים שעליהם הוא אומן עשויים לכלול זכויות יוצרים על התמונות עצמן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗