GPT
T

taesd

קוד פתוח

madebyollinmit2023-07-21

  • diffusers
  • safetensors

אוטואנקודר זעיר שמחליף את ה־VAE הכבד של סטייבל דיפיוז'ן כדי לקבל תצוגה מקדימה בזמן אמת. הוא שוקל גרושים ונועד לחסוך זמן יקר בזמן יצירת תמונה.

  • 2Mפרמטרים
  • 28.0 MBמשקל הקבצים
  • 98,448הורדות בחודש
  • 73לייקים

מה זה

במקום לפענח את המרחב הלטנטי עם ה־VAE המקורי והכבד של המודל, הרכיב הזה עושה את אותה פעולה בגרסה מכווצת של שני מיליון פרמטרים בלבד. הוא חולק בדיוק את אותו ממשק לטנטי של סטייבל דיפיוז'ן, מה שאומר שאפשר פשוט להחליף אותו ישירות בתוך פייפליין קיים של diffusers.

המטרה העיקרית שלו היא לאו דווקא להוציא את התמונה הסופית באיכות שיא, אלא להראות מה קורה בכל צעד של הדגימה בלי לטחון את המעבד הגרפי. כל המשקל שלו מסתכם בכעשרים ושמונה מגה-בייט, כך שהוא נטען בשבריר שנייה ורץ מהר בהרבה מכל חלופה רגילה.

מתאים ל

  • תצוגה מקדימה ברינדור

    מאפשר לראות את התמונה נבנית צעד אחר צעד בזמן אמת בלי להעמיס על החומרה.

  • החלפת VAE לחסכון בזיכרון

    משתלב ישירות בפייפליין של diffusers ותופס רק עשרים ושמונה מגה-בייט בזיכרון.

  • בדיקות פיתוח מהירות

    חוסך זמני המתנה ארוכים כשמריצים בדיקות מקומיות על תהליך יצירת התמונות.

איפה זה נופל

הוא לא מתאים כלל ל־SDXL. המבנה של ה־VAE ב־SD וב־SDXL שונה לחלוטין, ולכן הוא פשוט ייכשל שם ויש גרסה נפרדת עבורו. מעבר לזה, מדובר באוטואנקודר זעיר שנועד לתצוגה מקדימה, כך שאם מחפשים שחזור מדויק של פרטים קטנים וחדות מקסימלית בתמונה הסופית, הוא עלול לאכזב לעומת ה־VAE המקורי המלא.

שאלות
נפוצות

האם המודל הזה עובד עם SDXL?

לא, הוא לא תואם למבנה של SDXL בכלל. אם אתם עובדים עם המודלים האלה, צריך להשתמש בגרסה הייעודית TAESDXL שבנויה למרחב הלטנטי שלהם.

איך מטמיעים אותו בקוד קיים?

מייבאים את AutoencoderTiny מתוך diffusers, טוענים את המשקלים שלו ושמים אותו בתוך pipe.vae של הפייפליין שלכם. משם ממשיכים לקרוא לפייפליין כרגיל לחלוטין.

איך מריצים

טוענים אותו ישירות דרך ספריית diffusers באמצעות המחלקה AutoencoderTiny ומחליפים את pipe.vae במודל הקיים, למשל מעל Stable Diffusion 2.1 Base. מריצים את זה עם torch.float16 על כרטיס מסך כדי לקבל את המהירות המקסימלית.

בגלל המשקל המזערי של עשרים ושמונה מגה-בייט, אין שום צורך בחומרה מיוחדת או בשרת ענן ייעודי, ואין שום הגיון לשלם ל־API חיצוני על פענוח כזה. כל מחשב עם כרטיס מסך בסיסי שמריץ סטייבל דיפיוז'ן יריץ אותו בלי להרגיש.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("madebyollin/taesd")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 28.0 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני במיוחד. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית של היוצר בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗