GPT
P

PixArt-XL-2-1024-MS

קוד פתוח

PixArt-alphaopenrail++2023-11-04

  • diffusers
  • safetensors
  • text-to-image
  • Pixart-α
  • endpoints_compatible

מודל תמונה שמייצר פלט ברזולוציית 1024 פיקסלים ישירות מתוך ארכיטקטורת טרנספורמר מלאה. הוא מעניין בעיקר בזכות גודל של 612 מיליון פרמטרים שדרש שבריר ממשאבי האימון של מתחרים מוכרים.

  • 612Mפרמטרים
  • 20.4 GBמשקל הקבצים
  • 3,133הורדות בחודש
  • 212לייקים

מה זה

מדובר במודל מבוסס Diffusion Transformer שמשלב מקודד טקסט מסוג T5 יחד עם VAE, ומפיק תמונות של 1024 פיקסלים בתהליך דגימה יחיד. במקום רשת ה־UNet הנפוצה במודלי דיפוזיה, הארכיטקטורה כאן נשענת על בלוקים טהורים של טרנספורמר.

הייחוד המרכזי שלו מול סביבת הקוד הפתוח הוא היעילות. המפתחים אימנו אותו ב־675 ימי מעבד גרפי A100 בלבד, שזה בערך 10.8 אחוזים מזמן האימון שנמדד עבור Stable Diffusion 1.5. לפי סקרי העדפת משתמשים שהוצגו בכרטיס, התוצאות שלו עומדות בשורה אחת עם SDXL 0.9, דאלי 2 ו־DeepFloyd למרות ממדי הרשת הצנועים.

מתאים ל

  • איור ועיצוב קונספט

    יצירה מהירה של רעיונות גרפיים ואמנות דיגיטלית ברזולוציית 1024 פיקסלים בלי צורך בהגדלה נוספת.

  • מחקר בארכיטקטורת DiT

    בחינת יכולות של מודלי טרנספורמר מלאים לדיפוזיה מול ארכיטקטורות UNet מסורתיות.

  • שילוב בכלי יצירה

    הטמעה ביישומים שדורשים מודל בסיס קומפקטי יחסית של 612 מיליון פרמטרים על תשתית עצמאית.

איפה זה נופל

היוצרים מציינים במפורש שהמודל לא מגיע לפוטוריאליזם מושלם ולא מסוגל לייצר טקסט קריא בתוך תמונות. בנוסף, קיימת בעיה מוכרת ברינדור אצבעות ואיברי גוף.

יש לו גם קושי משמעותי בהבנת קשרים מורכבים בתיאור, למשל מיקום של עצם אחד על גבי עצם אחר. רכיב ה־autoencoding שלו מאבד מידע בתהליך, והכרטיס מזהיר שהוא אינו מיועד לייצוג עובדתי של אנשים או אירועים.

שאלות
נפוצות

האם כדאי להריץ אותו מקומית או לחפש גישה דרך שירות חיצוני?

המשקל הכולל של 20.4 גיגה-בייט נובע ממקודד ה־T5, ולכן הרצה מקומית דורשת כרטיס מסך מודרני עם מספיק זיכרון. אם אין לכם חומרה ייעודית, עדיף לבדוק אותו קודם בהדגמה החינמית ב־Hugging Face או בסביבת Colab שהמפתחים שיתפו, במקום להרים שרת יקר.

האם אפשר להשתמש במודל ליצירת שלטים או גרפיקה עם מלל?

לא, המפתחים מציינים בפירוש שהמודל נכשל ברינדור טקסט קריא. עבור משימות שדורשות טיפוגרפיה או מילים מדויקות בתוך התמונה, תצטרכו להוסיף את הטקסט בעריכה גרפית נפרדת.

איך מריצים

אתם יכולים לטעון את הפייפליין דרך ספריית diffusers עם PixArtAlphaPipeline בדיוק של float16, ולהריץ אותו ישירות על מעבד גרפי של Nvidia. מי שעובד עם PyTorch 2.0 ומעלה יכול להאיץ את הביצועים ב־20 עד 30 אחוזים באמצעות torch.compile על שכבת הטרנספורמר.

הורדת הקבצים כבדה ודורשת כ־20.4 גיגה-בייט של מקום בדיסק, בעיקר בגלל מקודד ה־T5 הגדול. אם כרטיס המסך שלכם מוגבל בזיכרון VRAM, המפתחים ממליצים להפעיל model cpu offload שפורק מודלים לזיכרון הראשי, או להתנסות קודם בסביבת גוגל קולאב לפני שמעמידים שרת ייעודי.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("PixArt-alpha/PixArt-XL-2-1024-MS")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M. הוא מאפשר שימוש מסחרי ומחקרי, אבל מטיל הגבלות שימוש ברורות כדי למנוע יצירת תוכן פוגעני או מזיק. אם אתם משלבים אותו במוצר, עליכם לוודא שהתנאים והמגבלות של הרישיון מועברים הלאה למשתמשי הקצה.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗