GPT
P

PixArt-Sigma-XL-2-1024-MS

קוד פתוח

PixArt-alphaopenrail++2024-04-11

  • diffusers
  • safetensors
  • text-to-image
  • PixArt-Σ

מודל דיפוזיה מבוסס טרנספורמר שמייצר תמונות ישירות ברזולוציית 1024 פיקסלים, 2K ואפילו 4K. הוא מציע ארכיטקטורה יעילה עם 611 מיליון פרמטרים בלבד ברשת הראשית.

  • 611Mפרמטרים
  • 20.3 GBמשקל הקבצים
  • 11,531הורדות בחודש
  • 105לייקים

מה זה

בניגוד לרוב מודלי הדיפוזיה הוותיקים שמבוססים על רשתות U-Net כבדות, המודל הזה בנוי כולו מבלוקים של טרנספורמר עבור latent diffusion. הוא נעזר במקודד טקסט T5 גדול מסוג T5-v1_1-xxl כדי להבין הנחיות מורכבות, ובמקודד VAE כדי לתרגם את המרחב הלטנטי לפיקסלים. השילוב הזה מאפשר לו לייצר תמונות ברזולוציות של 1024 פיקסלים, 2K ו־4K ישירות בתהליך דגימה יחיד.

היתרון הגדול כאן הוא היעילות של ליבת המודל, שמחזיקה כ־611 מיליון פרמטרים. עם זאת, המשקל הכולל להורדה מגיע ל־20.3 גיגה בייט, בעיקר בגלל מקודד ה־T5 הענק שיושב לצידו, כך שמבחינת תעבורה ואחסון לא מדובר בחבילה קטנה בכלל.

מתאים ל

  • יצירת איורים ואמנות דיגיטלית

    מתאים להפקת תמונות אמנותיות ברזולוציה גבוהה של עד 4K ישירות מהנחיית טקסט.

  • שילוב בכלים יצירתיים ועיצוב

    מאפשר לייצר רעיונות ויזואליים בתוך כלי עיצוב שנעזרים בצינור diffusers.

  • מחקר על Diffusion Transformers

    בסיס נוח לבדיקת ארכיטקטורת טרנספורמר טהורה במודלי תמונה עם אלגוריתמי דגימה חדשים.

איפה זה נופל

הכרטיס מודה בפירוש בבעיות קלאסיות של מחוללי תמונות. הוא לא יודע לייצר טקסט קריא בכלל, ויש לו בעיות מוכרות בייצור אנטומיה כמו אצבעות שלא תמיד יוצאות שלמות או תקינות. הוא גם מתקשה מאוד ביחסים מרחביים והרכבה של עצמים, כמו להניח קובייה אדומה על כדור כחול, והקידוד של ה־VAE מוגדר כבעל אובדן נתונים כך שאין לצפות לפוטוריאליזם מושלם.

שאלות
נפוצות

האם המודל שוקל מעט ומתאים למחשב חלש בגלל שיש לו רק 611 מיליון פרמטרים?

לא ממש. הטרנספורמר עצמו אכן קטן יחסית, אבל הצינור כולו דורש להוריד קבצים במשקל כולל של כ־20.3 גיגה בייט. זה נובע בעיקר ממקודד הטקסט הענק מסוג T5-XXL, ולכן עדיין צריך חומרה עם זיכרון גרפי סביר או הפעלה של cpu offload.

האם אפשר להשתמש בו כדי ליצור שלטים או עיצובים שכוללים כיתוב באנגלית או בעברית?

לא כדאי. המפתחים מציינים במפורש שהמודל לא מסוגל לייצר טקסט קריא בתמונה. אם אתם צריכים טיפוגרפיה, כותרות או לוגואים עם אותיות, תצטרכו להוסיף את הטקסט בעצמכם בעריכה גרפית נפרדת.

איך מריצים

כדי להריץ אותו צריך התקנה עדכנית של ספריית diffusers מגרסה 0.28.0 ומעלה, לצד ספריות transformers, accelerate, safetensors ו־sentencepiece. הקוד הרשמי רץ ב־float16 על כרטיס מסך של אנבידיה. אם אתם עובדים עם PyTorch 2.0 ומעלה, אפשר לקמפל את הטרנספורמר ולקבל שיפור ביצועים של 20 עד 30 אחוזים בזמן ההסקה.

אם הזיכרון בכרטיס המסך שלכם מוגבל, חובה להשתמש בפריקת שכבות למעבד באמצעות פקודת cpu offload במקום לטעון את כל המשקלים ישירות ל־CUDA. המפתחים מציעים גם דמו חינמי ב־Hugging Face Spaces, כך שאם אתם רוצים רק לבדוק את איכות הפלט בלי להוריד 20 גיגה בייט ולהגדיר סביבה מקומית, עדיף להתחיל שם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("PixArt-alpha/PixArt-Sigma-XL-2-1024-MS")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא CreativeML Open RAIL++-M, אותו רישיון שמוכר מ־SDXL. הוא מאפשר שימוש מסחרי ומחקרי, אבל מטיל הגבלות מחמירות על שימושים פוגעניים ומחייב להעביר את תנאי הרישיון הלאה אם אתם מפיצים גרסאות משלכם. בנוסף, הכרטיס מציין שהמודל מיועד למחקר ואינו מיועד לייצוג עובדתי של אנשים או אירועים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗