GPT
D

dalle-mega

קוד פתוח

dalle-miniapache-2.02022-06-28

  • transformers
  • jax
  • dallebart
  • text-to-image
  • en

גרסת קוד פתוח גדולה לייצור תמונות מטקסט ששוחזרה על בסיס הרעיון של OpenAI. מתאימה למי שחוקר ארכיטקטורות שנבנו לפני עידן הדיפיוז'ן ומחפש מודל מבוסס טרנספורמר.

  • 9.7 GBמשקל הקבצים
  • 103הורדות בחודש
  • 154לייקים

מה זה

מדובר בגרסה הגדולה ביותר של פרויקט DALL-E mini, שממירה תיאורי טקסט לתמונות באמצעות ארכיטקטורת eBart מבוססת טרנספורמר. המפתחים יצרו אותו בניסיון לשחזר את היכולות של DALL-E המקורי בקוד פתוח. המודל שוחרר באמצע 2022, ואומן בעזרת חומרת ענן מסיבית שכללה פוד של 256 שבבי TPU v3 במשך שבועות רבים, תוך שימוש באופטימיזציות כמו Distributed Shampoo ו־Normformer.

המודל מייצר קומפוזיציות סוריאליסטיות ושילובים מושגיים מפרומפטים באנגלית. בניגוד לכלים שנבנו מאוחר יותר על בסיס מודלי דיפיוז'ן, המבנה שלו נשען לחלוטין על קידוד ופענוח רצפים. התוצאות הוויזואליות שלו נוטות להיות גולמיות ופחות מדויקות, אך הוא מספק מבט ישיר על ניסיונות שחזור מוקדמים של מחוללי תמונות בקנה מידה פתוח.

מתאים ל

  • מחקר הטיות במודלים

    הכרטיס מתעד הטיות מובנות עקב דאטה לא מסונן, מה שהופך אותו לבסיס טוב למדידת פערי ייצוג.

  • יצירת שילובי מושגים הומוריסטיים

    הארכיטקטורה יודעת לחבר רעיונות מילוליים מנוגדים או להעביר סגנונות ויזואליים בסיסיים מפרומפט.

  • איור חופשי לטקסטים

    מתאים להפקת דימויים מהירים לשירים או פנטזיה שבהם אין צורך בריאליזם של דמויות אנושיות.

איפה זה נופל

הפנים של בני אדם יוצאות מרוחות, מעוותות וחסרות הבעה, וחיות נראות לרוב בלתי מציאותיות לחלוטין. הכרטיס מודה במפורש שהאימון נעשה על דאטה לא מסונן מהרשת שהוגבל לאנגלית, ולכן התוצאות משקפות הטיות חברתיות קשות, ייצוג יתר לתרבות מערבית ואנשים לבנים, וחוסר התאמה מוחלט לפרומפטים בעברית או בכל שפה אחרת. קשה לחזות מתי הוא יצליח או ייכשל, והוא דורש ניסוח מדויק מאוד של פרומפט כדי להפיק משהו שמיש.

שאלות
נפוצות

האם המודל מסוגל לעבד פרומפטים בעברית?

האימון נעשה באופן בלעדי על תיאורים באנגלית. פקודות בעברית יניבו תוצאות באיכות ירודה במיוחד או כשל מוחלט בהבנת הטקסט.

האם כדאי לשלב אותו במערכת לייצור תמונות למשתמשי קצה?

הוא מייצר לעיתים קרובות פנים מעוותות, יצורים לא מציאותיים ופגיע להטיות חברתיות פוגעניות. המפתחים לא ייעדו אותו לייצוג מדויק של אנשים או מציאות.

מה דרישות החומרה לטעינת המודל הזה?

הקבצים שוקלים כ־9.7 גיגה בייט ומיועדים לספריית transformers. כדי להריץ היקש מקומי בצורה יציבה נדרש כרטיס מסך מודרני עם נפח זיכרון של לפחות 16GB VRAM.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט עשרה גיגה בייט, שמחולקים לעשרה קבצים שונים בספריית transformers. כדי לטעון אותו ולבצע היקש מקומי בצורה סבירה, תצטרכו כרטיס מסך ייעודי עם מספיק זיכרון VRAM שיוכל להחזיק את משקלי ה־Transformer ורכיבי הפענוח בלי לקרוס.

אם אתם לא חוקרים את המשקלים עצמם אלא רק צריכים תמונות מהירות, עדיף להשתמש בספייס הציבורי של dalle-mini ב־Hugging Face במקום להתעסק עם הקצאת משאבי GPU מקומיים יקרים. הפער בזמני ההקמה מול הפלט הוויזואלי שתקבלו פשוט לא מצדיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-to-image", model="dalle-mini/dalle-mega")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. הוא מאפשר שימוש חופשי, שינוי קוד, הפצה ושימוש מסחרי, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מחמירות על שילוב במוצרים, אך המפתחים מפרטים שורה של שימושים אסורים ומזיקים שחורגים ממטרות המחקר המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗