GPT
O

OpenDalle

קוד פתוח

dataautogpt3cc-by-nc-nd-4.02023-12-19

  • diffusers
  • safetensors
  • text-to-image
  • endpoints_compatible

מודל תמונה שמכוון להבנת פרומפטים מורכבים במקום להתחרות על ריאליזם מוחלט. הוא מבוסס על שילוב מודלים סביב SDXL אבל סגור לחלוטין לשימוש מסחרי.

  • 2.6Bפרמטרים
  • 25.9 GBמשקל הקבצים
  • 202הורדות בחודש
  • 125לייקים

מה זה

הפרויקט הזה מנסה לפתור את הבעיה הקבועה של SDXL, חוסר היכולת להיצמד להנחיות טקסט מסובכות. היוצר לקח את מודל ה־DPO של Hugging Face ושילב אותו עם משקלים קיימים כמו Juggernaut7XL, ALBEDOXL ו־MEARGEHEAVEN. התוצאה מכוונת לסגור את הפער מול DALLE-3 בהבנה סמנטית של הטקסט, תוך ויתור מודע על מראה היפר-ריאליסטי לטובת דיוק במה שביקשתם.

המבנה עצמו יושב על גודל של 2.6 מיליארד פרמטרים. השילוב נעשה בשיטת מיזוג ייחודית של המפתח, והכרטיס מציין במפורש שהדגש הושם על תרגום נכון של תיאורים מורכבים לפרטים ויזואליים, ולא על ליטוש גרפי מושלם.

מתאים ל

  • מחקר הבנת שפה בתמונות

    בדיקת היכולת של ארכיטקטורת SDXL לפרש תיאורים עמוסים ורבי משתתפים ללא שימוש במנועים סגורים.

  • איור וקונספט לשימוש עצמי

    יצירת תמונות מורכבות בעלות אופי אמנותי או סגנון מאנגה עבור פרויקטים אישיים ותחביב.

  • ניסויי מיזוג מקומיים ב־UI

    הרצה מקומית ב־ComfyUI למי שרוצה לבחון שילוב מודלים עם ערכי דגימה מדויקים.

איפה זה נופל

היוצר עצמו מצהיר שהגרסה הזו לא מעודכנת וכבר יצאה לה גרסה 1.1. מעבר לכך, המודל מתמקד בדיוק סמנטי ולא מפיק תמונות ברמת פירוט וריאליזם קיצוניים, כך שאם אתם מחפשים צילומים שנראים אמיתיים לגמרי הוא כנראה יאכזב. דרישת הריצה של 60 עד 70 צעדים מאטה מאוד את קצב העבודה.

שאלות
נפוצות

האם כדאי להוריד את הגרסה הזו או לעבור לגרסה 1.1?

עדיף לעבור ישר ל־1.1. היוצר עצמו כותב בראש העמוד שהגרסה הזו ישנה ומפנה לגרסה הבאה, כך שאין סיבה טכנית להישאר עם הגרסה הראשונה אלא אם אתם משווים ביצועים היסטוריים.

אפשר לשלב את המודל הזה באפליקציה בתשלום?

לא. הרישיון אוסר מפורשות כל פעילות מסחרית, הפצה או תצוגה ציבורית ללא אישור בכתב, כך שהוא מוגבל אך ורק לניסויים פנימיים ולמחקר אישי.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך ספריית diffusers בפייתון עם משתנה חצי דיוק fp16 על גבי כרטיס מסך, או להוריד קובץ safetensors יחיד לממשקים מוכרים כמו ComfyUI, AUTOMATIC1111 או InvokeAI. נפח ההורדה הכולל של המאגר מגיע ל־25.9 גיגה-בייט שמחולקים ל־36 קבצים.

לפי ההנחיות, המודל עובד הכי טוב עם דוגם DPM2 ומספר צעדים גבוה יחסית של 60 עד 70 לתוצאה מפורטת, או לפחות 35 צעדים לבדיקות מהירות. ערך ה־CFG המומלץ נע בין 7 ל־8, כך שזמן הרינדור לכל פריים יהיה ממושך למדי על חומרה ביתית ממוצעת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dataautogpt3/OpenDalle")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא cc-by-nc-nd-4.0 לצד הסכם שימוש אישי מחמיר של היוצר. אסור לעשות שום שימוש מסחרי, יש איסור הפצה לצד שלישי, ואסור לנסות להנדס לאחור את שיטת המיזוג. אם אתם בונים מוצר או פיצ'ר שמניב כסף, אי אפשר לגעת בו.

הרישיון המלא בעמוד המודל ↗