GPT
O

OpenDalleV1.1

קוד פתוח

dataautogpt3cc-by-nc-nd-4.02023-12-21

  • diffusers
  • safetensors
  • text-to-image
  • endpoints_compatible

גרסה מכווננת של מודל יצירת תמונות שמכוונת להיצמד חזק לטקסט ולתת סגנון ריאליסטי יותר מ־SDXL הרגיל. מי שיוריד אותו מחפש חלופה מקומית ופתוחה שמנסה להתקרב לביצועים של DALL-E 3.

  • 2.6Bפרמטרים
  • 25.9 GBמשקל הקבצים
  • 1,262הורדות בחודש
  • 502לייקים

מה זה

מדובר במודל טקסט לתמונה המבוסס על מיזוג וכוונון של סטייבל דיפיוז'ן, עם כ־2.6 מיליארד פרמטרים. היוצר שלו מכוון אותו ישירות למשבצת שבין SDXL לבין DALL-E 3 של OpenAI, עם דגש על היצמדות מדויקת להוראות הטקסטואליות וסגנון אמנותי משופר לעומת מודל הבסיס.

ההורדה כבדה מאוד ושוקלת כמעט 26 ג'יגה בייט על פני עשרות קבצים. היוצר עצמו כבר מציין בעמוד שיש לו גרסה חדשה וטובה יותר בשם ProteusV0.2, כך שמי שבוחר לעבוד דווקא עם OpenDalleV1.1 צריך לקחת בחשבון שמדובר בשלב ביניים בפיתוח של המפתח ולא בגרסה הסופית ביותר שלו.

מתאים ל

  • מחקר והשוואת מיזוגים

    מתאים לבדיקה אקדמית של טכניקות מיזוג מודלים מקומיים שמנסים לעקוף את ביצועי SDXL.

  • יצירה אישית ותחביב

    מיועד למי שמריץ מקומית על כרטיס חזק ורוצה להפיק תמונות אומנותיות לשימוש עצמי בלבד.

  • ניסויי ציות לפרומפטים

    טוב לבחינת הנחיות טקסט מורכבות תחת דוגם DPM2 בטווח של 60 עד 70 צעדים.

איפה זה נופל

החיסרון הברור ביותר הוא שהיוצר עצמו מצהיר שהמודל אינו הגרסה הטובה ביותר שלו ומפנה לפרויקט חדש יותר, כך שאין טעם לצפות לעדכונים או לתיקוני באגים פה. בנוסף, המודל אינו מציג מדדי ביצועים כמותיים או מבחני השוואה רשמיים, אלא רק הבטחות כלליות לשיפור בסגנון ובדיוק, מה שמחייב אתכם לבדוק בעצמכם אם הוא באמת עומד בציפיות לפני שמשקיעים זמן בהרצה שלו.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי לייצר תמונות לאתר מסחרי או למוצר?

לא. הרישיון אוסר במפורש כל שימוש שמייצר רווח כספי, ומגביל את המודל לצרכים אישיים, מחקריים או לימודיים בלבד. בנוסף, חל איסור על הפצה של המודל לצד שלישי.

כמה זיכרון וידאו צריך בשביל להריץ אותו מקומית?

הקבצים שוקלים קרוב ל־26 ג'יגה בייט ורצים דרך ספריית diffusers ב־float16. מומלץ להצטייד בכרטיס מסך עם לפחות 16 עד 24 ג'יגה בייט של זיכרון ייעודי כדי לעבוד בצורה יציבה עם 60 עד 70 צעדי יצירה.

למה כדאי לשים לב לפני שמתחילים להוריד את המשקלים?

שימו לב שהיוצר עצמו מפנה בעמוד למודל עדכני יותר בשם ProteusV0.2. כדאי לבדוק קודם את הגרסה החדשה לפני שמורידים 26 ג'יגה בייט של גרסה ישנה.

איך מריצים

טעינה של המודל נעשית דרך ספריית diffusers בפייתון באמצעות AutoPipelineForText2Image, ומחייבת כרטיס מסך של אנבידיה עם תמיכה ב־CUDA והרצה ב־float16. נפח הקבצים הגדול דורש נפח אחסון פנוי וכרטיס מסך עם זיכרון וידאו בריא של לפחות 16 עד 24 ג'יגה בייט כדי להחזיק את המודל ולייצר תמונות בלי קריסות זיכרון.

מבחינת הגדרות ריצה, המפתח ממליץ להשתמש בדוגם DPM2 עם סקדיולר מסוג Normal או Karras, להגדיר CFG Scale של 7 עד 8, ולכוון ל־35 צעדים לתוצאה מהירה או בין 60 ל־70 צעדים לקבלת פירוט מקסימלי. אם אין לכם חומרה ייעודית חזקה בבית או בשרת, להוריד 26 ג'יגה בייט ולחכות עשרות שניות לכל תמונה יהיה יקר ואיטי מאוד לעומת פנייה לשירותי ענן.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("dataautogpt3/OpenDalleV1.1")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא שילוב נוקשה של CC-BY-NC-ND-4.0 והסכם שימוש אישי של היוצר. אסור לעשות במודל שום שימוש מסחרי שמניב רווח או תשלום, אסור להפיץ אותו מחדש לצדדים שלישיים, ואסור לפרסם פומבית תוצרים נגזרים שלו בלי אישור מראש בכתב. למי שמפתח מוצר שמיועד למכירה או לחברה עסקית, המודל הזה פסול לחלוטין לשימוש.

הרישיון המלא בעמוד המודל ↗